08. 技术 SEO、抓取、索引与性能 · 资料陈述 · 教学步骤 3
区分该收录与不该收录
后台、薄页和噪声页不应进入索引,但不能误挡核心页面资源。
原知识点:后台、薄页或不应收录页可设noindex,但不得误挡核心页面及必要渲染资源。
执行步骤
- 按URL类型写明内容是否公开、是否应出现在搜索、是否需要抓取以及访问者权限。
- 公开且应索引页保持200、可抓取、无noindex并进入规范内链/sitemap。
- 公开但不应索引页在允许抓取的响应中设置noindex;不要同时robots.txt禁止Google读取noindex。
- 私密或受限内容使用认证与授权控制,不能依赖robots.txt、noindex或难猜URL保护。
- 分别用HTTP响应、robots测试、生产HTML和URL Inspection验证规则,避免资源误挡导致页面无法渲染。
可复制工作表
URL类型:__ 示例URL:__ 是否公开:是/否__ 是否应索引:是/否__ 是否需Google抓取:是/否__ 访问控制:公开/登录/角色授权__ HTTP状态:__ robots.txt规则:__ meta robots/X-Robots-Tag:__ canonical:__ sitemap:包含/排除__ CSS/JS/图片资源是否可抓取:__ HTTP/HTML/URL Inspection实测:__ 规则冲突:__
完整示例
【完整示例】公开工具页:200、允许抓取、无noindex、进入sitemap;公开感谢页:200、允许抓取但meta robots=noindex、不进sitemap;账户页:必须登录并由服务端授权,未登录返回登录/拒绝响应,不依赖robots保护。团队没有把账户URL写进robots后就当成安全。
完成清单
- 每种URL的公开性、抓取、索引和访问权限被分别决定。
- noindex页面可被爬虫访问读取,没有被robots.txt同时阻断。
- 私密内容依靠真实认证授权,而非SEO指令。
- 核心渲染资源未被误挡,生产实测与矩阵一致。
当前官方依据
平台规则会变化,行动前以打开后的当前官方页面为准。
适用条件
URL仍可被抓取时noindex才能被读取。
来源:10个重要SEO元素中