08. 技术 SEO、抓取、索引与性能 · 资料陈述 · 教学步骤 3

区分该收录与不该收录

后台、薄页和噪声页不应进入索引,但不能误挡核心页面资源。

原知识点:后台、薄页或不应收录页可设noindex,但不得误挡核心页面及必要渲染资源。

执行步骤

  1. 按URL类型写明内容是否公开、是否应出现在搜索、是否需要抓取以及访问者权限。
  2. 公开且应索引页保持200、可抓取、无noindex并进入规范内链/sitemap。
  3. 公开但不应索引页在允许抓取的响应中设置noindex;不要同时robots.txt禁止Google读取noindex。
  4. 私密或受限内容使用认证与授权控制,不能依赖robots.txt、noindex或难猜URL保护。
  5. 分别用HTTP响应、robots测试、生产HTML和URL Inspection验证规则,避免资源误挡导致页面无法渲染。

可复制工作表

URL类型:__
示例URL:__
是否公开:是/否__
是否应索引:是/否__
是否需Google抓取:是/否__
访问控制:公开/登录/角色授权__
HTTP状态:__
robots.txt规则:__
meta robots/X-Robots-Tag:__
canonical:__
sitemap:包含/排除__
CSS/JS/图片资源是否可抓取:__
HTTP/HTML/URL Inspection实测:__
规则冲突:__

完整示例

【完整示例】公开工具页:200、允许抓取、无noindex、进入sitemap;公开感谢页:200、允许抓取但meta robots=noindex、不进sitemap;账户页:必须登录并由服务端授权,未登录返回登录/拒绝响应,不依赖robots保护。团队没有把账户URL写进robots后就当成安全。

完成清单

  • 每种URL的公开性、抓取、索引和访问权限被分别决定。
  • noindex页面可被爬虫访问读取,没有被robots.txt同时阻断。
  • 私密内容依靠真实认证授权,而非SEO指令。
  • 核心渲染资源未被误挡,生产实测与矩阵一致。

当前官方依据

平台规则会变化,行动前以打开后的当前官方页面为准。

适用条件

URL仍可被抓取时noindex才能被读取。

来源:10个重要SEO元素中