跳到内容
SiteMonk Learn
中文
Esc
↑ ↓ navigate ↵ open ⌘J preview
本页内容

Google 能访问并收录你的页面吗?

区分访问、抓取和收录问题,知道什么时候需要网站开发者协助。

顾客能打开页面,不代表 Google 一定能读取并收录。排查时,应先查看具体状态,再改设置。

先记住这几件事

  • Search Console 是 Google 的网站搜索检查工具。“网址检查”可以查看一个页面的收录信息,并测试当前页面是否能被访问。
  • robots.txt 是告诉自动程序哪些地方可以访问的规则文件;noindex 是告诉搜索引擎不要收录某页的标记。二者作用不同。
  • 站点地图是重要网址清单,帮助发现页面。公开页面还应能正常打开,并有可读取的内容;满足要求也不保证收录。

这些基本做法见 Google:网址检查工具 、 Google:不收录标记 。

检查的是具体地址和实际内容

robots.txt 里的规则按网址路径匹配。新增语言后,要检查 /zh/service 等真实地址,不能以为针对 /service 的设置自然覆盖所有译文。让开发者按实际语言路径维护规则,并逐个检查;同时分清“禁止抓取”和“不要收录”,不能拿其中一项替代另一项。规则见 Google:创建抓取规则文件 。

正式发布时,检查重要页面是否误留 noindex。未完成内容可以暂不收录,但私人资料还需要登录或其他访问限制,不能只靠 noindex 保护。站点地图也要打开核对,确认不是错误页面、测试域名或失效地址,并在 Search Console 查看是否读取成功。规则见 Google:构建并提交站点地图 。

HTML 是浏览器接收并显示网页的一种文档格式。开发者可以检查首次返回的 HTML 是否已有正文;如果没有,还要查看 Google 运行脚本后实际得到的内容。JavaScript 是让网页运行交互逻辑的脚本语言;Google 能处理许多脚本页面,因此“查看源代码没看到文字”并不能单独证明它无法收录。用网址检查测试当前页面的呈现结果,再定位缺失内容。说明见 Google:JavaScript SEO 基础 。

页面可以由模板和数据生成,也可以提前生成;Google 不要求服务器上必须保存一个同名 HTML 文件。需要核对的是每个公开网址返回的正文、标题和链接是否正确,以及是否正常访问。把这些检查列进交付要求,比仅凭框架名称判断 SEO 更可靠。

公开页还要用未登录状态实际打开。如果只有登录后正常,或只有部分人访问失败,先核对限制、配置和官方故障说明,再定位影响范围;一次报错不能证明整个服务被封禁,也不能直接判定需要搬站。

XML 站点地图是用规定格式列网址的文件,其中应写完整的正式网址,例如 https://example.com/service ,不能只写 /service 。它与给读者使用的分类目录不同,两者都应核对真实可访问地址。规则见 Google:构建站点地图 。

在 Google 输入 site:你的域名 ,可以寻找限定网站的结果;加上具体路径,还可以缩小范围。但结果不是完整收录清单,搜不到某页也不能单独断定未收录。具体排查仍用网址检查工具。说明见 Google:site 搜索运算符 。

首页没有收录时,也检查几个重要子页;单页情况不能代表全站。站内外的正常链接和站点地图都可能帮助 Google 发现地址,提交请求只是其中一种方式,不保证下一天收录。用户可以公开提交内容的网站,还应安排审核和异常检查,避免被用于发布垃圾内容或制造链接。相关做法见 Google:防止用户生成的垃圾内容 。

用一个例子走一遍

检查项 处理前(假设) 处理后或正确做法
访问情况 页面报错 修复后重新检查
收录设置 误加 noindex 确认要公开后移除
站内入口 没有任何入口 从相关页面添加链接

假设正式服务页误留了测试时使用的 noindex。开发者先确认页面确实应该公开,再移除标记;Google 重新读取后才可能更新收录状态。不要对私人页面照做。

容易误解的地方

不要用 robots.txt 屏蔽页面,再期待 Google 读取该页的 noindex;被屏蔽时它可能看不到标记。收录率也不必达到 100%,重复页或私人页可能本来就不该收录。

补充规则见 Google:抓取规则文件 、 Google:站点地图 。

接着读

官方资料核对日期:2026 年 10 月 2 日。表格与场景用于说明,并非真实商家数据。