robots.txt 是什么?AI 搜索时代,网站该开放哪些爬虫?
技能
AI 搜索越来越普及之后,网站经营者开始遇到一个以前比较少认真处理的问题:到底要不要让 AI 爬虫读取自己的网站?有人担心内容被拿去训练模型,于是想全部封锁;也有人为了让 ChatGPT、Google AI 等系统更容易找到自己的文章,反过来想把所有机器人都放进来。传统的 robots.txt 能不能做到这个目的呢?
真正要先弄清楚的,其实是 robots.txt是什么,以及「允许爬取」「允许索引」「允许用于 AI 搜索」和「允许用于模型训练」并不是完全相同的事情。
这篇文章不讨论玄学式的 AEO 技巧,而是从一个 WordPress 网站经营者真正需要处理的技术基础开始。
robots.txt 是什么?
robots.txt是放在网站根目录的纯文字文件,例如 https://example.com/robots.txt。它的作用,是告诉遵守 Robots Exclusion Protocol 的自动爬虫:网站哪些路径可以读取,哪些路径不要读取。
Google 的官方文件也明确说明,robots.txt 管理的是爬取(crawling),不是一个可靠的「禁止索引」工具。即使某个 URL 被 robots.txt 阻挡,在特定情况下,搜索引擎仍可能知道这个 URL 存在。若真正希望网页不进入 Google 索引,应使用 noindex,而不是只靠 robots.txt。
参考:Google:Create and Submit a robots.txt File;Google:Block Search Indexing with noindex。
robots.txt 和 noindex 最大差别是什么?
最简单的理解方法是:
- robots.txt:告诉爬虫「这个地方不要进来读取」。
- noindex:告诉搜索引擎「你可以读取,但不要把这一页放进搜索结果」。
这两个指令不能随便互相代替。Google 特别提醒,如果网页已经被 robots.txt阻挡,Googlebot 可能根本看不到网页里的 noindex 指令。因此,想让某一页从 Google 搜索结果消失,却同时又用 robots.txt把 Googlebot 挡在门外,反而可能让处理变得更麻烦。
进入 AI 搜索时代后,为什么 robots.txt又重要起来?
过去谈 robots.txt,多数网站经营者想到的是 Googlebot、Bingbot,以及如何避免搜索引擎浪费 crawl budget。现在多了一层:不同 AI 公司也有自己的 crawler,而且不同 crawler 的用途可能不同。
以 OpenAI 为例,网站经营者需要分清不同 user-agent,而不是把所有「OpenAI bot」想成同一个东西。OpenAI 的公开说明指出,其爬虫会遵守 robots.txt;网站的 CDN、WAF 或 bot protection 也可能在 robots.txt允许之后,仍然把自动访问挡掉。因此,「robots.txt 没有封锁」不代表爬虫一定访问得到网站。
参考:OpenAI:Guidance for allowing OpenAI web crawlers。
想被 AI 搜索发现,是不是开放所有爬虫就够了?
不是。
这是目前 AEO/AIO 最容易被过度简化的一点。允许 crawler 访问,只解决了「机器能不能进门」的问题,并不保证内容会被索引、引用,更不保证会成为 AI 回答里的来源。
Google 在 2026 年更新的生成式 AI 搜索指引中,仍然把基础 SEO 放在核心位置:网站必须可被爬取、重要内容最好以文字形式存在、内部链接要让内容容易被发现,同时内容本身要有价值、独特并以用户为中心。Google 也明确指出,AI 搜索功能并不需要一套神秘的特殊优化技巧。
参考:Google Search Central:Optimizing for generative AI in Google Search。
这也和我之前写的 AIO 时代:如何写出容易被 ChatGPT、Google AI 引用的文章? 有直接关系:技术上的「允许读取」只是入口,文章结构、事实可靠度、原创价值和主题关联仍然决定内容有没有被采用的价值。
WordPress 网站可以先检查这 5 件事
1. 直接打开 /robots.txt
在自己的网域后面输入 /robots.txt。先确认文件能正常显示,不要一开始就急着修改。
2. 检查有没有误挡重要内容
特别注意有没有出现针对全站的:
User-agent: *
Disallow: /
这代表对遵守规则的一般 crawler 封锁整个网站。网站测试期间这样设很常见,但正式上线后如果忘记解除,就可能直接影响搜索引擎读取。
3. 不要用 robots.txt保护私人资料
robots.txt是公开文件,任何人都能打开来看。Google 也提醒,不应该把它当成安全机制。真正不应公开的后台、会员资料或私人文件,应使用登录、权限控制或其他服务器层面的保护。
4. 检查 CDN 与防火墙
如果网站使用 Cloudflare、主机商防火墙或 bot protection,即使 robots.txt写着 Allow,自动爬虫仍可能收到 403。遇到「搜索引擎明明允许却抓不到」的问题时,不能只检查 WordPress。
5. 把爬取问题和内容问题分开
网站能被 crawler 访问之后,才轮到内容优化。我的 WordPress 内部链接怎么做? 讨论的就是下一层问题:机器进来以后,能不能顺着清楚的内部链接发现相关内容。图片也一样,除了可访问性,还应处理文件格式、文件名和 Alt Text;可参考 AI 图片上传 WordPress 前:做好 WebP 与图片 SEO 的 8 个步骤。
那 llms.txt 呢?需要马上安装吗?
近年不少网站开始讨论 llms.txt,希望用一个专门给大型语言模型读取的文字文件,整理网站的重要内容与文件入口。这个概念值得观察,也可以作为网站实验项目,但现阶段不应把它当成 robots.txt、sitemap 或正常 SEO 基础的替代品。
换句话说,如果网站本身连 crawler 都进不来、重要文章没有内部链接、页面内容不完整,再增加一个 llms.txt,并不会自动解决这些基础问题。
FAQ:robots.txt 常见问题
robots.txt可以让网页从 Google 消失吗?
不能把它当成可靠的移除索引方法。若目标是不让网页出现在 Google 搜索结果,应根据情况使用 noindex、移除内容或访问权限控制。
允许 AI crawler 后,就一定会被 ChatGPT 引用吗?
不会。允许爬取只是提供访问条件,是否被发现、使用或引用仍取决于系统本身、查询需求以及内容质量等因素。
WordPress 一定要自己建立 robots.txt吗?
不一定。WordPress 与部分 SEO 插件可以产生或管理相关规则。重点不是「有没有手写文件」,而是最终公开给 crawler 读取的规则是否正确。
robots.txt和 sitemap 是同一种东西吗?
不是。robots.txt 主要管理 crawler 可以访问哪些路径;sitemap 则帮助搜索引擎发现网站的重要 URL。robots.txt 也可以包含 Sitemap 的完整网址。
小结:AI SEO 还是要先把「门」处理好
AI 搜索出现以后,SEO 多了 AEO、AIO、GEO、llms.txt 等新名词,但网站最底层的逻辑没有消失:机器首先必须能够访问页面,然后才能读取、理解和决定是否使用内容。
所以,与其先问「怎样让 ChatGPT 引用我的网站」,更实际的顺序是:检查robots.txt → 确认页面可以正常访问 → 检查索引设置 → 整理内部链接与 sitemap → 再处理内容结构、可信度与 AI 搜索优化。
robots.txt看起来只是一个很小的文字文件,但在 AI crawler 越来越多的时代,它其实已经重新变成网站经营者应该看懂的基础设施。
感谢阅读。
支持本站
如果这篇文章对你有帮助,欢迎支持我们的创作。
.jpg)


Leave a comment