先给结论。
对绝大多数做工业机械、医疗器械、建筑材料、化工材料、电子元器件的 B2B 外贸独立站来说,正确做法是放行"搜索类"和"用户触发类"AI 爬虫,只对"训练类"爬虫单独做取舍。原因很直接:你的网站不靠广告和订阅赚钱,内容本身不是你要卖的商品,你要卖的是产品和解决方案。让 ChatGPT、Claude、Gemini 在客户提问时能找到你、能引用你,价值远大于"防止内容被拿去训练模型"。
同时有三件事必须现在就去确认:
Cloudflare 将在 2026 年 9 月 15 日调整默认策略。如果你的站点用 Cloudflare 免费套餐,并且在这个日期前没有主动去后台改过设置,新的默认值会自动套用到你的站点上。
屏蔽
Google-Extended并不能让你退出 AI Overviews。这两件事在 Google 官方文档里是分开的,很多中文教程写反了。屏蔽 GPTBot 不等于从 ChatGPT 搜索结果里消失。OpenAI 的三个爬虫是相互独立的开关,可以只关训练、不关搜索。
下面把每一条拆开讲清楚,包括判断标准、可直接抄的配置,以及怎么验证配置真的生效了。本文所有事实结论都回溯到 Google、OpenAI、Anthropic、Cloudflare 的官方文档,来源与访问日期列在文末。
一、先分清楚:AI 爬虫不是一种东西,是三种
把"AI 爬虫"当成一个整体来屏蔽或放行,是最常见的错误。现在主流 AI 公司都已经把自己的机器人按用途拆开,并且给了网站主独立的开关。用途不同,屏蔽它的后果也完全不同。
三类用途:
训练类(Training):抓取内容用于训练基础模型。屏蔽它,你的内容不会进入模型训练集,但不影响你在该产品搜索功能中的可见性。
搜索类(Search):为 AI 产品的搜索/检索功能建立索引。屏蔽它,你会从该产品的 AI 回答中消失。这是 B2B 站最不该关的一类。
用户触发类(User-initiated / Agent):用户在对话里贴了你的链接、或让 AI 去访问某个页面时才抓取。屏蔽它,用户即使主动想看你的页面,AI 也读不到。
同一家公司的这三个开关是独立的。OpenAI 官方文档写得很明确:"Each setting is independent of the others – for example, a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training OpenAI's generative AI foundation models."(每项设置相互独立——例如网站主可以允许 OAI-SearchBot 以出现在搜索结果中,同时禁止 GPTBot 以表明抓取的内容不应用于训练 OpenAI 的生成式 AI 基础模型。)
二、主流 AI 爬虫用途对照表
下表全部依据各家官方文档整理,User-agent 一列即 robots.txt 中应使用的 token。
有两条值得特别留意:
Anthropic 明确承诺遵守 robots.txt。官方原文:"Anthropic's Bots respect 'do not crawl' signals by honoring industry standard directives in robots.txt."(Anthropic 的机器人通过遵守 robots.txt 中的行业标准指令来尊重"禁止抓取"信号。)它还支持非标准的
Crawl-delay扩展,可以在不屏蔽的前提下降低抓取频率。OpenAI 的
ChatGPT-User是个例外。官方文档写明:"Because these actions are initiated by a user, robots.txt rules may not apply."(因为这些行为由用户发起,robots.txt 规则可能不适用。)也就是说这一条你在 robots.txt 里写了也未必生效。
三、Cloudflare 9 月 15 日默认变更:被普遍误读的"含广告页面"
这是本文时效性最强的一条,也是被中文自媒体转述得最离谱的一条。
Cloudflare 在 2026 年 7 月 1 日发布的官方新闻稿中给出的原文表述是:对于新客户以及既有客户的新网站,自 2026 年 9 月 15 日起,默认值将设定为允许搜索,但会封锁对含有广告页面的训练和智能体用途。对于未提供选项让网站主在搜索、智能体用途和训练之间进行选择的混合用途爬虫,将在所有含广告页面上遭到封锁。
拆开看四个限定条件:
默认允许搜索。不是"默认屏蔽所有 AI 爬虫"。Search 这一类是放行的。
被封锁的是训练(Training)和智能体(Agent)两类用途,不是全部。
只作用于"含有广告的页面"。绝大多数 B2B 制造业独立站不挂广告,因此不落在这个默认拦截范围内。
对"混合用途爬虫"(把搜索、智能体、训练混在一起,不给网站主分开选择的爬虫)更严格,但同样限定在含广告页面上。
Cloudflare 联合创始人兼 CEO Matthew Prince 在同一份新闻稿中说明了这个设计意图:"我们希望我们提议的预设值变更,能鼓励混合用途的爬虫将搜寻用途与智慧体用途和训练用途区分开来。"
真正需要你行动的是这一条:新闻稿明确写道,自 2026 年 9 月 15 日起,这些变更也将套用至所有未在 2026 年 9 月 15 日前于仪表板中变更设定的现有免费客户。换句话说,如果你用的是 Cloudflare 免费套餐、而且从来没进过 AI Crawl Control 的设置页,那么 9 月 15 日之后你的站点会被切到新的默认值上。这个默认值对不挂广告的 B2B 站影响有限,但"影响有限"和"我确认过了"是两回事。
另外,Cloudflare 的 AI Crawl Control 官方文档(页面标注最后更新于 2026 年 4 月 23 日)说明该功能"Available on all plans"(所有套餐可用),提供逐个爬虫的 allow / block 规则、robots.txt 合规性追踪,以及处于 private beta 阶段的 pay per crawl。也就是说这个开关你现在就能进去看。
关键机制:CDN 层拦截发生在 robots.txt 之前
这是很多人踩坑的地方。Cloudflare 的拦截发生在网络层,在爬虫读到你的 robots.txt 之前就生效了。 你在 robots.txt 里写了 Allow,不代表爬虫真的能进来。
Google 在《AI features and your website》官方文档中把这件事列为出现在 AI 功能中的基础实践之一:"Ensuring that crawling is allowed in robots.txt, and by any CDN or hosting infrastructure"(确保 robots.txt 以及任何 CDN 或托管基础设施都允许抓取)。这句话里的"any CDN or hosting infrastructure"就是在说这个场景。
所以你需要检查的是两层,不是一层:robots.txt 是一层,Cloudflare / 其他 CDN 的 Bot 策略是另一层。两层任意一层拦住,结果都是抓不到。
四、三个最容易做错的判断
1. 屏蔽 Google-Extended 不能让你退出 AI Overviews
Google 官方爬虫文档对 Google-Extended 的定性写得没有任何模糊空间:"Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search."(Google-Extended 不影响站点在 Google 搜索中的收录,也不作为 Google 搜索中的排名信号。)
它控制的是:内容是否用于训练支撑 Gemini Apps 与 Vertex AI Gemini API 的未来模型,以及是否用于 Gemini Apps 和 Vertex AI 上"Grounding with Google Search"的 grounding。
那 AI Overviews 和 AI Mode 由什么控制?Google 在《AI features and your website》里给出的答案是 Googlebot:"AI is built into Search and integral to how Search functions, which is why robots.txt directives for Googlebot is the control for site owners to manage access to how their sites are crawled for Search."(AI 已内建于搜索并且是搜索运作方式不可分割的一部分,因此针对 Googlebot 的 robots.txt 指令才是网站主管理其站点如何被搜索抓取的控制手段。)
这意味着一个残酷的取舍:想退出 AI Overviews,只能用 nosnippet、data-nosnippet、max-snippet 或 noindex。而 Google 同时说明,页面要有资格出现在 AI Overviews 或 AI Mode 的支撑链接中,前提是"a page must be indexed and eligible to be shown in Google Search with a snippet"(页面必须被索引,并且有资格带摘要出现在 Google 搜索中)。用 nosnippet 退出 AI Overviews,等于同时放弃了普通搜索结果里的摘要。对靠 Google 自然流量拿询盘的外贸站来说,这个代价基本不可接受。
结论:B2B 外贸站不要动 AI Overviews 的退出开关。这不是一个值得做的取舍。
2. 屏蔽 GPTBot 不等于从 ChatGPT 里消失
这条前面已经引过 OpenAI 官方原文了。三个开关独立,你完全可以 Disallow: GPTBot 同时 Allow: OAI-SearchBot。
OpenAI 还给了一个具体的生效时间参考:"it can take ~24 hours from a site's robots.txt update for our systems to adjust"(从站点更新 robots.txt 起,我们的系统大约需要 24 小时来调整)。改完不要当天就下结论说没生效。
3. 靠封 IP 来 opt out 是错的
Anthropic 官方文档专门提醒了这一点:"Alternate methods like blocking IP address(es) from which Anthropic Bots operates may not work correctly or persistently guarantee an opt-out, as doing so impedes our ability to read your robots.txt file."(封锁 Anthropic 机器人所使用的 IP 地址等替代方法可能无法正确工作,也无法持续保证退出生效,因为这样做会妨碍我们读取你的 robots.txt 文件。)
逻辑很直白:你把 IP 封了,它读不到你的 robots.txt,也就无从知道你的意愿。要表达"不要抓我",正确的做法是让它进得来、读得到 robots.txt,然后在 robots.txt 里说清楚。
顺带说一句:Google 官方在 AI features 文档中明确写道:"You don't need to create new machine readable files, AI text files, or markup to appear in these features."(你不需要为了出现在这些功能中而创建新的机器可读文件、AI 文本文件或标记。)如果有人告诉你必须做一个 llms.txt 才能被 AI 搜索到,至少在 Google 这边,官方口径是不需要。
五、B2B 制造业独立站的推荐配置
下面这套配置的取向是:最大化 AI 可见性,只在训练用途上保留自主权。 适合产品页、技术参数、应用案例都希望被 AI 引用的制造业出口企业。
第 1 步:确认你的业务模式是否适用
先回答一个问题:你的内容本身是不是你的收入来源?
如果你靠广告位、付费墙、内容订阅赚钱 → 训练类爬虫确实在无偿消耗你的核心资产,收紧是合理的。
如果你靠卖产品、接订单、拿询盘赚钱(绝大多数外贸制造企业属于这一类)→ 内容是获客工具,被更多 AI 系统读到基本都是好事。
这个判断决定了后面所有取舍的方向。
第 2 步:写 robots.txt
放在网站根目录 https://你的域名/robots.txt。以下是一份可直接参考的配置,取向是"全部放行,只对训练类保留一个可选开关":
# 搜索类:全部放行,这是 AI 可见性的基础
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# 用户触发类:全部放行,客户主动想看你的页面时不要挡
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
# 训练类:默认放行;若决定收紧,把 Allow: / 改为 Disallow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
# 通用规则:只挡真正不该被抓的路径
User-agent: *
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /search?
Allow: /
Sitemap: https://你的域名/sitemap.xml
三点说明:
不要在 robots.txt 里
Disallow: Googlebot。这等于退出 Google 搜索,连带退出 AI Overviews 和 AI Mode。上面
Disallow的几个路径只是常见示例,请按你自己站点的实际结构调整,不要照抄。如果你确实担心抓取压力,Anthropic 支持
Crawl-delay(官方文档给出的示例是User-agent: ClaudeBot配Crawl-delay: 1),这比直接屏蔽温和得多。
第 3 步:检查 Cloudflare 的 AI Crawl Control 设置
这一步不能跳过,因为它比 robots.txt 优先级更高。
进入 Cloudflare 后台 → 找到 AI Crawl Control → 逐个查看爬虫的当前动作是 Allow 还是 Block。重点确认三件事:
搜索类爬虫(OAI-SearchBot、Claude-SearchBot)是否被放行。
有没有你并不知情就被设成 Block 的爬虫。
在 2026 年 9 月 15 日之前,主动进去把设置保存一次,明确表达你的选择,而不是被动接受新默认值。
Cloudflare 官方文档也提到该功能包含 robots.txt 合规性追踪,可以看到哪些爬虫在违反你的指令,这是一个免费且有用的核查入口。
第 4 步:确认没有被 WAF 或安全插件误伤
除了 Cloudflare 的 AI 爬虫设置,还有几个常见的误杀来源:
WAF 自定义规则或速率限制把 AI 爬虫的 UA 一起挡了
WordPress 安全插件(不少插件内置了"屏蔽 AI 爬虫"的一键开关,且默认开启)
服务器层的
.htaccess或 Nginx UA 黑名单主机商在基础设施层面的统一策略
这几处都要逐一排查。Google 那句 "and by any CDN or hosting infrastructure" 涵盖的正是这些地方。
第 5 步:验证配置真的生效
改完不要假设它生效了,要验证:
直接访问
你的域名/robots.txt,确认线上内容就是你写的那份(CDN 缓存可能让你看到旧版本)。查服务器访问日志,按 UA 关键词过滤
GPTBot、OAI-SearchBot、ClaudeBot、Claude-SearchBot,看这些爬虫最近是否真的来过、返回的是 200 还是 403。日志是唯一的事实。在 Cloudflare AI Crawl Control 里看爬虫活动数据,与日志交叉验证。
用 Search Console 的网址检查工具确认 Googlebot 能正常抓取渲染。Google 官方也提示,如果改了预览控制,"crawling can take anywhere from several days to several months"(抓取可能需要几天到几个月),要给系统时间。
OpenAI 侧留出约 24 小时再判断。
六、判断标准:什么情况下才应该收紧
放行是默认建议,但确实有该收紧的场景。用下面这张表对号入座。
一条通用原则:真正不能公开的内容,应该用鉴权和 noindex 挡住,而不是指望 robots.txt。 robots.txt 是一份君子协定,它对遵守规则的爬虫有效,对恶意爬虫没有任何约束力。把敏感资料放在公开 URL 上、然后写一行 Disallow 就以为安全了,这是配置层面的错误。
七、这件事对询盘的实际影响
需要诚实地说明一点:放行 AI 爬虫不会自动带来询盘,屏蔽也不会立刻让询盘归零。 任何声称能给出具体转化提升数字的说法,都应该要求对方出示可核验的数据来源。
能确定的因果关系只有这一条:爬虫抓不到,就一定不可能被引用。 Google 官方对 AI 功能给出的可见性前提是页面必须被索引且有资格带摘要展示;OpenAI 明确说明退出 OAI-SearchBot 的站点不会出现在 ChatGPT 搜索答案中;Anthropic 说明禁用 Claude-SearchBot 会降低站点在用户搜索结果中的可见性与准确性。这些都是官方给出的、方向明确的后果说明。
至于抓得到之后能不能被引用、被引用之后能不能带来询盘,取决于你的内容质量、页面结构和产品竞争力——那是另一个话题。放行只是把门打开,不是把客户请进来。
MaxGrowth 在给制造业客户做独立站技术诊断时,会把"AI 爬虫可达性"作为一个独立检查项,同时核查 robots.txt、CDN 层策略、WAF 规则与服务器日志四个层面,因为我们确实遇到过 robots.txt 写得完全正确、但被安全插件默认开关全部挡住的情况。这类问题的特点是:不看日志就发现不了。
八、常见问题(FAQ)
Q1:屏蔽 GPTBot 会不会影响我的 Google 排名?
不会。GPTBot 属于 OpenAI,与 Google 搜索排名没有关系。反过来,Google-Extended 也不影响 Google 搜索排名——Google 官方文档明确写明它"不影响站点在 Google 搜索中的收录,也不作为 Google 搜索中的排名信号"。真正会影响 Google 搜索的是针对 Googlebot 的指令。
Q2:我的站在 Cloudflare 上,9 月 15 日之后会自动屏蔽 AI 爬虫吗?
按 Cloudflare 官方新闻稿的表述,新默认值是"允许搜索,但封锁对含有广告页面的训练和智能体用途"。如果你的站点不挂广告,这条默认拦截不适用。但新闻稿同时说明,该变更会套用到所有在 2026 年 9 月 15 日前未在仪表板中变更设定的现有免费客户。所以正确做法是:不要靠推测,现在就进后台确认一次当前设置。
Q3:llms.txt 需要做吗?
至少对 Google 来说不需要。Google 官方在 AI features 文档中明确写道:"You don't need to create new machine readable files, AI text files, or markup to appear in these features."(你不需要为了出现在这些功能中而创建新的机器可读文件、AI 文本文件或标记。)该文档同时说明"There are no additional requirements to appear in AI Overviews or AI Mode, nor other special optimizations necessary."(出现在 AI Overviews 或 AI Mode 中没有额外要求,也不需要其他特殊优化。)其他 AI 平台是否有此类要求,需要以各自官方文档为准。
Q4:改了 robots.txt 多久生效?
OpenAI 官方给出的参考是搜索侧约 24 小时。Google 侧没有固定时间,官方说明抓取"可能需要几天到几个月",取决于系统判断页面需要多久刷新一次。Anthropic 官方文档未给出明确时间。所以改完之后,看日志比看时间靠谱。
Q5:屏蔽了训练类爬虫,我的内容还会不会被拿去训练?
robots.txt 是一份自愿遵守的协定。Anthropic 官方承诺其机器人遵守 robots.txt 标准指令,OpenAI 也说明 Disallow GPTBot 表示内容不应用于训练其基础模型。但这只对声明遵守的爬虫有效,对不遵守规则的抓取行为没有技术约束力。如果内容的保密性是硬要求,应该用鉴权而不是 robots.txt。
Q6:Cloudflare 的 pay per crawl 我能用吗?
Cloudflare 官方文档目前将 pay per crawl 标注为 private beta。同时按其 FAQ 说明,站点主只能对不同爬虫设置不同动作(Block / Charge / Allow),但只能设定一个统一价格;/robots.txt、/sitemap.xml、/security.txt、/.well-known/security.txt、/crawlers.json 这几个路径始终免费抓取。对绝大多数 B2B 制造企业来说,这个功能的意义不大——你的商业模式不是卖内容访问权。
Q7:ChatGPT-User 写在 robots.txt 里到底管不管用?
OpenAI 官方文档写明:"Because these actions are initiated by a user, robots.txt rules may not apply."(因为这些行为由用户发起,robots.txt 规则可能不适用。)也就是说不保证生效。同时官方也说明,ChatGPT-User 不用于决定内容是否出现在搜索中——管搜索的是 OAI-SearchBot。
九、来源说明与核实边界
本文所有关于爬虫用途、默认策略、生效条件的结论,均来自以下官方一手文档,访问日期为 2026 年 8 月 7 日:
Cloudflare 官方新闻稿《Cloudflare 让自主式互联网蓬勃发展,其核心理念简单明了:您的内容,由您作主》,发布日期 2026 年 7 月 1 日
Cloudflare 官方开发者文档 AI Crawl Control 概览页,页面标注最后更新 2026 年 4 月 23 日
Cloudflare 官方开发者文档 Pay Per Crawl FAQ
OpenAI 官方文档《Overview of OpenAI Crawlers》
Anthropic(Claude)官方帮助中心文章《Does Anthropic crawl data from the web, and how can site owners block the crawler?》,页面标注 2026 年 4 月 8 日
Google Search Central 官方文档《List of Google's common crawlers》
Google Search Central 官方文档《AI features and your website》
以下说法本文未予采信,因为无法在官方文档中核实:
"自 2025 年 7 月 1 日起,所有新接入 Cloudflare 的域名默认屏蔽 GPTBot、ClaudeBot、PerplexityBot" —— 此说法流传较广,但未在 Cloudflare 官方文档中找到对应原文。请以你自己 Cloudflare 后台的实际设置为准。
各类 AI 爬虫"抓取次数与回流访问比"的具体数值(如 1700:1、73000:1)—— 来源为第三方转述,未核实。
发布商通过 pay per crawl 可获得的月收入区间 —— 来源为第三方转述,未核实。
"某比例的头部网站已屏蔽 GPTBot"的统计数字 —— 来源为第三方统计,未核实。
一处需要提醒的口径冲突:不少中文报道将 Cloudflare 的 9 月 15 日变更概括为"默认屏蔽所有 AI 爬虫"。这与官方新闻稿原文不符——官方表述是"允许搜索,但封锁对含有广告页面的训练和智能体用途"。本文以官方原文为准。
时效提示:Cloudflare 在新闻稿中说明,在截至 2026 年 9 月 15 日的两个月内,将与生态系统成员互动、听取反馈并进行测试,以最终确定新的默认值与分类。这意味着具体分类规则在 9 月 15 日前仍可能调整。请在采取行动前,回到 Cloudflare 官方页面确认当前最新表述。
本文最后更新时间:2026 年 8 月 7 日。