robots.txt 别误伤 AI 爬虫:GPTBot/PerplexityBot 白名单实操指南
多数跨境独立站默认 robots.txt 会屏蔽 GPTBot、PerplexityBot 等 AI 爬虫,导致品牌无法被 AI 搜索引用。本文逐项拆解误伤点,给出白名单配置与验证方法。
核心答案:多数站点在 robots.txt 里沿用了旧模板或一键屏蔽全爬虫的规则,把 GPTBot、PerplexityBot、ClaudeBot 等 AI 引用爬虫一并挡住。逐条放开这些 User-agent,并保留后台与结账路径的屏蔽,是 GEO 的第一步。
为什么默认 robots.txt 容易挡住 AI 爬虫?
常见的误伤来自三类写法:
- `User-agent: *` 后直接 `Disallow: /`,本意是防采集,却同时拒绝了 AI 引用爬虫。
- 只按 SEO 习惯放开 Googlebot、Bingbot,没有单独声明 GPTBot、PerplexityBot、ClaudeBot、Google-Extended。
- 从建站模板或旧站迁移时带入了屏蔽规则,管理员并不知情。
GEO 的前提是“可被抓取、可被引用”。Google Search Central 在 2024 年 6 月 12 日的 AI Overviews 官方说明中提到,答案完整性与来源可追溯性正成为新的排序信号(来源:developers.google.com/search/blog)。来源不可抓取,追溯就无从谈起。
GPTBot、PerplexityBot、Google-Extended 的区别是什么?
它们分属不同用途,不能一刀切:
- GPTBot:OpenAI 用于训练与部分检索的爬虫。是否放开取决于你是否接受内容进入训练语料。
- OAI-SearchBot / ChatGPT-User:用于 ChatGPT 搜索与用户触发的实时抓取,对 AI 引用影响更直接。
- PerplexityBot:Perplexity 的索引与引用爬虫,放开后页面才有机会出现在其答案来源中。
- ClaudeBot / anthropic-ai:Anthropic 相关抓取。
- Google-Extended:控制内容是否用于 Gemini 等生成式用途,与 Googlebot 的搜索收录是分开的。
跨境卖家需要区分“训练”与“引用”两种意图。只想被引用、不想被训练,可以只放开检索类爬虫,保留训练类限制。
怎么配置白名单,既放开 AI 引用又保护敏感路径?
原则是“按目录分级,而不是全站开关”。示例:
```
User-agent: GPTBot
Allow: /
Disallow: /cart
Disallow: /checkout
Disallow: /admin
User-agent: PerplexityBot
Allow: /
Disallow: /cart
Disallow: /checkout
User-agent: Google-Extended
Allow: /blog
Allow: /products
Disallow: /
```
要点:
1. 产品页、博客、FAQ、帮助中心优先放开,这些是 AI 最常引用的内容类型。
2. 后台、购物车、结账、用户账户保持屏蔽,避免抓取与安全风险。
3. 若使用 CDN 或 WAF,需同步检查是否在边缘层拦截了上述 User-agent,robots.txt 只是第一道门。
4. 配置后用 `curl -A "GPTBot"` 或日志抓取验证实际返回状态,不要只看文件内容。
结构化数据会放大效果。BrightEdge《Q2 2024 AI Search Report》显示,含 Schema.org + JSON-LD 结构化数据的页面在 Google AI 概览中的引用率提升约 3.2 倍,问答式长尾词贡献了搜索增量的 41%(来源:brightedge.com/resources/reports/q2-2024-ai-search-report)。放开爬虫只是入场券,内容形态决定能否被选中。
高风险垂类需要额外注意什么?
医疗、金融、保健类跨境站点,AI 搜索的信任门槛更高。Search Engine Journal 在 2024 年 6 月 25 日报道,Bing AI Search 新增可信来源强化模块,对高风险垂类实施双重事实核查,并优先展示经权威认证的实体页面(来源:searchenginejournal.com/bing-ai-search-trust-module/519872)。这类站点除了放开爬虫,还需补齐作者资质、企业实体、认证信息,否则即使被抓取也难被引用。
Princeton 等机构在 KDD 2024 的 GEO 研究中提出,引用来源、统计数据与权威表述能显著提升生成式引擎中的可见性。这与 robots.txt 的关系是:先让爬虫进得来,再让内容值得被引。
下一步:先测基线,再逐项优化
robots.txt 是低成本、高回报的一步,但它只是 GEO 的起点。建议先确认自家域名对 GPTBot、PerplexityBot 的可抓取状态,再检查结构化数据与问答内容覆盖。想系统化推进的读者,可以先用免费工具测一下自己品牌的 AI 可见性基线,明确当前在主流 AI 搜索中的引用情况,再决定优先修哪一环。
