llms.txt 是什么、怎么写、部署到哪:给 AI 爬虫一本站点说明书
llms.txt 是放在站点根目录的纯文本说明文件,用 Markdown 结构告诉 AI 爬虫哪些页面值得抓、能回答什么问题。本文给出模板、部署位置与跨境卖家的落地顺序。
llms.txt 是放在网站根目录的纯文本文件,用 Markdown 结构告诉 AI 爬虫:这个站点是做什么的、哪些页面值得抓、每个页面能回答什么问题。它不是排名技巧,而是一份降低 AI 理解成本的站点说明书。
为什么跨境卖家需要一份 llms.txt?
AI 搜索的抓取与引用逻辑,和传统爬虫不完全一样。传统 SEO 关心页面能否被索引,GEO(Generative Engine Optimization)更关心内容能否被模型准确提取、组织进答案。Google Search Central 在 2024 年 6 月 12 日的官方博客《AI Overviews: How we're evolving search with generative AI》中明确,"答案完整性"与"来源可追溯性"正在成为新的排序信号。
对跨境卖家来说,问题更具体:产品页、尺码表、物流政策、退换货规则分散在多个 URL,模型很容易只抓到一半信息,生成不完整的答案。llms.txt 的作用,是把这些分散信息按主题聚合,并用一句话说明每个链接的价值,让模型在有限抓取预算内优先拿到关键页面。
BrightEdge《Q2 2024 AI Search Report》(2024 年 6 月 18 日)显示,含结构化数据(Schema.org + JSON-LD)的页面在 Google AI 概览中的引用率提升 3.2 倍,问答式长尾词流量占搜索总增量的 41%。llms.txt 与结构化数据互补:前者是站点级导航,后者是页面级标注。
llms.txt 和 robots.txt、sitemap.xml 的区别是什么?
三者经常被混为一谈,但职责不同:
- robots.txt:访问许可。告诉爬虫哪些目录不能抓,是"禁止清单"。
- sitemap.xml:全量清单。列出所有希望被索引的 URL,机器可读,但不解释内容。
- llms.txt:语义导航。用人类可读的 Markdown 说明"这个站点是什么、哪些内容对问答有用"。
robots.txt 决定"能不能进",sitemap.xml 决定"有哪些门",llms.txt 决定"该先去哪扇门、进去看什么"。对 AI 搜索而言,第三层缺失时,模型只能靠页面权重自行猜测,跨境站尤其容易在物流与合规页面被漏读。
怎么写:一份可直接套用的结构模板
llms.txt 用 Markdown 书写,建议控制在 100 行以内,避免堆砌关键词。基本结构:
```markdown
品牌名 / 站点名
一句话说明:面向哪些市场、主营什么品类、核心差异化是什么。
核心页面
购买与履约
售后与合规
可选
- 博客与选购指南:按使用场景组织的长尾内容
```
写法上有三个要点:每行链接后跟一句用途说明,而非关键词罗列;按用户决策路径分组,而非按网站栏目结构;只用纯文本或 Markdown,不加脚本、不内嵌 HTML。
部署到哪、怎么被读取?
标准位置是站点根目录:`https://你的域名/llms.txt`。与 robots.txt 同级,无需登录、无需鉴权,返回 `Content-Type: text/plain; charset=utf-8` 即可。
部署方式按建站类型区分:
- Shopify:在后台"内容 > 文件"上传后,通过主题代码或应用将路径重写到根目录;部分主题可直接放入 `assets` 并配置路由。
- WordPress:在站点根目录直接放置文件,或用插件生成,注意伪静态规则不要把 `.txt` 重写到 404。
- 自建站(Next.js / Nuxt 等):放入 `public/` 目录,构建后即位于根路径。
部署后用浏览器直接访问该 URL 验证可读性,再用 `curl -I` 确认状态码为 200。若站点有 CDN,需确认 `.txt` 未被缓存规则拦截。
需要说明的是,llms.txt 目前仍属社区提案,尚无主流搜索引擎公开承诺将其作为抓取依据。它的价值在于降低模型理解成本,不宜视为确定性排名手段。Bing AI Search 在 2024 年 6 月 25 日新增"可信来源强化模块"(Search Engine Journal 报道),对医疗、金融等高风险垂类实施双重事实核查,推动垂直领域 GEO 向 E-E-A-T 2.0 演进——这意味着站点信息的可验证性,长期看仍是关键变量,llms.txt 只是其中一环。
落地建议:先测基线,再逐层补全
llms.txt 的投入不大,适合作为 GEO 的第一块拼图。建议顺序是:先确认核心页面已被 AI 正确引用,再补结构化数据,最后用 llms.txt 做站点级导航。想系统化推进的读者,可以先用一个免费工具测一下自己品牌的 AI 可见性基线,看清当前在主流 AI 答案中被提及和引用的实际情况,再决定优先级。
