llms.txt:给 AI 一份你的网站说明书
AI 引擎(ChatGPT、Claude、Perplexity、秘塔、豆包)回答用户问题时,会去抓网页。但它抓到的是给人看的 HTML——有导航栏、有页脚、有 CSS、有广告代码。AI 得从这一堆里"猜"哪部分是正文、哪篇文章讲什么、哪个页面最重要。
你的站有 sitemap.xml,它告诉 AI"我有哪些页面"。但 sitemap 有两个问题:一是太长,一个站几百个 URL,全塞进 AI 的上下文窗口塞不下;二是没有描述,sitemap 只有 URL 列表,AI 不知道每个页面讲什么、哪个值得优先读。
llms.txt 解决的就是这个:一份人写的、简短的、带描述的、给 AI 看的网站说明书。AI 来了先读它,就知道这个站讲什么、核心文章在哪、该读哪几篇。
三个文件,三个分工
robots.txt、sitemap.xml、llms.txt 经常被混淆,但分工完全不同。
上图:robots.txt 是门卫,管"能不能进";sitemap.xml 是目录,管"有哪些页";llms.txt 是菜单,管"进来后先读哪份"。llms.txt 官方原话说 robots.txt "lets automated tools know what access to a site is considered acceptable",而 llms.txt "is used on demand, when an agent needs information about a topic"。
llms.txt 的格式(v2 标准)
llms.txt 放在网站根目录,和 robots.txt 同级。格式按固定顺序四层:
第一层:H1 标题,写站名。这是唯一必须有的。
# 纪优 GEO 研究
第二层:blockquote 摘录,一句话讲清这个站是什么。 AI 扫一眼这句就知道要不要深入。
> 纪优的生成式引擎优化(GEO)研究站。记录如何让 AI 引擎引用你的内容。
第三层:可选的 H2 分区文件列表。 每条是 [名称](URL): 描述,这是核心——AI 按这个列表去读你的文章。
## 核心文章
- [自足段落](https://www.jiyou.site/articles/zi-zu-duan-luo.html): 答案优先、段落密度、可摘录性
- [怎么让 AI 引用你](https://www.jiyou.site/articles/rang-ai-yin-yong-ni.html): 统计数字、专家引用、流畅度三规则
第四层:## 可选 分区。 按惯例放"AI 上下文不够时可跳过的次要信息",比如关于页、外链。
整份文件就这么短——几十行,比 sitemap.xml 小一个数量级。这是刻意的:llms.txt 官方说 sitemap "will generally cover documents that in aggregate will be too large to fit in an LLM context window",所以 llms.txt 必须精挑细选、能整个塞进 AI 的上下文窗口。
谁真的在读 llms.txt?
标准再好,没人读就是摆设。2026 年实测结论:
三大 AI 厂以身作则。 OpenAI 在 developers.openai.com/llms.txt 发了自己的 llms.txt,Anthropic 在 docs.anthropic.com/llms.txt 发了,Google 在 ai.google.dev 也发了。三家都给自己的开发者文档配了 llms.txt——它们自己觉得这东西有用,才会给自己用。
工具链已接入。 Lighthouse(Chrome 的网站审计工具)把"有没有 llms.txt"纳入了 agentic browsing 检查。Yoast SEO、AIOSEO、Wix 这些主流建站工具内置了 llms.txt 生成器。当建站工具默认生成它时,采纳率会加速。
一个关键真相。 llmstxt.org 说"thousands of sites publish an llms.txt file",但没有声称 Google、百度这类通用搜索爬虫会去索引 llms.txt。它的设计意图是按需读取——AI Agent 在回答用户问题时去抓这份文件,不是被搜索引擎当排名因素。所以:llms.txt 是 AI 引用入口,不是 SEO 排名加分项。 这跟 GEO 的目标完全吻合——你要的是被 AI 引用,不是在搜索结果排第一。
为什么现在就该做
大多数站主还不知道这个文件,或觉得"我的站太小,AI 不会来读"。但这恰恰是机会。
一个大站的 llms.txt 可能又长又杂,AI 读进去一堆噪声。你的小站,llms.txt 简短精准,三篇核心文章各一句话讲清精髓——AI 反而更可能把它完整读进上下文。当 AI 拿到一份清晰菜单,而不是一堆 HTML 让它猜,它引用你内容的概率就上去了。
而且 llms.txt 是零成本零风险的:一个纯文本文件,不改动任何现有页面,不影响 SEO,不影响性能。做了不亏,不做等于把"AI 进站后先读哪份"这个引导权让给了 AI 自己猜。
动手:五分钟建一个
在网站根目录建 llms.txt(和 robots.txt 同级)。这是一份真实的、已上线 www.jiyou.site 的 llms.txt:
# 纪优 GEO 研究
> 纪优的生成式引擎优化(GEO)研究站。记录如何让 AI 引擎引用你的内容,含结构化数据、实体图、自足段落等实操方法。
## 核心文章
- [自足段落:怎么写才会被 AI 摘录](https://www.jiyou.site/articles/zi-zu-duan-luo.html): 答案优先、段落密度、可摘录性——让段落脱离标题后仍能独立成文被 AI 引用
- [怎么让 AI 引用你](https://www.jiyou.site/articles/rang-ai-yin-yong-ni.html): 用统计数字、可查证专家引用、流畅度三规则提升被 AI 引用的概率
- [怎么让 AI 引擎认出你是谁](https://www.jiyou.site/articles/shi-ti-tu.html): JSON-LD 实体图,用 @id 串联人物/机构/文章名片,解决实体消歧
## 可选
- [首页](https://www.jiyou.site/): AI 搜索对话式文章检索
- [知乎主页](https://www.zhihu.com/people/yeah-98-35): 纪优的知乎身份锚点
- [GitHub](https://github.com/jaykaai): 站点源码托管
写法要点三条:
描述要自己写。 每篇文章后面那句描述,是 AI 判断"要不要读这篇"的唯一线索。作者本人写的"这篇在讲什么"比任何人写的都准。别图省事用文章标题重复一遍——描述要讲清这篇的独到价值,不是换个说法复述标题。
核心区精挑细选。 ## 核心文章 下面只放最能代表你专业水平的文章。三到五篇最佳。把所有文章都塞进来,llms.txt 就退化成了第二个 sitemap——又长又没重点,AI 读不完。
## 可选 放身份锚点。 这个分区按惯例放次要信息。适合放你的知乎、GitHub 等身份锚点——这些不是文章,但帮 AI 验证"你是谁",和 JSON-LD 的 sameAs 一个逻辑。
和 robots.txt 的联动
llms.txt 不是孤立的,它和 robots.txt 是一套配合:
robots.txt 决定 AI 爬虫能不能进你的站。如果你的 robots.txt 屏蔽了 GPTBot、ClaudeBot、PerplexityBot,那 AI 连你的页面都抓不到,llms.txt 写了也没人读。
llms.txt 决定 AI 进来后先读哪份。爬虫放行是前提,菜单引导是放大器——先让 AI 能进来,再给它一份清晰地图,它引用你内容的概率才最高。
所以正确的顺序是:先查 robots.txt 确认 AI 爬虫全放行,再写 llms.txt 给 AI 一份菜单。这两步做完,你的站对 AI 引擎就是"可进、可读、懂优先级"的状态——这是 GEO 的基础设施层。
三个常见问题
llms.txt 和 robots.txt 有什么区别? robots.txt 管禁止(哪些不能抓),对象是所有爬虫;llms.txt 管引导(进来先读哪份),对象是 AI Agent。一个在门口,一个在菜单。
哪些 AI 引擎真的在读 llms.txt? OpenAI、Anthropic、Google 三家都给自己的开发者文档发了 llms.txt,Lighthouse 已把它的存在纳入审计。但注意——通用搜索爬虫(Googlebot、Baiduspider)不会把 llms.txt 当排名因素,它是按需读取的 AI 引用入口,不是 SEO 加分项。
llms.txt 会影响 SEO 排名吗? 不会。它不是搜索引擎的排名因素。它的价值在 AI 引用层:AI Agent 回答用户问题时,按需抓取这份文件来决定读你哪些页面。你要的是被 AI 引用,不是在搜索结果排第一——llms.txt 正好服务前者。