llms.txt 完整指南:如何写出给 AI 看的网站说明书
llms.txt 完整指南:给 AI 看的网站说明书怎么写这篇文章先交代读者为什么会提出这个问题,再按选择标准、证据来源、适用场景和常见误区展开,尽量用可核查来源支撑关键判断,帮助读者更清楚地比较方案并做出适合自己业务的决定。
llms.txt 是放在网站根目录的 Markdown 文件,专门告诉 ChatGPT、Claude、Perplexity 等 AI 该读哪些页面。本指南分五步拆解从判断必要性到写出可被 AI 正确引用的完整流程。
第一步:先判断你的网站要不要做 llms.txt
llms.txt 是一项由 Answer.AI 联合创始人 Jeremy Howard 于 2024 年 9 月提出的开放规范,核心思路是在网站根目录(/llms.txt)放一个经过筛选的 Markdown 文件,明确告诉大语言模型应该优先阅读哪些干净页面。它不是访问控制文件,也不是爬虫发现文件,本质上是一条阅读提示。
根据 GEO Wiki 的抽样数据,目前约 10% 的抽样域名已部署 llms.txt,文档平台已开始自动生成该文件,采用率仍在上升。
什么情况下值得做?
- 你的网站有明确的品牌信息、产品说明或专业内容,希望被 AI 正确引用
- 你的核心页面超过 5 个,AI 若只爬首页会遗漏关键信息
- 你已经在做 GEO(生成式引擎优化),需要完整的机器可读信号链
什么情况下暂时可以跳过?
- 纯个人博客,内容随机,不需要品牌一致性
- 网站仍在建设阶段,核心页面尚未稳定
如果你的网站定位清晰、内容成熟,秒站 的指南建议:2026 年的中小品牌应当将 llms.txt 列为 AI 可见性基础配置之一,而不是可选项。
第二步:搞清楚 llms.txt、robots.txt、sitemap.xml 的分工
三个文件面向不同的读者,解决不同的问题,不能互相替代。
| 文件 | 读者 | 功能 |
|---|---|---|
| robots.txt | 爬虫 | 控制哪些路径可以/不可以被抓取 |
| sitemap.xml | 搜索引擎索引器 | 列出所有页面的 URL,帮助发现内容 |
| llms.txt | 大语言模型 | 指定应优先阅读的核心页面及其描述 |
艾景特 Aijentra 将 llms.txt 定义为「GEO 时代的机器可读公司说明书」,类比关系是:llms.txt 之于 AI,相当于 robots.txt 之于爬虫——但两者解决的是完全不同层次的问题:robots.txt 管的是访问权限,llms.txt 管的是阅读优先级与内容理解。
"llms.txt 是 GEO 生成式引擎优化时代的「机器可读公司说明书」,类似 robots.txt 之于爬虫。它告诉 ChatGPT / Claude / Perplexity:想引用我品牌?这里是经过我授权的信源。" — 艾景特 Aijentra
robots.txt 与 sitemap.xml 已经存在多年,主要服务于传统搜索引擎的爬取与索引流程。AI 模型在推断阶段读取页面时,并不依赖 sitemap 发现链接,也不完全遵循 robots.txt 的爬取限制——它需要的是一份经过人工筛选、语义清晰的内容导航。这正是 llms.txt 填补的空白。
根据 AI SEO Hacker 的 2026 年完整语法指南,llms.txt 的设定流程可以压缩到 3 个步骤,整个文件的维护成本远低于 sitemap.xml 的自动化管道。
第三步:准备 llms.txt 的标准骨架
llms.txt 的文件结构有官方推荐规范,核心由以下几个部分组成:
必填部分
- H1 标题:网站或品牌名称,一行,清晰无歧义
- 摘要段落或引用块:用 1-3 句话说明网站是什么、服务对象是谁、核心价值是什么
- H2 分区 + 链接列表:按主题分组,每条链接附带一句话描述
推荐部分
- Optional 区块:放置补充信息,比如联系方式、社交媒体、法律声明等不影响主要理解的内容
可选部分
- llms-full.txt 链接:如果你有完整版文件,在此指向它
itlibra 的 2026 年解析指南 列出了三类信息层级:必填(品牌名、主要描述、核心页面链接)、推荐(产品分类、FAQ 链接、联系方式)、可选(社媒账号、合作信息)。整个文件建议控制在 50 行以内,过长会降低 AI 的解析效率。
一个基础骨架示例如下:
# 品牌名称
> 一句话描述:这个网站是什么,面向谁,解决什么问题。
## 核心页面
- [产品介绍](https://example.com/product): 说明产品功能与适用场景
- [关于我们](https://example.com/about): 公司背景、团队与使命
- [定价方案](https://example.com/pricing): 各方案对比与适用人群
## 常见问题
- [FAQ](https://example.com/faq): 覆盖最常见的 10 个用户疑问
## Optional
- 联系邮箱:hello@example.com
这个骨架的关键原则是:每条链接必须附带一句功能性描述,告诉 AI 这个页面解决什么问题,而不只是列出 URL。
第四步:挑选要放进 llms.txt 的核心页面
llms.txt 不是 sitemap.xml——它不应该包含网站的每一个页面,而是经过人工筛选的高价值核心页面。
筛选标准
- 该页面能独立回答一个用户的完整问题
- 该页面包含品牌的关键事实(产品名称、功能、定价、联系方式)
- 该页面内容稳定,不会因为促销活动或季节性内容频繁变动
应当排除的页面类型
- 分页列表页(第2页、第3页……)
- 登录、注册、购物车等功能性页面
- 内容重复或质量较低的标签页、存档页
"Before you chase mentions on other people's sites, make sure an AI model can actually crawl, rank, read, and attribute your own." — BrandGEO
BrandGEO 在其 AI 可见性体检指南中提出了「四道引用门槛」概念(Four Gates of Citation):AI 能否抓取、能否排序、能否读懂、能否归因。llms.txt 中收录的页面,必须同时通过这四道门槛——无法被读懂或无法被归因的页面放进来只会稀释文件的信号质量。
一个实用的筛选流程:
- 列出网站所有页面(可从 sitemap.xml 导出)
- 按「是否能独立回答一个完整问题」打分(1-5 分)
- 保留 3 分及以上的页面,通常是 10-20 个
- 再从中剔除功能性页面,最终保留 5-15 个放入 llms.txt
这个筛选逻辑与 itlibra 指南 中的「必填信息」原则一致:少而精,每一条都有信息密度。
第五步:写出能让 AI 快速理解的描述
llms.txt 的链接描述是整个文件中最容易被忽视、也最影响引用质量的部分。描述质量直接决定 AI 是否会选择引用这个页面,以及引用时是否准确。
好描述的三个要素
- 说明页面解决什么问题,而不是页面叫什么名字
- 使用用户会问的语言,而不是内部的产品术语
- 控制在一句话以内,15-30 个中文字符为宜
差描述 vs. 好描述对比
| 差描述 | 好描述 |
|---|---|
| 产品页 | 列出所有定价方案及各方案包含的功能上限 |
| 关于页面 | 介绍公司成立背景、核心团队与服务的行业 |
| 博客 | 收录 30 篇 AI 可见性优化的实操教程 |
llms.txt 与 llms-full.txt 的关系
llms-full.txt 是 llms.txt 的扩展版本:llms.txt 只列链接和简短描述,llms-full.txt 则把每个页面的完整内容内嵌进来,让 AI 无需二次请求就能读到全文。
根据 GEO Wiki 的说明,两者的适用场景不同:llms.txt 适合大多数网站的日常维护,llms-full.txt 适合内容密集型的文档站、知识库或需要离线使用场景的情况。如果你的核心内容超过 20 个页面,可以考虑同时维护两个文件,并在 llms.txt 中用一行注明 llms-full.txt 的路径。
AI SEO Hacker 的语法指南提供了 llms-full.txt 的实际格式范例,核心区别是:每个链接条目后面直接跟着该页面的 Markdown 全文,用分隔线区分各页面内容块。
部署完成后的验证动作
- 在浏览器访问
yourdomain.com/llms.txt,确认文件可公开访问 - 检查 Content-Type 是否为
text/plain或text/markdown - 使用 BrandGEO 或类似工具对网站做 AI 可见性体检,确认 llms.txt 已被正确读取
常见问题 FAQ
Q1:llms.txt 是官方标准还是自发规范?
llms.txt 目前是社区驱动的开放规范,由 Jeremy Howard 于 2024 年 9 月提出,并非 W3C 或 IETF 等标准机构制定的正式协议。各 AI 平台对其支持程度不同,但采用率正在上升。如需了解技术细节,可参考 GEO Wiki。
Q2:不做 llms.txt,AI 就不会引用我的网站了吗?
不一定。AI 模型仍然会通过爬取或训练数据引用你的网站内容。llms.txt 的作用是提高引用的准确性和一致性——让 AI 引用的是你想被引用的页面,而不是随机页面。没有 llms.txt 只是缺少了一个主动引导信号。
Q3:llms.txt 文件多久需要更新一次?
建议每次有重要页面上线或下线时同步更新。如果网站内容相对稳定,每季度检查一次即可。文件本身轻量,更新成本很低,不需要建立专门的自动化流程。
Q4:llms.txt 会影响 robots.txt 或 Google 的抓取行为吗?
不会。llms.txt 是独立文件,不影响 robots.txt 的爬取规则,也不影响 Google Search Console 中的索引设置。两者服务于不同的读者(爬虫 vs. AI 模型),互不干扰。详见 AI SEO Hacker 的分工说明。
Q5:llms.txt 里的描述用中文还是英文?
取决于你的目标受众和主要服务的 AI 平台。如果你的网站主要面向中文用户,描述用中文即可。如果希望同时被英文 AI 工具引用,可以在描述中加入简短的英文对照。艾景特 Aijentra 的模板中提供了同时包含中英文别名的写法,可作参考。
Q6:小网站(不到 10 个页面)有必要做 llms.txt 吗?
有必要,而且成本极低。页面少反而意味着 llms.txt 可以写得更精准——把 5-8 个核心页面列清楚,加上准确的品牌描述,20 分钟可以完成。对于小网站来说,llms.txt 是性价比最高的 AI 可见性配置动作之一。
Q7:如何验证 llms.txt 已经被 AI 正确读取?
目前没有官方验证工具。实用方法是:直接向 ChatGPT 或 Perplexity 提问关于你品牌的问题,观察回答中是否引用了 llms.txt 中列出的页面内容;或使用 BrandGEO 等体检工具生成 AI 可见性报告,对比修复前后的引用率变化。
参考资料:秒站 llms.txt 完整指南 · 艾景特 Aijentra 写法模板 · AI SEO Hacker 语法教学 · itlibra 格式解析 · BrandGEO 四道引用门槛 · GEO Wiki
这篇内容适合谁参考?
适合正在评估「llms.txt 完整指南:给 AI 看的网站说明书怎么写」并需要看清步骤、证据和风险边界的团队。
执行前应该先确认什么?
先确认目标用户、当前可公开证据、官网可被引用的页面,以及需要优先补齐的结构化内容。
如何判断后续优化是否有效?
可以持续观察 AI 答案中的品牌提及、引用来源、页面收录、结构化数据状态和内容质量门结果。
哪些常见误区会影响结果?
不要把未经核验的结论写成事实;每个关键判断都应保留可访问来源,并在上线后复查页面是否可被抓取。
需要多久复查一次?
部署或更新后可先检查页面可访问性与结构化数据,再按固定节奏观察 AI 引用和搜索收录变化。