TL;DR · 内容摘要,太长不看
llms.txt是放在网站根目录的一份 Markdown 文件,专为 LLM 和 AI Agent 编写,作用相当于"给 AI 看的网站导航 + 使用说明书"。
- 为什么:AI 直接读 HTML 浪费 Token、容易迷路、引用出错;
llms.txt用 10 行文字替它把路标标好。- 和谁不同:
robots.txt说"别碰这里",sitemap.xml甩一份 URL 清单,llms.txt说"重点看这几页"——语义级而非机械级。- 怎么做:根目录建文件 → 写 150–200 字简介 → 列 5–10 条核心链接(各附一句说明)→ 定期更新。
- 值不值:在 GEO(生成式引擎优化)语境下,这是让 AI 在回答用户时把你列为"权威来源"的最低成本动作。
📌 适合:技术站长、开发者文档负责人、关注 AI 搜索流量的产品/市场团队。

一项面向 AI 时代的新事实标准正在互联网上快速兴起:网站在根目录提供一份 /llms.txt 文件,供大语言模型(LLM)和 AI 智能体(AI Agent)高效地理解网站结构与核心内容。
简单来说,llms.txt 就是专门写给 LLM 和 AI Agent 看的"网站导航图"兼"使用说明书"。
该概念由 fast.ai 创始人 Jeremy Howard 于 2024 年下半年提出(项目官网:llmstxt.org),目前已被众多知名开源项目、技术文档网站和前沿博客广泛采用。
一、为什么需要 llms.txt?
在过去,网站是写给人类看的。网页中充斥着 HTML 标签、CSS 样式、JavaScript 脚本、广告、侧边栏和导航菜单。传统搜索引擎(如 Google、百度)的爬虫在抓取时,有成熟的算法从中提取正文,屏蔽噪声。
然而,当 AI 搜索(如 Perplexity、ChatGPT Search)或 AI 智能体(如 AutoGPT、Devin)来访问您的网站时,问题就来了:
- Token 浪费:AI 逐字读取充满噪声的 HTML,既消耗大量 Token 推高成本,又挤占有限的上下文窗口。
- 迷失方向:面对成百上千个网页,AI 很难快速判断"这个网站的核心价值是什么""哪篇文档才是最权威的入门指南"。
- 幻觉风险:若 AI 恰好抓取了过时或边缘页面,回答用户问题时便可能产生"幻觉"或给出错误引用。
llms.txt 的出现,正是为了给 AI 提供一份纯净、结构化、基于 Markdown 的"导览手册",明确告诉它:"我是谁,核心内容在哪里,请优先阅读这些链接。"
二、llms.txt 与 robots.txt、sitemap.xml 的区别
在引入 llms.txt 之前,先回顾两个更古老的协议。
回顾 robots.txt 与 sitemap.xml
robots.txt
robots.txt(机器人排除协议)是互联网上历史最悠久的爬虫控制文件。
互联网早期,网页抓取程序野蛮生长,频繁请求常常导致小型服务器过载瘫痪。1994 年,早期搜索引擎 WebCrawler 的开发者 Martijn Koster 提出了一种基于纯文本文件的"君子协定"——让网站管理员可以声明哪些目录不允许爬虫访问。
2022 年 12 月,IETF 正式发布 RFC 9309,将 robots.txt 的语法格式确立为互联网标准(RFC 9309)。需要指出的是,该标准仅规范了 robots.txt 文件本身的语法;基于 HTTP 响应头的 X-Robots-Tag 和 HTML <meta name="robots"> 标签虽在实践中被主流搜索引擎支持,但并不属于该标准的范畴。
sitemap.xml
如果说 robots.txt 是"防御性"的(告诉爬虫"别去哪"),那么 sitemap.xml(站点地图协议)则是"建设性"的(主动把核心内容"端"给爬虫)。
随着 Web 2.0 和动态网页的兴起,搜索引擎很难仅靠"顺藤摸瓜"(沿超链接逐层爬取)发现所有深层页面。Google 率先推出了基于 XML 的站点地图协议,让站长主动提交 URL 列表。该协议最初名为 Google Sitemaps,后演变为行业通用标准:只要符合 sitemaps.org 的规范,生成的 XML 文件即可被全球主流搜索引擎统一解析。
sitemap.xml 的核心版本(Sitemap Protocol 0.9)自 2008 年发布至今未经历大版本更迭,足见其设计之稳定。
三者对比
llms.txt、robots.txt 和 sitemap.xml 构成了现代网站与机器交互的"三驾马车",但分工截然不同:
| 文件 | 面向对象 | 核心作用 | 功能定位 |
|---|---|---|---|
| robots.txt | 传统搜索引擎爬虫 | 规则与限制——告知爬虫哪些路径禁止抓取 | 防御性("这里不要看") |
| sitemap.xml | 传统搜索引擎爬虫 | URL 清单——列出网站全部页面的物理链接 | 机械性("所有页面都在这") |
| llms.txt | LLM / AI Agent | 语义导览——提供网站简介、核心概念及最精华的链接 | 建设性("请看这里,这是重点") |
一个关键洞察
robots.txt 长期作为各大搜索引擎默契遵守的事实标准存在,但即便已升格为 IETF 标准,它也只能约束"守规矩"的爬虫。大量恶意爬虫、数据搬运机器人、漏洞扫描器根本不会读取它,其抓取行为规模庞大且具有破坏性。
换言之,精心编写的 robots.txt 在实践中往往只剩这么一行有意义:
User-agent: *
Sitemap: https://example.com/sitemap.xml不守规则的抓取工具不会因 Disallow 而止步,反而会像"欢迎" sitemap.xml 一样,把 llms.txt 当作"菜单"照着爬——它们对规则毫无敬畏,但绝不放过任何线索。
因此,robots.txt(同理 llms.txt)不能当作访问控制或安全边界。由于这些文件对所有人公开可见,切勿在其中列出敏感路径。以下写法相当于主动暴露后台入口:
User-agent: Bytespider
Disallow: /
User-agent: PetalBot
Disallow: /
User-agent: *
Disallow: /secret-admin-panel/真正的安全防护必须依赖身份认证、IP 白名单等访问控制机制,而非"写在文件里就不让看"。
三、llms.txt 文件长什么样?
llms.txt 是一个纯文本文件,强烈建议采用 Markdown 格式——LLM 对 Markdown 的解析能力极佳。
一个典型的 llms.txt 结构如下:
markdown
# {您的网站名称}
> {您的网站名称}是一个专注全球数字艺术品收藏与交易的在线平台。
## 核心业务
- 提供数字艺术品的确权与交易服务。
- 为独立创作者提供作品展示橱窗。
## 核心文档与指南(推荐 AI 优先阅读)
- [新手入门指南](/docs/getting-started.md):了解如何注册并完成首次交易。
- [API 接口文档](/docs/api-reference.md):开发者如何接入我们的交易系统。
- [创作者守则](/policies/creator-rules.md):平台对上传内容的审核标准。
## 近期重要更新
- [2026 年 Q3 平台规则调整说明](/blog/2026-q3-updates)
## 完整知识库(可选)
如需完整的上下文来回答复杂问题,请参考:
- [完整知识库 (llms-full.txt)](/llms-full.txt)注:llms-full.txt 是一种进阶实践——将网站所有核心文档的 Markdown 原文拼接为一个大文件,供拥有超长上下文窗口的 AI 模型一次性读取,避免多次跳转。四、对网站主的战略意义:GEO
在传统的 SEO(搜索引擎优化)时代,我们围绕关键词优化,争夺 Google、百度的排名。而在 AI 时代,GEO(Generative Engine Optimization,生成式引擎优化)正在崛起。
设想这样一个场景:用户向 Perplexity 或 ChatGPT 提问——
"请推荐一个靠谱的数字艺术品交易平台,并告诉我如何接入他们的 API。"
- 没有
llms.txt的网站:AI 可能在海量 HTML 中迷失,恰好抓取到一篇过时的论坛帖子,从而给出错误信息。 - 有
llms.txt的网站:AI 爬虫(如 PerplexityBot)会优先读取llms.txt,快速解析网站定位与核心内容,理解您的业务,并将您的"API 接口文档"链接作为权威引用来源呈现给用户。
结论:部署 llms.txt 是抢占 AI 搜索流量入口、让您的网站成为 AI"标准答案"来源的低成本、高回报策略。
五、落地建议
如果您希望被 AI 搜索(Perplexity、ChatGPT Search 等)更好地收录与引用,建议按以下步骤操作:
- 在网站根目录创建
llms.txt文件(确保返回Content-Type: text/plain或text/markdown)。 - 用 Markdown 撰写一段 150–200 字的网站简介,清晰说明"我是谁、做什么、为谁服务"。
- 列出 5–10 个最核心的页面链接(如产品页、API 文档、权威报告),使用相对路径或绝对 URL,每条附一句简短说明。
- 保持内容简洁、客观,不要嵌入 HTML 标签或 JavaScript。
- 定期更新——尤其在新功能上线、文档改版后同步修改,避免 AI 引用过时信息。
六、总结
llms.txt 不是强制性技术标准,而是 AI 时代网站与机器沟通的"新礼仪"。它标志着互联网的内容分发逻辑,正从"为人类阅读而设计"向"为机器理解而优化"发生深刻转变。
与其等待 AI 在 HTML 的丛林中迷路,不如主动递上一张清晰的地图。
七、FAQ/常见问题
问题1:不做 llms.txt 会怎样?AI 是不是就不收录我的站了?
不会。llms.txt 不是收录的"准入条件",而是"优先通道"。没有它,AI 依然能通过 sitemap.xml、正文抓取等方式访问你的网站,只是效率低、容易抓错页面。做了 llms.txt,等于给 AI 铺了一条"VIP 快速通道"——它大概率会优先读取、优先引用。不做不致命,做了更占便宜。
问题2:我已经有 sitemap.xml 了,还需要 llms.txt 吗?
需要,两者解决不同问题。sitemap.xml 是一份无差别的 URL 清单(可能几百上千条),llms.txt 是一份带语义的"编辑推荐"(5–10 条 + 一句说明)。对 AI 而言,从 500 条 URL 里猜"哪条最重要",和直接被告知"请优先读这 7 条",体验完全不同。两者互补,不互斥。
问题3:怎么让 AI 真正"发现"我的 llms.txt?需要加特殊 HTTP 头吗?
目前(截至 2025 年中)的通用约定是:放在网站根目录 /llms.txt,返回 200,Content-Type 建议为 text/plain; charset=utf-8 或 text/markdown; charset=utf-8。部分 AI 爬虫(如 PerplexityBot)会主动请求该路径;部分则依赖 robots.txt 中的 Sitemap: 提示或 Link HTTP 头(rel="llms")来发现。
保险做法:在 robots.txt 末尾加一行
Sitemap: https://example.com/llms.txt并在主页 <head> 中声明
<link rel="llms" href="/llms.txt">双保险,成本几乎为零。
问题4:llms.txt 会不会成为新的信息泄露面?
不会——前提是你只写"你本来就想让全世界知道的内容"。llms.txt 和 robots.txt 一样,是公开文件,任何匿名访问者都能 GET 到。因此:
- 不要在其中暴露未公开的内部链接、API 密钥、管理后台路径。
- 不要在文件里写"我们还有一个 /internal/ 目录不对外"这类话。
它本质上是你的"门店橱窗说明",不是"仓库钥匙"。
问题5:中文站 / 小型独立站有没有必要做?
有,甚至更有必要。大厂技术文档站本身就有大量结构化内容,AI 即便迷路也能兜住;而小站、独立博客、垂类产品页一旦 AI 抓错页面,用户得到的引用就是错的,品牌印象直接受损。而且 llms.txt 的编写成本极低(一次 20 分钟,之后偶尔更新),对小站来说几乎是"免费流量杠杆"。
问题6:需要多久更新一次?
没有硬性周期。建议触发式更新:
- 上线 / 下线核心功能页面时;
- 文档大版本改版后;
- 每 1–2 个月检查一次链接是否 404。
电话换了,名片总会更新一下,对吧?







