LLMs.txt 生成器
输入你的域名。LLMs.txt 生成器会抓取网站,挑出值得展示给 AI 系统的页面,把它们归入各个板块,并为每一页撰写描述。你会得到一份经过校验的 llms.txt,发布前还能自行修改。
差别在流程的中段。生成器不会把站点地图直接倒进一个文本文件:网址会被筛选,重要页面被优先排列,描述取自页面的真实内容,而不是 meta 标签。
工作方式
- 输入你的网站。 也可以指定站点地图,或粘贴自己的网址清单。
- LLMs.txt 生成器抓取并分析。 robots.txt、你的站点地图,以及每个页面的正文。
- 生成并校验文件。 板块、描述,以及合规性检查。
- 你审阅、修改并发布。 未经你确认,任何内容都不会发出去。
不只是把站点地图转成 llms.txt
简单的生成器只跑一遍:站点地图进去,带 meta 描述的网址出来。登录页、购物车和一百篇空洞的博客文章,就是这样混进已发布的文件里的。
| 能力 | DiagnoSEO | 其他生成器 |
|---|---|---|
| 抓取页面的真实内容 | ✅ | 因工具而异 |
| 过滤掉没有价值的网址 | ✅ | 因工具而异 |
| 优先处理重要页面 | ✅ | 因工具而异 |
| 生成条理清晰的板块 | ✅ | 因工具而异 |
| 根据页面内容撰写描述 | ✅ | 因工具而异 |
| 使用网站语言撰写 | ✅ | 因工具而异 |
| 内置校验 | ✅ | 因工具而异 |
| 下载前可编辑 | ✅ | 因工具而异 |
| 显示被跳过的网址及原因 | ✅ | 因工具而异 |
| 与你现有的 llms.txt 对比 | ✅ | 因工具而异 |
| 生成 llms-full.txt | ✅ | 因工具而异 |
LLMs.txt 生成器具体做什么
- 优先使用站点地图。 读取 robots.txt,并支持站点地图索引与 gzip 压缩的站点地图。
- 没有站点地图时的备用抓取。 从首页的内部链接出发寻找页面。
- 并行抓取 让较大规模的抓取依然保持速度。
- 聪明地挑选网址。 文档、产品、服务、价格、关于我们和联系方式优先。
- 剔除噪声。 文件、登录、购物车、分页、标签与日期归档、筛选参数。
- 自定义排除规则。 添加需要跳过的网址片段,例如
/tag/或?filter=。 - 板块平衡 可避免体量庞大的博客挤掉你的文档。
- 清理标题。 “价格 | 品牌”会变成“价格”。
- H2 板块 外加用于次要内容的
Optional板块。 - 站点摘要与逐页描述 取自真实内容,并使用你网站的语言。
- 回退到 meta 描述。 模型不可用时也能拿到一份可用的文件。
- 下载前校验, 包含 Chrome Lighthouse 的判定标准。
- 对比 你域名上已经发布的 llms.txt。
- 来源透明。 每个被采用的网址都会列出并可取消勾选;每个被跳过的都会写明原因。
- llms-full.txt, 来自同一次抓取,包含页面全文。
什么是 llms.txt
llms.txt 是 llmstxt.org 提案所定义的 Markdown 文件,由 Jeremy Howard(Answer.AI)于 2024 年 9 月发布,并在 2026 年 8 月更新到 v2。它是由社区推动的提案,并非 W3C 或 IETF 标准。
结构很简短:写有站点名称的 H1(唯一的必需元素)、引用块形式的摘要、可选的背景段落,随后是包含 Markdown 链接的 H2 板块,冒号后面可以补一句简短说明。名为 Optional 的板块标记的是上下文吃紧时智能体可以跳过的内容。
文件可以放在域名根目录,也可以放在其下任意路径。v2 允许范围受限的文件:/docs/llms.txt 覆盖 /docs/ 之下的全部内容;当多个文件都适用时,智能体应当选用最具体的那一个。
什么是 llms-full.txt
llms-full.txt 是文档平台带火的一种惯例,并不属于规范。它不是带描述的链接清单,而是把页面正文全部转成 Markdown,合并为一份文档。
在用户会向 AI 助手提出细节问题的场合,它才有价值:文档、SaaS 产品、知识库。两份文件出自同一次抓取,因此内容始终一致。
llms.txt、sitemap.xml 与 robots.txt
三个文件,三项职责。它们并不互相替代,维护良好的网站三者都会提供。
| robots.txt | sitemap.xml | llms.txt | |
|---|---|---|---|
| 面向 | 抓取程序 | 搜索引擎 | 语言模型与智能体 |
| 回答的问题 | 哪些内容可以抓取 | 存在哪些网址 | 关键页面讲的是什么 |
| 格式 | 指令 | XML | Markdown |
| 包含描述 | 否 | 否 | 是 |
| 控制访问 | 是 | 否 | 否 |
| 作用范围 | 域名 | 域名 | 域名或路径 |
发布者为什么可能需要它
- 掌控权。 由你决定展示哪些页面、用什么描述,而不是让模型从充斥着导航和脚本的 HTML 里去猜。
- 机器可读。 对于兼容的智能体和工具来说,Markdown 比渲染后的页面更容易处理。
- 节省上下文。 一份精简的地图能装进上下文窗口,而整个网站永远装不下。
- 成本低。 你的技术栈里不会多出需要维护的东西,也不影响性能。
该格式由 OpenAI、Anthropic 和 Gemini 的文档团队发布,Mintlify、GitBook、Wix 等平台以及 Yoast SEO 和 AIOSEO 插件都会自动生成它。
llms.txt 做不到什么
- 它不会拦截抓取程序。访问控制是 robots.txt 的职责。
- 它不能替代 robots.txt 或 sitemap.xml。
- 它不保证在 ChatGPT、Perplexity、Gemini 或 Claude 中被引用。
- 它不是谷歌确认过的排名因素。
- 它不是必需的,各家 AI 系统的采用程度也不一样。
- 它弥补不了内容单薄,也救不了抓取程序够不着的网站。
谁要是承诺光靠这个文件就能增加引用,那就是在承诺今天没人能证明的事。它的价值在于掌控权与可读性。
校验与 Chrome Lighthouse 检查
Chrome Lighthouse 13.3 新增了实验性的 Agentic Browsing 类别。其中一项审计会校验已发布 llms.txt 的基本属性:要有 H1 标题、至少一个 [标题](URL) 形式的真实 Markdown 链接,以及超过 50 个字符的长度。
生成器会照搬这项审计的检查项。这是结构检查,不是谷歌搜索的排名信号。就审计本身而言,文件缺失记为不适用,而已发布却未通过的文件可能被报为错误。
因此校验会在下载之前运行:llmstxt.org 结构、Lighthouse 的三项标准、重复网址、指向外部域名的链接,以及文件大小。独立的LLMs.txt 检查器与校验器用来检查已经上线的文件,包括其中的链接是否仍然有效。
如何发布该文件
以纯文本形式提供在 你的域名/llms.txt,与 robots.txt 放在一起。如果只描述网站的一部分,就放在对应路径下,例如 你的域名/docs/llms.txt。上传后打开该地址,确认看到的是 Markdown 而不是 404 页面。
| 平台 | 位置 |
|---|---|
| cPanel 或共享主机 | /public_html/llms.txt |
| WordPress | 站点根目录,不是 /wp-content/ |
| Next.js, Nuxt, Astro, React | /public/llms.txt |
| Laravel, Symfony | /public/llms.txt |
| Shopify | 内容 → 文件,然后把 /llms.txt 重定向到上传的文件 |
| Webflow | 站点设置、自定义代码或上传文件 |
| Netlify, Vercel, GitHub Pages | 放进仓库的 public 目录 |
文件里该放什么
llms.txt 是一份精选,不是存档。要罗列全部网址,站点地图才是干这个的。
- SaaS 与文档: 产品概览、价格、快速上手、API 参考、更新日志。
- 电商: 分类、主力商品、配送、退换、尺码表。不要放规格变体、筛选和分页。
- 本地服务: 每项服务单列、服务区域、价格或报价、关于我们和联系方式。
- 媒体: 主题聚合页和长青内容,而不是最近五十篇文章。
常见问题
-
一份 Markdown 文件,包含你的站点名称、一段简短摘要,以及带描述的关键页面清单。它给语言模型和智能体一张精简的内容地图,而不必让它们从 HTML 里推断。
-
不是。它是 llmstxt.org 上描述的社区提案,目前为 v2,尚未经 W3C 或 IETF 批准。这里所说的符合规范,指的就是那里描述的结构。
-
不是。没有任何系统要求它。你自愿发布它,是为了掌控向兼容的 AI 工具展示什么、以及如何描述。
-
没有证据支持,本工具也不作此承诺。这个文件让内容更易读,并让你掌控描述,但它既不是确认过的排名因素,也不是被引用的保证。
-
谷歌表示搜索中的 AI 功能并不需要这个文件。另一方面,Chrome Lighthouse 可以在实验性审计中校验已发布文件的基本属性。那是结构检查,不是排名信号。
-
以纯文本形式放在域名根目录,与 robots.txt 并列。v2 也允许放在任意路径:
/docs/llms.txt覆盖/docs/下的内容,智能体应选用最具体的文件。 -
llms.txt 是带描述链接的精选索引。llms-full.txt 以 Markdown 收录页面全文。前者是地图,后者是地形,只有前者属于规范。
-
站点地图为搜索引擎罗列全部网址,既无描述也无主次之分。robots.txt 控制抓取程序的访问。llms.txt 则是带上下文的简短精选地图,按模型的上下文窗口来裁剪。
-
可以。没有站点地图时,页面会通过首页的内部链接被发现,并优先考虑文档、产品和服务。
-
免费。在每日额度内你会拿到完整文件,没有水印,也不会截断预览。付费套餐可提高页面上限并增加 llms-full.txt。
生成你的 llms.txt
输入域名,即可获得结构清晰、经过校验且可编辑的 llms.txt 文件,随时可以发布。无需手工收集网址。已经有文件了?用LLMs.txt 检查器与校验器检查一下。