我构建了一个批量 llms.txt 生成器(让任何站点具备 AI 可读性,规模化)
robots.txt 告诉爬虫索引什么。llms.txt 告诉 LLM(大语言模型)你的站点意味着什么。如果你还没遇到过:llms.txt 是一个新兴标准——一个位于你域名根目录下的单一 Markdown 文件,它为 AI 模型提供一张清晰、结构化的站点地图。不是给 Googlebot 用的,而是给 ChatGPT、Claude、Perplexity 以及日益壮大的、在推理时读取网络的 AI 代理群用的。
在 2026 年,它不再只是新鲜事,原因有两个:
- RAG 吞噬了一切。检索增强生成(Retrieval-augmented generation, RAG)已经成为知识应用的默认架构,而 llms.txt / llms-full.txt 文件可以直接插入到 RAG 流水线中——预先结构化、密集、低噪声。
- Google 将其纳入 Lighthouse。截至 2026 年 5 月,llms.txt 已成为 Chrome Lighthouse 新推出的“自主浏览”(Agentic Browsing)审计的一部分——这是一项 AI 就绪性检查。这是一个强烈信号,表明它正在成为必需品,而非锦上添花。
文件实际长什么样
llms.txt 故意设计得非常简单——一个标题、一行摘要以及一个关键页面的链接索引:
# Your Product
> One sentence on what this site is and how an LLM should reference it.
## Pages
- [Getting Started](https://example.com/docs) : Install and first run in 5 minutes.
- [API Reference](https://example.com/api) : Endpoints, auth, rate limits.
- [Pricing](https://example.com/pricing) : Plans and limits.
还有一个配套的 llms-full.txt,它内嵌了每个页面的完整内容——RAG 流水线实际摄取的就是这个版本。
缺口:为多个站点以编程方式实现
目前有一些不错的单次性 Web 工具,你粘贴一个 URL 就能获得一个文件。对于单个站点来说很好。但如果你是一家代理商(每个客户都需要一个)、正在构建 RAG 流水线(数十个来源),或者按计划运行此任务,你需要的是一种 API、批量运行和按使用付费的定价——而不是复制粘贴的 UI。
因此我构建了一个 Apify Actor 来实现这一目标:llms.txt Generator on Apify。只需输入一个 URL → 它就会爬取同域名的页面(数量上限由你设定)。提取标题、meta 描述以及干净的主内容(识别 <article> / <main> 标签,剥离导航栏、页脚和脚本)。通过读取站点地图(sitemap)处理单页应用(SPA),确保全面覆盖。将 llms.txt 和 llms-full.txt 输出到运行的键值存储(key-value store)中。支持 API 调用,适合批量处理——一次工作流即可为 200 个客户站点生成。
输入只需:
{
"websiteUrl": "https://example.com",
"maxPages": 100,
"includeFullText": true
}
然后你将生成的 llms.txt 放在你的域名根目录下,遵循与 robots.txt 相同的约定。该项目也完全开源,如果你更愿意自行阅读或运行爬虫:github.com/cekuu35/llms-txt-generator
你应该为你的网站添加 llms.txt 吗?
如果你有文档、营销网站,或任何希望 AI 助手准确总结的内容:答案是需要。它成本低,正成为一种就绪信号,而且让你成为 LLM(大语言模型)能够直接解析而非猜测的网站,完全无需任何代价。如果你在大型网站上进行尝试,或将其接入某个管道,我真心希望听到哪里出了状况——留言评论,我会查看。