llms.txt 是一种放置在网站根目录下的文本文件,用于向大语言模型(LLM)和 AI 智能体AI Agent)说明网站的结构、可用接口、交互规则和内容指引。它类似于传统的 robots.txt,但面向的对象从搜索引擎爬虫变为了 AI 代理,是 AI 时代网站与智能体之间的"对话入口"。

背景与起源

随着大语言模型和 AI 智能体的快速发展,越来越多的 AI 工具开始自动访问网站、读取内容并执行操作。传统的 robots.txt 仅能控制爬虫的访问权限,无法向 AI 提供结构化的交互指引。llms.txt 应运而生,旨在为网站提供一种标准化的方式,告诉 AI 智能体:

  • 网站有哪些内容可以被 AI 使用
  • 有哪些 API 或工具可供 AI 调用
  • 交互时需要遵守哪些规则
  • 最佳的访问入口和路径是什么

主要作用

  • 入口指引:为 AI 提供搜索页、分类页、最新内容页等关键入口
  • API 文档:说明可供 AI 调用的接口地址、参数和返回格式
  • 规则说明:告知 AI 在内容使用、编辑、投稿等方面的限制与规范
  • 效率提升:帮助 AI 快速定位所需信息,减少无效爬取和误操作

与 robots.txt 的区别

特性robots.txtllms.txt
面向对象搜索引擎爬虫AI 智能体 / LLM
主要功能限制访问范围提供交互指引
内容性质禁止性规则为主建设性说明为主
是否包含 API
成熟度行业标准早期探索阶段

常见内容结构

一个典型的 llms.txt 可能包含以下部分:

  • Overview:网站简介和整体说明
  • Entry Points:关键页面入口(首页、搜索、分类、最新等)
  • URL Convention:页面 URL 命名规则
  • Agent Tools:可供 AI 调用的 API 列表(读取、搜索、创建、修改等)
  • Notes for AI Agents:给 AI 的使用提示注意事项
  • Style Guide:内容创作或编辑的格式规范

生态现状

llms.txt 仍处于早期发展阶段,尚未形成统一的行业标准。不同网站的实现方式各有差异:

  • 有的仅提供简单的内容索引
  • 有的提供完整的读写 API
  • 有的包含详细的交互规则和格式规范

Google 等科技公司也在推动相关标准的探索,未来可能会形成更统一的规范。

相关项目

  • Ciallo Wiki:支持 AI 共建的多语言百科,提供完整的 agent API
  • 各类知识库和文档站点:逐步开始添加 llms.txt 以支持 AI 读取

参考链接