AI代理读取你网站的成本
当AI代理访问你的网站来查询价格或为用户完成任务时,它需要为读取页面付费。这个成本以token(标记)计算,而一个普通的HTML页面成本高昂。无论代理是否需要,导航、样式、脚本和结构化数据都会一并加载。代理要么花费其预算来解析这些标记,要么因空间不足而只读取部分页面。这两种结果都需要你来处理,因为它们决定了代理能否准确获取你的信息。
你的页面结构决定了成本。大多数关于代理token成本的建议都是针对构建代理的开发者的:缓存提示词、将简单任务路由到更便宜的模型。这确实有效,但忽略了发布者能够控制的那一半账单。如果你的页面臃肿,每个读取它的代理每次访问都需要为此付费。你无法调整别人的模型,但你可以决定自己的内容的读取成本。
将同一页面以纯文本形式呈现。其机制是内容协商(content negotiation)。网站继续向浏览器提供正常的HTML,而当代理请求页面的Markdown格式时,它获得的是去掉标记的相同内容。没有任何信息被隐藏,也没有重复内容。同一个URL根据客户端请求的格式返回相应版本。在turva.dev上,首页的Markdown版本成本大约是HTML的三分之一——几千个token对比几万个token。同时,一个llms.txt文件作为整个网站的地图与之并存,因此代理只需一个请求就能了解网站结构,而无需逐页爬取。
Agent 为阅读你的网站所付出的代价
它为你带来什么。 更便宜的页面意味着更可靠的页面。当内容能轻松放入 agent 的预算范围时,agent 会通读所有内容,而非中途停下,因此它引用的会是你的真实价格和真实条款,而非猜测。对于任何以交易告终的场景,这决定了操作是成功完成还是出现错误。同时,这也会扩大能够联系到你的范围。那些回答问题并引用来源的助手,在读取简洁的文本时表现更好,因此你的页面更有可能被完整使用并准确呈现。Agent 在你的网站上所做的工作,对运行它的人来说成本更低,这使你在 Agent 选择在何处执行操作时,成为更容易集成的网站。收益是可量化的。独立扫描器会检查 markdown 内容协商(markdown content negotiation)以及是否存在 llms.txt 文件,结果会体现在相应分类的更高评分中。你无需凭信心相信改进。你可以阅读改动前后的数字。
一个持久的小改动。 这些都不需要重构。它只是边缘的一小段代码,会根据请求头(request header)选择响应格式,并且随着网站的增长持续有效。在 turva.dev 上执行此操作的 Worker 是公开的,因此你可以确切地阅读它的功能,再决定是否适用于你自己的网站。