用 PNG 提示词,Claude Code 费用能省 70%?

HN AI Tools 2026-07-24T05:21:00.558572

把文本转成图片来降低 AI 费用?这可行,因为视觉输入和文本输入的定价机制不同。本文将介绍这种技巧的工作原理、适用场景,以及可能带来的意外风险。

Save Up to 70% on Claude Code Costs With PNG Prompts?

最近有位开发者发布了一款名为 pxpipe 的工具,思路很特别:不直接向 Claude Code 发送大段文本,而是把文本转成 PNG 图片再提交给模型。模型依然能识别图片中的内容,但请求的计费方式可能和纯文本不同。

项目作者称,在他们的测试中,这种方法让 API 费用降低了 59% 到 70%。在处理超长系统提示、冗长日志和大量文档时,节省效果最明显。

乍一听,这方法似乎简单得不太真实。但当你了解多模态模型的定价方式后,就会觉得很有意思。

“Example Render”

“Example Render”

为什么图片比文本更省钱?

大语言模型(LLM)对不同输入的收费方式并不相同。

文本按 token 计费。提示词越长,token 越多,费用越高。大型系统提示或数千行的文档,很快就成了请求中最烧钱的部分。

图片则走另一套定价方案。模型不会把每个字符当成文本 token 来处理,而是用视觉系统分析图片。一张包含同样信息的截图,所需的视觉 token 可能远少于等效的文本输入。

信息本身没变,变的是表现形式——而某些情况下,这种形式计费更划算。

这是一个很有意思的案例:优化绕开了提示词本身,而是针对定价模型做文章。

节省从何而来

对于需要反复发送大量参考材料的工作负载,成本差异会非常显著。

“优化后的提示”

“优化后的提示”

具体包括:

如果模型只需要理解内容的总体含义,将其压缩成图片可能会降低成本,同时不会明显影响结果。

对于每天发出数千次请求的团队来说,即使是中等程度的节省,也能显著减少 API 开销。

权衡取舍

这种方法并非没有缺点。

当文本正常提交时,模型接收的是精确的字符序列。当相同的内容嵌入到图片中时,模型必须先通过视觉识别文字,然后才能进行推理。

这个额外的识别步骤引入了不确定性。

字符偶尔会被误读。相似的标识符可能混淆。长十六进制字符串或哈希值尤其容易出错。在普通文档中微不足道的识别错误,在技术工作流程中可能变得至关重要。

这意味着,该技术最适合文本的含义比精确字符更重要的情况。

不适用场景

在很多情况下,完美的准确性比低成本更重要。

具体包括:

哪怕一个字符出错,都可能导致难以调试的问题或意外的生产故障。

对于这类输入,发送纯文本仍然是更安全的选择。

一种特定优化,而非通用方案

pxpipe 的有趣之处,并不仅仅在于它能将文本转换成图片。

它更展示了:理解模型行为,可以带来实用的工程优化。

查看原文