Together AI 为开源模型解锁可预测、高性价比的 AI 推理
AI 开发领域正以前所未有的速度演进,大语言模型(LLM)已深度融入从复杂工作流自动化到高级编程助手的方方面面。随着企业越来越多地将这些强大模型部署到生产环境中,一个关键挑战浮出水面:如何管理大规模 AI 推理的成本并确保其可靠性。不可预测的成本和波动的性能,足以让最富创新性的 AI 项目功亏一篑。认识到这一日益增长的需求,Together AI 推出了 Provisioned Throughput(预置吞吐量)服务,这是一项突破性的服务,为开源权重前沿模型提供预留推理容量。这一战略举措旨在为企业提供长期以来在 AI 基础设施领域被视为圣杯的可预测性能和透明定价,从根本上改变公司规划 AI 推理预算的方式。
AI 推理的两难困境:无服务器 vs. 专用
在 Provisioned Throughput 出现之前,组织在部署 AI 模型时通常面临艰难的选择:
-
尽力而为的无服务器推理(Best-Effort Serverless Inference): 该选项为开发和可变工作负载提供了无与伦比的便利性和可扩展性。按用量付费,基础设施自动扩展。然而,它往往伴随着权衡:性能可能不一致,没有保证的容量或严格的服务级别协议(SLA)。对于关键的生产应用程序来说,这种不可预测性可能是一个重大障碍。想象一下,一个驱动客服聊天机器人的 LLM——延迟峰值或服务中断会直接影响用户体验和业务运营。
-
专用托管基础设施: 在光谱的另一端,专用基础设施提供了最大控制力、一致性能以及微调部署每个方面的能力。然而,它在搭建、管理和运维开销方面要求大量投入。这种方法通常复杂、昂贵,并且需要专业技术,使得许多组织(尤其是那些没有大型 MLOps 团队的组织)难以采用。
这种“推理困境”迫使企业在可靠性与便利性之间妥协——要么牺牲可靠性换取便利,要么为控制力承担高昂开销。随着 AI 推理成本成为公司的重大支出项,寻找一个中间方案——能够结合两者优势的解决方案——变得迫在眉睫。
预置吞吐量(Provisioned Throughput):中间方案
Together AI 的预置吞吐量(Provisioned Throughput)服务刚好填补了这一空白,提供了一种引人注目的替代方案,将无服务器(Serverless)的简单性与专用基础设施的可靠性融为一体。它专为需要一致性能和可预测成本的生产工作负载而设计,无需管理专用硬件的复杂性。以下是预置吞吐量(Provisioned Throughput)成为颠覆性方案的关键:
-
预留容量: 与尽力而为的无服务器不同,预置吞吐量保证为您选择的开源权重模型提供特定的、预留的推理容量。这意味着您的应用将始终拥有必要的资源,消除性能波动,即使在峰值负载下也能确保一致的响应时间。
-
基于 Token 的定价: 借鉴专有 AI 提供商简单直接的定价模式,Together AI 提供基于 Token 的定价。这简化了成本预测和管理,使企业能够根据预期的 Token 使用量进行准确预算,而无需纠结于复杂的 GPU 小时计算或不可预测的无服务器账单。
解锁可预测且经济高效的开源模型AI推理
- 99%正常运行时间SLA(服务等级协议): 对于任何生产工作负载,可靠性至关重要。预置吞吐量附带强大的99%正常运行时间服务等级协议,确保您的AI应用在业务最需要时保持运行和可用。对于不允许停机的关键任务系统,这种保证水平至关重要。
这种创新方法使预置吞吐量成为比传统无服务器方案更可靠的生产工作负载选择,同时显著降低与专用基础设施相关的运营负担和成本。
预置吞吐量如何运作:PTU解释
预置吞吐量的经济模型围绕预置吞吐量单位(Provisioned Throughput Units,PTU)构建。一个PTU代表一段固定的推理容量,保证特定模型每分钟的令牌速率。这种细粒度方法允许企业根据其确切需求合理调整容量。每个PTU以每分钟0.05美元的透明价格定价。该系统的巧妙之处在于它如何处理不同类型的令牌:
- 输入令牌(Input Tokens): 您发送给模型处理的令牌。
- 缓存输入令牌(Cached Input Tokens): 可能被重复使用或由模型内部缓存机制高效处理的令牌。
- 输出令牌(Output Tokens): 模型作为响应生成的令牌。
每种令牌类型在PTU内以不同的速率消耗容量。这允许根据您的特定流量模式优化利用率,而不会影响底层的SLA。例如,在MiniMax M3模型上,一个PTU可以处理:
- 每分钟138,840个输入令牌
- 每分钟694,200个缓存输入令牌
- 每分钟23,140个输出令牌
这种详细的分解使开发者和运维团队能够精确配置其容量,确保高效的资源分配和针对特定模型交互的可预测性能。这种对容量消耗的透明度和控制水平是优化LLM(大语言模型)推理成本的一大优势。
解锁显著的成本节约与更高的可靠性
可预测、高性价比的开放模型AI推理:Together AI解锁新能力
预配吞吐量最吸引人的一点是其大幅降低成本的潜力。Together AI报告称,其成本可显著低于专有替代方案,与Claude Opus 4.8等模型相比,费用最高可削减90%。这种显著的成本效益源于以下几个因素:
- 利用开放权重模型(Open-Weight Models): 预配吞吐量专注于开放权重模型,与闭源专有模型相比,这些模型通常具有更低的许可或使用费用。
- 优化的基础设施: Together AI的专用基础设施针对高效运行这些开放模型进行了高度优化,从而转化为更低的运营成本,并可以惠及用户。
- 可预测的计费: 基于Token的定价模式消除了与突发的无服务器函数或利用率不足的专用硬件相关的不可预测且通常不透明的成本,从而实现更可预测且更易于管理的预算。
除了成本优势外,99%的正常运行时间SLA(服务等级协议)提供了以前只有昂贵的专用部署才能达到的可靠性。这使得预配吞吐量成为生产级应用程序的理想选择,因为在这些应用中,持续可用性是不可妥协的。
目标受众与使用场景
目前,预配吞吐量可应用于强大的开放权重模型,如MiniMax M3和GLM-5.2,并在北美及EMEA(欧洲、中东和非洲)地区提供。该服务特别适合以下场景:
- 带保障的生产工作负载: 任何要求一致性能、低延迟和高可用性的应用,例如实时分析、自动化内容生成或客户支持AI。
- 从专有模型迁移的企业: 希望减少对昂贵专有API依赖的公司,现在可以自信地转向开放权重模型,因为他们知道能够以极低的成本获得相当的可靠性和可预测性。
- 扩展AI项目: 随着企业扩大AI采用规模,Provisioned Throughput(预置吞吐量)为他们提供了一条清晰的迁移路径,以便利用前沿质量的开源模型,而无需承担高昂成本或运营复杂性。
虽然预置吞吐量专为有保障的生产需求而设计,但Together AI仍提供:
- 无服务器推理: 适合快速开发、实验以及使用频率变化大或不频繁的负载,在这些场景下尽力而为的性能可以接受。
- 专用推理解决方案: 适用于高度定制化的需求或场景,要求对底层硬件和软件栈拥有绝对的最大控制权。
这种分层产品确保Together AI能够满足AI开发和部署的全面需求。
这对开源模型生态系统的意义
预置吞吐量的推出对整个开放权重模型生态系统来说是一项重大进展。该公司注意到流量发生了显著变化,代币量从每月300亿增长到超过400万亿,其中很大一部分来自封闭API的迁移。这显示了市场对开源模型的明确需求。
通过为这些模型提供可靠、经济高效且可预测的推理解决方案,Together AI正在加速它们在生产环境中的采用。这有助于普及先进AI能力的获取,让更多开发者和企业能够创新,而不受高昂成本或与专有解决方案相关的供应商锁定的限制。
Together AI解锁开放模型的可预测、高性价比AI推理
该公司强调,对于MiniMax M3推理,团队现在可以大规模运行这些模型,并附带支持业务运营的承诺。这与他们在“Together AI精通MiniMax M3推理”方面的工作相一致,确保了对要求严苛的应用具有稳健性能。这一创新直接解决了对高性价比且可靠AI基础设施日益增长的需求,通过一种新的容量管理方法来应对LLM推理成本。