Together AI 为开源模型解锁可预测、高性价比的 AI 推理

Dev.to AI 2026-07-08T09:08:10.116860

AI 开发领域正以前所未有的速度演进,大语言模型(LLM)已深度融入从复杂工作流自动化到高级编程助手的方方面面。随着企业越来越多地将这些强大模型部署到生产环境中,一个关键挑战浮出水面:如何管理大规模 AI 推理的成本并确保其可靠性。不可预测的成本和波动的性能,足以让最富创新性的 AI 项目功亏一篑。认识到这一日益增长的需求,Together AI 推出了 Provisioned Throughput(预置吞吐量)服务,这是一项突破性的服务,为开源权重前沿模型提供预留推理容量。这一战略举措旨在为企业提供长期以来在 AI 基础设施领域被视为圣杯的可预测性能和透明定价,从根本上改变公司规划 AI 推理预算的方式。

AI 推理的两难困境:无服务器 vs. 专用

在 Provisioned Throughput 出现之前,组织在部署 AI 模型时通常面临艰难的选择:

这种“推理困境”迫使企业在可靠性与便利性之间妥协——要么牺牲可靠性换取便利,要么为控制力承担高昂开销。随着 AI 推理成本成为公司的重大支出项,寻找一个中间方案——能够结合两者优势的解决方案——变得迫在眉睫。

预置吞吐量(Provisioned Throughput):中间方案

Together AI 的预置吞吐量(Provisioned Throughput)服务刚好填补了这一空白,提供了一种引人注目的替代方案,将无服务器(Serverless)的简单性与专用基础设施的可靠性融为一体。它专为需要一致性能和可预测成本的生产工作负载而设计,无需管理专用硬件的复杂性。以下是预置吞吐量(Provisioned Throughput)成为颠覆性方案的关键:

解锁可预测且经济高效的开源模型AI推理

这种创新方法使预置吞吐量成为比传统无服务器方案更可靠的生产工作负载选择,同时显著降低与专用基础设施相关的运营负担和成本。

预置吞吐量如何运作:PTU解释

预置吞吐量的经济模型围绕预置吞吐量单位(Provisioned Throughput Units,PTU)构建。一个PTU代表一段固定的推理容量,保证特定模型每分钟的令牌速率。这种细粒度方法允许企业根据其确切需求合理调整容量。每个PTU以每分钟0.05美元的透明价格定价。该系统的巧妙之处在于它如何处理不同类型的令牌:

每种令牌类型在PTU内以不同的速率消耗容量。这允许根据您的特定流量模式优化利用率,而不会影响底层的SLA。例如,在MiniMax M3模型上,一个PTU可以处理:

这种详细的分解使开发者和运维团队能够精确配置其容量,确保高效的资源分配和针对特定模型交互的可预测性能。这种对容量消耗的透明度和控制水平是优化LLM(大语言模型)推理成本的一大优势。

解锁显著的成本节约与更高的可靠性

可预测、高性价比的开放模型AI推理:Together AI解锁新能力

预配吞吐量最吸引人的一点是其大幅降低成本的潜力。Together AI报告称,其成本可显著低于专有替代方案,与Claude Opus 4.8等模型相比,费用最高可削减90%。这种显著的成本效益源于以下几个因素:

除了成本优势外,99%的正常运行时间SLA(服务等级协议)提供了以前只有昂贵的专用部署才能达到的可靠性。这使得预配吞吐量成为生产级应用程序的理想选择,因为在这些应用中,持续可用性是不可妥协的。

目标受众与使用场景

目前,预配吞吐量可应用于强大的开放权重模型,如MiniMax M3和GLM-5.2,并在北美及EMEA(欧洲、中东和非洲)地区提供。该服务特别适合以下场景:

虽然预置吞吐量专为有保障的生产需求而设计,但Together AI仍提供:

这种分层产品确保Together AI能够满足AI开发和部署的全面需求。

这对开源模型生态系统的意义

预置吞吐量的推出对整个开放权重模型生态系统来说是一项重大进展。该公司注意到流量发生了显著变化,代币量从每月300亿增长到超过400万亿,其中很大一部分来自封闭API的迁移。这显示了市场对开源模型的明确需求。

通过为这些模型提供可靠、经济高效且可预测的推理解决方案,Together AI正在加速它们在生产环境中的采用。这有助于普及先进AI能力的获取,让更多开发者和企业能够创新,而不受高昂成本或与专有解决方案相关的供应商锁定的限制。

Together AI解锁开放模型的可预测、高性价比AI推理

该公司强调,对于MiniMax M3推理,团队现在可以大规模运行这些模型,并附带支持业务运营的承诺。这与他们在“Together AI精通MiniMax M3推理”方面的工作相一致,确保了对要求严苛的应用具有稳健性能。这一创新直接解决了对高性价比且可靠AI基础设施日益增长的需求,通过一种新的容量管理方法来应对LLM推理成本。

结论:开放AI推理的新时代

查看原文