清华系团队发布国产Token优化工厂:兼容10余种国产芯片,日吞吐千亿Token
摘要:AI基础设施竞争正从“算力规模”转向“算力效率”。清华系团队是石科技发布国产Token优化工厂“拓元(Vectron)”,可兼容十余种国产芯片,日处理千亿Token,通过KV Cache压缩、全模态推理压缩等核心技术,把算力“榨”到极致,帮助企业降低大模型运行成本。

让每一份算力都变成有效Token
允中 发自 凹非寺
量子位 | 公众号 QbitAI
AI基础设施的竞赛规则,正在被改写。
上半场比的是谁的卡多,下半场比的是谁能把卡用好。
7月17日,WAIC 2026上海开幕,智算赛道200多家企业同台,新品密集发布。
但在一众“晒芯片、秀参数”的声浪里,是石科技的发布会显得有些不同——创始人兼董事长闫博文在台上,不讲芯片,不讲模型,只讲一个词:效率。

算力浪费现状:50多个智算中心,利用效率远未跑满
中国已建设50多个智算中心,智能算力总规模超过1000 EFLOPS(1 EFLOPS = 每秒百亿亿次浮点运算)。但平均利用效率仍有巨大提升空间。
“大量算力正在被浪费,算不快、长上下文多模态响应下降,是普遍现象。”闫博文说。
是石科技依托国家级计算中心工程经验,持续投入大规模集群研发,建设万卡级国产大集群,稳定持续运营,优化推理效率,构筑了深厚壁垒,率先打通从底层芯片到上层应用的超智融合全链路,真正把国产大集群从“点亮”变成“跑满”,让庞大国产算力切实转化为产业可用的Token稳定生产力。
“所以我们在重新思考,算力基础设施建设提速的同时,如何进一步释放算力价值?”闫博文认为,“十五五”期间,中国算力产业总投资预计达到7万亿元。
如果算力利用效率能够提升十到二十个百分点,将释放万亿级的算力价值空间,让各行各业以更低成本进入AI世界,激发出更多应用需求。
这背后是行业共识的转折:AI基础设施的竞争,正从“算力规模竞赛”转向“算力效率竞赛”。

未来AI基础设施的关键,不只在于芯片数量,更在于能否将芯片、互联、内存、散热、调度与软件栈整合为稳定可用的大规模系统。
而拓元(Vectron),正是是石科技为这场“效率竞赛”交出的系统性答卷。
拓元:一套完整的AI Infra优化体系,让每份算力发挥价值
目前AI基础设施面临的效率难题包括:异构算力难以统一调度、大模型推理缺乏深度优化、长上下文导致显存与成本压力骤增、国产芯片生态适配成本高昂等。
针对这些痛点,拓元不是单一模型或工具,而是一套完整的AI基础设施优化体系。具体来说——
-
任务自适应优化:依托请求画像匹配最优计算链路,算力按需分配,减少资源浪费。不同的推理任务自动匹配最合适的算力资源,而不是“一把抓”。
-
算子库优化:硬件专属算子融合编译,充分释放芯片极限算力。这意味着每颗国产芯片不再只是“能用”,而是被“榨”出了最优性能。
-
模型与推理框架优化:兼容主流国产芯片与大模型,异构深度调优,提升业务并发量。
-
异构集群调度:破除跨地域、多芯片算力孤岛,统一纳管调度,盘活闲置算力。
闫博文介绍,拓元全面兼容昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原等10余种国产算力芯片,适配20余个主流模型,实现国产异构算力池的统一调度与推理加速,每日Token吞吐量达千亿级别。
对于企业客户而言,这意味着不管底层跑的是什么国产芯片,拓元都能让你的算力资源池被统一管理、优化调度,最终产出更多可用的Token。
核心技术突破:把算力“榨”到极致
发布会上,闫博文重点介绍了拓元的多项核心技术突破,每一项都指向企业使用大模型过程中的真实痛点。
KV Cache压缩:让长文本不再烧钱
企业使用大模型时面临一个现实问题:模型越来越强,运行成本也越来越高。尤其当上下文变长时,显存压力急剧攀升。
传统方法更多依赖输入阶段判断信息价值,但在真实业务中,模型需要关注的内容往往动态变化。拓元采用结果感知驱动KV Cache压缩技术,可以在不牺牲模型效果的前提下,显著压缩KV Cache、降低显存压力,让长文本、大规模AI应用真正能够经济地运行。
全模态推理的Token压缩:让AI学会抓重点
在大模型运行过程中,并不是所有信息都具有同等价值。如何保留关键Token、减少无效计算,是效率提升的核心命题。
拓元在全模态场景中提出基于模态自适应的免训练Token压缩方法,针对文本、视频、语音等不同输入,实现更加精准的信息筛选。这意味着未来AI可以用更少计算完成更复杂任务——在多模态时代,这个能力会越来越重要。
关键要点
- 核心问题:国产算力利用率低,长上下文下显存成本高,异构芯片调度困难。
- 解决方案:拓元兼容10余种国产芯片,统一调度与加速,日处理千亿Token。
- 关键技术:任务自适应优化、算子融合编译、异构集群调度;KV Cache压缩降低显存压力;全模态Token压缩减少无效计算。
- 对开发者的意义:无需关注底层芯片差异,可直接复用已有模型,算力资源池化,降低大模型部署和运行成本。
本部分详细阐述拓元在长上下文优化、可靠深度推理和智能体长程记忆三个核心方向的技术方案:通过混合位置索引和记忆引导机制大幅提升超长文本处理能力;引入元奖励建模实现模型自优化,降低人工调教成本;以目标导向记忆策略解决长程Agent任务的信息丢失难题。同时介绍是石科技如何将这些技术封装为商用产品,并阐明其在国产算力生态中的“中间件”定位。
长上下文优化:百万级信息的高效处理
企业知识库、智能助手、复杂数据分析等场景,都要求大模型具备超长记忆能力——能一次性处理几十万甚至上百万 token 的上下文。拓元为此开发了两项技术:
- 混合位置索引合成的长上下文偏好训练方法:通过巧妙的索引合成策略,让模型在训练中学会处理极长序列,而无需海量训练数据。
- 记忆引导的重读机制:模型在处理长文本时,会主动“回顾”关键信息,避免遗漏。
这两项技术配合,使得拓元在远小于同类方法的训练数据量下,实现了显著的效果提升。对开发者而言,这意味着更低的成本投入也能获得稳健的长上下文处理能力。
可靠深度推理:让AI学会自我优化
传统大模型部署后,往往依赖大量人工反馈(如RLHF)来持续优化输出质量。这就像养了一个需要不断投喂、调教的系统,维护成本极高。
拓元提出的“基于元奖励的可扩展奖励建模方法”解决了这个难题。创始人闫博文将其比喻为:从“养一个需要不断人工训练的AI”变成“部署一个能够持续自我优化的AI系统”。系统能理解企业制定的业务标准,在复杂场景中稳定输出符合要求的结果,大大降低AI落地后的运维成本。
对企业来说,这意味着模型上线后,不再需要专门团队每天盯着输出做调整——系统自己就能学会“什么是对的”。
智能体长程任务记忆机制:确保长程Agent任务的稳定执行
AI Agent在执行长程检索任务时,常常会遇到一个棘手问题:无法判断某条缺失信息——是已经被系统丢弃了,还是根本不存在?这种不确定性会导致错误决策。
拓元明确了目标导向的信息记忆策略,破解了三个核心难题:
- 稀疏信息难以实时监测
- 长程建模受限于计算资源
- 注意力机制的二次复杂度开销过大
通过这项机制,模型能在更低训练成本下获得更强的上下文理解能力与复杂推理能力。闫博文表示:“我们希望AI不只是能够回答问题,而是能真正理解复杂世界。”
从技术到产品的关键一跃
是石科技成立于2021年,创始团队来自清华大学计算机系,具备国家级计算中心工程化经验。闫博文本人是清华大学航院博士、计算机系博士后,核心成员包括高性能计算、人工智能领域的资深专家,以及清华、北大、北航等高校学者。

过去几年,公司快速成长,已服务超过200家重点客户,覆盖互联网大厂、头部大模型公司、航空航天、生物制药、新能源等行业,在并行优化、算力调度等业务上形成了深厚的技术护城河。
拓元的发布,意味着是石科技将领先的技术能力凝结为一款商业化、标准化的产品,驶上规模化发展的快车道。闫博文在发布会上强调:
“技术创新的最终目的,不是停留在实验室,而是创造产业价值。”
拓元也再次明确了是石科技独特的赛道占位。国产芯片生态的成熟需要“中间件”——能够统一管理不同品牌芯片、屏蔽底层差异的平台,是国产算力生态从“能用”走向“好用”的关键。
在算力效率这个命题上,当大多数人还在讨论怎么做的时候,是石科技已经把产品摆上了WAIC的展台,并打开了从算力服务到Token服务的商业化新空间。
闫博文在发布会结尾说:
“对于我们这些技术出身的人来讲,最希望听到的声音就是两种:第一是每次交付给客户的大规模集群,满负荷跑起来发出的万卡集群的轰鸣声;第二就是我们每次帮用户优化终极效果之后,客户对我们的高度评价。这两种声音,我们认为也是未来中国的AI走得更强、走向世界的最强音。”
本文系量子位获授权刊载,观点仅为原作者所有。

- WAIC直击 | 十大开源社区「挤」进了一家GPU展台,沐曦凭什么?2026-07-18
- 一位失忆患者,揭开了AI记忆的误区2026-07-16
- Agent专用搜索登顶Product Hunt,Token更省搜得更准2026-07-13
- 全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货2026-07-02
相关阅读
热门文章

2026年世界人工智能大会,7月17-7月20上海举办

GPT-5.6一小时解开50年数学猜想,700词Prompt驾驭64个子Agent

中国首个十万卡集群落成!全国产算力支撑“十万卡时代”

中国首个十万卡集群落成!全国产算力支撑“十万卡时代”

英伟达 RTX Spark 真机亮相 Bilibili World:CPU与GPU一体化封装,笔记本可运行120B参数大模型
在Bilibili World展会上,英伟达展示了RTX Spark真机。该产品将CPU和GPU直接封装在一起,实现了高度集成。搭载这一方案的笔记本电脑已能本地运行120B(1200亿)参数的大模型,显著拉低了端侧AI大模型部署的门槛。