阿里云真武芯片超节点适配Qwen3.8,上线百炼提供推理服务

量子位 2026-07-23T17:37:49.005684

量子位的朋友们

阿里云真武M890超节点已于近日成功适配Qwen3.8大模型,并上线阿里云百炼平台提供推理服务。这是国内首个能稳定运行超2万亿参数大模型的超节点。通过64张芯片高速互联和全链路软硬件协同优化,推理性能最高可提升1.5倍,且显著降低了推理成本。

事件概述:国产超大模型跑通“超节点”

7月23日,阿里云宣布其真武M890超节点已成功适配最新旗舰模型Qwen3.8,并正式在阿里云百炼平台上线,向开发者提供模型推理服务。这是国内首个能够成功运行参数规模超过2万亿的大模型的超节点实例。

Qwen3.8参数规模达到2.4万亿。要跑通如此庞大的模型,必须将参数分散到数十甚至上百张高速互联的GPU卡上,同时保证吞吐高、延迟低、并发强。然而,普通AI集群由于通信带宽的限制,很难满足这些需求。

技术亮点:64张芯片是如何“拧成一股绳”的

真武M890是平头哥推出的新一代训推一体AI芯片。它原生支持从FP32到FP4等多种数据精度,既能用于高精度训练,也能胜任低精度和超低精度推理场景。

为了让多张芯片高效协同,真武超节点采用了ICN Switch 1.0互联芯片,将64张真武M890连接成一个整体,实现800GB/s的高速互联带宽。整个超节点拥有9TB的显存,单实例即可支撑大规模2万亿参数MoE(混合专家)模型的专家并行需求。

简单来说,这相当于用64张“高速高铁”将万亿参数拆成多个“专家小组”,每组各自计算,再快速汇总结果,大大提升效率。

全链路优化:推理性能提升与成本降低

除了硬件互联,阿里还从芯片到云平台层面,对Qwen模型做了全链路深度优化。这不仅让Qwen3.8能“丝滑”运行,还显著提升了推理效率、降低了推理成本。

实测数据显示,通过算子优化和软硬件架构协同,该超节点实例在Agentic推理场景(即AI自主调用工具、执行多步骤任务)中,最多可实现1.5倍的推理性能提升。

量子位的朋友们

本文由阿里提供,量子位获授权转载,观点归原作者所有。

关键要点

查看原文