无问芯穹PDD架构:跨集群异构推理的破局之道

量子位 2026-07-30T17:47:21.804809

无问芯穹在2026 WAIC大会上公布了新的跨集群异构推理架构PDD,通过将传统的PD分离链路重构为“P-RLD-MD”三级结构,并在以太网环境下优化KV Cache传输,实现了首Token延迟降低51.5%、单Token成本降低37.5%。本文带你看懂这一技术突破的设计逻辑与核心洞察。

背景:大模型推理的“生死线”与PD分离的理想

过去一年,大模型推理的成本和效率成了整个行业的共同“生死线”。业界共识是:大语言模型的推理包含两个特性迥异的阶段——Prefill(预填充,计算密集型)和Decode(解码,访存密集型)。理论上,最理想的方案是“异构分离”:让算力强的卡负责Prefill,让显存带宽高的卡负责Decode。

但现实很骨感。在一个集群里构建大规模异构算力,不仅采购成本极高,而且一旦模型架构变了,固定配比的硬件就容易出现闲置。

于是,一个自然的想法浮现出来:为什么不把分布在各地的、已经建好的同构集群,用低成本的广域网以太网连起来,做跨集群的异构分离式推理呢?

这个想法看似顺理成章,但落到工程实践中,就撞上了一堵“叹息之墙”——KV Cache的跨集群传输带宽和延迟瓶颈。PDD架构正是为了攻克这一难题而设计的。

三个核心洞察:硬件“偏科”与流量“二八定律”

要理解PDD的设计,得先从无问芯穹在技术报告中揭示的三个核心洞察入手。

洞察1:硬件性能的“极度偏科”

LLM推理的Prefill和Decode两个阶段对硬件资源的需求截然相反。无问芯穹团队在内部基准测试中发现,芯片的性能表现极度“偏科”。以8卡的某旗舰高性能GPU为基线,某厂商的E芯片在处理计算密集的Prefill阶段时,性能只能达到基线的81%;但在访存密集的Decode阶段,它却能爆发出基线210%的性能。

如果把这类“偏科”芯片放在同构集群里,既要扛Prefill计算又要做Decode输出,非但无法发挥自身长板,反而会拖慢Prefill阶段的整体效率。这一发现强烈激发了团队将Prefill与Decode拆分解耦、分别部署在最合适硬件上的想法。

洞察2:DRC技术带来的10倍“带宽”

跨集群传输庞大的KV Cache会瞬间吃掉广域网带宽。但好在智能体(Agent)业务有一个显著特征:前缀缓存命中率极高。利用这一特性,团队在Decode端部署了前缀缓存RadixCache(简称DRC)。

简单来说,DRC会在Decode实例上缓存历史请求的KV Cache。当Prefill端发现某个请求命中了前缀缓存,就不需要把整个上下文的KV Cache全量传过去,只需要传那一点点“增量”即可。在90%的平均命中率下,DRC理论上能将跨集群的带宽需求降低高达10倍,初步缓解了带宽瓶颈。

然而,带宽虽然降下来了,延迟问题却依然棘手。

洞察3:智能体工作负载下的“非均匀延迟”

在DRC技术加持下,KV Cache传输数据量降低了一个数量级,于是跨集群PD分离最棘手的痛点集中在了KV Cache的传输延迟上。

智能体工作负载特征有“三极”:上下文极长(动辄64K)、缓存命中率极高(平均90%)、但输出极短(经常不到100个Token)。用户发个请求,整个输出过程不过十几秒,但首字延迟却要等几十秒,产品体验直接被宣判死刑。

也正因如此,优化跨集群KV Cache的传输延迟,成了必须突破的核心关卡。团队分析了线上真实业务的600万条请求,其中约30%的请求输出的Token个数少于100个,约40%的请求输出不超过500个Token。


关键要点

本段揭示KV Cache传输延迟的根源:只有少数低命中率请求造成长尾延迟。基于此发现,无问芯穹提出PDD三层架构,用本地中继算力巧妙掩盖网络延迟。

延迟瓶颈的真相:偏斜分布下的“刺头”

对输入请求来说,1~20秒的KV Cache传输时间占端到端总延迟的43%~56%,是最大的性能瓶颈。

虽然降低跨集群KV Cache传输延迟的重要性已明确,但这1~20秒延迟的具体来源和分布却一直是个谜。

要弄清延迟分布,先要理解输入请求的真实情况:平均90%的缓存命中率,背后的分布是怎样的?

通过分析真实业务Trace,团队发现:输入请求的命中率分布极度偏斜——约70%~80%的请求命中率超过95%,只有极少数低命中率请求会携带巨大的KV Cache数据包。

随后,无问芯穹在20Gbps跨集群专线上做了微基准测试,对比“真实偏斜分布”与“均匀分布(85%~95%命中率)”的传输表现,结果令人震惊:

这个发现极为关键:极端传输延迟只集中在极少数低命中率的“刺头请求”上。偏斜分布下,大量轻量级请求利用TCP公平性机制,不会被高负载阻塞,能迅速释放连接池。

结论:要解决跨集群PD传输KV Cache的延迟瓶颈,不用全局优化网络,只需针对这少部分“刺头”做专门优化。

创新解法:PDD三层架构与“中继接力”跑法

基于上述洞察,无问芯穹提出PDD(Prefill-RelayDecode-MainDecode)架构。

传统PD分离只有Prefill(P)和Decode(D)两层,而无问芯穹在中间插入了一个“中继站”——RelayDecode(RLD)实例,专门用来掩盖以太网KV Cache传输延迟。

整个系统分成三层:

它的工作方式很像一场2×100米接力赛:

当P实例完成Prefill后,会同时做两件事:
1. 通过高速RDMA网络,把KV Cache“瞬间”传给同机房的RLD实例;
2. 通过慢速且延迟不稳定的以太网,把KV Cache传给外地的MD实例。

RLD实例拿到KV Cache后立即开始解码,输出Token给用户。此时用户根本感知不到跨集群的KV传输延迟,已经开始看到文字了。而在后台,以太网传输可能还在进行。

几秒后,MD实例终于收到完整KV Cache,解码任务无缝从RLD交接给MD,由MD完成后续大部分吐字工作。

这就是PDD的核心思想:用本地的RLD算力,精准掩盖跨集群那极少数低命中率请求的网络延迟。

核心机制:如何优雅完成“接力棒交接”?

PDD三级架构听起来简单,但最大的工程难题在于:当MD实例准备好后,如何无缝接管RLD正在进行的解码任务?

传统做法是:RLD一边解码,一边把新生成的“增量KV Cache”通过以太网传给MD。但这又掉进跨域网络传输延迟的坑里,还要经过繁琐的H2D/D2H(显存到内存、内存到显存)拷贝,延迟高且不稳定。

于是,无问芯穹提出了一个反直觉但极其高效的机制:Extend-Decode Handoff(扩展解码交接)

做法很简单:RLD绝不传输庞大的KV Cache,只把生成的Token ID传给MD。传输几个Token ID仅几KB数据量,网络开销几乎为零。

查看原文