无问芯穹PDD架构:跨集群异构推理的破局之道
无问芯穹在2026 WAIC大会上公布了新的跨集群异构推理架构PDD,通过将传统的PD分离链路重构为“P-RLD-MD”三级结构,并在以太网环境下优化KV Cache传输,实现了首Token延迟降低51.5%、单Token成本降低37.5%。本文带你看懂这一技术突破的设计逻辑与核心洞察。

背景:大模型推理的“生死线”与PD分离的理想
过去一年,大模型推理的成本和效率成了整个行业的共同“生死线”。业界共识是:大语言模型的推理包含两个特性迥异的阶段——Prefill(预填充,计算密集型)和Decode(解码,访存密集型)。理论上,最理想的方案是“异构分离”:让算力强的卡负责Prefill,让显存带宽高的卡负责Decode。
但现实很骨感。在一个集群里构建大规模异构算力,不仅采购成本极高,而且一旦模型架构变了,固定配比的硬件就容易出现闲置。
于是,一个自然的想法浮现出来:为什么不把分布在各地的、已经建好的同构集群,用低成本的广域网以太网连起来,做跨集群的异构分离式推理呢?
这个想法看似顺理成章,但落到工程实践中,就撞上了一堵“叹息之墙”——KV Cache的跨集群传输带宽和延迟瓶颈。PDD架构正是为了攻克这一难题而设计的。
三个核心洞察:硬件“偏科”与流量“二八定律”
要理解PDD的设计,得先从无问芯穹在技术报告中揭示的三个核心洞察入手。
洞察1:硬件性能的“极度偏科”
LLM推理的Prefill和Decode两个阶段对硬件资源的需求截然相反。无问芯穹团队在内部基准测试中发现,芯片的性能表现极度“偏科”。以8卡的某旗舰高性能GPU为基线,某厂商的E芯片在处理计算密集的Prefill阶段时,性能只能达到基线的81%;但在访存密集的Decode阶段,它却能爆发出基线210%的性能。

如果把这类“偏科”芯片放在同构集群里,既要扛Prefill计算又要做Decode输出,非但无法发挥自身长板,反而会拖慢Prefill阶段的整体效率。这一发现强烈激发了团队将Prefill与Decode拆分解耦、分别部署在最合适硬件上的想法。
洞察2:DRC技术带来的10倍“带宽”
跨集群传输庞大的KV Cache会瞬间吃掉广域网带宽。但好在智能体(Agent)业务有一个显著特征:前缀缓存命中率极高。利用这一特性,团队在Decode端部署了前缀缓存RadixCache(简称DRC)。
简单来说,DRC会在Decode实例上缓存历史请求的KV Cache。当Prefill端发现某个请求命中了前缀缓存,就不需要把整个上下文的KV Cache全量传过去,只需要传那一点点“增量”即可。在90%的平均命中率下,DRC理论上能将跨集群的带宽需求降低高达10倍,初步缓解了带宽瓶颈。
然而,带宽虽然降下来了,延迟问题却依然棘手。
洞察3:智能体工作负载下的“非均匀延迟”
在DRC技术加持下,KV Cache传输数据量降低了一个数量级,于是跨集群PD分离最棘手的痛点集中在了KV Cache的传输延迟上。
智能体工作负载特征有“三极”:上下文极长(动辄64K)、缓存命中率极高(平均90%)、但输出极短(经常不到100个Token)。用户发个请求,整个输出过程不过十几秒,但首字延迟却要等几十秒,产品体验直接被宣判死刑。
也正因如此,优化跨集群KV Cache的传输延迟,成了必须突破的核心关卡。团队分析了线上真实业务的600万条请求,其中约30%的请求输出的Token个数少于100个,约40%的请求输出不超过500个Token。
关键要点
- 核心创新:PDD架构将传统的PD分离链路重构为“P-RLD-MD”三级分离式推理,以低成本的广域网以太网串联多地同构数据中心,解决了跨集群KV Cache传输延迟痛点。
- 实际效果:实测显示,首Token延迟降低51.5%,单Token成本降低37.5%,实现了全域异构算力的最大化调度。
- 基础洞察:硬件性能极度“偏科”,DRC技术可降低带宽需求10倍,智能体工作负载的短输出特征使延迟优化成为关键。
本段揭示KV Cache传输延迟的根源:只有少数低命中率请求造成长尾延迟。基于此发现,无问芯穹提出PDD三层架构,用本地中继算力巧妙掩盖网络延迟。
延迟瓶颈的真相:偏斜分布下的“刺头”
对输入请求来说,1~20秒的KV Cache传输时间占端到端总延迟的43%~56%,是最大的性能瓶颈。


虽然降低跨集群KV Cache传输延迟的重要性已明确,但这1~20秒延迟的具体来源和分布却一直是个谜。
要弄清延迟分布,先要理解输入请求的真实情况:平均90%的缓存命中率,背后的分布是怎样的?
通过分析真实业务Trace,团队发现:输入请求的命中率分布极度偏斜——约70%~80%的请求命中率超过95%,只有极少数低命中率请求会携带巨大的KV Cache数据包。

随后,无问芯穹在20Gbps跨集群专线上做了微基准测试,对比“真实偏斜分布”与“均匀分布(85%~95%命中率)”的传输表现,结果令人震惊:
- 真实偏斜分布:P50传输延迟极低(仅248ms),只有极少数低命中率请求出现18秒以上的长尾延迟。
- 均匀分布:所有请求都有中等数据包,导致网络连接池瞬间打满(利用率100%),引发严重排队阻塞,P50延迟飙升到1210ms——这还没算平均1682ms的排队时间。

这个发现极为关键:极端传输延迟只集中在极少数低命中率的“刺头请求”上。偏斜分布下,大量轻量级请求利用TCP公平性机制,不会被高负载阻塞,能迅速释放连接池。
结论:要解决跨集群PD传输KV Cache的延迟瓶颈,不用全局优化网络,只需针对这少部分“刺头”做专门优化。
创新解法:PDD三层架构与“中继接力”跑法
基于上述洞察,无问芯穹提出PDD(Prefill-RelayDecode-MainDecode)架构。
传统PD分离只有Prefill(P)和Decode(D)两层,而无问芯穹在中间插入了一个“中继站”——RelayDecode(RLD)实例,专门用来掩盖以太网KV Cache传输延迟。

整个系统分成三层:
- P实例:位于主集群,负责处理输入Prompt,生成KV Cache。
- RLD实例:与P实例同集群,通过高速RDMA网络互联(KV传输延迟仅几十毫秒)。
- MainDecode实例(MD实例):位于外地集群,通过广域网以太网与主集群相连(KV传输延迟数秒及以上)。
它的工作方式很像一场2×100米接力赛:
当P实例完成Prefill后,会同时做两件事:
1. 通过高速RDMA网络,把KV Cache“瞬间”传给同机房的RLD实例;
2. 通过慢速且延迟不稳定的以太网,把KV Cache传给外地的MD实例。
RLD实例拿到KV Cache后立即开始解码,输出Token给用户。此时用户根本感知不到跨集群的KV传输延迟,已经开始看到文字了。而在后台,以太网传输可能还在进行。
几秒后,MD实例终于收到完整KV Cache,解码任务无缝从RLD交接给MD,由MD完成后续大部分吐字工作。
这就是PDD的核心思想:用本地的RLD算力,精准掩盖跨集群那极少数低命中率请求的网络延迟。
核心机制:如何优雅完成“接力棒交接”?
PDD三级架构听起来简单,但最大的工程难题在于:当MD实例准备好后,如何无缝接管RLD正在进行的解码任务?
传统做法是:RLD一边解码,一边把新生成的“增量KV Cache”通过以太网传给MD。但这又掉进跨域网络传输延迟的坑里,还要经过繁琐的H2D/D2H(显存到内存、内存到显存)拷贝,延迟高且不稳定。

于是,无问芯穹提出了一个反直觉但极其高效的机制:Extend-Decode Handoff(扩展解码交接)。
做法很简单:RLD绝不传输庞大的KV Cache,只把生成的Token ID传给MD。传输几个Token ID仅几KB数据量,网络开销几乎为零。