打破算力孤岛:PDD架构如何实现跨域推理延迟减半、成本骤降?

1 阅读

算力孤岛破局:从物理隔离到逻辑协同的架构演进

大语言模型(LLM)的规模化落地,正在经历从“能用”向“好用、用得起”的关键转折。在这一过程中,推理成本与响应速度构成了行业面临的“生死线”。传统观念认为,高性能推理依赖于同构集群内紧密耦合的高速互联,但随着模型上下文长度的指数级增长以及Agent业务场景的爆发,这种集中式部署模式已触及物理与经济的天花板。

行业普遍认知的理想解法是“异构分离”:让计算密集型硬件负责Prefill(预填充),让访存密集型硬件负责Decode(解码)。然而,在实际工程实践中,构建大规模异构同构混合集群不仅采购成本高昂,且面对模型架构的快速迭代,固定配比的硬件极易出现资源闲置。一种更具吸引力的思路浮现出来:利用低成本的广域网以太网,串联各地已建成的同构数据中心,实现跨集群的异构分离式推理。

但这一设想曾长期被视为“不可能任务”。核心障碍在于跨集群传输KV Cache(键值缓存)时遭遇的带宽与延迟瓶颈。以太网环境下,几秒甚至十几秒的传输延迟足以摧毁用户体验,导致产品被判定为“不可用”。近日,无问芯穹发布的PDD(Prefill-RelayDecode-MainDecode)架构,通过创新性的三级分离式设计,成功攻克了这一难题,实现了跨域推理延迟减半、成本直降近40%的突破性进展。这不仅是技术层面的创新,更是对分布式算力资源重新配置的一次深刻洞察。

痛点深挖:硬件“偏科”与流量“二八定律”

要理解PDD架构的设计精髓,必须首先审视LLM推理过程中的两个核心洞察。

洞察一:硬件性能的极度非对称性

LLM的Prefill阶段主要涉及大量矩阵乘法,属于计算密集型任务;而Decode阶段则需逐Token访问显存,属于访存密集型任务。无问芯穹的基准测试显示,芯片性能在这两个阶段呈现出极度的“偏科”现象。例如,某厂商E芯片在处理计算密集的Prefill时,性能仅为旗舰GPU的81%,但在访存密集的Decode阶段,其性能却能爆发至旗舰GPU的210%。

若在传统同构集群中混合使用这类芯片,非但无法发挥其长板优势,反而会因调度复杂拖慢整体效率。因此,将Prefill与Decode解耦,分别部署在最匹配其硬件特性的节点上,成为提升效率的必由之路。

洞察二:DRC技术带来的带宽跃迁

跨集群传输的首要阻力是带宽。然而,Agent业务具有前缀缓存命中率极高的特征。通过部署RadixCache(DRC),Decode端可缓存历史请求的KV Cache。当Prefill端请求命中时,仅需传输“增量”数据而非全量上下文。在90%的平均命中率下,DRC可将跨集群带宽需求降低10倍。

洞察三:非均匀延迟与“刺头请求”

尽管带宽压力缓解,但延迟仍是顽疾。智能体工作负载呈现“三极”特征:上下文极长、缓存命中率极高、输出极短。分析600万条真实业务Trace发现,30%的请求输出少于100个Token,40%不超过500个Token。对于这些短输出请求,KV Cache传输占据了端到端总延迟的43%-56%。

更关键的是,命中率分布极度偏斜。70%-80%的请求命中率在95%以上,仅少数低命中率请求携带巨大KV Cache数据包,导致长尾延迟。微基准测试表明,在真实偏斜分布下,绝大多数轻量请求因TCP公平性机制迅速释放连接,仅少数“刺头请求”引发阻塞。这意味着,解决跨集群PD传输延迟,无需全局优化网络,只需针对这少部分低命中率请求进行针对性处理即可。

PDD架构创新:三级分离与“接力跑”机制

基于上述洞察,PDD架构将传统的两层PD分离重构为P-RLD-MD三级分离式推理架构。

层级定义

  • P实例(Prefill):位于主集群,负责处理输入Prompt,生成KV Cache。
  • RLD实例(Relay Decode):作为中继站,与P实例位于同一集群,通过高速RDMA网络互联,延迟仅几十毫秒。
  • MD实例(Main Decode):位于远程集群,通过广域网以太网与主集群相连,延迟数秒及以上。

“接力跑”工作流

PDD的核心机制宛如一场2×100米接力赛。当P实例完成Prefill计算后,同步执行两项操作:首先,通过高速RDMA将KV Cache瞬间传输至同机房的RLD实例;其次,通过慢速以太网将KV Cache传输至远端MD实例。

RLD实例获取KV Cache后,立即开始解码并向用户输出Token。此时,用户已感知不到后台以太网的缓慢传输,实现了“首字即得”的流畅体验。数秒后,待MD实例接收完完整KV Cache,解码任务通过特定机制无缝交接给MD实例,由MD完成后续主要输出工作。

这种设计巧妙地利用本地RLD算力,精准掩盖了跨集群中极少数低命中率请求的网络延迟,实现了用户体验与系统效率的最优平衡。

核心机制解析:Extend-Decode Handoff

PDD架构的工程难点在于RLD与MD之间的任务交接。传统做法是RLD边解码边将增量KV Cache传送给MD,但这重新引入了跨域网络延迟及H2D/D2H拷贝开销。

无问芯穹团队提出了反直觉但高效的“Extend-Decode Handoff”机制:RLD不传输庞大的KV Cache,仅将生成的Token ID(几KB数据)发送给MD。

MD接收Token ID后,利用Extend-Decode技术(常见于MTP多Token预测和投机解码),在本地重新计算这些Token对应的KV Cache,并生成下一个新Token。由于Decode阶段访存密集而计算轻量,MD端重算100个Token的KV Cache平均耗时仅为305.2ms,且标准差极小,具有极高的确定性。相比之下,传统以太网传输不仅耗时波动大,还面临网络拥堵风险。

通过“只传Token,本地重算”,团队将一个受网络波动影响极大的不可控操作,转化为确定性的本地计算操作,显著提升了系统的稳定性和可预测性。

智能调度与负载均衡:让中继站“只藏延迟不干重活”

RLD作为中继站,若承担过多计算任务,将成为系统瓶颈。PDD架构通过智能流水线编排,确保RLD仅负责“掩藏延迟”,不承担重活。

双流水线策略

  • P-MD流水线:针对命中率>95%的高频请求(占比70%以上),数据包极小,直接通过以太网传输至MD,无需RLD介入。
  • P-RLD-MD流水线:仅针对低命中率、大数据量的“刺头请求”,启用RLD进行延迟掩盖。

实测数据显示,RLD仅承担系统6.2%的Token生成任务,而MD包揽了93.8%的重活。此外,该策略保证了MD端的缓存命中率与P端一致,避免了因RLD提前终止请求生命周期而导致的恶性正反馈循环,确保系统负载长期稳定。

实战验证:降本增效的最终检验

在DeepSeek-V4-pro模型及真实Agentic工作负载下的测试,全面验证了PDD架构的性能。

延迟表现

传统跨集群PD分离(CDC-PD)受广域网延迟影响,P90首Token延迟(TTFT)高达18.3秒。PDD架构通过RLD抢先输出,成功掩盖网络延迟,将P90 TTFT降低约46%至9.8秒,P99延迟从29.7秒降至14.4秒。用户感知的端到端延迟显著优化,体验接近同集群部署。

负载分布

RLD实例仅生成27万个Token,远端MD实例生成412万个Token,两者负载差异达15.2倍。这证明了路由策略的有效性:绝大多数请求通过P-MD管线快速通过,仅少数长尾请求借用RLD缓冲,并在传输完成后迅速交接,避免了RLD资源被长输出请求无限期占用。

性价比

在严格TTFT约束下(P90 < 10s, P99 < 15s),PDD架构相比传统单机房同构旗舰GPU集群(IDC-PD),在总成本下降3.5%-7.1%的前提下,有效吞吐量(RPS Goodput)提升27.8%,性价比(BCR)提升高达37.5%。值得注意的是,当前测试未开启MTP等进一步优化机制,且RLD节点规模有限,未来通过引入专用推理芯片及优化调度,性价比仍有巨大提升空间。

展望未来:极简局部异构与灵活远端分离

PDD架构不仅仅是一项延迟优化技术,它代表了下一代模型即服务(MaaS)基础设施的核心设计理念:极简局部异构+灵活远端分离。

未来,云厂商无需在单一数据中心堆砌庞杂的异构芯片,只需保留极小比例的“接力手”算力,即可通过可扩展的跨域以太网,将庞大的解码任务分发至全国乃至全球的低成本算力节点。这种范式能够极大盘活存量异构算力,降低资源空置率,使每一块芯片都能在其擅长的领域发挥最大价值。

随着模型迭代加速和硬件多样化,这种跨集群、异构化的推理架构,将为构建极具弹性、经济性和规模化潜力的大模型基础设施提供坚实支撑。从理论探讨到工程落地,PDD架构的成功实践,标志着分布式AI推理正式迈入精细化调度与全域资源协同的新阶段。