AI 快讯PD分离跨域破局:延迟减半
行业快讯

PD分离跨域破局:延迟减半

2026-07-30T09:03:31.458Z
PD分离跨域破局:延迟减半

最新测试显示,跨节点PD分离可将大模型推理延迟降低约50%、综合成本降低近40%。真正的进展不只是拆分计算,而是KV Cache传输、异构调度和跨域算力协同开始形成完整工程闭环。

PD分离从架构概念走向跨域生产

截至2026年7月30日,一份最新披露的完整技术报告把大模型PD分离向前推了一步:通过将Prefill与Decode部署到更匹配的异构算力节点,并配合高速网络、KV Cache传输和全局调度,测试中的推理延迟降低约50%,综合成本下降近40%。

PD分离是将大模型推理中的预填充阶段与解码阶段拆到不同资源池运行的系统架构。 Prefill负责一次性读取用户输入并建立上下文,Decode则根据上下文逐个生成Token;前者偏计算密集,后者偏显存带宽密集,把它们塞进同一组GPU,往往意味着两类任务互相抢资源。

这次进展值得关注的地方,不是业内又做了一遍PD拆分,而是尝试让分布在不同节点、不同硬件乃至不同地域的算力像接力跑一样协同工作。过去的PD分离大多局限在同一机房或同一高速集群内,KV Cache传输距离短、网络环境可控;一旦扩大到跨集群场景,传输延迟、故障域和调度复杂度都会迅速上升。

从现有公开结果看,跨域PD分离已经不再只是架构图上的理想方案。约50%的延迟降幅和近40%的成本降幅,意味着它开始触及生产系统最看重的两个指标:用户是否愿意等,以及服务商是否承担得起。

传统单体推理与跨节点PD分离架构对比图,展示请求进入Prefill节点、KV Cache经高速网络传输至Decode节点并持续生成Token的流程

为什么两个阶段必须分开

Prefill是模型并行处理全部输入Token并生成首轮KV Cache的阶段。 当用户提交一篇长文、一个代码仓库或数万Token的检索结果时,模型需要执行大量矩阵乘法,这类工作通常是compute-bound,也就是主要受GPU计算能力限制。

Decode是模型读取KV Cache并自回归生成后续Token的阶段。 Decode每轮通常只新增一个Token,却需要反复读取模型参数和上下文缓存,因此更容易受到HBM容量与带宽限制,是典型的memory-bound任务。

两者混跑的问题类似于让短途冲刺和长途运输共用一条车道。一个长Prompt进入Prefill后会短时间占满计算单元,旁边正在Decode的请求便可能突然卡顿;反过来,大量Decode请求占据显存和带宽,也会压缩Prefill可使用的批处理空间。

用户感知到的结果通常不是平均速度略慢,而是首字迟迟不出现,或者生成过程中隔几秒停顿一次。对于聊天机器人,这种波动令人烦躁;对于语音交互、实时翻译和Agent工作流,长尾延迟还会沿调用链逐级放大。

中国信通院在2026年发布的《大模型推理优化关键技术及应用实践研究报告》中,将PD分离概括为“阶段解耦、专用部署、并行调度”。这一定义抓住了核心:PD分离不是简单把一台服务器换成两台,而是让两种性质不同的负载分别采用合适的硬件、批处理策略和并行方式。

延迟减半是怎么做到的

本轮优化的第一层收益来自资源争抢的消除。 Prefill节点可以集中处理矩阵计算,Decode节点则维持相对稳定的Token生成节奏,长Prompt不再轻易打断正在运行的解码批次。

本轮优化的第二层收益来自异构硬件匹配。 Prefill更需要高计算吞吐,Decode更看重显存容量、显存带宽和单位成本,因此两个资源池不必采购完全相同的GPU。已有测试方案曾采用H20承担Prefill、L20承担Decode,思路就是让昂贵硬件集中处理真正擅长的任务,而不是要求每张卡同时兼顾所有负载。

本轮优化的第三层收益来自独立扩缩容。 在传统单体部署中,Prefill与Decode只能按同一比例扩容;PD分离后,平台可以根据Prompt长度、输出长度和并发结构分别调整P池与D池。例如文档分析业务的输入很长、输出较短,可以增加Prefill资源;代码生成和深度推理的输出较长,则可以扩充Decode资源。

公开实践也给出了相近方向的结果。阿里云AI开发平台TAI披露的PD分离实践中,字间延迟降低52%至85%;本次报告给出的约50%推理延迟降幅处在同一量级。不过,两组数字不能直接视为同一跑分,因为模型、输入长度、并发量、硬件配置以及延迟口径可能不同。

常见推理指标之间也不能混用:

  • TTFT是从请求发出到首个Token返回的时间。 它主要反映Prefill计算、排队和KV Cache传输效率。
  • TPOT是生成阶段每个输出Token的平均耗时。 它更接近用户看到的持续输出速度。
  • ITL是相邻输出Token之间的时间间隔。 它能揭示生成过程中是否存在卡顿和抖动。
  • 端到端延迟是请求进入系统到全部内容生成完毕的总时间。 它同时受到输入长度、输出长度、排队和网络传输影响。

因此,“延迟砍半”应理解为特定测试负载下的系统结果,而不是任意模型、任意并发条件下都能固定获得50%收益。真正有价值的报告必须同时交代P50、P95或P99延迟、输入输出长度分布及服务等级目标,否则单一平均值很容易掩盖长尾问题。

近40%的成本下降来自算力重新配比

近40%的成本下降并不是GPU突然便宜了,而是更少的昂贵资源被浪费。 单体架构往往按照最苛刻阶段配置整套集群,即使Decode并不需要同等计算能力,也必须跟随Prefill使用相同等级的设备。

PD分离允许平台把高算力GPU优先留给Prefill,把带宽、显存容量与价格更合适的设备用于Decode。对于已经拥有多代GPU、国产加速卡或跨地域闲置资源的企业,这种重新组合比整体替换硬件更现实。

成本收益还来自更高的有效吞吐。推理平台并不只关心每秒能生成多少Token,而是关心在TTFT和TPOT满足服务等级目标的前提下,系统能完成多少请求;如果吞吐很高,但用户需要排队几十秒,这部分吞吐并不能转化成合格服务。

中国信通院引用的相关研究将这一指标称为goodput,即满足延迟目标的有效吞吐。PD分离的工程价值正是通过独立批处理和调度,把“理论上跑出来的Token”转化成“能按时交付给用户的Token”。

| 架构 | Prefill与Decode部署 | 硬件选择 | KV Cache传输 | 延迟表现 | 成本特征 | |---|---|---|---|---|---| | 单体推理 | 同一实例或同一GPU组 | 两阶段使用相同设备 | 无跨节点传输 | 长Prompt容易干扰Decode | 部署简单,但资源配比僵化 | | 同机房PD分离 | 同一数据中心的独立资源池 | 可按阶段选择设备 | 依赖RDMA、NVLink或高速以太网 | TTFT与ITL更易分别优化 | 利用率提高,但依赖高速网络 | | 跨集群PD分离 | 不同集群或不同地域资源池 | 可组合异构、存量算力 | 需要跨域传输和全局调度 | 本轮测试约降低50% | 本轮测试综合成本降低近40% |

近40%也不是所有企业都能直接复制的固定折扣。如果现有集群本身负载稳定、GPU型号单一、网络成本较高,改造收益可能明显低于报告结果;如果业务潮汐明显、Prompt长度差异大,或者拥有大量分散闲置算力,PD分离的收益反而可能更高。

真正的难点是搬运KV Cache

KV Cache是保存注意力机制中Key与Value中间结果的缓存,也是连接Prefill与Decode的核心数据。 没有KV Cache,Decode节点就需要重新计算整个Prompt;有了KV Cache,系统又必须把一块可能相当庞大的数据从P节点送到D节点。

KV Cache的体积会随层数、上下文长度、KV Head数量和数据精度增长。模型越大、上下文越长,跨节点搬运的代价越高;如果网络传输耗时超过拆分后节省的计算时间,PD分离就会变成负优化。

工程上通常采用分层分块传输来隐藏这部分开销。Prefill节点不必等待所有层都计算完成再一次性发送,而是完成一部分计算就立即传输对应缓存,使网络通信与后续层计算重叠;Decode节点也可以提前接收和准备数据,减少完整等待时间。

RDMA则是降低传输开销的关键技术。RDMA是允许设备绕过传统CPU数据拷贝路径、直接访问远端内存的网络通信机制。 在GPU集群中,它可以减少CPU参与、内存复制和系统调用开销,让KV Cache更接近从一块显存直接流向另一块显存。

跨域场景比机房内PD分离更难,因为网络不再是一个近似稳定的常量。链路抖动、带宽争用、节点故障和跨区域流量费用都会进入调度决策,系统不能只寻找空闲GPU,还要判断把KV Cache送过去是否值得。

调度器正在取代单卡优化成为核心

全局调度器是根据请求特征、节点负载和网络状态,为Prefill与Decode选择执行位置的控制系统。 在跨节点PD架构中,它决定了延迟减半和成本下降能否同时成立。

一个成熟调度器至少需要观察Prompt长度、预计输出长度、GPU利用率、可用显存、队列长度、KV Cache位置和链路状态。短Prompt可以就近完成,超长Prompt可以发送到高算力P池;已有公共前缀的请求,则应优先路由到保留相应缓存的节点。

缓存亲和性调度是优先将请求发送到已保存相关KV Cache的实例。 RAG、固定系统提示词和多轮对话经常拥有大量公共前缀,如果每次都重新执行Prefill,不仅浪费计算,还会增加跨节点传输压力。

KV Cache Offload是将暂时不活跃的缓存从GPU显存迁移到主机内存或SSD的分层存储技术。 常见层次为GPU HBM、Host RAM和NVMe SSD,热数据留在显存,冷数据逐级下沉;其价值是扩大并发和上下文容量,代价则是缓存重新加载时的额外延迟。

这意味着下一阶段的竞争不再只是CUDA Kernel快几个百分点,而是推理操作系统层面的竞争。谁能同时管理计算、显存、网络、缓存和故障恢复,谁才可能把分散的算力真正组合成一个稳定服务。

全国算力“接力跑”仍有三道门槛

第一道门槛是跨地域网络可能吞掉PD分离收益。 同一机房内可以使用高带宽、低时延的RDMA网络,但跨城市链路的往返延迟、抖动和计费模式完全不同,因此不是距离越远、闲置算力越便宜,调度就越划算。

第二道门槛是异构后端必须保持数值和服务行为一致。 不同GPU或AI加速卡可能使用不同算子库、量化方案和并行策略,平台除了追求速度,还要验证输出质量、采样一致性、最大上下文和故障切换后的行为。

第三道门槛是成本口径必须包含网络与运维。 如果只计算GPU小时价格,而忽略专线、交换设备、KV传输流量、缓存副本和复杂调度系统的维护费用,近40%的节省可能被高估。

安全与数据治理同样不能被省略。Prefill处理的是用户原始Prompt,KV Cache虽然不是明文,却编码了输入上下文的信息;跨地域传输时仍需考虑加密、租户隔离、数据驻留和缓存销毁策略。

这次突破的意义不在“万能加速”

PD分离正在从单一推理优化技巧升级为算力资源组织方式。 它让不同代际、不同规格甚至不同地域的硬件,不必通过完全同质化才能进入同一个推理服务体系。

这对拥有海量在线请求的大型云平台最直接,因为稳定流量可以支撑精细调度;对中型企业而言,托管平台或标准化推理框架可能比自建跨域PD集群更现实。没有足够流量和工程团队,拆分出的网络与运维成本可能高于节省的GPU成本。

这次结果也不意味着传统单体推理已经过时。短上下文、低并发、小模型或边缘部署仍可能更适合单体架构,因为它没有KV Cache跨节点传输和复杂调度开销;只有当模型规模、上下文和并发达到一定程度,PD分离的结构性收益才会显现。

我们的判断是,约50%的延迟下降证明PD分离已经具备生产价值,而近40%的成本下降则证明它可能改变算力采购方式。但真正的“破局”要等到测试方法、网络接口、缓存格式和异构调度形成可复用标准,而不是每家厂商都搭建一套只能在自家集群运行的定制系统。

未来一年,值得重点观察的不是更多峰值跑分,而是三项更难的数据:P99延迟能否长期稳定、节点故障时请求能否无感迁移,以及计入网络和运维后每百万Token的实际成本。只有这三项同时过关,全国范围的算力接力才会从技术演示变成可持续商业基础设施。

参考来源

相关推荐

查看全部