DPU企业:百度(Baidu)——以太行DPU重构云计算与AI基础设施
百度(Baidu)不仅是一家搜索引擎和人工智能企业,也是中国较早投入DPU(Data Processing Unit,数据处理器)和智能网卡技术的大型云计算公司之一。
百度的DPU技术主要服务于百度智能云,其代表性技术体系是“百度太行”计算架构以及太行DPU。
与云豹智能、中科驭数这类主要向外部客户销售DPU芯片和板卡的独立半导体企业不同,百度研发DPU的主要目的并不是成为一家独立DPU芯片供应商,而是利用DPU重新设计百度智能云的服务器、网络、存储和虚拟化基础设施。
截至2026年,百度智能云仍然将自研DPU作为其云计算和AI基础设施的重要底座。
百度最新公开技术资料显示,自研DPU已经与商用高速网卡共同组成百度高性能网络的底层基础,用于RDMA、多路径传输、云存储以及AI工作负载;
百度太行DPU同时继续承担虚拟化卸载和云服务器I/O加速任务。
百度为什么要开发DPU?
传统服务器以CPU为中心。网络数据进入服务器以后,需要CPU处理虚拟交换、VPC、TCP/IP、存储协议、虚拟设备、安全规则和大量I/O操作。
随着云服务器网络从10Gbps逐渐提升到25G、50G、100G甚至200Gbps,仅仅依靠CPU处理这些任务会占用越来越多的计算资源。
对于百度这样的超大规模互联网和云计算企业,这个问题会被进一步放大。
一台服务器如果浪费几个CPU核心处理基础设施任务,影响可能并不明显;但是如果数十万台服务器都出现相同问题,最终就会形成巨大的CPU资源、电力和数据中心成本。
DPU的核心思想就是把这些任务从CPU中卸载出来。
CPU负责通用计算和用户应用,GPU或者昆仑芯负责AI计算,而DPU负责网络、存储、虚拟化以及大量数据移动。
这也是百度开发太行DPU的重要原因。
百度太行DPU
百度DPU技术最重要的品牌是“太行”。
“百度太行·计算”是百度智能云公有云的重要计算技术体系,涵盖云服务器BCC、弹性裸金属服务器、HPC以及AI异构计算等产品,而DPU是整个太行计算架构中的核心基础设施之一。
百度并没有把DPU简单设计成一张高速网卡,而是在DPU中加入网络、存储、虚拟化和数据移动硬件引擎,将原来需要运行在服务器CPU上的大量软件功能转移到专用硬件。
因此,从技术定位上看,百度太行DPU与AWS Nitro、阿里云CIPU、腾讯水杉/银杉DPU属于相似的发展路线:都是超大规模云服务商根据自己的数据中心需求开发基础设施处理器。
太行DPU 2.0
百度智能云随后推出了太行DPU 2.0,并将其定位为“Cloud Native IO Engine”,也就是云原生I/O引擎。
太行DPU 2.0的一个重要变化,是进一步把虚拟化软件从Host CPU卸载到DPU,让云服务器能够把更多CPU核心直接提供给客户。
同时,网络和存储I/O数据流也通过DPU进行硬件卸载和加速。
百度公开资料显示,基于太行DPU 2.0的新一代架构网络带宽提高到200Gbps,网络转发性能达到5000万PPS,并支持层级QoS,为不同租户提供更加稳定的网络和存储性能。
这说明百度DPU已经从早期智能网卡逐渐演变成真正参与服务器资源管理的基础设施处理器。
DPU让CPU“全核售卖”
云计算企业一个非常现实的问题,是服务器CPU并不是全部可以卖给用户。
如果一台服务器拥有64个CPU核心,而Hypervisor、虚拟交换、存储和网络等基础设施软件需要消耗几个CPU核心,那么真正可以销售给客户的计算能力就减少了。
百度太行DPU通过把虚拟化组件以及网络、存储I/O处理转移到DPU,能够让Host CPU更加接近全部用于客户工作负载。百度将这种能力称为“全核售卖”。
对于拥有大量服务器的云计算公司来说,这种资源利用率提升具有非常直接的经济价值。
因此,大型云服务商开发DPU,并不一定需要把DPU芯片卖给别人赚钱。
只要每台服务器能够节省几个CPU核心,部署规模达到几十万台以后,就可能产生非常大的经济效益。
vQPE硬件引擎
百度太行DPU内部集成了多个自研硬件引擎,其中之一是vQPE。
vQPE主要用于管理宿主机设备以及Host与DPU之间的数据交互,同时屏蔽不同硬件平台的复杂性。
现代云计算环境已经不只是x86 CPU。
服务器中可能同时存在Intel CPU、AMD CPU、Arm CPU、NVIDIA GPU、昆仑芯以及各种SSD和网络设备。
DPU需要在这些不同硬件之间建立统一的云基础设施接口。
vQPE的意义就在于让上层云平台不必直接面对每一种服务器硬件细节,从而更加容易实现不同计算资源的云化和统一管理。
BDMA数据移动引擎
百度DPU另一个重要模块是BDMA。
DMA,也就是Direct Memory Access,是服务器内部非常重要的数据移动技术。它可以让设备直接与内存交换数据,而不需要CPU参与每一次数据复制。
百度BDMA在此基础上进一步针对云计算数据路径进行了优化,通过软硬件协同接口对不同业务流量进行分发,使网络、存储以及其他I/O任务能够更加高效地使用DPU。
这实际上体现了DPU最重要的价值之一:
DPU不一定负责进行最复杂的计算,但是它非常擅长“移动数据”。
在现代数据中心中,数据移动本身正在成为越来越大的性能瓶颈。
BOE网络硬件卸载引擎
百度太行DPU还包含BOE硬件引擎。
在虚拟云网络中,服务器需要根据大量流表判断每一个数据包应该发送到哪里。
传统方式通常由CPU上的虚拟交换软件完成这些匹配操作。
BOE则把部分网络流表匹配从CPU中卸载到硬件,并采用Fast Path和Slow Path分离方式处理网络流量。
常见、稳定并且能够硬件处理的数据包进入Fast Path,可以高速转发。
复杂或者首次出现的数据流则进入Slow Path,由软件进行更加灵活的处理。
这种“软件控制+硬件快速转发”的方式已经成为现代DPU和SmartNIC的重要设计思想。
BDR协议卸载引擎
百度DPU另外一个具有代表性的模块是BDR。
BDR将百度自研高性能网络协议栈中的部分功能从CPU下沉到硬件,从而减少CPU参与网络通信的程度。
这一技术尤其适合RDMA。
RDMA允许服务器直接访问远端服务器的内存,减少CPU参与和多次数据复制,因此可以显著降低通信延迟。
百度利用DPU构建高带宽、低延迟RDMA网络,并将RDMA应用到HPC、AI训练、云存储和其他高性能计算场景。
DPU与RDMA
RDMA已经成为百度DPU非常重要的应用方向。
百度智能云的弹性RDMA网络ERI可以从DPU提供的VF虚拟设备创建弹性RDMA网卡,让云服务器直接接入RDMA网络。
同时,DPU能够同时处理TCP和RDMA网络流量,使客户可以在VPC网络体系中使用高性能RDMA,而不必完全建立另一套独立网络。
这种设计对于云计算非常重要。
传统InfiniBand等高性能网络性能很好,但是往往需要独立部署。
如果能够把RDMA与云计算现有的VPC网络融合,用户就可以同时获得云网络的弹性和RDMA的低延迟。
DPU与GPU Direct RDMA
在AI数据中心中,RDMA的重要性进一步提高。
传统数据传输通常需要GPU首先把数据复制到CPU内存,然后由CPU和网卡发送到另外一台服务器。
GPU Direct RDMA则可以让网络设备更加直接地访问GPU显存,大幅减少CPU参与和数据复制。
百度百舸AI异构计算平台已经支持GPU Direct RDMA,用于大型分布式AI训练。
百度公开资料显示,弹性RDMA相比传统TCP网络可以明显降低通信延迟,并用于提高多GPU和多服务器AI训练效率。
DPU、高速网卡、RDMA和GPU Direct因此正在逐渐成为同一个AI网络体系中的不同组成部分。
DPU与昆仑芯不是一回事
百度同时拥有昆仑芯AI加速器,因此很容易把昆仑芯和百度DPU混在一起。
实际上,两者的作用完全不同。
昆仑芯属于AI计算芯片,主要负责矩阵计算、深度学习训练和推理。
DPU属于基础设施处理器,主要负责网络、存储、虚拟化、RDMA和数据移动。
一个主要负责“计算数据”。
另一个主要负责“移动和管理数据”。
CPU运行系统和通用程序,昆仑芯或者GPU进行AI计算,而DPU负责这些处理器与网络、存储之间的数据传输。
这正是现代异构计算架构的发展方向。
太行弹性裸金属服务器
裸金属服务器是百度DPU最典型的应用之一。
传统裸金属服务器虽然可以提供完整的物理机性能,但是缺乏虚拟机的弹性。例如网络、云盘、安全组、镜像和设备管理都会更加困难。
采用DPU以后,网络和存储虚拟化可以独立于Host CPU运行。
百度太行架构可以通过DPU向裸金属服务器提供虚拟网卡、云盘以及设备热插拔等功能,让一台物理服务器拥有接近虚拟机的云管理能力。
百度公开的DPU落地资料显示,采用DPU以后,新一代裸金属服务器实例创建周期相比此前缩短约80%,可以实现分钟级启动,同时支持镜像、迁移、热升级和热插拔等功能。
这也是DPU改变云服务器架构最直观的案例之一。
网络卸载
网络处理是DPU最基础的功能。
云服务器中的VPC、虚拟交换、安全组、Overlay网络和流表处理都会消耗Host CPU。
百度DPU将部分网络数据路径直接转移到硬件,通过BOE等硬件引擎进行流表匹配和快速转发。
这种方式一方面可以提高吞吐量,另一方面可以让网络性能更加稳定。
对于云服务商来说,稳定有时甚至比峰值速度更加重要。
因为公有云服务器上同时存在多个不同客户,某一个客户突然产生大量网络流量,不应该导致其他客户网络性能明显下降。
因此百度在DPU基础上又实现了层级QoS,为不同租户提供网络和存储资源隔离。
存储卸载
DPU另外一个核心工作是存储。
今天的云硬盘通常并不是服务器内部的一块物理硬盘,而是来自远端分布式存储系统。
每一次读取云盘数据,本质上都可能是一次网络通信。
因此,云计算中的网络和存储已经高度融合。
百度通过DPU把部分存储I/O处理从Host CPU转移出去,并利用高速网络连接计算节点和远端存储资源。
这使百度能够实现存算分离,同时降低远程存储给CPU带来的负担。
百度智能云最新公开技术资料仍然显示,自研DPU与高速网络共同为云磁盘CDS、并行文件存储PFS以及其他块、文件、对象和KV存储提供底层高性能I/O能力。
虚拟化卸载
太行DPU 2.0最重要的变化之一,就是进一步把虚拟化组件卸载到DPU。
传统云服务器的Hypervisor和I/O虚拟化会运行在服务器CPU上。
采用DPU以后,这些功能可以迁移到独立基础设施处理器。
这样用户购买一个32核云服务器时,云平台就可以尽可能把真正的32个CPU核心提供给用户,而不是其中一部分被云平台自身占用。
百度因此能够让虚拟机性能更加接近物理服务器,同时继续保持云服务器的弹性、迁移和管理能力。
AI时代的百度DPU
生成式AI的发展让DPU的重要性进一步提高。
大型语言模型训练需要数千甚至数万块GPU或者AI加速器协同运行。
随着单块AI芯片越来越快,集群最大的瓶颈之一正在从“计算不够快”变成“数据送不过去”。
尤其是Mixture of Experts,也就是MoE模型,会产生大量All-to-All通信。
百度智能云近年来因此持续升级AI网络。
百度最新公开资料显示,其高性能网络底层采用自研DPU与商用网卡协同,实现端网融合RDMA协议和多路径转发,并进一步优化用户态TCP、RDMA以及高性能RPC。
这意味着百度DPU正在从传统云服务器基础设施进一步进入AI基础设施。
百度百舸AI异构计算平台
百度的AI基础设施品牌是“百舸”。
百舸提供GPU、昆仑芯以及其他异构算力,并通过高速网络、存储和调度系统组成大型AI计算集群。
百度公开资料显示,其AI基础设施已经支持RDMA容器网络,单机网络能力可以达到1.6Tbps级别,并面向大规模分布式训练进行网络、通信库和调度优化。
这里需要注意:
1.6Tbps是整个AI节点或相关高性能网络体系的能力,并不等于某一颗百度DPU本身拥有1.6Tbps端口。
因此,在介绍百度DPU时不能简单写成“百度已经拥有1.6Tbps DPU”。
更准确的说法是,百度DPU已经成为其Tbps级AI网络基础设施的一部分,与高速商用网卡、交换机和软件通信栈协同工作。
从全部硬件卸载到软硬件协同
百度近年来的DPU路线还有一个值得关注的变化:不是所有网络功能都一定要塞进DPU硬件。
大型公有云中可能同时使用多家厂商、多个代际的DPU和智能网卡。
如果云平台软件过度绑定某一种硬件,每更换一代网卡都需要重新开发大量功能。
百度因此继续发展BvS(Baidu virtual Switch)以及新一代数据平面Sonata。
通过标准化接口把稳定、简单、长期存在的数据流卸载到硬件,而把短连接、复杂规则和快速变化逻辑留在高性能软件路径。
百度2026年公开资料显示,Sonata已经部署到数十万台服务器,并能够同时适配自研DPU和不同厂商、不同代际的网卡。
这反映了DPU产业进入成熟阶段后一个非常重要的问题:
真正优秀的云基础设施,并不是“所有事情全部由DPU做”。
而是正确决定什么应该交给CPU,什么应该交给软件,什么应该交给DPU硬件。
百度DPU与NVIDIA BlueField的区别
NVIDIA BlueField是一种标准商业DPU。
NVIDIA设计BlueField芯片和DPU板卡,然后向服务器厂商、企业和云服务商销售,并通过DOCA建立软件生态。
百度的模式不同。
百度首先是一家超大规模互联网和云服务企业,然后根据百度智能云自己的需求开发DPU。
因此百度并不依赖销售DPU芯片本身赚钱。
只要DPU能够提升云服务器CPU利用率、提高网络和存储性能、降低延迟并增强资源隔离,就能够在百度庞大的服务器规模下产生商业价值。
因此,百度DPU更适合与AWS Nitro、阿里云CIPU和腾讯自研DPU进行比较,而不是单纯与BlueField比较芯片销售规模。
百度DPU与阿里云CIPU
百度太行DPU与阿里云CIPU有很多相似之处。
两家公司都是中国大型云服务商。
两家公司都希望把网络、存储和虚拟化从CPU卸载到专用处理器。
两家公司都利用这种架构支持弹性裸金属服务器。
两家公司也都在AI计算基础设施中加强高速网络和RDMA。
主要区别在于技术品牌和具体实现。
阿里云把这类基础设施处理器命名为CIPU,并强调CIPU与飞天云操作系统之间的结合。
百度则直接使用DPU名称,并把DPU作为“百度太行·计算”和百度智能云IaaS的重要底座。
从DPU企业目录的分类角度,两者都属于Hyperscaler自研DPU。
百度DPU与腾讯DPU
百度和腾讯的技术路线也非常相似。
腾讯公开过“水杉”和“银杉”两代DPU。
百度则更加突出“太行DPU”和“太行DPU 2.0”。
两家公司都利用DPU卸载网络、存储和虚拟化,并用于裸金属服务器、云服务器和高性能网络。
随着AI发展,两家公司也都开始把高速网络、RDMA以及GPU集群通信作为下一阶段基础设施重点。
这种趋势说明,中国大型云服务商已经基本接受一个共同判断:
未来服务器不会继续完全以CPU为中心。
DPU将成为服务器基础设施中的独立处理层。
百度DPU的优势
百度DPU第一个优势是拥有真实的大规模云计算场景。
百度智能云自身就是DPU最大的应用环境。
第二个优势是软硬件协同能力。百度同时开发DPU、虚拟交换、RDMA网络、云存储、服务器、云操作系统以及AI基础设施,可以进行从硬件到软件的整体优化。
第三个优势是与AI结合。
百度不仅拥有GPU云计算,也拥有昆仑芯和百舸AI异构计算平台,因此DPU可以直接进入大型AI集群。
第四个优势是长期运营能力。
DPU真正困难的不是做出一张能够跑通测试的网卡,而是在数万乃至数十万服务器中长期稳定运行。
百度已经把DPU和相关数据平面技术部署进大规模公有云生产环境。
第五个优势是异构兼容能力。
百度现在并不要求所有服务器只能使用一种自研DPU,而是让自研DPU和不同厂商的商用网卡共同工作。这种策略更加适合大型公有云长期运营。
百度DPU面临的挑战
百度DPU同样面临不少挑战。
首先是AI网络速度增长极快。
200Gbps在几年前属于非常高的服务器网络速度,但是今天高端AI服务器已经进入400G和800G网络时代。
其次是硬件与软件之间的平衡。
越来越复杂的网络功能如果全部固化到DPU,会降低灵活性;如果全部留在软件,又会损失性能。因此如何划分硬件Fast Path和软件Slow Path将长期影响DPU架构。
第三个挑战是生态。
百度DPU主要服务百度智能云,并没有像NVIDIA BlueField那样建立一个面向全球服务器市场的独立DPU产品和开发者生态。
但这并不一定是缺点,因为百度研发DPU本来的目标就是优化自身数据中心,而不是成为一家通用DPU芯片销售企业。
百度在DPU产业中的定位
如果把全球DPU企业分成不同类型,百度属于非常典型的一类:
超大规模云服务商自研DPU。
这一类企业还包括AWS、Microsoft、Google、阿里云和腾讯。
另一类则是NVIDIA、AMD Pensando、Marvell、云豹智能、中科驭数等独立DPU芯片和产品供应商。
两类企业虽然都在开发DPU,但商业逻辑完全不同。
独立DPU企业需要把芯片卖出去。
Hyperscaler则希望通过DPU提高整个云数据中心效率。
因此,对于百度来说,最重要的问题不是“DPU卖了多少颗”。
而是它能否让百度智能云服务器拥有更高CPU利用率、更低网络延迟、更稳定的存储性能以及更高效的AI集群。
总结
百度是中国较早大规模研发和部署DPU技术的云计算企业之一,其核心DPU技术体系围绕“百度太行·计算”和太行DPU展开。
百度太行DPU集成vQPE、BDMA、BOE和BDR等自研硬件引擎,可以把服务器中的网络、存储、虚拟化、RDMA以及数据移动任务从Host CPU卸载到专用硬件。
太行DPU 2.0进一步被定位为Cloud Native IO Engine,通过全面虚拟化卸载实现云服务器“全核售卖”,并将网络能力提升到200Gbps和5000万PPS级别,同时支持层级QoS和分钟级弹性裸金属服务器。
进入生成式AI时代以后,百度DPU的角色又进一步发生变化。
它已经不仅仅服务传统云服务器,而是与商用高速网卡、RDMA、高性能RPC、云存储以及百舸AI异构计算平台共同组成百度大型AI基础设施的数据传输底座。
因此,在全球DPU产业版图中,百度更适合被归类为“Hyperscaler自研DPU”企业。
百度并不是希望单独销售一颗DPU。
它真正希望解决的是一个更大的问题:
当CPU、GPU、昆仑芯、内存、存储和数千台服务器连接到一起以后,怎样让数据足够快地在这些计算资源之间移动。
CPU负责通用计算,GPU和昆仑芯负责AI计算,而DPU负责网络、存储、虚拟化以及数据移动。
从这个角度来看,百度太行DPU已经不是一张简单的智能网卡,而是百度智能云和AI基础设施中的重要基础处理器。
