DPU企业:阿里云(Alibaba Cloud)——以CIPU重构云计算基础设施
阿里云(Alibaba Cloud)是阿里巴巴集团旗下的云计算与人工智能基础设施平台,也是中国最重要的云计算服务提供商之一。
在DPU、SmartNIC以及云基础设施加速领域,阿里云走了一条与NVIDIA、AMD Pensando、Marvell等芯片厂商不同的路线:
阿里云并没有把自己的核心产品简单称为DPU,而是提出了CIPU(Cloud Infrastructure Processing Unit,云基础设施处理器)的概念,并将其作为新一代云服务器架构的重要组成部分。
从技术功能上看,CIPU与业界通常所说的DPU、IPU和高端SmartNIC存在大量重叠,例如网络处理、存储I/O、虚拟化卸载、安全隔离和基础设施管理等。
因此,在讨论全球DPU产业时,阿里云通常可以被归入“超大规模云服务商自研DPU/CIPU基础设施”的重要代表。
阿里云是什么公司?
阿里云成立于2009年,主要提供弹性计算、云存储、数据库、网络、安全、大数据、人工智能、容器、云原生和高性能计算等服务。
与传统芯片公司不同,阿里云开发DPU类技术的主要目的并不是把一块独立PCIe加速卡销售给服务器厂商,而是改善自己庞大的云数据中心基础设施。
云计算的数据中心里,一台服务器除了运行用户应用之外,还需要完成大量后台工作,包括虚拟机管理、虚拟网络、数据包转发、云硬盘访问、安全隔离、加密、资源调度和监控。
如果这些工作全部交给服务器CPU执行,就会消耗原本应该分配给客户应用的CPU资源,同时增加系统延迟和不同租户之间的性能波动。
DPU出现的核心原因之一,就是把这些基础设施任务从CPU中卸载出来。
阿里云的CIPU正是针对这一问题发展起来的。
阿里云的CIPU是什么?
CIPU全称为Cloud Infrastructure Processing Unit,即“云基础设施处理器”。
阿里云在2022年6月正式发布CIPU,并将其定位为连接服务器硬件与飞天云操作系统的重要基础设施处理单元。
阿里云的技术资料指出,CIPU向下连接计算、存储和网络等数据中心基础设施,并利用硬件加速完成相关处理;向上则连接阿里云飞天云操作系统,实现大规模资源管理和调度。
从传统服务器来看,CPU通常处于整个系统的中心位置,网络、存储和各种I/O设备都围绕CPU工作。
但是在超大规模云数据中心中,CPU既要执行客户程序,又要处理大量虚拟化和基础设施任务,这种结构越来越容易成为性能和资源利用率的瓶颈。
CIPU试图改变这种结构。
在阿里云的设计思想中,CIPU不仅仅是一块“更快的网卡”,而是云基础设施中的一个专用处理层,可以承担网络、存储、虚拟化、安全以及数据路径处理等工作。
阿里云自己的技术介绍甚至把CIPU描述为高性能基础设施池化的中心节点,让计算、网络和存储资源围绕它进行组织。
CIPU和DPU有什么关系?
严格来说,阿里云官方通常使用CIPU,而不是直接把产品命名为DPU。
但是从体系结构和功能来看,CIPU与DPU非常接近。
业界所谓DPU,也就是Data Processing Unit,主要任务通常包括网络数据包处理、虚拟交换、存储协议处理、RDMA、加密、安全隔离、虚拟化卸载和基础设施管理。
NVIDIA BlueField、AMD Pensando、Intel IPU以及部分Marvell OCTEON产品,都属于这一技术方向。
阿里云CIPU同样承担大量类似任务。阿里云技术资料在解释CIPU时也直接把CIPU、DPU和IPU放在同一技术演进背景中讨论,并指出这些技术的发展与I/O硬件虚拟化、SR-IOV等技术的成熟密切相关。
因此,更准确的说法是:
阿里云不是一家传统的“商用DPU芯片供应商”,而是一家拥有自研DPU类云基础设施处理架构的大型云服务商。
CIPU可以理解为阿里云针对超大规模云计算环境发展出来的一种DPU/IPU类架构。
从神龙架构到CIPU
阿里云进入DPU类技术领域并不是从CIPU突然开始的。在CIPU之前,阿里云已经长期开发“神龙架构”(X-Dragon Architecture),尝试把传统服务器CPU负责的一部分虚拟化、网络和存储任务转移到专用硬件上。
阿里云早期的神龙架构使用MoC网卡和专用芯片,把VPC虚拟网络、云盘以及部分虚拟化功能从服务器CPU中卸载出去,使CPU可以更多地用于客户实际计算任务。
阿里云介绍第三代神龙架构时指出,管理、网络虚拟化和存储虚拟化等原本运行在物理服务器CPU上的软件可以被卸载到专用硬件上。
从这个角度看,神龙架构实际上已经具有明显的SmartNIC和DPU思想。
CIPU则进一步把这种理念提升到整个云基础设施体系结构层面。
因此,阿里云的技术发展路线可以大致理解为:
普通服务器虚拟化 → 神龙架构 → 专用I/O与虚拟化卸载 → CIPU云基础设施处理架构。
这也是为什么阿里云在全球DPU产业中具有特殊位置:它并不是单纯开发一颗DPU芯片,而是围绕自己的云操作系统、服务器、网络和存储系统建立完整的基础设施处理体系。
CIPU主要负责什么?
CIPU最核心的功能之一是I/O和数据处理加速。
现代云服务器需要处理非常庞大的网络数据流和存储访问。如果这些任务全部经过CPU软件栈处理,就会大量消耗CPU周期,同时增加内存访问和数据搬运开销。
CIPU可以通过专用硬件处理数据路径,把一部分工作从通用CPU中移走。
第二个重要功能是网络加速。
对于云服务器而言,虚拟交换机、VPC、数据包转发和RDMA等网络功能会带来巨大处理压力。通过CIPU或者类似DPU的专用硬件处理这些任务,可以降低主CPU负担,同时提高网络吞吐量、时延稳定性和多租户环境下的性能一致性。
第三个功能是存储加速。
云硬盘实际上通常位于分布式存储系统中,服务器需要不断通过网络访问远端存储资源。CIPU可以参与云存储数据路径处理,让CPU不必直接承担所有存储虚拟化和I/O任务。
第四个功能是虚拟化卸载。
传统虚拟化系统中的Hypervisor、虚拟设备以及虚拟网络会消耗主机CPU资源。把这些功能转移到独立基础设施处理器上,可以让用户获得更加接近物理服务器的CPU性能。
第五个功能是安全隔离。
云计算环境中往往有大量不同客户同时共享同一套基础设施,把云管理和基础设施处理逻辑与用户CPU执行环境进行更彻底的隔离,有助于降低攻击面。阿里云在介绍CIPU时也把多租户环境下的安全作为重要设计目标之一。
CIPU为什么对云计算非常重要?
CPU是一种通用处理器,它非常擅长运行各种复杂程序,但这并不意味着所有任务都应该由CPU完成。
在现代云服务器中,CPU旁边已经出现越来越多的专用处理器:
GPU负责大规模并行计算和AI,AI加速器负责神经网络计算,而DPU、IPU和CIPU则负责数据移动和基础设施处理。
阿里云对CIPU的一个重要描述就是“加速数据”。其技术资料指出,CPU主要负责通用计算,GPU负责加速计算,而CIPU更侧重于数据处理与数据移动效率,目标是减少数据搬运,提高吞吐量并降低平均延迟和长尾延迟。
这反映了现代计算体系结构正在发生的重要变化。
过去服务器基本上可以理解成“CPU + 内存 + 网卡 + 硬盘”。
未来的大型云服务器则越来越像“CPU + GPU/AI加速器 + DPU/CIPU + 高速网络 + 分布式存储”的异构计算系统。
CIPU已经应用到阿里云ECS
CIPU并不是一个只存在于研究项目中的概念,它已经成为阿里云多代ECS云服务器实例的基础架构组成部分。
截至2026年,阿里云最新的多种第九代ECS实例已经明确采用新一代CIPU架构。
例如g9i通用型实例采用CIPU并搭配Intel Xeon 6处理器;c9i计算型实例同样基于CIPU架构;AMD平台上的c9a、c9ae等实例也采用新一代CIPU架构。
阿里云将这些实例的特点概括为更加稳定的计算能力、更强的I/O引擎以及芯片级安全增强。
这说明CIPU已经从早期专用基础设施技术逐渐成为阿里云通用云服务器平台的重要基础。
阿里云的HPC实例、高频计算实例、网络增强实例以及部分GPU和裸金属服务器同样采用CIPU架构。
例如,阿里云HPC优化实例目前已经建立在新一代CIPU体系之上,而部分裸金属GPU服务器则结合CIPU与eRDMA网络,为大规模AI训练提供高带宽互联。
CIPU与AI基础设施
AI的发展正在进一步提升DPU和CIPU的重要性。
大型语言模型训练往往需要数百甚至数万块GPU协同工作。在这种系统中,真正的瓶颈不一定来自GPU本身,而可能来自GPU之间的数据通信、网络、存储以及数据搬运。
因此,大型AI集群越来越依赖RDMA、高速以太网、InfiniBand、SmartNIC、DPU以及其他专用I/O处理器。
阿里云的CIPU同样被用于这一方向。CIPU与高性能网络、云存储以及GPU计算节点结合,可以帮助构建大规模分布式AI计算集群。
阿里云目前部分计算型实例已经把AI训练和AI推理明确列为应用场景,而CIPU架构所提供的I/O和网络能力也越来越重要。
随着AI模型规模持续增加,云计算基础设施的竞争已经不再只是比较“谁有更多GPU”,而是比较整个系统的数据中心架构,包括GPU、CPU、DPU、网络、存储、互连和调度软件能否高效率协同。
在这一趋势下,CIPU的重要性可能会进一步提高。
阿里云与NVIDIA、AMD和Intel DPU路线的区别
NVIDIA的BlueField是一种典型的商业化DPU产品,可以作为独立硬件销售给服务器厂商、云服务商和企业数据中心。
AMD通过Pensando平台发展DPU与基础设施加速芯片。
Intel则使用IPU(Infrastructure Processing Unit)这一名称发展类似产品。
Marvell、Broadcom等芯片企业也提供大量网络、存储和基础设施处理器。
阿里云的模式有所不同。
它首先是一家超大规模云计算运营商,然后根据自身数据中心的实际需求开发CIPU。
因此,阿里云更加重视CIPU与飞天云操作系统、ECS、云网络、云存储以及整个数据中心资源调度体系之间的深度结合。
这种模式与AWS开发Nitro System、微软为Azure开发基础设施加速硬件的思路更加接近。
对于这些大型云服务商来说,DPU类芯片并不一定需要单独成为一个对外销售的产品。
只要它能够降低每台服务器的基础设施开销、提高CPU利用率、降低网络延迟、增强安全隔离,那么部署到数十万甚至数百万台服务器后,就可以产生非常巨大的经济价值。
阿里云在DPU行业中的优势
阿里云最大的优势不是单独某一颗DPU芯片的参数,而是拥有巨大的云计算应用场景。
DPU是一种高度依赖实际数据中心负载的处理器。只有拥有大规模服务器、网络和存储系统,才能持续获得真实工作负载的数据,并针对性能瓶颈不断优化芯片和软件。
阿里云同时拥有云服务器ECS、VPC网络、云存储、数据库、大数据、AI平台和云原生基础设施,因此可以围绕整个云计算技术栈优化CIPU。
第二个优势是软硬件协同。
CIPU可以与阿里云飞天云操作系统、神龙架构、eRDMA、高性能网络、ESSD云盘以及ECS服务器协同工作。
这种从芯片到操作系统再到云服务的垂直整合,是传统独立DPU芯片企业很难复制的能力。
第三个优势是规模。
云服务商的数据中心部署规模决定了即使单台服务器只节省少量CPU资源或者降低少量功耗,累计到整个基础设施后也可能产生巨大的经济效益。
这也是AWS、Google、Microsoft、阿里云等超大规模云服务商纷纷投入DPU/IPU/CIPU的重要原因。
阿里云CIPU面临的挑战
阿里云CIPU同样面临一些限制。
首先,它主要服务于阿里云自己的云计算体系,因此不像NVIDIA BlueField那样拥有广泛的独立硬件市场和开发者生态。
其次,DPU正在逐渐形成包括芯片、操作系统、SDK、网络协议、虚拟化和安全软件在内的完整生态。
NVIDIA、AMD、Intel、Broadcom和Marvell等公司都拥有强大的芯片和软件基础,行业竞争会长期存在。
第三,AI数据中心正在推动网络速度从100G、200G和400G继续向800G乃至更高带宽发展,对DPU、SmartNIC和交换芯片的处理能力提出越来越高的要求。
CIPU需要持续跟上这些变化。
阿里云在DPU产业中的定位
如果只按照“是否销售独立DPU芯片”来分类,阿里云可能并不是一家典型DPU公司。
但如果按照技术功能和数据中心体系结构来看,阿里云无疑是全球DPU类基础设施的重要参与者之一。
它代表的是DPU产业中的另一类企业:超大规模云服务商。
这一类公司的核心目标不是销售DPU,而是利用专用基础设施处理器重新设计整个云数据中心。
AWS有Nitro,Microsoft Azure发展自己的基础设施加速架构,Google也持续推进自研数据中心基础设施处理技术,而阿里云则选择了CIPU。
这种技术路线说明,未来服务器可能越来越不再由CPU独自控制所有资源。
CPU负责通用计算,GPU和AI加速器负责高并行计算,而DPU、IPU和CIPU则负责网络、存储、虚拟化、安全和数据移动。
总结
阿里云是中国云计算产业中最重要的DPU类基础设施技术开发者之一,其核心技术路线不是传统意义上的独立DPU芯片,而是Cloud Infrastructure Processing Unit,也就是CIPU。
CIPU源自阿里云多年发展的神龙架构和云基础设施卸载技术,通过专用硬件处理网络、存储、虚拟化、安全以及数据路径任务,把大量基础设施工作从服务器CPU中分离出来。
从功能上看,CIPU与NVIDIA DPU、AMD Pensando DPU和Intel IPU属于同一大的技术发展方向,但阿里云更加突出其“云基础设施处理器”的定位,并将其与飞天云操作系统、ECS服务器、云网络和云存储深度结合。
截至2026年,CIPU已经被广泛用于阿里云多个新一代ECS实例系列,包括Intel和AMD平台,并继续向HPC、AI、大数据、高性能网络和裸金属计算等场景扩展。
因此,在全球DPU企业版图中,阿里云更适合被归入“超大规模云服务商自研DPU/CIPU”的类别。
它与单纯销售芯片的DPU公司不同,其真正竞争力在于芯片、服务器、网络、存储和云操作系统之间的整体协同。
随着AI数据中心和异构计算继续发展,CPU、GPU与DPU/CIPU之间的分工会越来越明确。
CIPU也可能从今天的云计算基础设施加速器,逐渐成为未来大型AI和云数据中心架构中不可缺少的一类处理器。
