DPU企业:天翼云(CTyun)——以紫金DPU构建新一代云计算基础设施
天翼云(CTyun)是中国电信旗下的云计算品牌,也是中国大型云服务商中较早投入自研DPU(Data Processing Unit,数据处理器)的企业之一。
天翼云的核心DPU技术品牌是“紫金DPU”,并围绕紫金DPU进一步建立了“紫金架构”。
通过专用硬件将服务器中的网络、存储、虚拟化以及部分安全和数据处理任务从CPU中卸载出来,从而提高云服务器算力利用率、降低网络时延,并支持弹性裸金属、云主机、容器和AI智算等多种计算形态。
与云豹智能、中科驭数这类独立DPU芯片设计企业不同,天翼云开发DPU的主要目的并不是向全球服务器市场单独出售一颗DPU芯片,而是利用DPU重构中国电信和天翼云自己的云计算基础设施。
因此,从产业分类上看,天翼云与阿里云CIPU、腾讯自研DPU、百度太行DPU以及AWS Nitro更加接近,都属于超大规模云服务商自研基础设施处理器的技术路线。
天翼云是什么公司?
天翼云最早源自中国电信2012年成立的云计算分公司,2021年完成公司化改革,成立天翼云科技有限公司。
天翼云主要向政府、企业和互联网客户提供公有云、私有云、专属云、混合云、边缘云、云存储、网络、数据库、大数据、人工智能、安全以及算力调度等服务。
中国电信将天翼云定位为其“云改数转”战略的重要技术底座。
对于中国电信这样的电信运营商来说,云计算和普通互联网公司的云业务还有一个明显不同点:
中国电信同时拥有庞大的网络基础设施、数据中心、边缘节点、运营商网络和企业客户。
因此DPU不仅可以用于公有云服务器,还可以进入云网融合、边缘计算、5G、AI数据中心以及运营商基础设施。
这使紫金DPU拥有非常广泛的潜在应用场景。
为什么天翼云要自己开发DPU?
传统服务器基本以CPU为中心。
网络数据进入服务器以后,CPU需要参与虚拟交换、TCP/IP协议、虚拟机I/O、云盘访问、安全规则以及各种网络和存储处理。
随着服务器网络速度从10Gbps逐渐提升到25G、50G、100G、200G乃至400G,这些基础设施任务开始占用越来越多CPU资源。
对于普通企业的一台服务器来说,几个CPU核心被系统软件占用可能问题不大。
但是对于拥有大量数据中心的云服务商来说,这意味着巨大的资源浪费。
假设每台服务器因为网络、存储和虚拟化需要消耗几个CPU核心,当服务器数量达到几十万甚至更多以后,最终损失的CPU算力会非常可观。
DPU就是为了解决这个问题。
CPU负责真正的应用计算。
DPU则负责网络、存储、虚拟化、安全以及数据移动。
天翼云开发紫金DPU,本质上就是希望把这些“基础设施工作”从主CPU中移走。
紫金DPU
天翼云正式对外发布的自研DPU品牌名为“紫金DPU”。
中国电信在2022年底举行的天翼数字科技生态大会上正式发布天翼云紫金DPU。
并表示基于紫金DPU开发的新一代云计算架构能够对计算、网络和存储资源进行云化加速,同时实现虚拟化全卸载、多种业务硬件加速以及自研高性能网络协议三项核心技术突破。
这里所谓“全卸载”,是理解紫金DPU最关键的概念之一。
传统云服务器中,Hypervisor、虚拟网卡、虚拟存储以及部分云平台软件运行在Host CPU上。
紫金DPU则尝试把这些任务迁移到独立硬件。
这样服务器CPU就能够更加完整地提供给客户使用。
紫金架构
天翼云并没有把紫金DPU仅仅看作一张网卡。
围绕紫金DPU,天翼云建立了完整的“紫金架构”。
紫金架构把DPU、定制服务器、自研云服务器操作系统CTyunOS以及云操作系统等技术结合起来,形成软硬件协同的数据中心基础设施。
中国电信公开资料将紫金架构描述为下一代云计算算力基础底座,可以快速适配不同CPU架构,并服务核心数据库和智算等场景。
因此,紫金DPU真正的竞争对象并不是普通网卡。
它更像是服务器内部新增的一个“基础设施控制平面”。
CPU负责客户程序,而DPU负责管理和加速服务器与云平台之间的关系。
虚拟化全卸载
紫金DPU最重要的功能之一,就是虚拟化全卸载。
传统云服务器需要运行Hypervisor以及各种虚拟设备。
这些软件会消耗Host CPU资源。
天翼云通过紫金DPU,将原本运行在服务器CPU上的部分虚拟化组件迁移到DPU,目标是让服务器实现接近“虚拟化零损耗”的计算能力。
中国电信在发布紫金DPU时表示,这种架构可以提高弹性云主机资源利用率,同时支持弹性裸金属服务。
对于云服务商来说,这一点非常重要。
CPU核心就是可以销售的计算资源。
云平台自身占用得越少,真正提供给用户的算力就越多。
网络硬件加速
网络是DPU最基本的工作之一。
现代云服务器需要处理VPC、虚拟交换、Overlay网络、流表、路由、安全策略以及大量数据包转发。
如果所有数据包都经过Host CPU的软件网络栈,就会产生非常大的CPU开销。
紫金DPU通过硬件方式处理其中大量网络任务。
天翼云披露,在早期紫金DPU架构中,相比传统CPU软件处理方式,网络PPS能力可以实现明显提升,同时网络时延显著下降。
这也是DPU最直接的性能优势之一。
网络数据不需要全部绕过CPU软件栈,而可以直接通过专用硬件处理。
存储硬件加速
DPU的第二个重要任务是存储。
现代云硬盘很多时候并不真正位于当前服务器内部。
数据可能保存在远端分布式存储集群中,服务器需要通过高速网络进行访问。
这意味着所谓“存储I/O”实际上同时也是“网络I/O”。
如果CPU需要不断处理远程存储协议,就会占用大量CPU资源。
紫金DPU将NVMe-oF等存储功能部分硬件化,让远程存储数据能够通过DPU高速处理。
天翼云早期公布的紫金架构数据显示,相比传统软件架构,存储IOPS性能获得明显提升。
这对于数据库和云硬盘业务尤其重要。
NVMe over Fabrics
NVMe over Fabrics,也就是NVMe-oF,是现代DPU非常重要的一项技术。
NVMe最初主要用于PCIe SSD。
NVMe-oF则可以把NVMe协议扩展到高速网络,使服务器通过网络访问远端NVMe存储设备。
对于云服务商来说,这样就可以把存储从服务器中抽离出来,形成集中式或者分布式存储池。
服务器只负责计算。
存储则可以独立扩展。
紫金DPU可以参与NVMe-oF数据路径处理,让CPU不必承担大量远程存储协议任务。
天翼云在紫金DPU公开资料中明确提到对NVMe-oF数据路径进行硬件化。
EC纠删码硬件加速
天翼云还将EC,也就是Erasure Coding纠删码,作为紫金DPU的硬件加速任务之一。
分布式存储系统为了保证数据可靠性,通常需要保存多个数据副本,或者使用纠删码。
纠删码可以在较低存储开销下提供较高数据可靠性,但是编码和恢复过程需要大量计算。
如果这些任务全部交给CPU,就会占用服务器计算资源。
DPU可以通过专用硬件处理部分EC任务。
因此,紫金DPU不仅仅承担“网络转发”。
它逐渐成为网络、存储和数据处理综合加速器。
高性能网络协议
紫金DPU另外一个重要特色,是天翼云自研高性能网络协议。
普通TCP网络虽然兼容性很好,但在大型分布式计算和AI训练中,对超低延迟和高吞吐量的要求越来越高。
天翼云围绕紫金DPU研发高性能网络数据面和拥塞控制技术,通过端网协同方式控制网络流量。
其目标是减少交换机队列堆积、降低长尾延迟,并提升大规模集群中的通信效率。
这与当前AI数据中心大量使用RDMA和RoCE的趋势基本一致。
紫金DPU与RDMA
随着AI和高性能计算发展,DPU和RDMA之间的关系越来越紧密。
RDMA允许服务器在不同机器的内存之间直接传输数据,减少CPU参与和多次内存复制。
如果训练一个大型语言模型,数千块GPU需要频繁同步参数。
这时,CPU如果参与每一次数据传输,很容易成为瓶颈。
因此,现代AI数据中心往往采用:
GPU + RDMA网卡/DPU + 高速交换机。
天翼云目前已经建设400G接入的RoCE RDMA网络,并使用自研拥塞控制算法优化大型集群通信。
需要注意的是,400G是天翼云整体高性能网络体系中的接入能力,并不能简单理解为“每一颗紫金DPU都是400G”。
但这说明紫金DPU已经进入越来越高速的云计算和智算网络环境。
三栈合一
天翼云在介绍紫金DPU时,还强调“自研三栈合一高性能网络协议”。
其核心思想是减少不同类型网络之间的软件层级和数据复制,将云网络、存储网络以及高性能计算网络更加紧密地整合到统一基础设施中。
传统数据中心往往需要多套网络。
一套用于普通TCP/IP。
一套用于存储。
另一套用于高性能计算或者RDMA。
这种模式会增加设备数量、布线复杂度和运维成本。
DPU则提供了一个机会:
通过同一张高性能硬件平台处理多种数据流。
这也是未来数据中心“网络融合”的重要方向。
一云多芯
紫金DPU另外一个非常重要的能力是“一云多芯”。
今天的数据中心已经不再只有Intel x86服务器。
云服务商可能同时拥有Intel、AMD、Arm、海光、鲲鹏以及其他国产CPU。
如果每一种CPU都需要重新开发完整的虚拟化和I/O体系,云平台复杂度会非常高。
紫金DPU将Host CPU环境和虚拟化环境进行更加彻底的隔离。
从云平台角度看,不管下面是一颗什么CPU,都可以通过DPU提供相对统一的网络、存储和虚拟化接口。
天翼云将这种能力描述为不同CPU平台可以“即插即用”。
这对于国产服务器尤其重要。
紫金DPU与弹性裸金属
弹性裸金属是紫金DPU非常重要的商业应用。
裸金属服务器让客户直接使用物理CPU和内存,不需要传统虚拟机Hypervisor,因此可以获得接近原生服务器的性能。
但是传统裸金属存在一个问题:
不好管理。
如果没有虚拟化层,云平台很难像管理普通云服务器一样管理网络、云盘和实例生命周期。
DPU解决了这个问题。
DPU负责云网络、云存储和管理功能,而主服务器CPU完全交给客户。
中国电信披露,紫金DPU与定制服务器结合推出的弹性裸金属已经实现规模化落地。
数据库应用
核心数据库是天翼云较早公开披露的紫金DPU落地场景之一。
数据库非常依赖网络延迟和存储IOPS。
尤其是分布式数据库,一个事务可能需要在多个服务器之间交换数据。
任何网络或存储延迟都会直接影响数据库性能。
天翼云披露,在同等配置下,基于紫金DPU的弹性裸金属用于核心数据库场景时,相比传统裸金属方案可以获得约30%的整体性能提升。
这说明DPU的价值并不仅仅体现在理论网络指标上。
它可以直接影响数据库应用性能。
云主机应用
紫金DPU也已经进入天翼云普通云服务器。
天翼云围绕紫金架构推出了新一代云主机和智能网卡产品,通过DPU减少Host CPU承担的基础设施任务。
中国电信此前披露,紫金架构已经用于第八代云主机等计算产品。
截至2026年,天翼云仍然持续在新一代ECS云主机中使用自研智能网卡。
例如2026年推出的海光3系列增强型云主机明确搭载天翼云自研紫金智能网卡,可提供3200万级收发包能力。
这说明紫金DPU相关技术已经从早期发布阶段进入持续产品化应用。
DPU与智能网卡
在天翼云的产品体系中,“紫金DPU”和“紫金智能网卡”两个名称都会出现。
这并不矛盾。
DPU首先是一颗数据处理器。
当DPU芯片被做成服务器PCIe板卡以后,最终产品通常就是DPU卡或者智能网卡。
因此,“DPU”更强调处理器和体系结构。
“智能网卡”更强调服务器中的具体硬件产品形态。
类似情况在其他厂商也很常见。
NVIDIA BlueField既被称为DPU,也可以被理解成高端SmartNIC。
DPU 2.0
紫金DPU并没有停留在第一代产品。
中国电信在2023年度相关公开资料中披露,紫金DPU 2.0已经完成网络、存储和虚拟化软硬一体技术研发并上线。
这说明天翼云很快把DPU从第一代硬件卸载架构继续向更加完整的数据中心基础设施平台发展。
网络、存储和虚拟化同时软硬协同,才是真正意义上的全功能DPU。
如果DPU只做网络包转发,那么它与普通SmartNIC的差距并不大。
当它同时承担网络、存储、虚拟化和基础设施控制后,DPU才真正开始改变服务器架构。
紫金DPU 4.0
更值得关注的是,紫金DPU还在持续迭代。
中国电信后来公开披露,自研紫金DPU 4.0已经在网络存储加速、虚拟化卸载等领域取得进一步进展,并已经在国产化万卡集群中实现规模化应用。
这说明紫金DPU的发展已经明显超过最初面向普通云服务器的网络和存储卸载。
它开始进入大型AI基础设施。
对于今天的DPU产业来说,这是非常重要的变化。
因为AI正在成为DPU下一轮增长的核心动力之一。
为什么AI需要DPU?
训练过程中,它们需要不断交换模型参数、梯度和中间结果。
一块GPU可能计算非常快,但如果网络数据送不过来,GPU就只能等待。
因此,大型AI集群真正的性能越来越取决于:
GPU性能。
DPU或高性能网卡性能。
交换机性能。
RDMA效率。
通信库。
拥塞控制。
数据中心网络拓扑。
这些部分必须协同工作。
紫金DPU与国产万卡集群
天翼云紫金DPU 4.0已经被中国电信明确披露用于国产化万卡集群。
这里的“万卡”通常指拥有上万块AI加速器的大型智算集群。
这种系统对于网络基础设施要求极高。
假设每一块AI加速器都拥有数百Gbps通信能力,那么整个集群内部产生的数据流量会达到非常惊人的规模。
DPU需要承担数据搬运、网络协议、存储访问、虚拟化以及部分基础设施控制。
因此,AI时代实际上让DPU的重要性进一步提高。
紫金DPU与中国电信AIDC
中国电信正在建设大量AIDC,也就是AI Data Center,人工智能数据中心。
天翼云公开的新一代AIDC方案已经将紫金DPU、紫金山JDM服务器、白盒交换机以及CTyunOS等基础设施结合起来。
该方案同时支持国产NPU万卡高速互联,说明紫金DPU已经成为中国电信智算基础设施软硬件协同体系的一部分。
这也是天翼云与一些普通DPU芯片初创企业最明显的区别。
天翼云不仅拥有DPU。
它还拥有服务器、交换机、云操作系统、运营商网络和数据中心。
所以它可以从整个数据中心角度设计DPU。
紫金DPU与CTyunOS
CTyunOS是天翼云自研服务器操作系统。
紫金DPU与CTyunOS之间的协同非常重要。
DPU如果只提供硬件,却没有操作系统驱动、管理软件和虚拟化平台支持,就很难发挥真正价值。
因此,现代DPU竞争往往不是“哪颗芯片参数更高”。
而是整个软件生态竞争。
NVIDIA有BlueField和DOCA。
AWS有Nitro和自己的云平台。
天翼云则把紫金DPU与CTyunOS和TeleCloudOS结合。
中国电信公开资料将这种软硬件融合称为紫金架构的重要组成部分。
紫金DPU与TeleCloudOS
TeleCloudOS是天翼云的分布式云操作系统。
它负责管理大规模计算、存储和网络资源。
DPU负责每一台服务器内部网络、存储和虚拟化处理。
TeleCloudOS则从更高层进行整个资源池的调度和管理。
因此,两者形成一种上下关系:
DPU负责服务器级基础设施处理。
云操作系统负责数据中心级资源管理。
这与未来云计算体系结构的发展趋势非常一致。
自动化运维
DPU真正大规模部署以后,会产生一个新的问题:
怎样管理成千上万张DPU?
普通网卡可能只需要驱动和固件升级。
DPU内部则可能运行独立操作系统、网络软件、存储软件和各种硬件加速模块。
因此,DPU本身越来越像一台小型服务器。
天翼云已经为紫金DPU建立统一管控和自动化运维能力,可以在不同硬件平台之间进行统一管理和迁移,并提供故障定位和恢复工具。
这类能力不会出现在普通芯片规格表里,但对于真正大规模云计算部署非常重要。
安全隔离
DPU还有一个经常被忽视的价值:
安全。
传统云服务器中,云平台和客户虚拟机共享同一套Host CPU。
即使通过Hypervisor进行隔离,基础设施软件仍然运行在主CPU环境中。
DPU可以把云平台控制、网络和存储环境迁移到独立处理器。
客户运行的CPU环境与云服务商基础设施环境因此可以进行更加彻底的物理隔离。
紫金DPU公开资料也将安全隔离列为其重要能力之一。
这对于政务云、金融云和运营商云尤其重要。
为什么“一云多芯”对天翼云特别重要?
对于国外云服务商来说,目前x86和Arm仍然是主要服务器CPU。
但中国云计算市场还有一个更加特殊的问题:
国产CPU种类非常多。
海光、鲲鹏、飞腾、龙芯以及其他平台都可能进入不同客户的数据中心。
如果每种CPU都重新设计虚拟化和网络基础设施,开发和维护成本非常高。
DPU正好可以提供一个统一基础设施层。
无论Host CPU采用什么架构,网络和存储都可以通过紫金DPU进行统一处理。
因此,紫金DPU对于中国“多CPU架构并存”的市场环境尤其有价值。
天翼云与NVIDIA BlueField有什么不同?
NVIDIA BlueField是一种标准商业DPU产品。
NVIDIA设计芯片、板卡和DOCA软件平台,然后销售给全球服务器厂商、云服务商和企业数据中心。
天翼云紫金DPU的商业模式完全不同。
天翼云本身就是大型云计算运营商。
因此,紫金DPU首先服务天翼云自己的服务器和数据中心。
它不一定需要依靠单独销售DPU芯片获利。
只要DPU能够提高CPU利用率、降低网络时延、提升存储性能并减少服务器数量,就已经能够为天翼云创造商业价值。
所以紫金DPU更应该与AWS Nitro、阿里云CIPU、腾讯自研DPU和百度太行DPU进行比较。
天翼云与阿里云CIPU
天翼云紫金DPU和阿里云CIPU有很多共同点。
两家公司都是大型云服务商。
两家公司都希望通过专用处理器卸载网络、存储和虚拟化任务。
两家公司都支持多种CPU架构。
两家公司都利用这种架构发展弹性裸金属服务器。
区别主要在技术品牌和具体实现。
阿里云强调CIPU是云基础设施处理中心。
天翼云则直接采用DPU名称,并将其与紫金架构、CTyunOS和TeleCloudOS结合。
从行业分类来看,两者属于同一种Hyperscaler DPU路线。
天翼云与腾讯DPU
腾讯公开过水杉和银杉两代自研DPU。
腾讯重点强调VPC、云盘、Hypervisor以及腾讯内部业务基础设施。
天翼云则围绕紫金DPU进一步强调云网融合、一云多芯、国产化以及运营商级基础设施。
两家公司共同说明,中国大型云服务商已经越来越认可一个趋势:
CPU不应该继续承担所有数据中心任务。
服务器需要独立的基础设施处理器。
天翼云与百度太行DPU
百度太行DPU同样承担网络、存储、虚拟化和RDMA处理。
百度更加突出与百度智能云、百舸AI平台以及昆仑芯之间的协同。
天翼云则更加突出中国电信的云网资源、全国数据中心布局、运营商网络和异构国产算力。
所以虽然两者都是DPU,但实际应用环境有所不同。
天翼云则同时覆盖政企云、运营商云、智算中心和云网融合场景。
天翼云DPU的优势
天翼云最大的优势首先是中国电信拥有庞大的数据中心和网络基础设施。
DPU不仅可以部署在公有云服务器中,还可以进入边缘云、电信网络、政企云和AI数据中心。
第二个优势是软硬件协同。
紫金DPU可以与CTyunOS、TeleCloudOS、定制服务器和自研交换机结合。
第三个优势是“一云多芯”。
这让紫金DPU非常适合中国多种国产CPU同时发展的产业环境。
第四个优势是已经实现真实规模化部署。
中国电信已经披露紫金DPU用于弹性裸金属、云主机、容器、数据库以及国产万卡AI集群。
第五个优势是运营商网络资源。
中国电信拥有大规模骨干网络、城域网、IDC和边缘节点,这种网络资源是普通DPU芯片公司无法复制的。
天翼云DPU面临的挑战
紫金DPU同样面临非常激烈的技术竞争。
首先,AI数据中心网络正在从100G和200G快速向400G、800G以及更高速率发展。
DPU必须持续升级SerDes、RDMA、拥塞控制和数据处理能力。
第二,DPU越来越依赖软件生态。
硬件性能再强,如果驱动、云平台、Kubernetes、虚拟化和开发工具不完善,部署规模仍然会受到限制。
第三,国际厂商仍然拥有强大的技术优势。
NVIDIA BlueField、AMD Pensando、Marvell等公司都在持续发展下一代DPU。
第四,国产DPU市场内部竞争也越来越激烈。
云豹智能、中科驭数以及其他国内企业都在推进高性能DPU和AI网络产品。
天翼云在DPU行业中的定位
如果按照DPU产业角色分类,天翼云应该属于:
超大规模云服务商自研DPU。
这一类别包括AWS、Microsoft、Google、阿里云、腾讯、百度以及天翼云。
与独立DPU芯片厂商相比,这类企业有一个非常重要的优势:
它们自己就是最大的客户。
DPU不需要首先找到外部市场。
只要能够在自己的数据中心提高效率,就可以获得大规模部署机会。
而天翼云又拥有中国电信全国性的云网基础设施,因此其DPU应用范围甚至可能比普通互联网云厂商更加广泛。
紫金DPU真正改变了什么?
从传统服务器角度来看,一台服务器主要是:
CPU + 内存 + 网卡 + SSD。
DPU出现以后,架构开始变化。
未来服务器越来越可能变成:
CPU + GPU/NPU + DPU + 高速网络 + 分布式存储。
CPU负责应用。
DPU负责网络、存储、虚拟化、安全和数据移动。
这种改变意味着服务器正在从“CPU中心架构”向“异构计算架构”转型。
紫金DPU实际上就是天翼云对这种新服务器体系结构的一次实践。
总结
天翼云是中国较早自主研发并规模部署DPU的大型云服务商之一,其核心DPU技术品牌是“紫金DPU”。
天翼云于2022年底正式发布紫金DPU,并围绕DPU建立紫金架构,通过虚拟化全卸载、多种业务硬件加速以及自研高性能网络协议,将传统服务器CPU承担的网络、存储和虚拟化任务迁移到专用处理器。
紫金DPU已经被应用于弹性云主机、弹性裸金属、容器和核心数据库等场景,并与CTyunOS、TeleCloudOS、紫金系列定制服务器和自研网络设备共同构成天翼云的新一代云计算基础设施。
此后紫金DPU持续迭代。
中国电信公开资料显示,紫金DPU 2.0已经完成网络、存储和虚拟化软硬一体研发并上线。
而更新的紫金DPU 4.0已经进入国产化万卡集群规模应用,用于网络存储加速和虚拟化卸载。
截至2026年,天翼云仍在新一代云主机中使用自研紫金智能网卡,同时继续建设400G级RoCE网络和大规模国产AI集群。
因此,在全球DPU产业版图中,天翼云不应该被看作一家普通网卡企业。
它代表的是另外一条非常重要的DPU路线:
大型云服务商通过自研DPU重新设计整个数据中心。
天翼云真正希望解决的,并不是怎样多卖一颗DPU芯片,而是怎样让CPU、GPU、NPU、内存、网络和存储组成一个更加高效的整体。
CPU负责计算,GPU和NPU负责AI,而DPU负责让数据在这些计算资源之间高速流动。
随着云计算和AI数据中心继续发展,紫金DPU很可能会继续成为天翼云算力基础设施中的核心硬件之一。
