Menu Close

腾讯

DPU企业:腾讯(Tencent)——从水杉、银杉到云计算与AI基础设施卸载

腾讯

腾讯(Tencent)是中国最大的互联网和云计算企业之一,也是中国较早大规模部署自研DPU(Data Processing Unit,数据处理器)的云服务商之一。

云豹智能中科驭数这类主要向外部客户销售DPU芯片和板卡的独立半导体企业不同,腾讯开发DPU的主要目的,是服务腾讯云以及微信、QQ、腾讯会议等自身庞大的互联网业务,通过专用硬件把网络、存储、虚拟化等基础设施工作从服务器CPU中卸载出去,提高云服务器性能并降低数据中心成本。

腾讯公开披露的两代代表性自研DPU分别名为“水杉”和“银杉”。

水杉于2020年在腾讯公有云上线,支持2×50Gbps网络接口;银杉于2021年上线,支持2×100Gbps网络接口,并进一步强化了网络、存储和虚拟化硬件卸载能力。

腾讯随后表示,这两代DPU已经在腾讯云实现大规模部署,并服务公有云客户以及微信、QQ、腾讯会议等内部业务。

因此,如果制作全球或者中国DPU企业目录,腾讯应该被归入“超大规模云服务商自研DPU”这一类别,而不是传统意义上的独立DPU芯片供应商。

腾讯为什么要自己开发DPU?

现代服务器拥有越来越多CPU核心。一台高端服务器可能拥有几十甚至上百个CPU核心,但是这些CPU并不能全部提供给用户应用,因为云计算平台自身也需要消耗大量计算资源。

虚拟交换机、虚拟网络、云硬盘、Hypervisor、QEMU、数据包转发、安全策略以及各种I/O操作都会占用CPU

对于普通企业的一台服务器来说,这些损耗可能并不明显。

但腾讯运营着超大规模数据中心,如果每台服务器都要拿出几个CPU核心处理基础设施任务,累积到数十万甚至更多服务器之后,就会形成巨大的计算资源、功耗和成本损失。

腾讯研发DPU的一个核心目标,就是把这些任务从Host CPU中移走。

CPU主要运行客户程序和业务应用。

DPU则负责网络、存储、虚拟化和数据移动。

这种分工与AWS Nitro、阿里云CIPU、Microsoft Azure的基础设施加速器以及NVIDIA BlueField背后的基本思想是一致的。

第一代DPU:水杉

腾讯第一代公开披露的自研DPU名为“水杉”。

水杉于2020年正式在腾讯公有云上线,支持2×50Gbps网络接口。

腾讯当时开发这代DPU的重要目标之一,是提升云服务器网络和云盘性能,同时减少Host CPU处理这些I/O任务时产生的资源消耗。

从技术发展的角度看,水杉代表腾讯从传统SmartNIC逐渐走向完整DPU的重要阶段。

SmartNIC主要解决数据面加速问题,而DPU进一步把控制、网络、存储和虚拟化基础设施的一部分处理能力转移到网卡侧,使这张“网卡”越来越像服务器内部的一台独立小型计算机。

这种体系结构特别适合大型云服务商,因为DPU不仅可以提高网络性能,更重要的是可以重新划分服务器CPU与云基础设施之间的职责。

第二代DPU:银杉

2021年,腾讯第二代自研DPU“银杉”开始在公有云上线。

银杉将网络接口提高到2×100Gbps,相比水杉进一步提高网络和存储处理能力,并针对服务器内部NUMA、PCIe以及高密度CPU平台进行了更多优化。

腾讯公开资料显示,银杉适配服务器时引入Socket Direct架构,让不同CPU Socket可以通过更直接的PCIe路径访问DPU,从而减少跨NUMA访问产生的时延和性能损失。

这实际上反映出高性能DPU设计中一个经常被忽略的问题:DPU本身快还不够。

CPU、PCIe、NUMA、内存和DPU之间的数据路径必须同时进行优化。

如果数据需要不断跨CPU Socket或者跨NUMA节点传输,即使网卡拥有100Gbps甚至更高带宽,服务器整体性能仍然可能受到限制。

银杉已经成为腾讯云虚拟化基础设施的一部分

银杉并不只是实验性的DPU产品,它后来被应用到腾讯云实际云服务器产品。

例如腾讯云S8和M8实例就公开说明采用腾讯云自研“银杉”DPU虚拟化平台,通过DPU承担虚拟化相关工作,以降低Host CPU承担的虚拟化开销。

这也是腾讯DPU与很多初创企业DPU最大的区别之一。

DPU初创企业通常需要首先找到客户、完成服务器验证,然后才能逐步扩大部署。

腾讯本身就是大型云服务商,因此拥有天然的大规模应用环境。

一旦某一代DPU通过稳定性验证,就可以直接进入腾讯云服务器、内部互联网服务以及大型数据中心基础设施。

把Hypervisor和QEMU I/O移出CPU

腾讯DPU最值得注意的技术方向之一,是把Hypervisor和QEMU的部分I/O处理工作下沉到DPU。

传统虚拟机运行在Host CPU上,Hypervisor需要处理虚拟硬件、网络和存储等大量工作。QEMU同样可能参与虚拟设备模拟以及I/O数据处理。

这些任务都会消耗CPU核心。

腾讯公开资料显示,其自研DPU已经将Hypervisor和QEMU中的部分I/O工作下沉到智能网卡,让更多CPU资源能够留给虚拟机和容器。

与此同时,服务器的网络和存储数据路径也可以直接通过DPU进行处理。

对于云计算来说,这种变化非常关键。

因为云厂商真正能够卖给客户的是CPUGPU、内存和存储资源。

基础设施软件占用的CPU越少,可以真正提供给客户的CPU比例就越高。

网络卸载

网络处理是腾讯DPU最基础的功能之一。

传统云服务器需要通过软件虚拟交换机处理VPC、虚拟机通信、数据包转发和各种虚拟网络功能。

当服务器网络从10Gbps发展到25Gbps、50Gbps、100Gbps甚至更高之后,CPU处理这些数据包的成本越来越高。

DPU可以把大量Fast Path网络处理逻辑转移到硬件。

这意味着网络数据包进入服务器以后,不需要全部经过Host CPU的软件协议栈,而可以直接在DPU完成分类、转发、封装和数据移动。

服务器CPU因此可以更加专注于真正的用户程序。

存储卸载

腾讯DPU另外一个非常重要的用途是云存储。

腾讯云的CBS,也就是Cloud Block Storage云硬盘,本质上属于分布式存储系统。用户虽然看到的是一块“硬盘”,但背后的数据可能通过数据中心高速网络访问远端存储服务器。

这意味着云硬盘性能实际上同时受到网络和存储协议的影响。

腾讯DPU可以把部分存储I/O处理从CPU中卸载,并通过专用硬件优化云盘数据路径。

腾讯还研发了HARP多路径可靠传输协议,针对云盘前端网络的吞吐量、拥塞和可靠性进行优化。腾讯公开的技术方案显示,HARP可以利用数据中心中的多条网络路径进行负载分担,并与交换机配合降低拥塞、网络排队和故障切换带来的影响。

这也是DPU越来越重要的一个原因:

现代数据中心中的“网络”和“存储”已经越来越难完全分开。

Smart Endpoint与Smart DMA

腾讯在DPU技术中还发展了Smart Endpoint和Smart DMA等基础设施技术。

Smart Endpoint主要面向控制和设备虚拟化,使DPU能够更灵活地向服务器和虚拟机呈现不同的PCIe设备。

Smart DMA则更加偏向数据路径,负责Host、DPU以及其他设备之间的数据移动。

腾讯把控制面的Smart Endpoint和数据面的Smart DMA视为下一代可编程云I/O体系的重要基础,通过它们支持不同虚拟机设备、网络和存储资源的混合部署与迁移。

从体系结构角度看,这种能力已经远远超过传统网卡。

传统网卡的主要任务是“收包和发包”。

DPU则开始参与服务器内部资源组织。

支持多种CPU平台

大型云数据中心不可能只使用一种CPU

腾讯的星星海服务器体系同时涉及IntelAMD以及Arm等不同CPU平台,因此DPU必须能够在不同服务器架构之间运行。

腾讯公开资料显示,水杉和银杉已经针对多种Intel Xeon、AMD EPYC以及Ampere Arm服务器平台进行适配,并建立PCIe兼容性和BIOS扫描等测试体系。

这一点对于DPU商业化非常重要。

实验室中做出一块能够运行的DPU并不难。

真正困难的是让它能够稳定运行在数十种服务器主板、BIOS、CPU操作系统和云计算环境中。

对于超大规模云服务商来说,“能够运营”往往和芯片性能本身一样重要。

DPU热升级

普通服务器网卡出现问题时,可以通过重启服务器或者更换设备解决。

但是对于公有云来说,大量服务器上运行着客户虚拟机,不能因为升级DPU固件就随意重启整台服务器。

因此腾讯为自研DPU开发了软硬件分层热升级机制。

公开资料显示,腾讯DPU可以分别升级SoC软件、硬件Framework以及业务加速引擎,并尽可能让Host和客户虚拟机保持无感知或者轻感知。

这看似只是一个运维功能,其实非常重要。

DPU真正进入大型云数据中心之后,规模可能达到数万甚至更多。如果每次升级都需要人工停机,整个体系就无法有效运营。

所以DPU竞争不仅是芯片性能竞争,也是可靠性和数据中心运营能力的竞争。

自动化DPU运维

腾讯还围绕DPU建立了大量自动化运维工具。

这些工具可以监控DPU内部状态、高速接口和各种配置表项,并进行数据包Capture、Pipeline状态分析、网络连通性测试和端到端时延追踪。

腾讯公开介绍的工具包括Ping Trace、Fltrace以及VPC网络诊断工具vTrace等,用于定位复杂的大规模云网络问题。

这一点再次体现出云厂商DPU与普通商业DPU的区别。

对于腾讯来说,DPU不是单独卖出去的一张PCIe卡。

它必须成为整个腾讯云运营体系的一部分。

腾讯DPU与裸金属服务器

裸金属云服务器也是DPU非常适合的应用场景。

传统虚拟机使用Hypervisor隔离不同用户,但有些客户希望直接获得完整物理服务器性能。

问题在于,如果完全把服务器交给用户,云服务商就很难继续管理它的网络、存储和生命周期。

DPU解决了这个矛盾。

DPU可以独立管理网络、云盘和云基础设施,而Host CPU和服务器内存则可以最大限度交给客户使用。

腾讯研发水杉和银杉的重要目标之一,就是建立CVM虚拟机和Bare Metal裸金属服务器更加统一的基础设施底座。

这与AWS Nitro和阿里云神龙/CIPU背后的技术逻辑非常相似。

腾讯DPU与AI数据中心

DPU最初主要解决云计算网络、存储和虚拟化问题,但是AI正在改变数据中心网络。

过去,一台服务器最重要的芯片CPU

现在的大型AI服务器可能拥有8块甚至更多GPU,而成千上万块GPU必须通过高速网络互联。

GPU越来越快以后,网络本身可能成为新的瓶颈。

腾讯目前已经建设智能高性能网络IHN,作为其大型AI模型基础设施的一部分。腾讯云最新公开资料显示,IHN能够为单个计算节点提供1.6Tbps或者3.2Tbps通信带宽,并为每块GPU提供400Gbps级网络接入,同时结合腾讯自研网络设备、TCCL通信库和全局拥塞调度实现端网协同。

需要说明的是,腾讯目前公开的IHN资料并没有简单把这些AI网络能力全部归因于水杉或银杉DPU,因此不能直接把IHN等同于腾讯DPU。

但从整个技术趋势来看,DPU、SuperNIC、高速以太网、GPU Direct、RDMA和AI通信正在越来越紧密地结合。

这也是未来腾讯DPU体系值得继续关注的方向。

为什么AI时代DPU更加重要?

大型语言模型训练的一个核心问题是通信。

一块GPU计算完成以后,往往需要把结果发送给其他GPU

如果拥有一万块GPU,每块GPU都需要不断交换大量参数和梯度,那么数据中心内部会产生极其庞大的网络流量。

这个时候,CPU如果还要负责大量网络协议和数据搬运,就会成为系统瓶颈。

未来服务器的分工可能越来越清晰:

CPU负责通用计算。

GPU负责AI和大规模并行计算。

DPU或SuperNIC负责高速数据移动、RDMA、网络、安全和基础设施处理。

交换芯片负责把大量服务器连接起来。

因此,在AI时代,DPU并不会因为GPU越来越强而失去价值,反而可能变得更加重要。

腾讯与NVIDIA BlueField有什么区别?

NVIDIA BlueField是一种标准商业DPU。

NVIDIA设计BlueField芯片,然后向服务器厂商、云服务商和企业客户销售,并通过DOCA软件平台建立开发者生态。

腾讯走的是另一种路线。

腾讯首先是一家大型互联网和云计算企业,然后根据自己数据中心的实际需求研发DPU。

水杉和银杉最主要的市场,就是腾讯自己的服务器和腾讯云。

因此,腾讯并不需要依靠销售DPU芯片赚钱。

只要DPU能够让每台服务器节省几个CPU核心、提高云盘性能、降低网络延迟、减少功耗或者提高服务器利用率,在巨大的数据中心规模下就可能创造非常可观的经济价值。

从这个角度看,腾讯DPU更应该与AWS Nitro和阿里云CIPU比较,而不是直接与一家普通DPU芯片创业公司比较。

腾讯与阿里云CIPU的区别

腾讯和阿里云的DPU技术路线有很多相似之处。

两家公司都是大型云服务商。

两家公司开发这类处理器的主要目的都是把网络、存储和虚拟化从CPU卸载出去。

两家公司都将相关硬件深度整合到自己的云服务器基础设施。

区别主要在品牌和体系结构表达方式。

腾讯直接使用DPU和智能网卡的概念,并公开了水杉、银杉两个产品名称。

阿里云则把自己的产品定义为CIPU,也就是Cloud Infrastructure Processing Unit,更加强调整个云数据中心资源管理和飞天云操作系统之间的关系。

但从整个行业分类来看,两者都属于Hyperscaler自研基础设施处理器路线。

腾讯与云豹智能、中科驭数的区别

云豹智能中科驭数主要是独立DPU企业。

它们需要设计芯片、板卡和软件,然后销售给其他服务器企业、云厂商、电信运营商和数据中心。

腾讯的商业逻辑完全不同。

腾讯本身就是最终用户。

所以评价腾讯DPU时,不能只看“芯片卖了多少颗”。

更加重要的是:

部署了多少腾讯云服务器。

节省了多少CPU资源。

提高了多少网络和云盘性能。

能否稳定运行多年。

能否支持海量在线升级。

能否与腾讯自己的云操作系统、网络、存储和服务器协同。

这也是Hyperscaler自研芯片最特殊的地方。

水杉和银杉之后还有没有新DPU?

截至2026年9月,在目前能够公开核实的腾讯资料中,“水杉”和“银杉”仍然是腾讯最明确公开命名的两代自研DPU。

腾讯早在2022年就已经披露下一代DPU将继续向更加灵活的软件定义可编程架构、RDMA、NVMe、Smart Endpoint和Smart DMA方向发展。

但是目前公开资料并没有清晰披露一个可以确认的“第三代腾讯DPU”正式产品名称和完整芯片参数,因此不能简单把后续技术规划写成已经正式量产的新一代产品。

对于企业目录来说,这一点应该明确区分。

可以确认的是,腾讯的数据中心网络已经继续向更高带宽演进,当前AI基础设施已经达到单GPU 400Gbps接入、单计算节点1.6Tbps或3.2Tbps通信能力。

但最新AI网络平台与水杉、银杉或者后续未公开DPU之间具体采用什么芯片组合,目前腾讯并没有完全公开。

腾讯DPU的优势

腾讯DPU最大的优势首先是规模。

腾讯拥有腾讯云,同时还拥有微信、QQ、腾讯会议、游戏、视频、广告、金融科技以及大量互联网服务,这些业务每天产生极其庞大的网络和存储流量。

第二个优势是软硬件协同。

腾讯可以同时控制服务器、DPU、交换机、云网络、云存储、Hypervisor和云操作系统,因此能够针对真实业务进行端到端优化。

第三个优势是运营能力。

水杉和银杉已经经历真实公有云环境的大规模部署。对于DPU来说,这种运营经验非常宝贵。

第四个优势是DPU可以直接进入腾讯自己的数据中心,不需要像初创企业一样首先寻找大客户。

第五个优势是腾讯正在大规模建设AI基础设施,未来DPU、高性能网卡、RDMA和AI网络可能拥有越来越大的内部应用空间。

腾讯DPU面临的挑战

腾讯最大的挑战之一,是AI网络带宽增长速度非常快。

水杉的2×50G和银杉的2×100G在传统云服务器时代属于很高的网络带宽,但今天高端AI服务器已经开始使用400G、800G甚至更高速网络。

因此,DPU必须继续快速升级。

第二个挑战是可编程能力。

传统云DPU可以针对固定的网络和存储功能开发专用硬件,但未来客户可能要求防火墙、NFV、安全、存储、AI通信甚至网络内计算等更加复杂的功能。

DPU需要同时保持ASIC级性能和软件级灵活性,这是非常困难的芯片设计问题。

第三个挑战是生态。

NVIDIA拥有GPU、BlueField、Spectrum、InfiniBand、CUDA和DOCA完整生态。

腾讯虽然拥有巨大的云计算环境,但其DPU目前主要服务内部基础设施,外部开发者生态明显不同于NVIDIA

腾讯在DPU产业中的定位

从全球DPU产业来看,腾讯属于非常典型的一类企业:

Hyperscaler,也就是超大规模云服务商自研DPU。

这一类企业包括AWS、MicrosoftGoogle阿里云、腾讯云以及其他大型云计算公司。

它们开发DPU的目的通常不是成为一家DPU芯片销售公司,而是重新设计自己的数据中心。

过去的数据中心是:

CPU + 内存 + 网卡 + 存储。

今天正在逐渐变成:

CPU + GPU/AI加速器 + DPU/SmartNIC + 高速网络 + 分布式存储。

DPU开始成为连接CPUGPU、网络和存储的重要基础设施处理器。

总结

腾讯是中国较早进行大规模DPU研发和部署的云计算企业之一,其公开的代表性自研DPU包括“水杉”和“银杉”。

水杉于2020年在腾讯公有云上线,支持2×50Gbps网络接口;银杉于2021年上线,支持2×100Gbps网络接口,并进一步引入Socket Direct等技术优化服务器内部CPU、PCIe和DPU之间的数据路径。

两代产品随后进入腾讯云以及微信、QQ、腾讯会议等腾讯内部业务的大规模基础设施。

腾讯DPU已经能够把部分Hypervisor、QEMU、网络和存储I/O处理从Host CPU下沉到智能网卡,并支持硬件加速、在线热升级、自动化运维以及多CPU架构适配。

云豹智能中科驭数不同,腾讯并不是一家主要向市场销售DPU芯片的企业,而是利用DPU重构自身云基础设施的超大规模云服务商。

这也是腾讯DPU真正值得关注的地方。

腾讯并不是想多卖一颗芯片

它真正希望做到的是,让数据中心里的CPU少处理一些网络、存储和虚拟化工作,把更多计算能力留给真正的应用。

随着AI数据中心继续发展,这种分工会越来越明显。

CPU负责通用计算,GPU负责AI计算,而DPU负责让数据在服务器、网络和存储之间高速、高效、可靠地流动。

从这个角度看,DPU并不是一张更高级的网卡。

它正在逐渐成为现代云数据中心中的第三类核心处理器。

Entires个相关