DPU企业:腾讯(Tencent)——从水杉、银杉到云计算与AI基础设施卸载
腾讯(Tencent)是中国最大的互联网和云计算企业之一,也是中国较早大规模部署自研DPU(Data Processing Unit,数据处理器)的云服务商之一。
与云豹智能、中科驭数这类主要向外部客户销售DPU芯片和板卡的独立半导体企业不同,腾讯开发DPU的主要目的,是服务腾讯云以及微信、QQ、腾讯会议等自身庞大的互联网业务,通过专用硬件把网络、存储、虚拟化等基础设施工作从服务器CPU中卸载出去,提高云服务器性能并降低数据中心成本。
腾讯公开披露的两代代表性自研DPU分别名为“水杉”和“银杉”。
水杉于2020年在腾讯公有云上线,支持2×50Gbps网络接口;银杉于2021年上线,支持2×100Gbps网络接口,并进一步强化了网络、存储和虚拟化硬件卸载能力。
腾讯随后表示,这两代DPU已经在腾讯云实现大规模部署,并服务公有云客户以及微信、QQ、腾讯会议等内部业务。
因此,如果制作全球或者中国DPU企业目录,腾讯应该被归入“超大规模云服务商自研DPU”这一类别,而不是传统意义上的独立DPU芯片供应商。
腾讯为什么要自己开发DPU?
现代服务器拥有越来越多CPU核心。一台高端服务器可能拥有几十甚至上百个CPU核心,但是这些CPU并不能全部提供给用户应用,因为云计算平台自身也需要消耗大量计算资源。
虚拟交换机、虚拟网络、云硬盘、Hypervisor、QEMU、数据包转发、安全策略以及各种I/O操作都会占用CPU。
对于普通企业的一台服务器来说,这些损耗可能并不明显。
但腾讯运营着超大规模数据中心,如果每台服务器都要拿出几个CPU核心处理基础设施任务,累积到数十万甚至更多服务器之后,就会形成巨大的计算资源、功耗和成本损失。
腾讯研发DPU的一个核心目标,就是把这些任务从Host CPU中移走。
CPU主要运行客户程序和业务应用。
DPU则负责网络、存储、虚拟化和数据移动。
这种分工与AWS Nitro、阿里云CIPU、Microsoft Azure的基础设施加速器以及NVIDIA BlueField背后的基本思想是一致的。
第一代DPU:水杉
腾讯第一代公开披露的自研DPU名为“水杉”。
水杉于2020年正式在腾讯公有云上线,支持2×50Gbps网络接口。
腾讯当时开发这代DPU的重要目标之一,是提升云服务器网络和云盘性能,同时减少Host CPU处理这些I/O任务时产生的资源消耗。
从技术发展的角度看,水杉代表腾讯从传统SmartNIC逐渐走向完整DPU的重要阶段。
SmartNIC主要解决数据面加速问题,而DPU进一步把控制、网络、存储和虚拟化基础设施的一部分处理能力转移到网卡侧,使这张“网卡”越来越像服务器内部的一台独立小型计算机。
这种体系结构特别适合大型云服务商,因为DPU不仅可以提高网络性能,更重要的是可以重新划分服务器CPU与云基础设施之间的职责。
第二代DPU:银杉
2021年,腾讯第二代自研DPU“银杉”开始在公有云上线。
银杉将网络接口提高到2×100Gbps,相比水杉进一步提高网络和存储处理能力,并针对服务器内部NUMA、PCIe以及高密度CPU平台进行了更多优化。
腾讯公开资料显示,银杉适配服务器时引入Socket Direct架构,让不同CPU Socket可以通过更直接的PCIe路径访问DPU,从而减少跨NUMA访问产生的时延和性能损失。
这实际上反映出高性能DPU设计中一个经常被忽略的问题:DPU本身快还不够。
CPU、PCIe、NUMA、内存和DPU之间的数据路径必须同时进行优化。
如果数据需要不断跨CPU Socket或者跨NUMA节点传输,即使网卡拥有100Gbps甚至更高带宽,服务器整体性能仍然可能受到限制。
银杉已经成为腾讯云虚拟化基础设施的一部分
银杉并不只是实验性的DPU产品,它后来被应用到腾讯云实际云服务器产品。
例如腾讯云S8和M8实例就公开说明采用腾讯云自研“银杉”DPU虚拟化平台,通过DPU承担虚拟化相关工作,以降低Host CPU承担的虚拟化开销。
这也是腾讯DPU与很多初创企业DPU最大的区别之一。
DPU初创企业通常需要首先找到客户、完成服务器验证,然后才能逐步扩大部署。
腾讯本身就是大型云服务商,因此拥有天然的大规模应用环境。
一旦某一代DPU通过稳定性验证,就可以直接进入腾讯云服务器、内部互联网服务以及大型数据中心基础设施。
把Hypervisor和QEMU I/O移出CPU
腾讯DPU最值得注意的技术方向之一,是把Hypervisor和QEMU的部分I/O处理工作下沉到DPU。
传统虚拟机运行在Host CPU上,Hypervisor需要处理虚拟硬件、网络和存储等大量工作。QEMU同样可能参与虚拟设备模拟以及I/O数据处理。
这些任务都会消耗CPU核心。
腾讯公开资料显示,其自研DPU已经将Hypervisor和QEMU中的部分I/O工作下沉到智能网卡,让更多CPU资源能够留给虚拟机和容器。
与此同时,服务器的网络和存储数据路径也可以直接通过DPU进行处理。
对于云计算来说,这种变化非常关键。
因为云厂商真正能够卖给客户的是CPU、GPU、内存和存储资源。
基础设施软件占用的CPU越少,可以真正提供给客户的CPU比例就越高。
网络卸载
网络处理是腾讯DPU最基础的功能之一。
传统云服务器需要通过软件虚拟交换机处理VPC、虚拟机通信、数据包转发和各种虚拟网络功能。
当服务器网络从10Gbps发展到25Gbps、50Gbps、100Gbps甚至更高之后,CPU处理这些数据包的成本越来越高。
DPU可以把大量Fast Path网络处理逻辑转移到硬件。
这意味着网络数据包进入服务器以后,不需要全部经过Host CPU的软件协议栈,而可以直接在DPU完成分类、转发、封装和数据移动。
服务器CPU因此可以更加专注于真正的用户程序。
存储卸载
腾讯DPU另外一个非常重要的用途是云存储。
腾讯云的CBS,也就是Cloud Block Storage云硬盘,本质上属于分布式存储系统。用户虽然看到的是一块“硬盘”,但背后的数据可能通过数据中心高速网络访问远端存储服务器。
这意味着云硬盘性能实际上同时受到网络和存储协议的影响。
腾讯DPU可以把部分存储I/O处理从CPU中卸载,并通过专用硬件优化云盘数据路径。
腾讯还研发了HARP多路径可靠传输协议,针对云盘前端网络的吞吐量、拥塞和可靠性进行优化。腾讯公开的技术方案显示,HARP可以利用数据中心中的多条网络路径进行负载分担,并与交换机配合降低拥塞、网络排队和故障切换带来的影响。
这也是DPU越来越重要的一个原因:
现代数据中心中的“网络”和“存储”已经越来越难完全分开。
Smart Endpoint与Smart DMA
腾讯在DPU技术中还发展了Smart Endpoint和Smart DMA等基础设施技术。
Smart Endpoint主要面向控制和设备虚拟化,使DPU能够更灵活地向服务器和虚拟机呈现不同的PCIe设备。
Smart DMA则更加偏向数据路径,负责Host、DPU以及其他设备之间的数据移动。
腾讯把控制面的Smart Endpoint和数据面的Smart DMA视为下一代可编程云I/O体系的重要基础,通过它们支持不同虚拟机设备、网络和存储资源的混合部署与迁移。
从体系结构角度看,这种能力已经远远超过传统网卡。
传统网卡的主要任务是“收包和发包”。
DPU则开始参与服务器内部资源组织。
支持多种CPU平台
大型云数据中心不可能只使用一种CPU。
腾讯的星星海服务器体系同时涉及Intel、AMD以及Arm等不同CPU平台,因此DPU必须能够在不同服务器架构之间运行。
腾讯公开资料显示,水杉和银杉已经针对多种Intel Xeon、AMD EPYC以及Ampere Arm服务器平台进行适配,并建立PCIe兼容性和BIOS扫描等测试体系。
这一点对于DPU商业化非常重要。
实验室中做出一块能够运行的DPU并不难。
真正困难的是让它能够稳定运行在数十种服务器主板、BIOS、CPU、操作系统和云计算环境中。
对于超大规模云服务商来说,“能够运营”往往和芯片性能本身一样重要。
DPU热升级
普通服务器网卡出现问题时,可以通过重启服务器或者更换设备解决。
但是对于公有云来说,大量服务器上运行着客户虚拟机,不能因为升级DPU固件就随意重启整台服务器。
因此腾讯为自研DPU开发了软硬件分层热升级机制。
公开资料显示,腾讯DPU可以分别升级SoC软件、硬件Framework以及业务加速引擎,并尽可能让Host和客户虚拟机保持无感知或者轻感知。
这看似只是一个运维功能,其实非常重要。
DPU真正进入大型云数据中心之后,规模可能达到数万甚至更多。如果每次升级都需要人工停机,整个体系就无法有效运营。
所以DPU竞争不仅是芯片性能竞争,也是可靠性和数据中心运营能力的竞争。
自动化DPU运维
腾讯还围绕DPU建立了大量自动化运维工具。
这些工具可以监控DPU内部状态、高速接口和各种配置表项,并进行数据包Capture、Pipeline状态分析、网络连通性测试和端到端时延追踪。
腾讯公开介绍的工具包括Ping Trace、Fltrace以及VPC网络诊断工具vTrace等,用于定位复杂的大规模云网络问题。
这一点再次体现出云厂商DPU与普通商业DPU的区别。
对于腾讯来说,DPU不是单独卖出去的一张PCIe卡。
它必须成为整个腾讯云运营体系的一部分。
腾讯DPU与裸金属服务器
裸金属云服务器也是DPU非常适合的应用场景。
传统虚拟机使用Hypervisor隔离不同用户,但有些客户希望直接获得完整物理服务器性能。
问题在于,如果完全把服务器交给用户,云服务商就很难继续管理它的网络、存储和生命周期。
DPU解决了这个矛盾。
DPU可以独立管理网络、云盘和云基础设施,而Host CPU和服务器内存则可以最大限度交给客户使用。
腾讯研发水杉和银杉的重要目标之一,就是建立CVM虚拟机和Bare Metal裸金属服务器更加统一的基础设施底座。
这与AWS Nitro和阿里云神龙/CIPU背后的技术逻辑非常相似。
腾讯DPU与AI数据中心
DPU最初主要解决云计算网络、存储和虚拟化问题,但是AI正在改变数据中心网络。
现在的大型AI服务器可能拥有8块甚至更多GPU,而成千上万块GPU必须通过高速网络互联。
GPU越来越快以后,网络本身可能成为新的瓶颈。
腾讯目前已经建设智能高性能网络IHN,作为其大型AI模型基础设施的一部分。腾讯云最新公开资料显示,IHN能够为单个计算节点提供1.6Tbps或者3.2Tbps通信带宽,并为每块GPU提供400Gbps级网络接入,同时结合腾讯自研网络设备、TCCL通信库和全局拥塞调度实现端网协同。
需要说明的是,腾讯目前公开的IHN资料并没有简单把这些AI网络能力全部归因于水杉或银杉DPU,因此不能直接把IHN等同于腾讯DPU。
但从整个技术趋势来看,DPU、SuperNIC、高速以太网、GPU Direct、RDMA和AI通信正在越来越紧密地结合。
这也是未来腾讯DPU体系值得继续关注的方向。
为什么AI时代DPU更加重要?
大型语言模型训练的一个核心问题是通信。
如果拥有一万块GPU,每块GPU都需要不断交换大量参数和梯度,那么数据中心内部会产生极其庞大的网络流量。
这个时候,CPU如果还要负责大量网络协议和数据搬运,就会成为系统瓶颈。
未来服务器的分工可能越来越清晰:
CPU负责通用计算。
DPU或SuperNIC负责高速数据移动、RDMA、网络、安全和基础设施处理。
交换芯片负责把大量服务器连接起来。
因此,在AI时代,DPU并不会因为GPU越来越强而失去价值,反而可能变得更加重要。
腾讯与NVIDIA BlueField有什么区别?
NVIDIA BlueField是一种标准商业DPU。
NVIDIA设计BlueField芯片,然后向服务器厂商、云服务商和企业客户销售,并通过DOCA软件平台建立开发者生态。
腾讯走的是另一种路线。
腾讯首先是一家大型互联网和云计算企业,然后根据自己数据中心的实际需求研发DPU。
水杉和银杉最主要的市场,就是腾讯自己的服务器和腾讯云。
因此,腾讯并不需要依靠销售DPU芯片赚钱。
只要DPU能够让每台服务器节省几个CPU核心、提高云盘性能、降低网络延迟、减少功耗或者提高服务器利用率,在巨大的数据中心规模下就可能创造非常可观的经济价值。
从这个角度看,腾讯DPU更应该与AWS Nitro和阿里云CIPU比较,而不是直接与一家普通DPU芯片创业公司比较。
腾讯与阿里云CIPU的区别
腾讯和阿里云的DPU技术路线有很多相似之处。
两家公司都是大型云服务商。
两家公司开发这类处理器的主要目的都是把网络、存储和虚拟化从CPU卸载出去。
两家公司都将相关硬件深度整合到自己的云服务器基础设施。
区别主要在品牌和体系结构表达方式。
腾讯直接使用DPU和智能网卡的概念,并公开了水杉、银杉两个产品名称。
阿里云则把自己的产品定义为CIPU,也就是Cloud Infrastructure Processing Unit,更加强调整个云数据中心资源管理和飞天云操作系统之间的关系。
但从整个行业分类来看,两者都属于Hyperscaler自研基础设施处理器路线。
腾讯与云豹智能、中科驭数的区别
它们需要设计芯片、板卡和软件,然后销售给其他服务器企业、云厂商、电信运营商和数据中心。
腾讯的商业逻辑完全不同。
腾讯本身就是最终用户。
所以评价腾讯DPU时,不能只看“芯片卖了多少颗”。
更加重要的是:
部署了多少腾讯云服务器。
节省了多少CPU资源。
提高了多少网络和云盘性能。
能否稳定运行多年。
能否支持海量在线升级。
能否与腾讯自己的云操作系统、网络、存储和服务器协同。
这也是Hyperscaler自研芯片最特殊的地方。
水杉和银杉之后还有没有新DPU?
截至2026年9月,在目前能够公开核实的腾讯资料中,“水杉”和“银杉”仍然是腾讯最明确公开命名的两代自研DPU。
腾讯早在2022年就已经披露下一代DPU将继续向更加灵活的软件定义可编程架构、RDMA、NVMe、Smart Endpoint和Smart DMA方向发展。
但是目前公开资料并没有清晰披露一个可以确认的“第三代腾讯DPU”正式产品名称和完整芯片参数,因此不能简单把后续技术规划写成已经正式量产的新一代产品。
对于企业目录来说,这一点应该明确区分。
可以确认的是,腾讯的数据中心网络已经继续向更高带宽演进,当前AI基础设施已经达到单GPU 400Gbps接入、单计算节点1.6Tbps或3.2Tbps通信能力。
但最新AI网络平台与水杉、银杉或者后续未公开DPU之间具体采用什么芯片组合,目前腾讯并没有完全公开。
腾讯DPU的优势
腾讯DPU最大的优势首先是规模。
腾讯拥有腾讯云,同时还拥有微信、QQ、腾讯会议、游戏、视频、广告、金融科技以及大量互联网服务,这些业务每天产生极其庞大的网络和存储流量。
第二个优势是软硬件协同。
腾讯可以同时控制服务器、DPU、交换机、云网络、云存储、Hypervisor和云操作系统,因此能够针对真实业务进行端到端优化。
第三个优势是运营能力。
水杉和银杉已经经历真实公有云环境的大规模部署。对于DPU来说,这种运营经验非常宝贵。
第四个优势是DPU可以直接进入腾讯自己的数据中心,不需要像初创企业一样首先寻找大客户。
第五个优势是腾讯正在大规模建设AI基础设施,未来DPU、高性能网卡、RDMA和AI网络可能拥有越来越大的内部应用空间。
腾讯DPU面临的挑战
腾讯最大的挑战之一,是AI网络带宽增长速度非常快。
水杉的2×50G和银杉的2×100G在传统云服务器时代属于很高的网络带宽,但今天高端AI服务器已经开始使用400G、800G甚至更高速网络。
因此,DPU必须继续快速升级。
第二个挑战是可编程能力。
传统云DPU可以针对固定的网络和存储功能开发专用硬件,但未来客户可能要求防火墙、NFV、安全、存储、AI通信甚至网络内计算等更加复杂的功能。
DPU需要同时保持ASIC级性能和软件级灵活性,这是非常困难的芯片设计问题。
第三个挑战是生态。
NVIDIA拥有GPU、BlueField、Spectrum、InfiniBand、CUDA和DOCA完整生态。
腾讯虽然拥有巨大的云计算环境,但其DPU目前主要服务内部基础设施,外部开发者生态明显不同于NVIDIA。
腾讯在DPU产业中的定位
从全球DPU产业来看,腾讯属于非常典型的一类企业:
Hyperscaler,也就是超大规模云服务商自研DPU。
这一类企业包括AWS、Microsoft、Google、阿里云、腾讯云以及其他大型云计算公司。
它们开发DPU的目的通常不是成为一家DPU芯片销售公司,而是重新设计自己的数据中心。
过去的数据中心是:
CPU + 内存 + 网卡 + 存储。
今天正在逐渐变成:
CPU + GPU/AI加速器 + DPU/SmartNIC + 高速网络 + 分布式存储。
DPU开始成为连接CPU、GPU、网络和存储的重要基础设施处理器。
总结
腾讯是中国较早进行大规模DPU研发和部署的云计算企业之一,其公开的代表性自研DPU包括“水杉”和“银杉”。
水杉于2020年在腾讯公有云上线,支持2×50Gbps网络接口;银杉于2021年上线,支持2×100Gbps网络接口,并进一步引入Socket Direct等技术优化服务器内部CPU、PCIe和DPU之间的数据路径。
两代产品随后进入腾讯云以及微信、QQ、腾讯会议等腾讯内部业务的大规模基础设施。
腾讯DPU已经能够把部分Hypervisor、QEMU、网络和存储I/O处理从Host CPU下沉到智能网卡,并支持硬件加速、在线热升级、自动化运维以及多CPU架构适配。
与云豹智能和中科驭数不同,腾讯并不是一家主要向市场销售DPU芯片的企业,而是利用DPU重构自身云基础设施的超大规模云服务商。
这也是腾讯DPU真正值得关注的地方。
腾讯并不是想多卖一颗芯片。
它真正希望做到的是,让数据中心里的CPU少处理一些网络、存储和虚拟化工作,把更多计算能力留给真正的应用。
随着AI数据中心继续发展,这种分工会越来越明显。
CPU负责通用计算,GPU负责AI计算,而DPU负责让数据在服务器、网络和存储之间高速、高效、可靠地流动。
从这个角度看,DPU并不是一张更高级的网卡。
它正在逐渐成为现代云数据中心中的第三类核心处理器。
