Menu Close

星云智联

星云智联:从DPU到400G AI智能网卡,面向云计算与智算中心的国产高速互联芯片企业

星云智联

星云智联(NebulaMatrix)是一家专注于数据中心通信互联架构、智能网卡芯片和DPU解决方案的中国芯片企业,注册主体为珠海星云智联科技有限公司,成立于2021年。

公司目前在深圳、南京、北京和上海等地布局研发和业务团队,核心技术覆盖可编程网络处理、RDMA、网络与存储卸载、I/O虚拟化、安全加速以及DPU系统软件。

随着人工智能集群迅速发展,星云智联近年来又将产品重点进一步延伸到400Gbps AI高速互联网卡和RNIC IP,逐渐从传统云计算DPU企业向AI算力网络互联企业发展。

星云智联是一家什么样的DPU企业

星云智联的技术路线非常典型:先解决云数据中心服务器CPU被网络、存储和虚拟化任务大量占用的问题,再进一步解决AI时代GPU之间高速数据移动的问题。

传统服务器中,CPU不仅需要运行用户程序,还要执行虚拟交换、网络协议、存储协议、安全策略、流量管理和I/O虚拟化等大量基础设施任务。

当服务器网络从10GbE、25GbE发展到100GbE、200GbE甚至400GbE之后,这些工作对CPU资源的消耗越来越明显。

DPU的基本思路就是把这些基础设施任务从CPU中分离出来,由专门的数据处理芯片执行。

星云智联从成立之初就围绕这一方向进行研发,公司目前把自身定位为专注于数据中心通信互联架构、智能网卡芯片和DPU解决方案集成电路设计企业。

官方资料显示,截至2025年6月,公司已经获得212件授权专利、69件公开专利、2件集成电路布图设计专有权以及39件软件著作权。

D1055AS:星云智联第一代商用DPU

星云智联较早进入市场的代表产品之一是D1055AS DPU

2022年,星云智联公开介绍D1055AS时,将其称为公司的首款DPU产品,并重点强调“全硬件加速”的技术路线。

该产品主要面向公有云、互联网和企业数据中心,可以承担网络、存储以及虚拟化等基础设施处理任务。

D1055AS的设计思路与普通SmartNIC存在明显区别。

普通智能网卡通常只卸载部分网络功能,而DPU还需要同时承担更完整的基础设施任务,例如虚拟交换、存储访问、I/O虚拟化以及独立的管理功能。

星云智联官方资料显示,D1055AS已经完成多家客户测试并进入实际部署阶段,可应用于算力卸载、存算分离和网络安全等场景。

D1055AS通过中国联通测试

DPU能不能真正进入数据中心,最重要的并不是厂商公布多少参数,而是能否通过服务器、操作系统、虚拟化平台和真实业务环境的验证。

2023年,星云智联与中国联通研究院针对D1055AS进行了30多项测试,内容覆盖运维、兼容性、网络虚拟化以及存储虚拟化等方面。

根据双方公开的结果,D1055AS在基本功能、虚拟化以及网络场景测试中通过测试并满足预期需求。

这类运营商测试对于DPU企业非常重要,因为DPU不像普通CPU或者GPU那样只执行计算任务,它必须直接参与服务器最底层的网络、存储和虚拟化工作。

一旦DPU出现兼容性或者稳定性问题,可能直接影响整台服务器甚至整个云平台。

金山云采用星云智联DPU

星云智联DPU还进入了实际公有云产品。

公司公开资料显示,星云智联与金山云合作,为裸金属服务器开发DPU解决方案。

NebulaMatrix DPU用于帮助裸金属服务器接入公有云VPC网络,同时提供网络和云盘支持。

裸金属服务器是DPU非常典型的应用场景。

普通虚拟机通常由Hypervisor管理网络和存储,但裸金属服务器直接把物理服务器交给客户使用。

如果还希望它像虚拟机一样接入VPC、云盘、安全策略和云管理平台,就必须有另外一个独立处理器承担这些云基础设施功能。

DPU正好可以完成这项工作。

因此,一块DPU实际上可以把普通物理服务器变成“云化裸金属服务器”。

DPU可以释放服务器CPU

DPU最直接的价值就是释放CPU

在传统服务器中,Open vSwitch、网络Overlay、存储协议、数据包转发和虚拟机I/O都会消耗CPU资源。

星云智联采用硬件卸载方式,把大量数据平面处理任务直接交给DPU芯片

其公有云方案支持百万级流表、硬件数据流统计、层级化QoS以及硬件高速转发,并支持OVS相关接口,可以与云数据中心控制器结合。

对于大型云服务商来说,这种架构具有明显经济意义。

如果一台服务器原本需要拿出若干CPU核心运行网络和存储基础设施,那么使用DPU之后,这部分CPU核心可以重新用于客户虚拟机、数据库和应用程序。

服务器数量达到几万甚至几十万台以后,整体节省的CPU资源非常可观。

网络卸载

网络处理是星云智联DPU最重要的功能之一。

公司拥有自主研发的可编程包处理引擎、大流表查找引擎和层级化QoS调度器,可以在网卡侧执行大量高速网络数据处理工作。

其软件体系支持OVS-DPDK以及Linux内核驱动,可以与云数据中心现有软件基础设施进行集成。

这意味着服务器中的很多数据包不需要再进入CPU执行复杂的软件转发,而可以直接由DPU完成。

对于100Gbps甚至更高速率的数据中心网络,这种硬件卸载能力越来越重要。

存储卸载

DPU的另一个核心任务是存储。

星云智联的软件技术体系支持SPDK、iSCSI以及NVMe-oF等存储技术。

NVMe-oF,也就是NVMe over Fabrics,可以让服务器通过高速网络访问远程NVMe SSD。

在传统架构中,远程存储访问需要CPU执行大量协议处理,而DPU可以直接承担其中一部分网络和存储工作。

这样就可以形成“存算分离”架构。

计算服务器负责计算,独立存储服务器负责保存数据,两者通过高速网络和DPU进行连接。

这种架构已经成为大型云计算、数据库和AI数据中心的重要发展方向。

虚拟化卸载

星云智联DPU还支持vDPA、VirtIO、PCIe以及SR-IOV等虚拟化技术。

其中VirtIO是云计算中非常常见的虚拟I/O标准。

vDPA则允许硬件直接实现VirtIO数据路径,使虚拟机能够获得接近硬件直通的I/O性能,同时保留虚拟机迁移等云计算能力。

DPU如果能够把VirtIO、网络和存储同时卸载,就可以进一步减少Hypervisor和主机CPU参与。

这也是DPU与普通高性能网卡之间的重要区别。

M18220:进入自主智能网卡ASIC阶段

除了DPU板卡和解决方案,星云智联也在开发自己的核心网络ASIC。

公司已经公开发布M18220智能网卡ASIC芯片

根据星云智联官方资料,M18220单端口最高吞吐能力达到100Gbps,并集成公司自研的RoCEv2、网络、存储和安全相关技术,可面向公有云、私有云、混合云、NVMe存储、网络安全和工业互联等市场。

M18220的意义在于,星云智联开始从“DPU解决方案提供商”进一步进入真正的核心网络芯片设计领域。

2026年2月,公司又宣布其自主研发的智能网卡芯片通过国家权威机构的信息产品成熟度评估。

这表明星云智联正在持续推动自研智能网卡芯片走向更加成熟的产业化阶段。

N1025XS智能网卡

星云智联也拥有面向传统服务器和工业市场的较低速率智能网卡。

例如N1025XS是一款双端口10GbE智能网卡,总带宽20Gbps,采用SFP+/SFP接口。

该产品支持SR-IOV、VMDq、RSS、DPDK以及发送和接收Checksum Offload等功能,同时兼容Linux和Windows,并支持国产CPU操作系统和服务器平台。

这类产品虽然不像400G AI网卡那么引人关注,但却反映了星云智联产品覆盖范围比较广。

企业可以从10GbE服务器智能网卡开始,一直到100G DPU和400G AI网络。

N1045XT:机器视觉也是一个市场

星云智联还推出了N1045XT四端口10GbE智能网卡。

N1045XT提供4个RJ45接口,总带宽40Gbps,通过PCIe Gen3 x8连接主机,支持SR-IOV、VMDq、RSS以及DPDK等功能。

值得注意的是,它还针对机器视觉提供GVSP协议卸载。

因此,该产品可以直接连接多台高速工业相机,把大量图像数据传输和处理工作从CPU卸载出去。

这说明SmartNIC的应用已经不仅局限于云计算。

工业视觉、高速图像采集、半导体检测以及智能制造同样需要大量高速网络数据处理。

从云计算进入AI智算中心

随着生成式AI快速发展,星云智联的产品方向也发生了明显变化。

过去DPU主要解决的问题是:

怎样减少CPU用于网络、存储和虚拟化的开销?

今天AI数据中心面对的问题变成:

怎样让几千甚至几万块GPU之间的数据传输足够快?

大模型训练需要大量GPU同时执行数据并行、流水线并行和张量并行。

每一轮训练过程中,GPU都必须交换大量梯度、参数和中间结果。

如果网络速度不够快,GPU就只能等待数据。

因此,在AI数据中心里,网络已经开始直接决定GPU利用率。

星云智联也因此把RDMA和AI高速互联提升到了更加重要的位置。

D1205CQ:面向100G级DPU

星云智联此前公布过面向智算和高性能云计算市场的D1205CQ DPU

公开技术资料显示,D1205CQ采用双100GbE接口,也就是2×100G,相比公司早期25G级DPU大幅提高网络能力,同时进一步强化RDMA功能。

公司特别强调其自研NBL-CC拥塞控制算法,希望降低RDMA网络延迟并扩大集群规模。

需要注意的是,公司早期公开D1205CQ时使用的是“即将推出”的表述,因此在判断具体出货规模时,应当与已经明确部署的D1055AS区别开来。

不宜仅凭产品发布资料推断其已经形成大规模商业销售。

400G智能网卡进入AI网络

AI服务器领域,星云智联已经将网络速率进一步提升到400Gbps。

公司早期公布过S1405VQ智能网卡,提供1×400G或者2×200G网络接口,主要面向AI大模型训练、GPU资源池以及HPC高性能计算。

随后,公司继续扩展这一技术路线。

2025年6月,星云智联正式发布S1400系列AI智算高速互联网卡,进一步把产品重点转向大规模人工智能训练和推理网络。

目前星云智联公开的AI网络产品已经覆盖400Gbps级高速网络。

S1400系列AI智算网卡

S1400系列是星云智联目前非常值得关注的一条产品线。

它已经不再只是传统意义上的“DPU卸载卡”,而更加接近专门为AI训练和推理设计的高性能RNIC。

2025年公开资料显示,该系列高端型号支持400Gbps网络,并通过自适应路由、乱序接收等技术改善AI集群的网络效率,实现高带宽和低延迟。

这种产品的核心目标不是简单释放几个CPU核心,而是提高整个GPU集群的有效算力。

如果GPU需要等待网络通信,即使GPU理论峰值算力很高,真正能够用于训练的时间仍然会下降。

因此,400G智能网卡已经成为大型AI训练服务器的重要组成部分。

RDMA是星云智联AI网络的核心技术

星云智联在DPU和AI网卡领域非常强调RDMA

RDMA全称Remote Direct Memory Access,也就是远程直接内存访问。

传统网络通信通常需要操作系统CPU以及多次内存复制参与。

RDMA则允许一台服务器通过网络直接访问另一台服务器的内存,明显减少CPU干预和数据复制,因此可以降低延迟并提高吞吐量。

星云智联已经自研RoCEv2 RDMA模块以及Verbs驱动,并进一步开发自己的拥塞控制和重传机制。

这使它与普通以太网网卡企业形成了明显区别。

NBL-CC拥塞控制

AI网络一个非常难解决的问题是拥塞。

例如几千块GPU同时执行集合通信时,大量数据流可能突然集中发送到某些网络端口。

如果处理不好,就可能产生排队、丢包甚至PFC死锁。

星云智联为此开发了NBL-CC(NebulaMatrix Congestion Control)拥塞控制算法

公司称这一技术可以改善传统RoCE网络在大规模组网中的稳定性和扩展能力,并降低对交换机复杂配置的依赖。

如果这类技术能够在真实大规模GPU集群中持续稳定运行,其价值会远远超过普通网卡本身。

因为AI数据中心最大的目标不是“网络接口跑到400G”,而是:

几千块GPU同时通信时,仍然能够保持高吞吐和低延迟。

NBL-SRP选择性重传

星云智联还开发了NBL-SRP(Selective Retransmission Protocol)选择性重传协议

传统RDMA网络对于丢包比较敏感。

一旦数据包丢失,错误恢复机制可能影响整体传输效率。

选择性重传的思想是只重新发送真正丢失的数据,而不是大量重复传输已经成功到达的数据。

星云智联将NBL-SRP与NBL-CC结合,用于提升RoCE网络在存在拥塞或者丢包环境下的稳定性。

这种技术尤其适合AI训练网络,因为大规模GPU集群产生的网络流量极其密集。

万级GPU互联

星云智联公开资料称,其RDMA技术目标可以支持万级GPU卡集群连接。

公司希望通过NBL-CC拥塞控制、NBL-SRP选择性重传以及与交换机之间的端网协同,实现更加稳定的大规模RDMA网络。

这里需要区分“技术支持能力”和“已经部署多少块GPU”。

支持万级节点并不等于已经拥有一个万卡商业客户集群。

更准确的说法应该是:

星云智联的RDMA和DPU架构以万级GPU组网能力作为设计目标之一。

GDA与AI数据直接传输

星云智联近年的AI网卡技术还涉及GDA,也就是GPU Direct Access一类的数据直接访问能力。

传统AI服务器数据通信可能经过:

GPUCPU内存 → 网络接口。

如果网卡能够更加直接地与GPU交换数据,就可以减少CPU和系统内存参与。

这对于AI训练十分重要,因为CPU并不是AI服务器中的核心计算资源。

GPU之间传输数据最好尽可能减少CPU干预。

星云智联在2025年的AI网络技术展示中已经把GDA、乱序接收、报文喷洒以及选择性重传列为提高AI网络效率的重要技术方向。

从DPU走向RNIC

从星云智联这几年的产品变化,可以清楚看到整个DPU行业正在发生转变。

早期公司的明星产品是D1055AS。

那个阶段的核心关键词是:

云计算、CPU卸载、虚拟化、网络、存储。

现在官网首页最醒目的技术之一已经变成了NebulaMatrix RNIC IP,明确面向HPC、高性能计算和AI大模型训练及推理。

这意味着星云智联已经不再只围绕传统云计算DPU展开产品布局。

其技术正在进一步向AI网络核心IP延伸。

什么是RNIC

RNIC就是RDMA Network Interface Controller,即支持RDMA的网络接口控制器。

普通NIC主要负责以太网数据收发。

SmartNIC可以执行更多网络处理。

DPU进一步承担服务器基础设施卸载。

RNIC则重点解决超低延迟和高吞吐远程内存访问。

AI训练集群中,这几种芯片的功能正在越来越多地融合。

一张400G AI高速网卡可能同时具备:

高速Ethernet、RDMA、拥塞控制、GPU Direct、数据包处理、遥测以及安全功能。

因此,今天DPU、SmartNIC和RNIC之间已经不再存在绝对清晰的边界。

星云智联正是这种产业变化的典型例子。

软件技术栈也是DPU竞争力

DPU不是只有硬件。

如果只有一颗ASIC,却没有驱动、虚拟化、存储和云平台软件,客户实际上很难部署。

星云智联目前的软件技术体系覆盖:

网络方面包括OVS-DPDK和内核驱动;

存储方面包括SPDK、iSCSI和NVMe-oF;

虚拟化方面包括vDPA、VirtIO以及PCIe驱动;

RDMA方面拥有Verbs驱动、NBL-CC拥塞控制和NBL-SRP选择性重传;

系统管理方面还包括IPMI/IPMB、BIOS以及系统热升级。

这也是为什么DPU企业的技术门槛明显高于普通网卡厂商。

真正的DPU需要同时拥有芯片、板卡、固件、操作系统、驱动和云软件能力。

自研核心IP

星云智联官方将多个关键模块列为自主研发的芯片核心IP,其中包括:

可编程包处理引擎、

大流表查找引擎、

层级化QoS调度器、

安全加密与校验引擎、

RoCEv2 RDMA模块

以及CPU系统相关组件。

这说明公司并不是只把第三方CPU、FPGA和网卡芯片组合成一块DPU板卡。

随着M18220等ASIC进入产品化阶段,星云智联正在不断提高核心网络处理技术的自主程度。

为什么AI时代DPU越来越重要

在传统服务器时代,CPU几乎是整个计算系统的中心。

但是AI服务器完全不同。

一台AI服务器可能拥有8块GPU,而真正昂贵的资源是GPU

因此系统设计目标已经从:CPU利用率更高

变成:绝对不能让GPU等待。

GPU等待网络数据、等待模型参数或者等待其他GPU完成通信,都会浪费昂贵算力。

因此现代AI数据中心开始形成新的处理器分工:

CPU负责通用计算和系统控制。

GPU负责AI计算。

DPU/RNIC负责高速数据移动和基础设施处理。

这正是星云智联所处的市场。

与NVIDIA BlueField的区别

NVIDIA BlueField代表一种非常完整的DPU路线。

BlueField内部拥有Arm CPU、高速网络接口以及大量网络、存储和安全硬件引擎,可以独立运行操作系统

它更像安装在服务器内部的一台小型基础设施服务器。

星云智联早期DPU同样强调完整基础设施卸载,但目前的产品路线更加突出高性能网络互联和RDMA

尤其随着S1400系列400G AI网卡和RNIC IP出现,星云智联正在越来越明显地向AI算力网络方向扩展。

因此,把星云智联简单理解成“中国版BlueField”并不准确。

它目前更接近:

DPU + SmartNIC + RNIC + AI Network ASIC/IP平台。

与云脉芯联的区别

星云智联和云脉芯联的名字很像,而且都属于中国DPU和AI网络芯片企业,因此很容易被混淆。

两家公司并不是同一家公司。

云脉芯联的英文品牌是Yunsilicon,近年来以YSA-100、metaConnect以及metaScale等RDMA和网络互联产品为重点。

星云智联的英文品牌是NebulaMatrix,产品则包括D1055AS DPU、M18220智能网卡ASIC、N系列智能网卡以及S1400系列AI高速互联网卡。

两家公司都在从传统DPU市场向AI高速网络扩展,因此未来在400G、800G RDMA网卡和国产AI集群领域会存在越来越明显的竞争。

与芯启源的区别

芯启源Corigine拥有明显的NFP可编程网络处理器技术基因,长期围绕Agilio SmartNIC和Network Flow Processor构建产品。

星云智联则更加强调从DPU完整基础设施卸载向RDMA和AI互联扩展。

从技术分类来看,芯启源更适合归类为:Network Processor → SmartNIC → DPU。

而星云智联更接近:Cloud DPU → SmartNIC ASIC → AI RNIC。

两条路线最终都进入AI数据中心高速网络市场。

与中科驭数的区别

中科驭数是中国较早实现自研DPU芯片商业化的企业之一,核心技术围绕KPU架构和K系列DPU发展。

中科驭数强调软件定义加速器和通用DPU平台。

星云智联的优势则更加集中在数据中心网络、RDMA、云计算卸载和AI高速互联。

因此两家公司虽然都属于DPU企业,但技术重点并不完全一样。

400G之后是800G

星云智联未来面临的最大技术挑战之一,就是网络速度升级。

目前AI数据中心已经大量讨论400GbE和800GbE。

下一阶段甚至会进入1.6TbE。

网络带宽翻倍并不仅仅意味着把SerDes速度提高。

DPU和RNIC还必须同步升级:

PCIe接口、RDMA引擎、拥塞控制、内存带宽、数据包处理能力、交换网络以及GPU接口。

因此对于星云智联而言,S1400系列400G产品只是进入高端AI网络市场的重要一步。

能否进一步进入800G甚至1.6T市场,将决定它是否能够长期参与最先进AI数据中心竞争。

生态也是关键

AI网络芯片最大的竞争壁垒之一并不是单纯芯片性能,而是生态。

NVIDIA为什么强大,并不仅仅因为拥有ConnectX和BlueField。

NVIDIA同时拥有GPU、CUDA、NCCL、Spectrum交换机、InfiniBand以及完整AI软件平台。

国产DPU和RNIC企业想进入大型AI集群,就必须与国产CPUGPU、服务器、交换机、操作系统AI软件建立完整适配。

星云智联近年来持续加入计算和产业标准组织。

2025年加入全球计算联盟,并在2025年底加入中国移动“千帆”生态联盟;

2026年仍持续参加智能计算产业活动。

这说明公司正在从单一芯片开发进一步进入整个AI算力网络生态。

星云智联值得关注的地方

星云智联最值得关注的地方,是它完整体现了DPU产业在过去几年中的变化。

第一阶段,DPU主要解决:释放CPU

第二阶段,DPU开始解决:网络、存储和虚拟化统一卸载。

第三阶段,随着AI出现,市场开始关注:怎样让GPU之间的数据移动更快。

因此,DPU逐渐与SmartNIC、RNIC和AI高速互联融合。

星云智联的产品演进正好符合这一过程:

D1055AS DPU → 自研SmartNIC ASIC → RDMA → 400G AI高速网卡 → RNIC IP。

总结

星云智联(NebulaMatrix)是一家专注于DPU、智能网卡芯片、RDMA以及AI数据中心高速互联的中国芯片企业。

公司成立于2021年,早期通过D1055AS等DPU产品进入云计算市场,主要解决网络、存储、I/O虚拟化和基础设施卸载问题。

D1055AS已经完成中国联通等客户测试,并进入金山云裸金属服务器等实际应用场景。

随后星云智联开始进一步强化自主芯片能力,推出M18220智能网卡ASIC,并形成从10G智能网卡到100G DPU,再到400G AI高速互联网卡的产品布局。

公司目前尤其值得关注的技术包括RoCEv2 RDMA、NBL-CC拥塞控制、NBL-SRP选择性重传、可编程包处理、NVMe-oF、VirtIO/vDPA、GPU高速互联以及RNIC IP

从长期方向来看,星云智联已经不仅仅是一家传统DPU企业,而正在向AI数据中心网络互联芯片和IP平台企业发展。

在未来AI基础设施中,GPU解决计算问题,而DPU和RNIC解决数据移动问题。

随着GPU集群从几百卡扩大到几千卡甚至万卡规模,网络将越来越成为决定AI集群效率的核心因素。

这正是星云智联未来最值得关注的市场机会。

公司名称: 珠海星云智联科技有限公司
英文品牌: NebulaMatrix
成立时间: 2021年
企业类型: Fabless / 数据中心互联芯片与DPU解决方案企业
核心领域: DPU、SmartNIC、RNIC、RDMA、AI高速互联
代表DPU: D1055AS、D1205CQ
代表智能网卡ASIC: M18220
代表智能网卡: N1025XS、N1045XT、S1400系列等
最高公开AI网卡速率: 400Gbps级
主要技术: RoCEv2、RDMA、NBL-CC、NBL-SRP、OVS-DPDK、SPDK、NVMe-oF、vDPA、VirtIO、SR-IOV、可编程包处理
主要应用: 公有云、裸金属服务器、AI训练、AI推理、HPC、分布式存储、网络安全、工业互联、机器视觉

Entires个相关