Menu Close

Kalray

Kalray:法国DPU先驱与MPPA多核数据处理器公司

Kalray

Kalray是一家来自法国的半导体企业,长期专注于高性能并行处理器、DPU(Data Processing Unit,数据处理器)以及面向人工智能、数据中心、网络和存储的数据加速技术。

公司成立于2008年,源自法国原子能与替代能源委员会CEA的技术孵化项目,目前主要团队位于法国和罗马尼亚。

Kalray是一家Fabless半导体公司,也就是自己负责处理器架构、芯片设计和软件开发,但通常不自己建设晶圆厂生产芯片

与很多后来进入DPU市场的企业不同,Kalray很早就开始研究面向大规模并行数据处理的处理器架构。

它最具代表性的技术是MPPA,也就是Massively Parallel Processor Array,可以翻译为“大规模并行处理器阵列”。

今天,Kalray已经把MPPA发展成为自己的DPU技术基础,并围绕这一架构提供DPU芯片、PCIe加速卡、DPU IP授权以及定制芯片设计服务。

什么是DPU

DPU是Data Processing Unit的缩写,中文通常称为“数据处理器”。

现代服务器中的CPU除了运行应用程序之外,还要处理网络数据包、存储协议、虚拟化、安全加密以及服务器之间的大量数据移动。

随着网络从10Gbps、25Gbps发展到100Gbps甚至更高速度,这些任务开始占用越来越多的CPU资源。

DPU的作用就是把这些“数据搬运和基础设施工作”从CPU卸载出来,由专门的处理器负责。

这样CPU可以更多地运行操作系统、数据库和应用逻辑,GPU专门执行人工智能训练和推理,而DPU负责网络、存储、安全以及CPUGPU之间的数据流动。

Kalray对未来AI系统的描述也采用类似分工:

CPU负责通用计算和系统控制,GPU负责模型训练和推理,而DPU处理Data Path,也就是数据通路,包括网络、存储、隔离以及大量数据移动。

Kalray的核心技术:MPPA

Kalray最重要的技术资产是MPPA架构。

MPPA的全称是Massively Parallel Processor Array。

其核心思想是在一颗SoC芯片内部放入大量可以独立运行的可编程处理器核心,再通过高速片上网络、共享内存以及专用加速器把这些核心连接起来。

SoC是System on Chip的缩写,中文叫“片上系统”。

传统电脑主板需要CPU、内存控制器和大量外围控制芯片共同工作,而SoC会把许多功能集成到一颗芯片中。DPU通常就是一种高度集成的SoC。

Kalray目前将MPPA描述为一种模块化SoC架构,可以把可编程处理器核心、内存、高速互连和硬件加速器组合在一起,根据不同客户需要构建针对AI、存储、网络、HPC和边缘计算的处理器。

MPPA的一个重要特点是并行处理。

普通CPU拥有少量非常强大的处理器核心,而MPPA采用大量相对独立的处理器核心同时处理不同数据流。

这种设计特别适合网络数据包、视频、传感器数据、存储I/O以及人工智能等存在大量并行任务的应用。

Coolidge DPU处理器

Coolidge是Kalray最具代表性的DPU处理器系列,也是MPPA架构的重要商业化产品。

Kalray目前销售的Coolidge v2处理器拥有80个RISC-V处理器核心,并集成AI加速、密码学、FEC以及数据压缩等硬件能力,同时支持Ethernet、PCIe Gen4和DDR4接口。

Coolidge v2也是Kalray K300和TC4等DPU加速卡的核心处理器。

RISC-V是一种开放的处理器指令集架构。

简单来说,它规定软件指令应该如何让处理器执行加法、加载数据、保存数据、跳转以及其他基本操作。

与x86和ARM不同,RISC-V的基础指令集采用开放标准,因此芯片企业可以围绕它设计自己的处理器核心和专用加速器。

这里需要注意,Kalray的MPPA并不是简单地“把很多RISC-V CPU放到一起”。

MPPA还包含内存系统、高速片上互连、数据通路以及各种专门的硬件加速模块,真正的价值在于整个并行数据处理架构。

K200-LP DPU加速卡

Kalray的K200-LP是一款主要针对存储、网络和安全应用的DPU加速卡。

K200-LP采用一颗Coolidge v1处理器,拥有80个处理核心、8GB DDR4内存、两路100Gbps以太网接口,并通过PCIe Gen4 x16与服务器连接。

它还支持NVMe-oF、RoCE、数据加密、压缩以及Erasure Coding等存储和网络功能。

PCIe,也就是Peripheral Component Interconnect Express,是CPUGPU、DPU、SSD以及其他高速设备之间最重要的连接总线之一。

PCIe Gen4 x16代表使用第四代PCIe并配置16条数据通道,可以在服务器与DPU之间高速传输数据。

NVMe-oF是NVMe over Fabrics的缩写,可以理解为“通过高速网络访问NVMe SSD”。

传统NVMe SSD通常直接插在服务器内部,而NVMe-oF允许服务器通过高速网络访问远端存储设备,使多个服务器可以共享大型NVMe存储系统。

RoCE和RDMA

Kalray的DPU产品大量涉及RDMA和RoCE,这是现代DPU和AI数据中心中非常重要的两个专业名词。

RDMA是Remote Direct Memory Access,也就是“远程直接内存访问”。

传统网络通信需要CPU操作系统不断复制和处理数据,而RDMA允许服务器通过网络更加直接地把数据写入另一台服务器的内存,从而减少CPU参与,提高传输速度并降低延迟。

RoCE则是RDMA over Converged Ethernet,也就是“在以太网上运行RDMA”。这种技术已经大量应用于AI训练集群、高性能计算和分布式存储系统。

Kalray的DPU可以承担这些高速网络和存储协议的处理,让服务器CPU不用花大量时间处理数据搬运工作。

K300:同时面向DPU和AI计算

K300是Kalray目前比较重要的一款通用DPU加速卡,采用一颗Coolidge v2处理器,拥有80个处理核心、16GB DDR4内存、4路10/25Gbps以太网接口以及PCIe Gen4 x16主机接口。

Kalray给出的K300计算性能达到40 TOPS INT8和20 TFLOPS FP16,并集成FEC、密码学以及数据压缩加速能力,可以用于AI推理、网络、安全、电信以及智能视觉等场景。

TOPS是Trillion Operations Per Second的缩写,表示每秒能够完成多少万亿次操作。

人工智能推理中,经常使用INT8,也就是8位整数计算,因此40 TOPS INT8可以简单理解为每秒最高完成约40万亿次8位整数运算。

TFLOPS则主要表示浮点计算能力。FP16指16位浮点数,在人工智能计算中非常常见。

因此,Kalray的DPU与很多只负责网络和存储卸载的DPU存在一定区别。它的产品可以同时承担网络、存储和一定程度的人工智能计算任务。

TC4:四颗Coolidge组成的大型DPU加速卡

TC4,也叫TurboCard 4,是Kalray面向AI推理、工业AI和边缘计算推出的更高性能DPU加速卡。

一块TC4集成4颗Coolidge v2处理器,总计320个处理核心和32GB DDR4内存,通过PCIe Gen4 x16连接服务器。

Kalray公布的TC4性能达到160 TOPS INT8和80 TFLOPS FP16。

这种设计特别适合需要大量并行任务的应用。例如智能工厂中可能同时接入几十路甚至几百路摄像头,每一路视频都需要图像处理、物体识别和实时分析。

大量相对独立的数据流正是Manycore,也就是“众核处理器”比较适合处理的任务。

Kalray还推出了Turbo Server,把两颗AMD EPYC服务器CPU与八块TC4加速卡组合在一台2U服务器中,形成高密度AI和数据处理平台。

FEC是什么

Kalray产品资料中经常出现FEC,这是通信设备中的重要技术。

FEC是Forward Error Correction的缩写,中文叫“前向纠错”。

高速网络在传输数据过程中可能出现少量比特错误。如果每出现一个错误都要求重新发送整个数据包,就会增加网络延迟。

FEC通过在发送数据时加入额外的纠错信息,使接收端能够自动检测甚至修复一定数量的错误。

在高速以太网、5G以及卫星通信等领域,FEC都是非常重要的硬件功能。

DPU把FEC直接放到硬件中执行,可以减少CPU负担并提高通信效率。

Kalray不仅做网络DPU

很多人把DPU理解成“高级智能网卡”,但Kalray对DPU的定义更宽。

Kalray目前把DPU应用划分到AI、存储、网络、安全、5G、电信边缘以及其他高数据流应用。

它认为DPU最重要的能力不是某一种协议,而是高效率地处理Data in Motion,也就是“正在移动的数据”。

例如在AI服务器中,GPU可能非常快,但是训练数据如果不能及时从SSD传到GPU,昂贵的GPU就只能等待。

DPU可以负责SSD、网络、CPUGPU之间的数据移动,让GPU更多时间用于真正的矩阵计算。

因此现代AI系统的瓶颈正在从单纯“算得够不够快”,逐渐转变为“数据能不能足够快地送到GPU”。

这也是Kalray现在越来越强调AI基础设施DPU的重要原因。

Edge Computing与Kalray

Kalray还长期面向Edge Computing,也就是“边缘计算”市场。

传统Cloud Computing把大量数据传送到远程数据中心处理,而边缘计算是在距离数据产生地点比较近的位置进行计算。

例如工厂摄像头、机器人、自动驾驶汽车和5G基站每天都会产生大量数据。如果全部先发送到远程云服务器再处理,不仅需要巨大的网络带宽,还会增加延迟。

因此可以在工厂、车辆、基站或者其他边缘设备附近部署计算服务器。

Kalray MPPA拥有大量并行核心,同时强调较低功耗和实时处理能力,因此很早就被用于智能视觉、工业设备、通信和边缘计算等领域。

从完整产品转向DPU IP和定制设计

Kalray近几年发生了一个非常重要的战略变化。

过去Kalray不仅开发DPU芯片和加速卡,还经营名为Data Acceleration Platform的数据管理与软件业务,其中包括Ngenea产品。

2025年2月,Kalray把这一业务的全部资产出售给美国DataCore Software,交易金额最高可达到2000万美元,其中首笔付款为1250万美元。

完成出售之后,Kalray重新把重点集中到半导体技术本身。

现在Kalray的商业模式已经不仅是自己设计Coolidge芯片和销售DPU板卡,而是开始把MPPA架构以及相关DPU技术作为Silicon IP授权给其他半导体公司,同时提供定制DPU和芯片联合开发服务。

Silicon IP,也就是“芯片知识产权模块”,可以理解为已经设计好的处理器、网络控制器或者硬件加速模块。

其他芯片公司购买IP授权之后,可以把这些模块集成到自己的SoC中,而不用从零开始设计。

这种商业模式与ARM非常相似:公司不一定需要自己销售所有最终芯片,也可以通过处理器架构、IP授权和芯片设计服务赚钱。

与Openchip合作开发AI DPU

Kalray战略转型中最重要的合作伙伴之一,是西班牙半导体公司Openchip。

2025年,Kalray与Openchip签署战略合作协议,其中包括Kalray部分DPU知识产权的非独家授权,以及为Openchip开发定制DPU的工程服务。

Kalray表示,这一合作用于面向下一代AI基础设施和数据中心。

到2026年,双方进一步延长合作关系,继续开发Openchip下一代加速芯片。Kalray公布的信息显示,Openchip还通过行使认股权证成为Kalray的重要股东。

这一合作非常值得关注,因为它说明Kalray正在从传统的“自己设计一款DPU然后卖板卡”,转向“把多年积累的DPU技术授权给其他芯片公司”。

与Bull合作AI高速网络

2026年7月,Kalray又宣布与法国高性能计算和AI企业Bull建立战略合作关系,共同开发下一代AI和HPC高速网络技术。

双方还计划围绕Ultra Ethernet开展合作。

Ultra Ethernet是一种针对AI和高性能计算集群开发的新型开放网络技术,希望让传统以太网更适合数千甚至数万颗AI加速器之间的大规模高速通信。

HPC是High Performance Computing的缩写,中文叫“高性能计算”。超级计算机、天气模拟、核物理计算、科学研究以及大规模AI训练都属于HPC的重要应用。

随着AI集群规模不断扩大,GPU之间的通信逐渐成为性能瓶颈,因此DPU、高速网络、RDMA和Ultra Ethernet正在成为AI基础设施的重要组成部分。

Kalray在2026年的新商业模式

截至2026年,Kalray已经明显从过去以现成DPU芯片和加速卡销售为主的模式,转向三条路线同时发展:

一是继续提供Coolidge处理器、K200-LP、K300、TC4等现成DPU产品;

二是把MPPA、RISC-V计算模块、网络数据处理模块、AI加速模块以及其他DPU IP授权给芯片设计企业;

三是与大型AI、HPC和半导体企业合作,为客户定制新的DPU和数据处理芯片

这种变化意味着Kalray逐渐从“一家DPU芯片产品公司”转向“一家DPU技术平台和芯片设计公司”。

2026年业务恢复增长

Kalray在经历2024年至2025年的业务重组之后,2026年的半导体业务出现明显增长。

公司公布的2026年上半年数据显示,半导体业务收入达到850万欧元,而2025年同期可比收入为540万欧元,同比增长58%。

Kalray同时宣布已经与一家大型AI和HPC基础设施企业签订战略合作协议,对方将把Kalray技术集成到下一代高性能互连芯片中。

Kalray公布的2025全年数据显示,在出售Data Acceleration Platform业务之后,新口径半导体业务收入约1428万欧元,比2024年的约361万欧元增长接近四倍。

因此,现在介绍Kalray不能只把它写成早期的Coolidge DPU板卡公司。

它目前越来越重要的价值,是十多年积累下来的MPPA架构、DPU IP以及面向AI基础设施的定制芯片设计能力。

Kalray与NVIDIA DPU有什么不同

NVIDIA BlueField等主流DPU通常强调网络、存储、安全以及虚拟化卸载。

Kalray的MPPA路线有所不同。

它采用大量通用可编程核心与硬件加速器组成并行处理架构,因此不仅能够处理网络和存储,还可以执行AI推理、视觉计算、电信协议以及各种用户自定义数据处理任务。

也就是说,Kalray试图让DPU成为一种更加通用的“数据处理计算平台”,而不仅仅是一块带有CPU的高速智能网卡。

这也解释了为什么Kalray经常同时出现在DPU、AI Accelerator、Edge Computing、Storage Accelerator以及Telecom Processor等不同市场中。

Kalray在DPU产业中的位置

从全球DPU产业来看,Kalray是一家比较特别的企业。

它不像NVIDIA那样拥有庞大的GPU和服务器生态,也不像AWS、Microsoft或者Google那样拥有自己的超大规模云计算平台,但是Kalray进入并行数据处理和DPU领域非常早,并拥有自己独特的MPPA处理器架构。

Kalray甚至指出,其MPPA技术在“DPU”这一行业名称普及之前就已经开始研发。

经过多代产品发展,MPPA逐渐从早期众核处理器演变为今天面向数据中心、AI、HPC、网络、存储和边缘计算的DPU平台。

它与大禹智芯云豹智能等独立DPU企业属于比较接近的产业层级,但Kalray的特点更加鲜明:

核心竞争力不是传统ARM智能网卡路线,而是自主MPPA众核处理架构,并逐渐向DPU IP授权和定制芯片设计发展。

总结

Kalray是一家来自法国的DPU和高性能数据处理器企业,成立于2008年,源自法国CEA研究机构,是全球较早探索大规模并行数据处理器的公司之一。

公司的核心技术是MPPA大规模并行处理器阵列架构。

当前Coolidge v2 DPU拥有80个RISC-V处理核心,并集成AI、密码学、FEC和数据压缩等硬件加速功能。

围绕Coolidge处理器,Kalray已经推出K200-LP、K300、TC4以及Turbo Server等产品,覆盖高速存储、网络、安全、AI推理、工业视觉和边缘计算等应用。

Kalray近年来最大的变化,是从单纯销售DPU芯片和加速卡逐渐转向DPU IP授权和定制芯片联合开发。

2025年出售Data Acceleration Platform业务后,公司重新聚焦半导体核心技术,并与Openchip合作开发面向AI基础设施的新一代DPU,同时在2026年与Bull合作下一代AI和HPC高速网络技术。

从更大的计算机体系来看,Kalray代表了DPU产业中非常值得关注的一条路线:

CPU负责通用程序,GPU负责大规模矩阵计算,而采用大量并行处理核心的DPU负责网络、存储、安全、数据移动以及越来越多的数据密集型计算。

随着AI服务器从单机计算发展到数千甚至数万颗GPU组成的AI集群,真正的瓶颈越来越不只是“计算得够不够快”,而是“数据能不能足够快地送到计算单元”。

正是在这个问题上,Kalray的MPPA和DPU技术找到了自己的位置。

Entires个相关