Menu Close

SambaNova Systems

SambaNova Systems:以 RDU 数据流架构挑战 GPUAI 芯片公司

SambaNova Systems

SambaNova Systems 是美国一家专注于 AI 芯片AI 推理系统和企业级生成式 AI 平台半导体公司,也是 Nvidia GPU 之外最受关注的 AI 计算架构挑战者之一。

SambaNova 最大的特点,是没有沿着传统 CPUGPU 架构继续发展,而是从头设计了一种新的处理器:

RDU,Reconfigurable Dataflow Unit,可重构数据流处理器。

SambaNova 认为,今天大型语言模型真正昂贵的部分,并不只是数学运算,而是:

数据在计算单元和内存之间不断移动。

因此,它试图改变整个 AI 处理器的数据流方式,让计算单元、片上内存和互联网络围绕 AI 模型的数据流图进行配置。

到了 2026 年,SambaNova 已经从早期的 DataScale AI 系统,发展到以 SN40、SN50 RDU、SambaRack、SambaStack 和 SambaCloud 为核心的完整 AI 推理平台。

SambaNova 成立于 2017 年

SambaNova Systems 成立于 2017 年,诞生于美国硅谷。

公司三位联合创始人是:

Rodrigo Liang

Kunle Olukotun

Christopher Ré

其中 Rodrigo Liang 担任公司联合创始人兼 CEO。

他拥有二十多年半导体行业经验,曾经在 Hewlett-Packard、Sun Microsystems 和 Oracle 工作,并参与高性能企业处理器开发。

另外两位创始人则都来自 Stanford University。

Kunle Olukotun 是斯坦福大学电子工程与计算机科学教授,也是芯片多处理器领域的重要研究者。

他曾创立 Afara Websystems。Afara 后来被 Sun Microsystems 收购,其技术成为 Sun Niagara 多核服务器处理器的重要基础。

Christopher Ré 则是 Stanford 计算机科学教授,长期研究机器学习、数据库和 AI 系统。

这意味着 SambaNova 从成立之初,就不是一家单纯设计 AI ASIC 的公司。

它的核心团队同时拥有:

CPU 架构

并行计算

机器学习

编译器

数据系统

等多个领域的背景。

SambaNova 为什么不直接做 GPU?

GPU 最初是为了图形处理设计的。

后来 GPU 强大的并行计算能力被广泛应用于:

机器学习训练、科学计算、大型语言模型和 AI 推理。

Nvidia 又通过 CUDA 建立了非常成熟的软件生态。

但是 SambaNova 认为,GPU 的一个根本问题仍然存在:

大量能量和时间被消耗在数据移动上。

在传统 GPU 中,一个 AI 模型通常会被拆成大量 kernel。

一个 kernel 完成以后,中间结果经常需要写回内存,然后另外一个 kernel 再把数据读取回来。

随着模型越来越大,内存访问和数据移动可能成为比数学运算本身更加严重的瓶颈。

SambaNova 因此选择另一条路线:

Dataflow Architecture,数据流架构。

什么是 RDU?

SambaNova 把自己的 AI 芯片称为:

RDU

全称:

Reconfigurable Dataflow Unit

中文可以翻译成:

可重构数据流处理器。

传统 CPU 的基本思路通常是:

取指令 → 解码 → 执行指令。

GPU 则使用大量并行计算核心执行 kernel。

RDU 的思路不同。

AI 神经网络本身可以表示成一个计算图:

输入数据进入第一个操作,然后进入下一个操作,再进入下一个操作。

SambaNova 的编译软件会分析这个计算图,然后把不同运算直接映射到芯片内部不同的计算单元、存储单元和通信路径。

结果就是:

不是让数据不断寻找计算核心,而是让硬件的数据路径尽量按照模型本身的数据流组织起来。

这也是 SambaNova 架构最核心的思想。

RDU 内部有什么?

RDU 并不是简单堆积大量相同的计算核心。

它主要由不同类型的可编程单元组成。

其中一个重要单元叫:

PCU — Programmable Compute Unit

早期资料也称 Pattern Compute Unit。

PCU 负责执行矩阵、向量以及其他高度并行的数学运算。

另外一个重要单元叫:

PMU — Programmable Memory Unit

PMU 是分布在芯片内部的大量 SRAM 存储资源。

PCU 和 PMU 通过高速片上网络连接。

这样做的目的,是尽量让:

计算和数据靠得更近。

当一个 PCU 正在处理某一部分数据时,下一个操作需要的数据可以同时提前进入相应的 PMU。

因此芯片可以形成类似生产流水线的数据处理方式。

SambaNova 最关键的思想:减少数据移动

今天 AI 芯片的竞争已经不仅仅是:

谁拥有更多 FLOPS。

真正重要的问题越来越变成:

每产生一个 Token,需要移动多少数据?

例如一个大型语言模型生成文字时,需要不断访问模型权重、KV Cache 和中间结果。

如果大量数据频繁离开芯片进入外部内存,再返回计算单元,就会消耗:

时间、内存带宽和电力。

SambaNova 的设计目标就是尽量把中间数据保持在芯片内部,并让多个操作形成连续流水线。

因此 SambaNova 把自己的核心竞争指标更多放在:

Tokens per second

Tokens per watt

以及推理延迟上。

这与传统单纯强调峰值 TFLOPS 的芯片设计思路明显不同。

SambaFlow:RDU 背后的编译器

RDU 如果没有强大的软件系统,其实很难使用。

因此 SambaNova 另外开发了一套重要的软件平台:

SambaFlow

SambaFlow 的作用,是把 PyTorch 等机器学习模型转换成能够在 RDU 上运行的数据流图。

它会分析:

模型中的运算、张量、数据依赖关系以及并行关系。

然后自动决定:

哪些操作放在哪些 PCU 上运行;

哪些数据放在哪些 PMU 中;

数据应该怎样经过片上网络传输。

换句话说,SambaFlow 同时承担了一部分传统:

Compiler + Scheduler + Hardware Mapper

的工作。

这也是 SambaNova 能够使用高度可重构硬件的重要原因。

Cardinal SN10:SambaNova 早期 RDU

SambaNova 第一代广为人知的芯片之一是:

Cardinal SN10

SN10 已经采用了后来 SambaNova 一直坚持的数据流架构。

芯片内部拥有大量:

PCU、PMU、地址生成单元以及高速片上交换网络。

多个 SN10 RDU 可以组合成 DataScale 系统。

早期最小的 DataScale SN10-8 系统包含:

8 颗 Cardinal SN10 RDU。

当时 SambaNova 就已经不是把芯片作为一块普通 PCIe 加速卡销售,而是把:

芯片、服务器、内存、编译器和 AI 软件

组合成完整系统提供给客户。

SN40L:SambaNova 转向生成式 AI 推理的重要产品

随着大型语言模型爆发,SambaNova 的重点越来越明显地转向:

AI Inference。

其中最重要的产品之一就是:

SN40L RDU。

SN40L 是 SambaNova 第四代 RDU。

它不仅继续采用 Dataflow Architecture,还使用了一套非常重要的:

三级内存架构。

这三层包括:

高速片上 SRAM、高带宽内存,以及更大容量的系统内存。

这样做的一个重要目的,是让大型模型能够驻留在系统中,同时根据需要快速切换不同模型。

为什么模型切换越来越重要?

传统 Chatbot 通常只是:

用户输入问题 → 一个大型语言模型回答。

但是 Agentic AI,也就是 AI Agent,工作方式完全不同。

一个 Agent 可能首先调用一个模型进行规划,然后调用另一个模型写代码,再调用一个模型验证答案,同时还可能使用:

搜索、数据库、图像模型、Embedding 模型以及工具调用模型。

也就是说:

一个 AI 请求背后可能连续调用多个模型。

如果每次都需要重新从存储加载一个大型模型,效率会非常低。

SambaNova 因此特别强调:

Model Bundling 和快速模型切换。

这也成为 SN40L 和后来的 SN50 的重要设计目标。

SN50:第五代 RDU

2026 年 2 月,SambaNova 正式公布第五代 AI 推理芯片

SN50 RDU。

SN50 的目标非常明确:

Agentic AI Inference。

与上一代 SN40 相比,SambaNova 表示 SN50 能提供大约:

5 倍计算能力

以及:

4 倍网络带宽。

SN50 同样使用分层内存架构,把:

大容量内存、HBM 和高速 SRAM

结合起来。

它还加入针对 Agent 推理的缓存设计,从而减少重复执行 Prefill 所产生的开销。

SambaRack SN50

SambaNova 不只是销售单颗 SN50。

它把多颗 RDU 组成完整系统:

SambaRack SN50。

一个 SambaRack SN50 系统包含:

16 颗 SN50 RDU。

多个系统还可以进一步扩展。

官方表示,SN50 可以在系统内部扩展到 256 颗 RDU,并进一步通过 Scale-Out 网络扩展到大型云计算基础设施。

这说明 SambaNova 的目标已经非常清楚:

它并不是想制造一块普通 AI Accelerator。

它希望直接进入:

AI 数据中心基础设施。

SambaNova甚至开始让 GPU 和 RDU 一起工作

SambaNova 的策略也正在发生一个非常有意思的变化。

早期,人们通常把 SambaNova 看作:

Nvidia GPU 的替代者。

但是到了 2026 年,SambaNova 开始强调:

GPU 和 RDU 可以共同工作。

例如在大型语言模型推理中,可以把工作分为:

Prefill

和:

Decode。

Prefill 可以由 Nvidia B200 或 H200 GPU 执行。

Decode 则交给 SambaNova RDU。

2026 年,SambaNova 展示过使用 Nvidia B200 负责 Prefill、SN40 RDU 负责 Decode 的异构推理系统。

随后又展示使用 H200 与 SN50 组合的系统。

这实际上是一种非常现实的战略。

SambaNova 不一定需要完全消灭 GPU

它也可以成为:

AI 推理系统中的专用 Decode Accelerator。

SambaCloud

除了硬件之外,SambaNova 还建立了:

SambaCloud

开发者可以通过云端 API 直接调用大型开放模型,而不需要自己购买 RDU 服务器。

SambaNova 的 API 还强调兼容 OpenAI API。

因此原来使用 OpenAI 风格接口的软件,可以相对容易地迁移到 SambaNova 平台。

SambaStack 和 SambaManaged

SambaNova 现在已经形成多层产品体系。

SambaStack

主要面向企业和数据中心,提供从芯片、服务器到模型管理和软件平台的完整 AI Stack。

SambaManaged

则更接近托管式 AI 推理基础设施。

客户可以在自己的数据中心部署 SambaNova RDU,而 SambaNova 负责软件、模型和系统管理。

这种模式特别适合:

政府、银行、大型企业以及需要 Private AI 和 Sovereign AI 的客户。

Samba-1:1 万亿参数级模型平台

SambaNova 还曾推出一个非常有意思的 AI 系统:

Samba-1。

Samba-1 并不是传统意义上单独训练出来的一个万亿参数 LLM

它采用的是:

Composition of Experts

思路。

Samba-1 把多个不同模型组合起来,包括 Llama、Mistral、Falcon、DeepSeek 等模型,并通过路由机制根据不同任务选择适合的专家模型。

官方曾将 Samba-1 描述为大约:

1.3 trillion parameters

的 Composition of Experts 平台,并集成数十个不同专家模型。

这与 SambaNova 的硬件方向实际上非常吻合。

因为它的三级内存和快速模型切换技术,非常适合:

一个 Agent 同时使用多个不同模型。

SambaNova 曾经是全球融资最多的 AI 芯片创业公司之一

SambaNova 从成立开始就获得大量资本支持。

2018 年,公司获得约:

5600 万美元 Series A。

2019 年获得:

1.5 亿美元 Series B。

2020 年又获得:

2.5 亿美元 Series C。

2021 年,SoftBank Vision Fund 2 领投了规模达到:

6.76 亿美元

的 Series D。

当时 SambaNova 的累计融资已经超过 10 亿美元,公司估值超过:

50 亿美元。

2026 年 SambaNova 再次获得巨额融资

2026 年 SambaNova 的融资再次明显加速。

2026 年 2 月,公司获得一轮约:

3.5 亿美元融资。

该轮投资由 Vista Equity Partners 和 Cambium Capital 领投,Intel Capital 也参与其中。

资金主要用于 SN50、SambaCloud 和企业级 AI 推理业务扩张。

SoftBank 也成为 SN50 在日本 AI 数据中心的重要早期客户。

更重要的是,2026 年 7 月,SambaNova 宣布完成 Series F 的首轮交割:

10 亿美元。

这一轮由 General Atlantic 领投,并获得 Seligman Ventures、T. Rowe Price 等机构参与。

融资完成后,SambaNova 宣布公司 Post-Money Valuation 达到:

110 亿美元。

这使 SambaNova 再次成为全球估值最高的独立 AI 芯片公司之一。

Intel 与 SambaNova 的关系越来越密切

Intel 很早就是 SambaNova 的投资者之一。

到了 2026 年,双方关系进一步加深。

Intel 不仅继续投资 SambaNova,还与 SambaNova 建立多年 AI 推理合作关系。

Reuters 报道显示,Intel 在 2026 年继续提高其在 SambaNova 的持股比例。

与此同时,SambaNova 董事会主席 Lip-Bu Tan 同时也是 Intel CEO,因此双方之间的资本和产业联系非常紧密。

SambaNova 与 Nvidia 的区别

如果简单比较,Nvidia 的路线可以理解成:

GPU + CUDA + HBM + NVLink

而 SambaNova 的路线更接近:

RDU + Dataflow + 分布式 SRAM + 分层内存 + SambaFlow。

GPU 仍然拥有极其强大的通用性。

CUDA 生态更是 Nvidia 最大的护城河。

SambaNova 则试图针对:

大型模型推理

特别是:

Agentic AI

重新优化整个芯片和系统。

因此 SambaNova 最大的优势可能不是模型训练,而是:

高速、低延迟和低功耗的大模型推理。

SambaNova 与 Groq 有什么区别?

SambaNova 与 Groq 都试图挑战传统 GPU

但思路并不相同。

Groq 的 LPU 非常强调:

确定性执行和极低延迟。

SambaNova 则更加重视:

可重构 Dataflow 和大型分层内存。

简单来说:

Groq 更强调让程序以极其确定、快速的方式穿过芯片

SambaNova 更强调根据整个 AI 模型的数据流图重新配置计算和数据移动方式。

两家公司都在高速 LLM Inference 市场与 Nvidia 形成竞争,但技术路线明显不同。

SambaNova 与 Cerebras 也完全不同

Cerebras 的核心思想是:

把整个晶圆做成一颗巨大 AI 芯片

也就是 Wafer Scale Engine。

SambaNova 则坚持:

可扩展 RDU。

多个 RDU 可以通过高速互联组合起来。

因此三家公司代表了三种非常不同的 AI 芯片路线:

Cerebras:Wafer Scale

Groq:LPU

SambaNova:RDU Dataflow

这也是今天 AI 芯片产业最有意思的地方之一。

GPU 已经不再是唯一可能的计算架构。

SambaNova 的优势

SambaNova 最大的优势首先是:

拥有真正自主设计的 AI 处理器架构。

其次,是软硬件一体化。

它拥有:

RDU、SambaFlow、SambaRack、SambaStack 和 SambaCloud。

第三,是它非常早就意识到:

AI 的核心瓶颈正在从计算转向数据移动。

第四,是它目前重点押注的 Agentic AI,恰好需要:

高速推理、多模型并发、低延迟以及快速模型切换。

这些都是 SambaNova 架构希望解决的问题。

SambaNova 面临的挑战

SambaNova 最大的挑战仍然是:

Nvidia CUDA 生态。

今天企业选择 Nvidia,不仅因为 GPU 快。

更重要的是大量 AI 软件默认围绕:

CUDA、cuDNN、TensorRT、PyTorch CUDA

开发。

一种新的 AI 架构要真正进入大型数据中心,必须证明:

模型能够运行;

软件足够稳定;

开发环境足够成熟;

成本真正更低;

长期供应能够保证。

这些问题往往比芯片本身的峰值性能更加重要。

另外,Reuters 报道也指出,SambaNova 曾经历裁员以及融资和潜在并购方面的波折。公司随后明显把战略重点重新集中在 AI inference 和云服务。

SambaNova 为什么值得关注?

SambaNova 真正值得关注的地方,并不是它能不能在短期内取代 Nvidia

更重要的是,它提出了一个非常根本的问题:

AI 处理器为什么一定要像 GPU

CPU 是围绕指令流设计的。

GPU 是围绕大规模并行线程设计的。

而 SambaNova 则认为:

神经网络天然就是一个数据流图。

那么处理器是不是也应该按照:

Dataflow

来运行?

这就是 RDU 背后的核心思想。

随着 AI 从模型训练逐渐进入大规模推理时代,这个问题越来越重要。

尤其当未来数百万甚至数十亿 AI Agent 不断产生 Token 时:

每移动一次数据需要多少能量

可能比:

芯片拥有多少 TFLOPS

更加重要。

总结

SambaNova Systems 是当前全球 AI 芯片企业中技术路线最独特的公司之一。

它没有简单制造“另一块 GPU”。

而是从计算机体系结构本身重新思考 AI

AI 模型是数据流图,那么芯片也应该围绕数据流来设计。

从最早的 Cardinal SN10,到 SN40L,再到 2026 年的 SN50,SambaNova 已经形成了一条非常清晰的发展路线:

RDU → Dataflow Architecture → SambaFlow → SambaRack → SambaStack → SambaCloud。

随着公司在 2026 年完成新一轮巨额融资、估值达到约 110 亿美元,以及 SN50 开始进入 Agentic AI 推理市场,SambaNova 已经不再只是一家实验性 AI 芯片创业公司。

它正在尝试成为 Nvidia GPU 体系之外的另一种完整 AI 计算平台。

如果未来 AI 计算的核心瓶颈真的从:

“算得够不够快”

逐渐转向:

“数据能不能移动得足够快、足够省电”

那么 SambaNova 的 RDU 数据流架构,很可能会成为 AI 芯片发展史上一条非常值得长期观察的技术路线。