Menu Close

FuriosaAI

FuriosaAI:韩国高能效 AI 推理芯片公司,以 RNGD 挑战 GPU

FuriosaAI

FuriosaAI 是一家来自韩国的 AI 芯片企业,专注于 数据中心 AI 推理芯片、NPU、大语言模型推理服务器和高能效 AI 基础设施

如果说 Rebellions 的路线正在向:

NPU + Chiplet + AI Factory

发展,那么 FuriosaAI 的技术哲学更加集中:

用完全针对神经网络重新设计的处理器架构,提高 AI 推理的实际利用率,同时大幅降低数据中心功耗。

FuriosaAI 并不打算简单制造另一颗 GPU

公司认为传统 GPU 最初并不是为了 Transformer、大语言模型和 Agentic AI 而设计,因此很多晶体管、数据移动和计算资源并不能始终得到充分利用。

FuriosaAI 希望从计算架构底层重新解决这个问题。

公司第一代芯片

Warboy

主要针对计算机视觉。

第二代:

RNGD,读作 Renegade

则直接进入:

LLM、VLM、生成式 AI 和 Agentic AI 推理。

截至 2026 年,RNGD 已经进入量产,公司正在从一家韩国 AI 芯片创业公司逐渐转向国际企业级 AI 推理基础设施供应商。

FuriosaAI 成立于 2017 年

FuriosaAI 成立于:

2017 年。

总部位于韩国首尔。

公司是一家典型的:

Fabless Semiconductor Company

也就是无晶圆厂半导体公司。

它自己负责:

处理器架构、

芯片设计、

Compiler、

Runtime、

AI 软件

以及服务器解决方案。

芯片制造则交给:

Samsung Foundry

和:

TSMC

晶圆代工厂。

FuriosaAI 的创始团队拥有 SamsungAMDQualcomm 等国际芯片公司的研发经验。

创始人 June Paik 曾在 Samsung 和 AMD 工作

FuriosaAI 创始人兼 CEO 是:

June Paik

韩文名通常译作:

白俊浩。

June Paik 拥有超过二十年的半导体和计算机体系结构经验。

他曾经在:

Samsung Electronics

和:

AMD

从事 CPUGPU、内存系统等领域的设计与开发。

他拥有 Georgia Institute of Technology,也就是佐治亚理工学院电子工程硕士学位。

这段职业经历对于理解 FuriosaAI 很重要。

公司并不是从 AI 软件开始,然后寻找一家 ASIC 公司帮忙制造芯片

它从成立开始就是一家:

Computer Architecture Company。

FuriosaAI 希望回答的问题是:

如果今天重新设计一种真正为神经网络而生的处理器,它还有必要长得像传统 GPU 吗?

FuriosaAI 的名字来自《疯狂的麦克斯》

Furiosa 这个名字也很特别。

它来自电影:

Mad Max: Fury Road

中的角色:

Furiosa。

因此公司后来第二代处理器:

RNGD

也选择了:

Renegade

这个带有“反叛者”意味的名字。

这种命名其实与公司的定位非常一致:

挑战传统 GPU 主导的 AI 计算方式。

第一代 AI 芯片:Warboy

FuriosaAI 第一代真正商业化的 NPU 是:

Warboy。

Warboy 于:

2021 年发布。

它主要面向:

Computer Vision Inference。

例如:

图像分类、

物体检测、

OCR、

姿态识别、

超分辨率

以及:

智能视频分析。

FuriosaAI 官方资料显示,Warboy 于 2023 年与 Samsung Foundry 和 ASUS 合作进入正式批量生产。

Warboy 的主要规格

Warboy 可以提供:

64 TOPS

AI 计算能力。

芯片内部拥有:

32MB SRAM

一颗 Warboy 包含:

两个 Processing Element。

每个 PE 提供:

32 TOPS。

两个 PE 还可以独立运行不同 AI 工作负载。

显存最高:

32GB LPDDR4X

内存带宽约:

66GB/s。

接口:

PCIe Gen4 ×8。

整卡功耗可以配置在大约:

40W—60W。

这套设计已经体现 FuriosaAI 最早的技术路线:

不追求最高峰值 TOPS,而追求低 Batch、低延迟和更高计算资源利用率。

Warboy 曾进入 MLPerf

Warboy 对 FuriosaAI 另外一个重要意义,是让这家韩国创业公司第一次获得国际 AI 芯片市场关注。

2021 年,FuriosaAI 使用第一代 NPU 参加:

MLPerf Inference。

公司成为当时少数能够在国际标准 AI Benchmark 中与 Nvidia 产品直接比较的亚洲 AI 芯片创业企业之一。

但 Warboy 仍然属于上一代 AI 时代。

它最适合:

CNN、

Vision

和传统深度学习。

ChatGPT、Llama、DeepSeek大语言模型快速出现以后,AI 芯片面对的问题彻底变化。

大语言模型改变了 FuriosaAI

传统 Computer Vision 模型可能只有:

几百万、

几千万

或者:

几亿参数。

但是大型语言模型可能拥有:

70 亿、

320 亿、

700 亿

甚至:

数千亿参数。

芯片突然需要解决完全不同的问题:

更大的模型权重

KV Cache

更高显存容量

更高内存带宽

更复杂的 Transformer 运算

以及:

巨大的 Token 推理成本。

因此 FuriosaAI 第二代产品几乎重新思考了整个架构。

这就是:

RNGD。

RNGD:FuriosaAI 真正进入 LLM 时代

FuriosaAI 第二代 AI 芯片叫:

RNGD。

读音:

Renegade。

RNGD 于:

2024 年正式公开。

2025 年开始向全球大型客户送样。

到了:

2026 年

正式进入规模量产。

如果 Warboy 是 FuriosaAI 的:

Computer Vision NPU

那么 RNGD 才是公司真正挑战数据中心 GPU 的产品。

它主要针对:

LLM

Multimodal AI

Generative AI

Agentic AI

以及传统:

Vision Model。

RNGD 没有采用传统矩阵处理器思路

RNGD 最重要的创新是:

Tensor Contraction Processor,TCP。

中文可以翻译成:

张量收缩处理器。

这是 FuriosaAI 自主研发的新型 AI Processor Architecture。

公司认为很多传统 AI Accelerator 的基本思路仍然是:

Matrix Multiplication,也就是矩阵乘法。

但是现代深度学习模型本质上处理的是:

Tensor,张量。

而现代 AI 模型中的大量数学运算,本质上可以表示成:

Tensor Contraction,张量收缩。

因此 FuriosaAI 干脆直接围绕:

Tensor Contraction

设计处理器。

什么是 Tensor Contraction?

最简单理解:

矩阵乘法其实可以看成:

Tensor Contraction 的一种特殊情况。

例如:

两个二维矩阵相乘。

但是神经网络里面的数据很多时候不只是二维。

可能是:

三维、

四维

甚至:

更高维 Tensor。

Transformer 中的:

Attention、

Linear Layer

以及其他运算,

都涉及复杂张量关系。

如果处理器只为固定矩阵乘法设计,那么:

复杂 Tensor 运算首先需要被拆成大量更简单操作。

FuriosaAI 的思路则是:

让硬件直接理解更高级的 Tensor Contraction。

这可以给编译器更大的优化空间。

TCP 的核心目标是提高利用率

AI 芯片有一个非常容易被误解的数据:

Peak FLOPS。

一颗芯片可能标称:

1000 TFLOPS。

但真实运行模型时,并不意味着:

这 1000 TFLOPS 一直全部工作。

计算核心可能因为:

内存等待、

数据依赖、

不同 Tensor Shape、

通信

或者:

模型结构

而大量空闲。

因此真正重要的是:

Utilization。

FuriosaAI 的 TCP 架构希望根据模型 Tensor 运算,在编译阶段设计更加合适的数据流。

简单来说:

不是让模型勉强适应硬件。

而是:

尽量让硬件的数据流适应模型。

这也是 FuriosaAI 把 Compiler 看得非常重要的原因。

RNGD 使用 TSMC 5nm

RNGD 采用:

TSMC 5nm

制造。

工作频率:

1.0GHz。

当前官方规格达到:

256 TFLOPS BF16

512 TFLOPS FP8

512 TOPS INT8

以及:

1024 TOPS INT4。

这是非常完整的一组 AI 数据格式。

BF16 和 FP8 主要适合:

高性能 AI 模型。

INT8 和 INT4 则更加适合:

量化推理。

48GB HBM3

RNGD 一个非常重要的升级是:

HBM3。

每张 RNGD 卡配备:

48GB HBM3。

使用:

两个 HBM3 Stack。

总显存带宽达到:

1.5TB/s。

芯片内部还有:

256MB SRAM

这与 Warboy 的 LPDDR4X 已经完全不是一个级别。

原因就是:

LLM 极度依赖内存带宽。

为什么 LLM 这么需要 HBM?

假设一个模型拥有:

70 亿参数。

即使每个参数只使用:

2 Bytes,

模型权重也需要:

大约 14GB。

如果模型增加到:

320 亿参数,

仅模型本身就可能需要:

几十 GB。

而运行模型时还需要:

KV Cache

和各种中间数据。

更加重要的是:

每生成一个 Token,

模型都需要不断读取大量 Weight。

如果 AI Core 运算速度非常快,但显存只能慢慢把权重送过来,那么芯片大部分时间就在:

等数据。

所以现代 AI Accelerator 已经越来越像:

Compute Engine + Memory System。

RNGD 的:

1.5TB/s HBM3

就是为了缓解这个问题。

RNGD 最大特点之一:功耗只有约 180W

目前 FuriosaAI 官方页面给出的 RNGD TDP 为:

180W。

这也是 FuriosaAI 最核心的商业卖点之一。

与很多大型数据中心 GPU 相比:

180W 非常低。

而且它仍然可以提供:

512 TFLOPS FP8

以及:

48GB HBM3。

FuriosaAI 因此不只是强调:

Performance。

更加重视:

Performance per Watt。

为什么功耗越来越重要?

AI 数据中心正在遇到一个非常现实的问题:

电不够。

一台高端 AI 服务器可能消耗:

几千瓦。

一个大型 AI Rack 可能消耗:

几十甚至上百千瓦。

整个 AI 数据中心可能需要:

数百兆瓦。

甚至未来可能进入:

Gigawatt

级别。

但是大量传统企业数据中心仍然只有:

十几 kW 每机柜

的供电和空气冷却能力。

如果为了部署 AI 必须重新建设:

供电、

变压器、

液冷

甚至整个数据中心,

成本会非常高。

FuriosaAI 因此提出一个很现实的市场定位:

不要让企业为了运行 AI 去重建数据中心。

RNGD 可以继续使用空气冷却

因为 RNGD 单卡只有大约:

180W。

它可以继续采用:

Passive Air Cooling。

也就是服务器风道空气冷却。

这让 FuriosaAI 可以直接进入大量现有:

企业数据中心、

金融数据中心、

运营商机房

和:

私有云。

不需要首先建设复杂液冷系统。

这可能是 RNGD 最重要的商业优势之一。

NXT RNGD Server:8 张 RNGD 组成一台服务器

FuriosaAI 已经不只销售单张 AI 卡。

公司推出:

NXT RNGD Server。

一台 NXT RNGD Server 安装:

8 张 RNGD。

因此整台服务器拥有:

384GB HBM3

总显存带宽:

12TB/s。

FP8 算力达到:

4096 TFLOPS

也就是约:

4.1 PFLOPS。

FP16 算力:

2048 TFLOPS。

整机功耗:

约 3kW。

3kW 为什么很重要?

一台服务器功耗只有约:

3kW,

意味着一个普通:

15kW Air-Cooled Rack

理论上可以安装:

5 台 RNGD Server。

也就是:

40 张 RNGD。

这样 FuriosaAI 就能够充分利用:

传统企业机房。

这与很多需要特殊高功率机柜和液冷设施的高端 GPU 系统形成明显区别。

FuriosaAI 押注的是:

世界上绝大多数企业数据中心不会为了 AI 全部重新建设。

如果这个判断成立,那么低功耗 AI Inference Accelerator 会拥有非常大的市场。

RNGD 可以虚拟成 8 个独立 NPU

RNGD 另外一个很有意思的功能是:

Multi-Instance。

一张 RNGD 可以划分成:

2 个、

4 个

或者:

8 个独立 NPU Instance。

并支持:

SR-IOV。

每个虚拟 NPU 拥有自己独立的:

计算核心

和:

内存带宽。

这对于:

Cloud AI

特别重要。

因为云服务商并不总是希望:

一名客户占用整张 AI 卡。

可能:

客户 A 使用 1/8,

客户 B 使用 1/8,

其他客户继续使用剩余资源。

这可以明显提高:

Hardware Utilization。

FuriosaAI 软件栈

真正决定 RNGD 能不能成功的,很可能不是芯片

而是:

Software。

FuriosaAI 已经建立一套完整 AI 软件平台。

其中包括:

Furiosa Compiler

负责把神经网络模型映射到 TCP 架构。

Furiosa Runtime

负责实际管理 NPU。

Furiosa LLM

负责大型语言模型推理和 Serving。

还有:

量化工具、

模型优化工具、

Profiler

以及:

Model Zoo。

FuriosaAI 没有试图让用户重新学习一套 AI 框架

这一点很重要。

如果开发者为了使用 RNGD 必须放弃:

PyTorch,

重新学习:

Furiosa Language,

这几乎是不现实的。

所以 FuriosaAI 软件战略非常明确:

尽量保留开发者已经熟悉的生态。

目前 RNGD 软件已经支持:

PyTorch 2.x

以及:

torch.compile。

Furiosa LLM 则采用:

vLLM-compatible

接口。

同时支持:

OpenAI-compatible API。

也就是说,理想情况下:

原来使用:

PyTorch + vLLM + OpenAI API

的应用,

不需要完全重新设计。

Furiosa SDK 更新速度很快

FuriosaAI 近年来明显加快软件开发。

2026 年 6 月,公司发布:

Furiosa SDK 2026.3。

继续增加新的 Kernel Framework 和模型支持。

这说明 FuriosaAI 已经认识到一个现实:

AI 芯片最大的竞争不是 Tape-Out。

而是:

模型每天都在变。

今天是:

Llama。

明天是:

DeepSeek

后天又可能是:

Qwen、

Gemma、

gpt-oss

或者新的 MoE 模型。

芯片必须迅速跟上。

RNGD 已经运行 120B 参数 gpt-oss

FuriosaAIOpenAI 的公开活动中展示过:

gpt-oss 120B

运行在 RNGD 上。

公司表示:

只需要:

两张 RNGD 卡

即可运行这一 120B 参数模型。

这里需要说明:

运行一个模型,并不代表性能一定全面超过 GPU

但它至少证明:

RNGD 已经真正从传统 NPU 进入:

Frontier LLM Inference。

LG AI Research 是 FuriosaAI 最重要的商业突破之一

2025 年 7 月:

LG AI Research

正式宣布采用 RNGD。

这是 FuriosaAI 发展历史中非常重要的一笔订单。

LG AI Research 使用自己的:

EXAONE

大型语言模型对 RNGD 进行了长期测试。

最终决定采用 RNGD 运行:

企业 AI 推理。

这件事比任何 FuriosaAI 自己公布的 Benchmark 都更加重要。

因为这是:

真实大型企业客户测试以后做出的商业选择。

LG 测试中性能功耗比提高 2.25 倍

根据 LG AI Research 与 FuriosaAI 公布的测试:

在 EXAONE LLM 推理中,

RNGD 的:

Performance per Watt

达到此前 GPU 方案的:

2.25 倍。

在相同 Rack 电力限制下,RNGD 系统可以产生:

约 3.75 倍 Token。

这里需要注意:

这是 LG 针对特定 EXAONE 模型和部署环境进行的测试。

不能简单理解成:

“RNGD 比所有 Nvidia GPU 快 2.25 倍。”

更加准确的说法是:

在 LG AI Research 测试的特定 LLM 推理场景中,RNGD 展现出了明显的性能功耗优势。

EXAONE 32B 已经实际运行

LG AI Research 还使用:

4 张 RNGD

运行:

EXAONE 3.5 32B。

在 Batch Size 1 条件下:

4K Context 约达到:

60 tokens/s。

32K Context 约达到:

50 tokens/s。

这种 Benchmark 比只公布 TFLOPS 更有意义。

因为最终用户真正关心的是:

一个模型到底每秒能生成多少 Token。

2026 年 RNGD 正式进入量产

FuriosaAI 在:

2026 年 1 月 27 日

宣布 RNGD 正式进入规模量产。

公司表示已经收到首批:

4000 颗 RNGD

量产产品。

制造和供应链合作伙伴包括:

TSMC

和:

ASUS。

这对于 FuriosaAI 是一个非常重要的里程碑。

AI 芯片创业公司最困难的事情之一,就是从:

Demo

跨越到:

Mass Production。

很多创业公司能够设计芯片

真正做到:

稳定制造几千、几万颗

并交付企业客户,

则困难得多。

FuriosaAI 已经开始进入欧洲

2026 年 7 月:

FuriosaAI 宣布在:

Equinix Lisbon LS2 数据中心

部署 RNGD Server。

企业客户可以在欧洲直接测试:

RNGD

和:

FuriosaAI 软件平台。

公司同时在葡萄牙里斯本建立欧洲旗舰办公室。

这表明 FuriosaAI 已经不再满足于韩国市场。

它正在进入:

Europe Enterprise AI

Furiosa Access 已经覆盖多个地区

截至 2026 年,企业可以通过 Furiosa Access 在多个地区测试 RNGD。

包括:

Seoul

Bay Area

Lisbon

以及:

Johor Bahru。

这使 FuriosaAI 从韩国创业公司逐渐建立:

Global Evaluation Infrastructure。

对于 AI 芯片公司而言,这非常重要。

因为企业通常不会仅凭网页参数购买数百万美元服务器。

它们首先需要:

运行自己的模型,

测试自己的 Context Length,

测试自己的 Batch Size,

然后比较:

性能、

功耗

和:

TCO。

Samsung SDS 推出韩国首个国产 NPUaaS

2026 年,FuriosaAI 又获得一个非常重要的商业突破:

Samsung SDS。

Samsung SDS 宣布基于:

Furiosa RNGD

推出韩国首个国产:

NPU-as-a-Service,NPUaaS。

也就是说:

客户不需要自己购买 RNGD Server。

可以像租 GPU Cloud 一样:

直接租用 FuriosaAI NPU 算力。

这对于 FuriosaAI 的生态意义很大。

开发者可以先:

使用云端 RNGD,

等业务规模扩大后再考虑:

On-Premise 部署。

Samsung 对 FuriosaAI 的意义不只是客户

Samsung 与 FuriosaAI 的关系其实已经持续很长时间。

第一代 Warboy 就使用:

Samsung Foundry 14nm。

到了 RNGD,则转向:

TSMC 5nm。

Samsung 体系继续通过:

Samsung SDS

等业务与 FuriosaAI 合作。

这说明 FuriosaAI 并没有把自己绑定在单一韩国供应链,而是根据不同产品选择:

最适合的 Foundry 和系统合作伙伴。

SK Hynix 也是重要生态伙伴

RNGD 使用:

HBM3。

韩国恰好拥有全球最重要的 HBM 企业:

SK Hynix。

FuriosaAI 官方已经把 SK Hynix 列为其全球生态合作伙伴之一。

这也是韩国 AI 芯片产业天然拥有的一项优势:

韩国已经拥有非常成熟的:

DRAM

HBM

和:

先进半导体供应链。

2026 年与 Broadcom 合作开发第三代 AI 芯片

FuriosaAI 已经开始准备下一代产品。

2026 年 5 月

公司宣布与:

Broadcom

建立战略合作。

双方将共同开发:

第三代 AI Accelerator。

新一代产品重点针对:

Agentic AI

以及:

大规模推理基础设施。

这是一个非常重要的发展方向。

因为 RNGD 仍然主要是一张:

PCIe Accelerator。

下一代产品将更加重视:

Scale-Up。

为什么 Agentic AI 会改变芯片?

普通 Chatbot 可能是:

用户问一次,

模型回答一次。

但是 AI Agent 可能需要:

规划、

搜索、

调用工具、

重新推理、

验证、

调用第二个 Agent

然后再次推理。

一个用户任务可能触发:

几十次,

甚至:

几百次模型调用。

因此 Agentic AI 可能导致:

Token 需求出现指数级增长。

这意味着下一代 AI 芯片真正重要的不只是:

单颗芯片 TFLOPS。

还包括:

Memory

Data Reuse

Chip-to-Chip Communication

以及:

Scale-Up。

FuriosaAIBroadcom 的合作正是针对这一问题。

第三代芯片可能使用 HBM4

韩国政府 2026 年披露的产业支持资料还透露:

FuriosaAI 正在开发基于:

HBM4

的下一代产品。

项目暂称:

Stork。

该产品属于 FuriosaAI RNGD 之后的下一代 AI Accelerator 计划。

因此 FuriosaAI 的路线已经大致可以看成:

Warboy

RNGD

下一代 HBM4 / Scale-Up AI Accelerator。

Meta 曾经考虑收购 FuriosaAI

FuriosaAI 在 2025 年还有一件事情获得全球媒体大量关注。

Meta

曾与 FuriosaAI 讨论收购。

2025 年 3 月,多家媒体报道称:

Meta 提出的潜在收购价格大约:

8 亿美元。

但 FuriosaAI 最终没有继续完成交易。

根据当时报道,谈判失败并不主要是价格问题。

双方对于:

收购后的业务方向

和:

公司组织结构

存在分歧。

FuriosaAI 最终选择:

继续独立发展。

为什么 Meta 会对 FuriosaAI 感兴趣?

这其实并不难理解。

Meta 每天运行极其庞大的:

推荐模型、

广告模型、

Llama 大语言模型

以及:

AI 服务。

它已经成为全球最大的 AI 计算买家之一。

如果所有 AI Inference 都依赖 Nvidia

成本会极其巨大。

因此 Meta 一直在开发自己的:

MTIA AI Accelerator。

如果收购 FuriosaAI,就可能获得:

成熟 NPU 团队、

TCP 架构、

编译器

和:

RNGD 技术。

所以 Meta 的兴趣本身,说明 FuriosaAI 的技术已经引起全球大型 AI 企业关注。

FuriosaAI 拒绝 Meta 后继续融资

2025 年 7 月:

FuriosaAI 完成:

1.25 亿美元 Series C Bridge。

参与投资者包括:

Korea Development Bank

Industrial Bank of Korea

Keistone Partners

PI Partners

以及:

Kakao Investment。

融资完成以后,公司累计融资达到:

2.46 亿美元。

当时公开报道的公司估值约:

7.35 亿美元。

2026 年韩国政府又决定大规模支持 FuriosaAI

2026 年 5 月:

韩国 National Growth Fund,也就是:

国民成长基金

批准了针对 FuriosaAI 的大规模资金支持方案。

韩国政府资料显示,围绕 FuriosaAI 的直接股权投资计划规模:

约 8000 亿韩元。

其中包括先进战略产业基金等政策资金。

按当时汇率大致相当于:

5 亿多美元。

这笔资金主要用于:

RNGD 扩大量产

以及:

下一代 HBM4 AI 芯片研发。

这里需要注意:

这与公司 2025 年已经完成的 1.25 亿美元 Series C Bridge 不完全是一回事。

更加准确的说法是:

2026 年韩国政府已经批准对 FuriosaAI 的大型产业投资支持计划。

FuriosaAI 估值已经明显提高

随着 RNGD 开始量产,以及国家基金参与,韩国资本市场在 2026 年对 FuriosaAI 的估值预期明显提高。

韩国媒体报道,在新一轮融资和 Pre-IPO 讨论中,FuriosaAI 的估值已经被讨论到:

约 3 万亿韩元甚至更高。

不过这些数字仍与正在进行的融资和未来 IPO 有关。

因此不应该简单把它写成:

已经确定的公开市场市值。

截至 2026 年 8 月:

FuriosaAI 仍然是一家私人公司。

FuriosaAI 正在考虑 IPO

随着公司规模扩大,FuriosaAI 也开始进入:

Pre-IPO

阶段。

韩国媒体报道,公司正在评估:

韩国上市

以及:

美国 Nasdaq

等不同资本市场方案。

但截至:

2026 年 8 月

FuriosaAI 仍未正式成为上市公司。

因此目前最准确的状态是:

Private AI Semiconductor Company,正在为未来 IPO 扩大融资和业务规模。

FuriosaAI 与 Rebellions 是韩国最值得关注的两家 AI 芯片企业

如果观察韩国 AI 芯片产业:

目前最受关注的两家公司就是:

FuriosaAI

和:

Rebellions

两家公司都主要针对:

AI Inference。

但路线非常不同。

Rebellions 当前旗舰 Rebel100 采用:

4 Chiplet + UCIe + HBM3E

并向:

RebelServer、

RebelRack、

RebelPOD

扩展。

FuriosaAI RNGD 则更加突出:

TCP Architecture + 低功耗 + 现有空气冷却数据中心。

简单来说:

Rebellions 越来越强调:

Scale-Up AI Infrastructure。

FuriosaAI 目前则更强调:

Performance per Watt 和部署效率。

FuriosaAI 与 Groq 有什么不同?

Groq 同样专门做:

AI Inference。

但技术哲学也不同。

Groq 的:

LPU

强调:

确定性执行、

超低延迟

以及:

极高 Token Generation Speed。

FuriosaAI 则更加关注:

Tensor Contraction

和:

计算资源利用率。

Groq 更像是在问:

怎样让 Token 尽可能快地产生?

FuriosaAI 更像是在问:

怎样让整个数据中心用更少的电产生更多 Token?

FuriosaAI 与 Nvidia 最大的区别

Nvidia 的路线是:

GPU + CUDA + HBM + NVLink + Networking + DGX。

FuriosaAI 则是:

TCP NPU + HBM + Compiler + Furiosa LLM + RNGD Server。

Nvidia 最大优势仍然是:

General Purpose。

同一张 Nvidia GPU 可以:

训练 LLM

运行 LLM

进行科学计算、

运行图形程序

以及:

大量其他 CUDA 工作负载。

RNGD 则专门优化:

AI Inference。

这种专用性既是优势,也是风险。

专用 NPU 的优势是什么?

假设一家银行已经决定:

未来五年这套服务器只负责运行:

大型语言模型。

那么它并不一定需要:

图形功能、

HPC 功能

或者:

训练能力。

它真正需要的是:

每美元产生最多 Token。

每瓦产生最多 Token。

在这种情况下:

专门 AI Inference NPU

理论上可以比通用 GPU 更有效率。

这就是 FuriosaAI 的商业机会。

FuriosaAI 最大优势之一:极低功耗

RNGD 只有大约:

180W。

而一台 8 卡服务器大约:

3kW。

这使普通 15kW Air-Cooled Rack 可以部署多台服务器。

对于已经存在几十年的:

银行数据中心、

电信机房、

政府数据中心、

普通企业机房

而言,

这个优势可能比:

“峰值算力多 20%”

更加重要。

因为重新建设数据中心的成本可能远远超过芯片本身。

第二个优势:架构真正不同

很多所谓 Nvidia Challenger 实际上仍然沿着:

GPU Matrix Engine

思路设计。

FuriosaAI 的 TCP 至少是一种真正从:

Tensor Contraction

重新思考计算的数据流架构。

该架构研究还进入:

ISCA 2024

等国际计算机体系结构会议。

这说明 FuriosaAI 并不只是做:

“便宜版 GPU”。

它真正拥有自己的:

Computer Architecture。

第三个优势:已经有大型商业客户

LG AI Research 正式采用 RNGD,

Samsung SDS 推出 RNGD NPUaaS,

欧洲 Equinix 开始部署测试环境。

这些都说明 FuriosaAI 已经逐渐跨过:

只有 Benchmark,没有客户

这一阶段。

对于一家 AI 芯片创业公司而言,这非常重要。

第四个优势:已经进入量产

2026 年第一批:

4000 颗 RNGD

进入量产交付。

这说明 FuriosaAI 已经开始解决:

Yield、

封装、

HBM、

PCB、

Server Qualification

以及:

Supply Chain

等现实问题。

这些工程能力往往比芯片 Demo 更难建立。

第五个优势:韩国政府正在给予战略支持

韩国已经意识到:

虽然自己拥有世界领先的:

Samsung

和:

SK Hynix,

但真正高端 AI Processor 仍然高度依赖国外企业。

因此韩国近年来明显加强:

国产 AI Semiconductor

战略。

FuriosaAIRebellions 都成为重点支持企业。

2026 年批准的约:

8000 亿韩元 FuriosaAI 投资计划

说明 AI Logic Chip 已经被放到韩国国家产业战略层面。

FuriosaAI 最大挑战仍然是 CUDA

所有 Nvidia Challenger 最终都会遇到同一个问题:

CUDA。

AI 企业并不只是购买 GPU

它们已经围绕 Nvidia 建立:

PyTorch、

CUDA、

cuDNN、

NCCL、

TensorRT、

Triton

和:

各种模型部署工具。

如果换成 RNGD 以后:

模型不能跑,

性能工具不好用,

模型支持慢半年,

那么即使芯片更加省电,也很难迁移。

因此 FuriosaAI 必须持续投资:

Compiler 和 Software。

这也是公司近年来大量招聘软件和编译器专家的原因。

第二个挑战:48GB 显存并不算特别大

RNGD 拥有:

48GB HBM3。

对于很多:

7B、

8B、

32B

模型已经非常实用。

但是对于:

70B、

120B

以及:

更大型模型,

就需要:

多卡并行。

一旦进入多卡:

PCIe P2P、

通信效率、

Tensor Parallelism

就变得非常重要。

FuriosaAI 已经在软件中加入多卡 Tensor Parallelism,但未来能不能扩大到更大规模,仍然是重要挑战。

这也是第三代产品为什么越来越重视:

Scale-Up。

第三个挑战:FuriosaAI 目前主要还是推理公司

RNGD 是:

Inference Accelerator。

这让它可以围绕推理做极强优化。

但也意味着客户如果同时需要:

Training,

仍然可能需要 NvidiaAMD 或其他训练平台。

企业可能面临:

训练使用一个生态,

推理又迁移到另一个生态。

是否值得承担这部分软件和运维复杂度,需要取决于:

推理规模到底有多大。

第四个挑战:未来 GPU 也会越来越省电

FuriosaAI 现在最大的优势之一是:

Performance per Watt。

NvidiaAMD 不会停止进步。

GPU 架构、

低精度计算、

HBM、

先进封装

和:

推理软件

都会持续优化。

所以 FuriosaAI 必须做到:

不仅今天比 GPU 更节能,而且下一代仍然保持足够大的差距。

这也是为什么公司必须迅速从:

RNGD

进入:

第三代 HBM4 产品。

第五个挑战:量产规模仍然需要扩大

4000 颗 RNGD 是重要里程碑。

但是与 Nvidia 每年巨大的数据中心 GPU 出货相比,仍然非常小。

真正进入:

Hyperscaler

市场以后,

客户需要的可能是:

1 万颗、

10 万颗

甚至更多。

FuriosaAI 必须证明自己的:

晶圆、

HBM、

CoWoS、

板卡

和:

服务器供应链

能够支持真正大规模增长。

为什么 FuriosaAI 值得长期关注?

FuriosaAI 最有意思的地方不是:

“韩国又出现一家 Nvidia Challenger。”

而是它提出了一个越来越重要的问题:

未来 AI 数据中心最稀缺的资源到底是什么?

过去答案可能是:

算力。

但未来答案越来越可能是:

电力。

当一座 AI 数据中心拥有足够资金购买 GPU,却没有更多电可以供给服务器时:

峰值 FLOPS 就不再是唯一重要指标。

真正重要的是:

Tokens per Watt。

而这恰好是 FuriosaAI 从 RNGD 开始最集中攻击的问题。

AI 推理可能比训练形成更大的长期市场

训练一个模型可能只发生:

一次,

或者:

几年内训练很多次。

但是模型部署以后,每天可能被:

几百万、

几千万

甚至:

数亿用户

反复调用。

AI Agent 又会让每个用户请求产生:

更多 Token。

所以长期来看:

Inference Compute

完全可能成为比训练更加庞大的计算需求。

这也是为什么:

Groq

Rebellions

SambaNova

以及:

FuriosaAI

都在押注:

Inference。

FuriosaAI 最终并不需要取代 Nvidia 才能成功

FuriosaAI 不需要让全球所有数据中心:

Nvidia GPU 全部扔掉。

只要它能够证明:

在企业 LLM Inference 中,

RNGD 可以实现:

足够高性能、

明显更低功耗、

更低 TCO

并且:

软件迁移足够简单,

就可能获得相当大的市场。

尤其是在:

Enterprise AI

Private AI

Sovereign AI

和:

传统空气冷却数据中心

这几个市场中。

总结

FuriosaAI 是韩国 AI 芯片产业中技术路线非常独特的一家公司。

公司从:

2017 年开始研发

到:

2021 年 Warboy

再到:

2024 年 RNGD

以及:

2026 年 RNGD 正式量产

已经完成从传统 Computer Vision NPU 向大型语言模型 AI Accelerator 的转型。

第一代:

Warboy

主要解决:

图像识别、

物体检测

和:

Vision AI

第二代:

RNGD

则直接进入:

LLM

VLM、

Generative AI

和:

Agentic AI

RNGD 当前拥有:

TSMC 5nm

512 TFLOPS FP8

48GB HBM3

1.5TB/s HBM 带宽

256MB SRAM

以及:

约 180W TDP。

一台:

NXT RNGD Server

可以安装:

8 张 RNGD,

提供:

384GB HBM3

和:

约 4.1 PFLOPS FP8

同时整机功耗控制在:

约 3kW。

在商业化方面:

LG AI Research 已经采用 RNGD 运行 EXAONE;

Samsung SDS 已经推出基于 RNGD 的 NPUaaS;

欧洲 Equinix 数据中心开始提供测试和部署环境;

2026 年首批约 4000 颗 RNGD 已进入量产交付。

更加值得注意的是:

2025 年 FuriosaAI 拒绝了媒体报道中 Meta 约 8 亿美元的潜在收购方案,选择继续独立发展。

随后,公司完成:

1.25 亿美元 Series C Bridge

累计融资达到:

2.46 亿美元。

到了 2026 年,韩国国家成长基金又批准了围绕 FuriosaAI、规模约:

8000 亿韩元

的战略投资支持方案,用于扩大 RNGD 量产并开发基于 HBM4 的下一代 AI 芯片

FuriosaAI 下一阶段真正需要证明的,并不是:

RNGD 的 TOPS 数字够不够漂亮。

而是几个更加重要的问题:

TCP 架构能不能持续适应快速变化的 AI 模型?

Furiosa SDK 能不能把从 CUDA 迁移过来的成本降到足够低?

RNGD 能不能从几千颗扩大到数万甚至十万颗商业部署?

下一代 HBM4 + Scale-Up 产品能不能真正进入大型 Agentic AI 数据中心?

如果这些问题能够逐步解决,FuriosaAI 很可能不会只是:

“另一家韩国 NPU 公司”。

它可能代表 AI 芯片行业一条越来越重要的路线:

不用最大功耗追求最高峰值算力,而是用更高的计算利用率,在有限电力下产生更多 Token。

而在 AI 数据中心越来越受制于电力和散热的时代,这条路线可能比单纯追求更大的 GPU 更有价值。

Entires个相关