FuriosaAI:韩国高能效 AI 推理芯片公司,以 RNGD 挑战 GPU
FuriosaAI 是一家来自韩国的 AI 芯片企业,专注于 数据中心 AI 推理芯片、NPU、大语言模型推理服务器和高能效 AI 基础设施。
如果说 Rebellions 的路线正在向:
NPU + Chiplet + AI Factory
发展,那么 FuriosaAI 的技术哲学更加集中:
用完全针对神经网络重新设计的处理器架构,提高 AI 推理的实际利用率,同时大幅降低数据中心功耗。
公司认为传统 GPU 最初并不是为了 Transformer、大语言模型和 Agentic AI 而设计,因此很多晶体管、数据移动和计算资源并不能始终得到充分利用。
FuriosaAI 希望从计算架构底层重新解决这个问题。
公司第一代芯片:
Warboy
主要针对计算机视觉。
第二代:
RNGD,读作 Renegade
则直接进入:
LLM、VLM、生成式 AI 和 Agentic AI 推理。
截至 2026 年,RNGD 已经进入量产,公司正在从一家韩国 AI 芯片创业公司逐渐转向国际企业级 AI 推理基础设施供应商。
FuriosaAI 成立于 2017 年
FuriosaAI 成立于:
2017 年。
总部位于韩国首尔。
公司是一家典型的:
Fabless Semiconductor Company
也就是无晶圆厂半导体公司。
它自己负责:
处理器架构、
芯片设计、
Compiler、
Runtime、
AI 软件
以及服务器解决方案。
芯片制造则交给:
Samsung Foundry
和:
等晶圆代工厂。
FuriosaAI 的创始团队拥有 Samsung、AMD、Qualcomm 等国际芯片公司的研发经验。
创始人 June Paik 曾在 Samsung 和 AMD 工作
FuriosaAI 创始人兼 CEO 是:
June Paik
韩文名通常译作:
白俊浩。
June Paik 拥有超过二十年的半导体和计算机体系结构经验。
他曾经在:
Samsung Electronics
和:
他拥有 Georgia Institute of Technology,也就是佐治亚理工学院电子工程硕士学位。
这段职业经历对于理解 FuriosaAI 很重要。
公司并不是从 AI 软件开始,然后寻找一家 ASIC 公司帮忙制造芯片。
它从成立开始就是一家:
Computer Architecture Company。
FuriosaAI 希望回答的问题是:
如果今天重新设计一种真正为神经网络而生的处理器,它还有必要长得像传统 GPU 吗?
FuriosaAI 的名字来自《疯狂的麦克斯》
Furiosa 这个名字也很特别。
它来自电影:
Mad Max: Fury Road
中的角色:
Furiosa。
因此公司后来第二代处理器:
RNGD
也选择了:
Renegade
这个带有“反叛者”意味的名字。
这种命名其实与公司的定位非常一致:
第一代 AI 芯片:Warboy
FuriosaAI 第一代真正商业化的 NPU 是:
Warboy。
Warboy 于:
2021 年发布。
它主要面向:
Computer Vision Inference。
例如:
图像分类、
物体检测、
OCR、
姿态识别、
超分辨率
以及:
智能视频分析。
FuriosaAI 官方资料显示,Warboy 于 2023 年与 Samsung Foundry 和 ASUS 合作进入正式批量生产。
Warboy 的主要规格
Warboy 可以提供:
64 TOPS
AI 计算能力。
芯片内部拥有:
32MB SRAM。
一颗 Warboy 包含:
两个 Processing Element。
每个 PE 提供:
32 TOPS。
两个 PE 还可以独立运行不同 AI 工作负载。
显存最高:
32GB LPDDR4X
内存带宽约:
66GB/s。
接口:
PCIe Gen4 ×8。
整卡功耗可以配置在大约:
40W—60W。
这套设计已经体现 FuriosaAI 最早的技术路线:
不追求最高峰值 TOPS,而追求低 Batch、低延迟和更高计算资源利用率。
Warboy 曾进入 MLPerf
Warboy 对 FuriosaAI 另外一个重要意义,是让这家韩国创业公司第一次获得国际 AI 芯片市场关注。
2021 年,FuriosaAI 使用第一代 NPU 参加:
MLPerf Inference。
公司成为当时少数能够在国际标准 AI Benchmark 中与 Nvidia 产品直接比较的亚洲 AI 芯片创业企业之一。
但 Warboy 仍然属于上一代 AI 时代。
它最适合:
CNN、
Vision
和传统深度学习。
当 ChatGPT、Llama、DeepSeek 等大语言模型快速出现以后,AI 芯片面对的问题彻底变化。
大语言模型改变了 FuriosaAI
传统 Computer Vision 模型可能只有:
几百万、
几千万
或者:
几亿参数。
但是大型语言模型可能拥有:
70 亿、
320 亿、
700 亿
甚至:
数千亿参数。
芯片突然需要解决完全不同的问题:
更大的模型权重
KV Cache
更高显存容量
更高内存带宽
更复杂的 Transformer 运算
以及:
巨大的 Token 推理成本。
因此 FuriosaAI 第二代产品几乎重新思考了整个架构。
这就是:
RNGD。
RNGD:FuriosaAI 真正进入 LLM 时代
RNGD。
读音:
Renegade。
RNGD 于:
2024 年正式公开。
2025 年开始向全球大型客户送样。
到了:
2026 年
正式进入规模量产。
如果 Warboy 是 FuriosaAI 的:
Computer Vision NPU
那么 RNGD 才是公司真正挑战数据中心 GPU 的产品。
它主要针对:
Multimodal AI
Generative AI
Agentic AI
以及传统:
Vision Model。
RNGD 没有采用传统矩阵处理器思路
RNGD 最重要的创新是:
Tensor Contraction Processor,TCP。
中文可以翻译成:
张量收缩处理器。
这是 FuriosaAI 自主研发的新型 AI Processor Architecture。
公司认为很多传统 AI Accelerator 的基本思路仍然是:
Matrix Multiplication,也就是矩阵乘法。
但是现代深度学习模型本质上处理的是:
Tensor,张量。
而现代 AI 模型中的大量数学运算,本质上可以表示成:
Tensor Contraction,张量收缩。
因此 FuriosaAI 干脆直接围绕:
Tensor Contraction
设计处理器。
什么是 Tensor Contraction?
最简单理解:
矩阵乘法其实可以看成:
Tensor Contraction 的一种特殊情况。
例如:
两个二维矩阵相乘。
但是神经网络里面的数据很多时候不只是二维。
可能是:
三维、
四维
甚至:
更高维 Tensor。
Transformer 中的:
Attention、
Linear Layer
以及其他运算,
都涉及复杂张量关系。
如果处理器只为固定矩阵乘法设计,那么:
复杂 Tensor 运算首先需要被拆成大量更简单操作。
FuriosaAI 的思路则是:
让硬件直接理解更高级的 Tensor Contraction。
这可以给编译器更大的优化空间。
TCP 的核心目标是提高利用率
Peak FLOPS。
一颗芯片可能标称:
1000 TFLOPS。
但真实运行模型时,并不意味着:
这 1000 TFLOPS 一直全部工作。
计算核心可能因为:
内存等待、
数据依赖、
不同 Tensor Shape、
通信
或者:
模型结构
而大量空闲。
因此真正重要的是:
Utilization。
FuriosaAI 的 TCP 架构希望根据模型 Tensor 运算,在编译阶段设计更加合适的数据流。
简单来说:
不是让模型勉强适应硬件。
而是:
尽量让硬件的数据流适应模型。
这也是 FuriosaAI 把 Compiler 看得非常重要的原因。
RNGD 使用 TSMC 5nm
RNGD 采用:
TSMC 5nm
制造。
工作频率:
1.0GHz。
当前官方规格达到:
256 TFLOPS BF16
512 TFLOPS FP8
512 TOPS INT8
以及:
1024 TOPS INT4。
这是非常完整的一组 AI 数据格式。
BF16 和 FP8 主要适合:
高性能 AI 模型。
INT8 和 INT4 则更加适合:
量化推理。
48GB HBM3
RNGD 一个非常重要的升级是:
HBM3。
每张 RNGD 卡配备:
48GB HBM3。
使用:
两个 HBM3 Stack。
总显存带宽达到:
1.5TB/s。
芯片内部还有:
256MB SRAM。
这与 Warboy 的 LPDDR4X 已经完全不是一个级别。
原因就是:
LLM 极度依赖内存带宽。
为什么 LLM 这么需要 HBM?
假设一个模型拥有:
70 亿参数。
即使每个参数只使用:
2 Bytes,
模型权重也需要:
大约 14GB。
如果模型增加到:
320 亿参数,
仅模型本身就可能需要:
几十 GB。
而运行模型时还需要:
KV Cache
和各种中间数据。
更加重要的是:
每生成一个 Token,
模型都需要不断读取大量 Weight。
如果 AI Core 运算速度非常快,但显存只能慢慢把权重送过来,那么芯片大部分时间就在:
等数据。
所以现代 AI Accelerator 已经越来越像:
Compute Engine + Memory System。
RNGD 的:
1.5TB/s HBM3
就是为了缓解这个问题。
RNGD 最大特点之一:功耗只有约 180W
目前 FuriosaAI 官方页面给出的 RNGD TDP 为:
180W。
这也是 FuriosaAI 最核心的商业卖点之一。
与很多大型数据中心 GPU 相比:
180W 非常低。
而且它仍然可以提供:
512 TFLOPS FP8
以及:
48GB HBM3。
FuriosaAI 因此不只是强调:
Performance。
更加重视:
Performance per Watt。
为什么功耗越来越重要?
AI 数据中心正在遇到一个非常现实的问题:
电不够。
一台高端 AI 服务器可能消耗:
几千瓦。
一个大型 AI Rack 可能消耗:
几十甚至上百千瓦。
整个 AI 数据中心可能需要:
数百兆瓦。
甚至未来可能进入:
Gigawatt
级别。
但是大量传统企业数据中心仍然只有:
十几 kW 每机柜
的供电和空气冷却能力。
如果为了部署 AI 必须重新建设:
供电、
变压器、
液冷
甚至整个数据中心,
成本会非常高。
FuriosaAI 因此提出一个很现实的市场定位:
不要让企业为了运行 AI 去重建数据中心。
RNGD 可以继续使用空气冷却
因为 RNGD 单卡只有大约:
180W。
它可以继续采用:
Passive Air Cooling。
也就是服务器风道空气冷却。
这让 FuriosaAI 可以直接进入大量现有:
企业数据中心、
金融数据中心、
运营商机房
和:
私有云。
不需要首先建设复杂液冷系统。
这可能是 RNGD 最重要的商业优势之一。
NXT RNGD Server:8 张 RNGD 组成一台服务器
公司推出:
NXT RNGD Server。
一台 NXT RNGD Server 安装:
8 张 RNGD。
因此整台服务器拥有:
384GB HBM3
总显存带宽:
12TB/s。
FP8 算力达到:
4096 TFLOPS
也就是约:
4.1 PFLOPS。
FP16 算力:
2048 TFLOPS。
整机功耗:
约 3kW。
3kW 为什么很重要?
一台服务器功耗只有约:
3kW,
意味着一个普通:
15kW Air-Cooled Rack
理论上可以安装:
5 台 RNGD Server。
也就是:
40 张 RNGD。
这样 FuriosaAI 就能够充分利用:
传统企业机房。
这与很多需要特殊高功率机柜和液冷设施的高端 GPU 系统形成明显区别。
FuriosaAI 押注的是:
世界上绝大多数企业数据中心不会为了 AI 全部重新建设。
如果这个判断成立,那么低功耗 AI Inference Accelerator 会拥有非常大的市场。
RNGD 可以虚拟成 8 个独立 NPU
RNGD 另外一个很有意思的功能是:
Multi-Instance。
一张 RNGD 可以划分成:
2 个、
4 个
或者:
8 个独立 NPU Instance。
并支持:
SR-IOV。
每个虚拟 NPU 拥有自己独立的:
计算核心
和:
内存带宽。
这对于:
Cloud AI
特别重要。
因为云服务商并不总是希望:
一名客户占用整张 AI 卡。
可能:
客户 A 使用 1/8,
客户 B 使用 1/8,
其他客户继续使用剩余资源。
这可以明显提高:
Hardware Utilization。
FuriosaAI 软件栈
真正决定 RNGD 能不能成功的,很可能不是芯片。
而是:
Software。
其中包括:
Furiosa Compiler
负责把神经网络模型映射到 TCP 架构。
Furiosa Runtime
负责实际管理 NPU。
Furiosa LLM
负责大型语言模型推理和 Serving。
还有:
量化工具、
模型优化工具、
Profiler
以及:
Model Zoo。
FuriosaAI 没有试图让用户重新学习一套 AI 框架
这一点很重要。
如果开发者为了使用 RNGD 必须放弃:
PyTorch,
重新学习:
Furiosa Language,
这几乎是不现实的。
所以 FuriosaAI 软件战略非常明确:
尽量保留开发者已经熟悉的生态。
目前 RNGD 软件已经支持:
PyTorch 2.x
以及:
torch.compile。
Furiosa LLM 则采用:
vLLM-compatible
接口。
同时支持:
OpenAI-compatible API。
也就是说,理想情况下:
原来使用:
的应用,
不需要完全重新设计。
Furiosa SDK 更新速度很快
FuriosaAI 近年来明显加快软件开发。
2026 年 6 月,公司发布:
Furiosa SDK 2026.3。
继续增加新的 Kernel Framework 和模型支持。
这说明 FuriosaAI 已经认识到一个现实:
而是:
模型每天都在变。
今天是:
Llama。
明天是:
后天又可能是:
Qwen、
Gemma、
gpt-oss
或者新的 MoE 模型。
芯片必须迅速跟上。
RNGD 已经运行 120B 参数 gpt-oss
gpt-oss 120B
运行在 RNGD 上。
公司表示:
只需要:
两张 RNGD 卡
即可运行这一 120B 参数模型。
这里需要说明:
运行一个模型,并不代表性能一定全面超过 GPU。
但它至少证明:
RNGD 已经真正从传统 NPU 进入:
Frontier LLM Inference。
LG AI Research 是 FuriosaAI 最重要的商业突破之一
2025 年 7 月:
LG AI Research
正式宣布采用 RNGD。
这是 FuriosaAI 发展历史中非常重要的一笔订单。
LG AI Research 使用自己的:
EXAONE
大型语言模型对 RNGD 进行了长期测试。
最终决定采用 RNGD 运行:
企业 AI 推理。
这件事比任何 FuriosaAI 自己公布的 Benchmark 都更加重要。
因为这是:
真实大型企业客户测试以后做出的商业选择。
LG 测试中性能功耗比提高 2.25 倍
根据 LG AI Research 与 FuriosaAI 公布的测试:
在 EXAONE LLM 推理中,
RNGD 的:
Performance per Watt
达到此前 GPU 方案的:
2.25 倍。
在相同 Rack 电力限制下,RNGD 系统可以产生:
约 3.75 倍 Token。
这里需要注意:
这是 LG 针对特定 EXAONE 模型和部署环境进行的测试。
不能简单理解成:
“RNGD 比所有 Nvidia GPU 快 2.25 倍。”
更加准确的说法是:
在 LG AI Research 测试的特定 LLM 推理场景中,RNGD 展现出了明显的性能功耗优势。
EXAONE 32B 已经实际运行
LG AI Research 还使用:
4 张 RNGD
运行:
EXAONE 3.5 32B。
在 Batch Size 1 条件下:
4K Context 约达到:
60 tokens/s。
32K Context 约达到:
50 tokens/s。
这种 Benchmark 比只公布 TFLOPS 更有意义。
因为最终用户真正关心的是:
一个模型到底每秒能生成多少 Token。
2026 年 RNGD 正式进入量产
FuriosaAI 在:
2026 年 1 月 27 日
宣布 RNGD 正式进入规模量产。
公司表示已经收到首批:
4000 颗 RNGD
量产产品。
制造和供应链合作伙伴包括:
和:
ASUS。
这对于 FuriosaAI 是一个非常重要的里程碑。
Demo
跨越到:
Mass Production。
很多创业公司能够设计芯片。
真正做到:
稳定制造几千、几万颗
并交付企业客户,
则困难得多。
FuriosaAI 已经开始进入欧洲
2026 年 7 月:
FuriosaAI 宣布在:
Equinix Lisbon LS2 数据中心
部署 RNGD Server。
企业客户可以在欧洲直接测试:
RNGD
和:
FuriosaAI 软件平台。
公司同时在葡萄牙里斯本建立欧洲旗舰办公室。
这表明 FuriosaAI 已经不再满足于韩国市场。
它正在进入:
Europe Enterprise AI。
Furiosa Access 已经覆盖多个地区
截至 2026 年,企业可以通过 Furiosa Access 在多个地区测试 RNGD。
包括:
Seoul
Bay Area
Lisbon
以及:
Johor Bahru。
这使 FuriosaAI 从韩国创业公司逐渐建立:
Global Evaluation Infrastructure。
因为企业通常不会仅凭网页参数购买数百万美元服务器。
它们首先需要:
运行自己的模型,
测试自己的 Context Length,
测试自己的 Batch Size,
然后比较:
性能、
功耗
和:
TCO。
Samsung SDS 推出韩国首个国产 NPUaaS
2026 年,FuriosaAI 又获得一个非常重要的商业突破:
Samsung SDS。
Samsung SDS 宣布基于:
Furiosa RNGD
推出韩国首个国产:
NPU-as-a-Service,NPUaaS。
也就是说:
客户不需要自己购买 RNGD Server。
可以像租 GPU Cloud 一样:
直接租用 FuriosaAI NPU 算力。
这对于 FuriosaAI 的生态意义很大。
开发者可以先:
使用云端 RNGD,
等业务规模扩大后再考虑:
On-Premise 部署。
Samsung 对 FuriosaAI 的意义不只是客户
Samsung 与 FuriosaAI 的关系其实已经持续很长时间。
第一代 Warboy 就使用:
Samsung Foundry 14nm。
到了 RNGD,则转向:
TSMC 5nm。
但 Samsung 体系继续通过:
Samsung SDS
等业务与 FuriosaAI 合作。
这说明 FuriosaAI 并没有把自己绑定在单一韩国供应链,而是根据不同产品选择:
最适合的 Foundry 和系统合作伙伴。
SK Hynix 也是重要生态伙伴
RNGD 使用:
HBM3。
韩国恰好拥有全球最重要的 HBM 企业:
SK Hynix。
FuriosaAI 官方已经把 SK Hynix 列为其全球生态合作伙伴之一。
韩国已经拥有非常成熟的:
DRAM、
HBM
和:
先进半导体供应链。
2026 年与 Broadcom 合作开发第三代 AI 芯片
FuriosaAI 已经开始准备下一代产品。
2026 年 5 月
公司宣布与:
建立战略合作。
双方将共同开发:
第三代 AI Accelerator。
新一代产品重点针对:
Agentic AI
以及:
大规模推理基础设施。
这是一个非常重要的发展方向。
因为 RNGD 仍然主要是一张:
PCIe Accelerator。
下一代产品将更加重视:
Scale-Up。
为什么 Agentic AI 会改变芯片?
普通 Chatbot 可能是:
用户问一次,
模型回答一次。
但是 AI Agent 可能需要:
规划、
搜索、
调用工具、
重新推理、
验证、
调用第二个 Agent
然后再次推理。
一个用户任务可能触发:
几十次,
甚至:
几百次模型调用。
因此 Agentic AI 可能导致:
Token 需求出现指数级增长。
单颗芯片 TFLOPS。
还包括:
Data Reuse
Chip-to-Chip Communication
以及:
Scale-Up。
FuriosaAI 与 Broadcom 的合作正是针对这一问题。
第三代芯片可能使用 HBM4
韩国政府 2026 年披露的产业支持资料还透露:
FuriosaAI 正在开发基于:
HBM4
的下一代产品。
项目暂称:
Stork。
该产品属于 FuriosaAI RNGD 之后的下一代 AI Accelerator 计划。
因此 FuriosaAI 的路线已经大致可以看成:
Warboy
↓
RNGD
↓
下一代 HBM4 / Scale-Up AI Accelerator。
Meta 曾经考虑收购 FuriosaAI
FuriosaAI 在 2025 年还有一件事情获得全球媒体大量关注。
Meta
曾与 FuriosaAI 讨论收购。
2025 年 3 月,多家媒体报道称:
Meta 提出的潜在收购价格大约:
8 亿美元。
但 FuriosaAI 最终没有继续完成交易。
根据当时报道,谈判失败并不主要是价格问题。
双方对于:
收购后的业务方向
和:
公司组织结构
存在分歧。
FuriosaAI 最终选择:
继续独立发展。
为什么 Meta 会对 FuriosaAI 感兴趣?
这其实并不难理解。
Meta 每天运行极其庞大的:
推荐模型、
广告模型、
Llama 大语言模型
以及:
AI 服务。
它已经成为全球最大的 AI 计算买家之一。
成本会极其巨大。
因此 Meta 一直在开发自己的:
MTIA AI Accelerator。
如果收购 FuriosaAI,就可能获得:
成熟 NPU 团队、
TCP 架构、
编译器
和:
RNGD 技术。
所以 Meta 的兴趣本身,说明 FuriosaAI 的技术已经引起全球大型 AI 企业关注。
FuriosaAI 拒绝 Meta 后继续融资
2025 年 7 月:
FuriosaAI 完成:
1.25 亿美元 Series C Bridge。
参与投资者包括:
Korea Development Bank
Industrial Bank of Korea
Keistone Partners
PI Partners
以及:
Kakao Investment。
融资完成以后,公司累计融资达到:
2.46 亿美元。
当时公开报道的公司估值约:
7.35 亿美元。
2026 年韩国政府又决定大规模支持 FuriosaAI
2026 年 5 月:
韩国 National Growth Fund,也就是:
国民成长基金
批准了针对 FuriosaAI 的大规模资金支持方案。
韩国政府资料显示,围绕 FuriosaAI 的直接股权投资计划规模:
约 8000 亿韩元。
其中包括先进战略产业基金等政策资金。
按当时汇率大致相当于:
5 亿多美元。
这笔资金主要用于:
RNGD 扩大量产
以及:
这里需要注意:
这与公司 2025 年已经完成的 1.25 亿美元 Series C Bridge 不完全是一回事。
更加准确的说法是:
2026 年韩国政府已经批准对 FuriosaAI 的大型产业投资支持计划。
FuriosaAI 估值已经明显提高
随着 RNGD 开始量产,以及国家基金参与,韩国资本市场在 2026 年对 FuriosaAI 的估值预期明显提高。
韩国媒体报道,在新一轮融资和 Pre-IPO 讨论中,FuriosaAI 的估值已经被讨论到:
约 3 万亿韩元甚至更高。
不过这些数字仍与正在进行的融资和未来 IPO 有关。
因此不应该简单把它写成:
已经确定的公开市场市值。
截至 2026 年 8 月:
FuriosaAI 仍然是一家私人公司。
FuriosaAI 正在考虑 IPO
随着公司规模扩大,FuriosaAI 也开始进入:
Pre-IPO
阶段。
韩国媒体报道,公司正在评估:
韩国上市
以及:
美国 Nasdaq
等不同资本市场方案。
但截至:
2026 年 8 月
FuriosaAI 仍未正式成为上市公司。
因此目前最准确的状态是:
Private AI Semiconductor Company,正在为未来 IPO 扩大融资和业务规模。
FuriosaAI 与 Rebellions 是韩国最值得关注的两家 AI 芯片企业
目前最受关注的两家公司就是:
FuriosaAI
和:
两家公司都主要针对:
AI Inference。
但路线非常不同。
Rebellions 当前旗舰 Rebel100 采用:
4 Chiplet + UCIe + HBM3E
并向:
RebelServer、
RebelRack、
RebelPOD
扩展。
FuriosaAI RNGD 则更加突出:
TCP Architecture + 低功耗 + 现有空气冷却数据中心。
简单来说:
Rebellions 越来越强调:
Scale-Up AI Infrastructure。
FuriosaAI 目前则更强调:
Performance per Watt 和部署效率。
FuriosaAI 与 Groq 有什么不同?
Groq 同样专门做:
AI Inference。
但技术哲学也不同。
Groq 的:
LPU
强调:
确定性执行、
超低延迟
以及:
极高 Token Generation Speed。
FuriosaAI 则更加关注:
Tensor Contraction
和:
计算资源利用率。
Groq 更像是在问:
怎样让 Token 尽可能快地产生?
FuriosaAI 更像是在问:
怎样让整个数据中心用更少的电产生更多 Token?
FuriosaAI 与 Nvidia 最大的区别
Nvidia 的路线是:
GPU + CUDA + HBM + NVLink + Networking + DGX。
FuriosaAI 则是:
TCP NPU + HBM + Compiler + Furiosa LLM + RNGD Server。
Nvidia 最大优势仍然是:
General Purpose。
训练 LLM、
运行 LLM、
进行科学计算、
运行图形程序
以及:
大量其他 CUDA 工作负载。
RNGD 则专门优化:
AI Inference。
这种专用性既是优势,也是风险。
专用 NPU 的优势是什么?
假设一家银行已经决定:
未来五年这套服务器只负责运行:
大型语言模型。
那么它并不一定需要:
图形功能、
HPC 功能
或者:
训练能力。
它真正需要的是:
每美元产生最多 Token。
每瓦产生最多 Token。
在这种情况下:
专门 AI Inference NPU
理论上可以比通用 GPU 更有效率。
这就是 FuriosaAI 的商业机会。
FuriosaAI 最大优势之一:极低功耗
RNGD 只有大约:
180W。
而一台 8 卡服务器大约:
3kW。
这使普通 15kW Air-Cooled Rack 可以部署多台服务器。
对于已经存在几十年的:
银行数据中心、
电信机房、
政府数据中心、
普通企业机房
而言,
这个优势可能比:
“峰值算力多 20%”
更加重要。
因为重新建设数据中心的成本可能远远超过芯片本身。
第二个优势:架构真正不同
很多所谓 Nvidia Challenger 实际上仍然沿着:
GPU Matrix Engine
思路设计。
FuriosaAI 的 TCP 至少是一种真正从:
Tensor Contraction
重新思考计算的数据流架构。
该架构研究还进入:
ISCA 2024
等国际计算机体系结构会议。
这说明 FuriosaAI 并不只是做:
“便宜版 GPU”。
它真正拥有自己的:
Computer Architecture。
第三个优势:已经有大型商业客户
LG AI Research 正式采用 RNGD,
Samsung SDS 推出 RNGD NPUaaS,
欧洲 Equinix 开始部署测试环境。
这些都说明 FuriosaAI 已经逐渐跨过:
只有 Benchmark,没有客户
这一阶段。
第四个优势:已经进入量产
2026 年第一批:
4000 颗 RNGD
进入量产交付。
这说明 FuriosaAI 已经开始解决:
Yield、
封装、
HBM、
PCB、
Server Qualification
以及:
Supply Chain
等现实问题。
这些工程能力往往比芯片 Demo 更难建立。
第五个优势:韩国政府正在给予战略支持
韩国已经意识到:
虽然自己拥有世界领先的:
和:
SK Hynix,
但真正高端 AI Processor 仍然高度依赖国外企业。
因此韩国近年来明显加强:
国产 AI Semiconductor
战略。
FuriosaAI 和 Rebellions 都成为重点支持企业。
2026 年批准的约:
8000 亿韩元 FuriosaAI 投资计划
说明 AI Logic Chip 已经被放到韩国国家产业战略层面。
FuriosaAI 最大挑战仍然是 CUDA
所有 Nvidia Challenger 最终都会遇到同一个问题:
CUDA。
它们已经围绕 Nvidia 建立:
PyTorch、
CUDA、
cuDNN、
NCCL、
TensorRT、
Triton
和:
各种模型部署工具。
如果换成 RNGD 以后:
模型不能跑,
性能工具不好用,
模型支持慢半年,
那么即使芯片更加省电,也很难迁移。
因此 FuriosaAI 必须持续投资:
Compiler 和 Software。
这也是公司近年来大量招聘软件和编译器专家的原因。
第二个挑战:48GB 显存并不算特别大
RNGD 拥有:
48GB HBM3。
对于很多:
7B、
8B、
32B
模型已经非常实用。
但是对于:
70B、
120B
以及:
更大型模型,
就需要:
多卡并行。
一旦进入多卡:
PCIe P2P、
通信效率、
Tensor Parallelism
就变得非常重要。
FuriosaAI 已经在软件中加入多卡 Tensor Parallelism,但未来能不能扩大到更大规模,仍然是重要挑战。
这也是第三代产品为什么越来越重视:
Scale-Up。
第三个挑战:FuriosaAI 目前主要还是推理公司
RNGD 是:
Inference Accelerator。
这让它可以围绕推理做极强优化。
但也意味着客户如果同时需要:
Training,
企业可能面临:
训练使用一个生态,
推理又迁移到另一个生态。
是否值得承担这部分软件和运维复杂度,需要取决于:
推理规模到底有多大。
第四个挑战:未来 GPU 也会越来越省电
FuriosaAI 现在最大的优势之一是:
Performance per Watt。
GPU 架构、
低精度计算、
HBM、
先进封装
和:
推理软件
都会持续优化。
所以 FuriosaAI 必须做到:
不仅今天比 GPU 更节能,而且下一代仍然保持足够大的差距。
这也是为什么公司必须迅速从:
RNGD
进入:
第三代 HBM4 产品。
第五个挑战:量产规模仍然需要扩大
4000 颗 RNGD 是重要里程碑。
但是与 Nvidia 每年巨大的数据中心 GPU 出货相比,仍然非常小。
真正进入:
Hyperscaler
市场以后,
客户需要的可能是:
1 万颗、
10 万颗
甚至更多。
FuriosaAI 必须证明自己的:
晶圆、
HBM、
CoWoS、
板卡
和:
服务器供应链
能够支持真正大规模增长。
为什么 FuriosaAI 值得长期关注?
FuriosaAI 最有意思的地方不是:
“韩国又出现一家 Nvidia Challenger。”
而是它提出了一个越来越重要的问题:
未来 AI 数据中心最稀缺的资源到底是什么?
过去答案可能是:
算力。
但未来答案越来越可能是:
电力。
当一座 AI 数据中心拥有足够资金购买 GPU,却没有更多电可以供给服务器时:
峰值 FLOPS 就不再是唯一重要指标。
真正重要的是:
Tokens per Watt。
而这恰好是 FuriosaAI 从 RNGD 开始最集中攻击的问题。
AI 推理可能比训练形成更大的长期市场
训练一个模型可能只发生:
一次,
或者:
几年内训练很多次。
但是模型部署以后,每天可能被:
几百万、
几千万
甚至:
数亿用户
反复调用。
AI Agent 又会让每个用户请求产生:
更多 Token。
所以长期来看:
Inference Compute
完全可能成为比训练更加庞大的计算需求。
这也是为什么:
Groq、
SambaNova
以及:
FuriosaAI
都在押注:
Inference。
FuriosaAI 最终并不需要取代 Nvidia 才能成功
FuriosaAI 不需要让全球所有数据中心:
只要它能够证明:
在企业 LLM Inference 中,
RNGD 可以实现:
足够高性能、
明显更低功耗、
更低 TCO
并且:
软件迁移足够简单,
就可能获得相当大的市场。
尤其是在:
Enterprise AI
Private AI
Sovereign AI
和:
传统空气冷却数据中心
这几个市场中。
总结
FuriosaAI 是韩国 AI 芯片产业中技术路线非常独特的一家公司。
公司从:
2017 年开始研发
到:
2021 年 Warboy
再到:
2024 年 RNGD
以及:
2026 年 RNGD 正式量产
已经完成从传统 Computer Vision NPU 向大型语言模型 AI Accelerator 的转型。
第一代:
Warboy
主要解决:
图像识别、
物体检测
和:
Vision AI。
第二代:
RNGD
则直接进入:
LLM、
VLM、
Generative AI
和:
Agentic AI。
RNGD 当前拥有:
TSMC 5nm
512 TFLOPS FP8
48GB HBM3
1.5TB/s HBM 带宽
256MB SRAM
以及:
约 180W TDP。
一台:
NXT RNGD Server
可以安装:
8 张 RNGD,
提供:
384GB HBM3
和:
约 4.1 PFLOPS FP8
同时整机功耗控制在:
约 3kW。
在商业化方面:
LG AI Research 已经采用 RNGD 运行 EXAONE;
Samsung SDS 已经推出基于 RNGD 的 NPUaaS;
欧洲 Equinix 数据中心开始提供测试和部署环境;
2026 年首批约 4000 颗 RNGD 已进入量产交付。
更加值得注意的是:
2025 年 FuriosaAI 拒绝了媒体报道中 Meta 约 8 亿美元的潜在收购方案,选择继续独立发展。
随后,公司完成:
1.25 亿美元 Series C Bridge
累计融资达到:
2.46 亿美元。
到了 2026 年,韩国国家成长基金又批准了围绕 FuriosaAI、规模约:
8000 亿韩元
的战略投资支持方案,用于扩大 RNGD 量产并开发基于 HBM4 的下一代 AI 芯片。
FuriosaAI 下一阶段真正需要证明的,并不是:
RNGD 的 TOPS 数字够不够漂亮。
而是几个更加重要的问题:
TCP 架构能不能持续适应快速变化的 AI 模型?
Furiosa SDK 能不能把从 CUDA 迁移过来的成本降到足够低?
RNGD 能不能从几千颗扩大到数万甚至十万颗商业部署?
下一代 HBM4 + Scale-Up 产品能不能真正进入大型 Agentic AI 数据中心?
如果这些问题能够逐步解决,FuriosaAI 很可能不会只是:
“另一家韩国 NPU 公司”。
不用最大功耗追求最高峰值算力,而是用更高的计算利用率,在有限电力下产生更多 Token。
而在 AI 数据中心越来越受制于电力和散热的时代,这条路线可能比单纯追求更大的 GPU 更有价值。
