Menu Close

FuriosaAI

FuriosaAI:韩国高能效 AI 推理芯片公司,以 RNGD 挑战 GPU

FuriosaAI

FuriosaAI 是一家来自韩国的 AI 芯片企业,专注于 数据中心 AI 推理芯片、NPU、大语言模型推理服务器和高能效 AI 基础设施

如果说 Rebellions 的路线正在向 NPU + Chiplet + AI Factory 发展,

那么 FuriosaAI 的技术哲学更加集中:

用完全针对神经网络重新设计的处理器架构,提高 AI 推理的实际利用率,同时大幅降低数据中心功耗。

FuriosaAI 并不打算简单制造另一颗 GPU

公司认为传统 GPU 最初并不是为了 Transformer、大语言模型和 Agentic AI 而设计,因此很多晶体管、数据移动和计算资源并不能始终得到充分利用。

FuriosaAI 希望从计算架构底层重新解决这个问题。

公司第一代芯片Warboy 。主要针对计算机视觉。

第二代:RNGD,读作 Renegade。则直接进入 LLM、VLM、生成式 AI 和 Agentic AI 推理。

截至 2026 年,RNGD 已经进入量产,公司正在从一家韩国 AI 芯片创业公司逐渐转向国际企业级 AI 推理基础设施供应商。

FuriosaAI 成立于 2017 年

FuriosaAI 成立于:2017 年。总部位于韩国首尔。

公司是一家典型的:Fabless Semiconductor Company。也就是无晶圆厂半导体公司。

它自己负责 处理器架构、芯片设计、Compiler、Runtime、AI 软件 以及服务器解决方案。

芯片制造则交给 Samsung Foundry 和 TSMC 等晶圆代工厂。

FuriosaAI 的创始团队拥有 SamsungAMDQualcomm 等国际芯片公司的研发经验。

创始人 June Paik 曾在 Samsung 和 AMD 工作

FuriosaAI 创始人兼 CEO 是:June Paik。 韩文名通常译作:白俊浩。

June Paik 拥有超过二十年的半导体和计算机体系结构经验。他曾经在 Samsung Electronics 和 AMD 从事 CPUGPU、内存系统等领域的设计与开发。

他拥有 Georgia Institute of Technology,也就是佐治亚理工学院电子工程硕士学位。这段职业经历对于理解 FuriosaAI 很重要。

公司并不是从 AI 软件开始,然后寻找一家 ASIC 公司帮忙制造芯片

它从成立开始就是一家 Computer Architecture Company。

FuriosaAI 希望回答的问题是:

果今天重新设计一种真正为神经网络而生的处理器,它还有必要长得像传统 GPU 吗?

FuriosaAI 的名字来自《疯狂的麦克斯》

Furiosa 这个名字也很特别。

它来自电影 Mad Max: Fury Road 中的角色:Furiosa。

因此公司后来第二代处理器 RNGD 也选择了 Renegade 这个带有“反叛者”意味的名字。

这种命名其实与公司的定位非常一致:挑战传统 GPU 主导的 AI 计算方式。

第一代 AI 芯片:Warboy

FuriosaAI 第一代真正商业化的 NPU 是:Warboy。2021 年发布。

它主要面向 Computer Vision Inference。

例如:图像分类、物体检测、OCR、姿态识别、超分辨率 以及 智能视频分析。

FuriosaAI 官方资料显示,Warboy 于 2023 年与 Samsung Foundry 和 ASUS 合作进入正式批量生产。

Warboy 的主要规格

Warboy 可以提供:64 TOPS,AI算能力。

芯片内部拥有:32MB SRAM

一颗 Warboy 包含:两个 Processing Element。

每个 PE 提供:32 TOPS。

两个 PE 还可以独立运行不同 AI 工作负载。

显存最高:32GB LPDDR4X

内存带宽约:66GB/s。

接口:PCIe Gen4 ×8。

整卡功耗可以配置在大约:40W—60W。

这套设计已经体现 FuriosaAI 最早的技术路线:

不追求最高峰值 TOPS,而追求低 Batch、低延迟和更高计算资源利用率。

Warboy 曾进入 MLPerf

Warboy 对 FuriosaAI 另外一个重要意义,是让这家韩国创业公司第一次获得国际 AI 芯片市场关注。

2021 年,FuriosaAI 使用第一代 NPU 参加:MLPerf Inference。

公司成为当时少数能够在国际标准 AI Benchmark 中与 Nvidia 产品直接比较的亚洲 AI 芯片创业企业之一。

但 Warboy 仍然属于上一代 AI 时代。它最适合 CNN、Vision 和传统深度学习。

ChatGPT、Llama、DeepSeek大语言模型快速出现以后,AI 芯片面对的问题彻底变化。

大语言模型改变了 FuriosaAI

传统 Computer Vision 模型可能只有 几百万、几千万, 或者 几亿参数。

但是大型语言模型可能拥有 70 亿、320 亿、700 亿,甚至 数千亿参数。

芯片突然需要解决完全不同的问题:

更大的模型权重

KV Cache

更高显存容量

更高内存带宽

更复杂的 Transformer 运算

以及:巨大的 Token 推理成本。

因此 FuriosaAI 第二代产品几乎重新思考了整个架构。

这就是:RNGD。

RNGD:FuriosaAI 真正进入 LLM 时代

FuriosaAI 第二代 AI 芯片叫:RNGD。读音:Renegade。

RNGD 于2024 年正式公开。

2025 年开始向全球大型客户送样。

到了2026 年,正式进入规模量产。

如果 Warboy 是 FuriosaAI 的 Computer Vision NPU,那么 RNGD 才是公司真正挑战数据中心 GPU 的产品。

它主要针对 LLMMultimodal AIGenerative AIAgentic AI 以及传统 Vision Model。

RNGD 没有采用传统矩阵处理器思路

RNGD 最重要的创新是:Tensor Contraction Processor,TCP。

中文可以翻译成:张量收缩处理器。

这是 FuriosaAI 自主研发的新型 AI Processor Architecture。

公司认为很多传统 AI Accelerator 的基本思路仍然是:Matrix Multiplication,也就是矩阵乘法。

但是现代深度学习模型本质上处理的是:Tensor,张量。

而现代 AI 模型中的大量数学运算,本质上可以表示成:Tensor Contraction,张量收缩。

因此 FuriosaAI 干脆直接围绕 Tensor Contraction 设计处理器。

什么是 Tensor Contraction?

最简单理解,矩阵乘法其实可以看成 Tensor Contraction 的一种特殊情况。

例如:两个二维矩阵相乘。

但是神经网络里面的数据很多时候不只是二维。

可能是 三维、四维 ,甚至 更高维 Tensor。

Transformer 中的:Attention、Linear Layer 以及其他运算,都涉及复杂张量关系。

如果处理器只为固定矩阵乘法设计,那么 复杂 Tensor 运算首先需要被拆成大量更简单操作。

FuriosaAI 的思路则是 让硬件直接理解更高级的 Tensor Contraction。这可以给编译器更大的优化空间。

TCP 的核心目标是提高利用率

AI 芯片有一个非常容易被误解的数据:Peak FLOPS。

一颗芯片可能标称 1000 TFLOPS。但真实运行模型时,并不意味着 这 1000 TFLOPS 一直全部工作。

计算核心可能因为 内存等待、数据依赖、不同 Tensor Shape、通信 或者 模型结构 而大量空闲。

因此真正重要的是 Utilization。

FuriosaAI 的 TCP 架构希望根据模型 Tensor 运算,在编译阶段设计更加合适的数据流。

简单来说,不是让模型勉强适应硬件。而是 尽量让硬件的数据流适应模型。

这也是 FuriosaAI 把 Compiler 看得非常重要的原因。

RNGD 使用 TSMC 5nm

RNGD 采用 TSMC 5nm 制造。

工作频率 1.0GHz。

当前官方规格达到:

256 TFLOPS BF16

512 TFLOPS FP8

512 TOPS INT8

以及 1024 TOPS INT4。这是非常完整的一组 AI 数据格式。

BF16 和 FP8 主要适合 高性能 AI 模型。

INT8 和 INT4 则更加适合量化推理。

48GB HBM3

RNGD 一个非常重要的升级是 HBM3。

每张 RNGD 卡配备 48GB HBM3。

使用 两个 HBM3 Stack。

总显存带宽达到 1.5TB/s。

芯片内部还有 256MB SRAM

这与 Warboy 的 LPDDR4X 已经完全不是一个级别。

原因就是 LLM 极度依赖内存带宽。

为什么 LLM 这么需要 HBM?

假设一个模型拥有 70 亿参数。即使每个参数只使用 2 Bytes,模型权重也需要 大约 14GB。

如果模型增加到 320 亿参数,仅模型本身就可能需要 几十 GB。

而运行模型时还需要 KV Cache 和各种中间数据。

更加重要的是 每生成一个 Token,模型都需要不断读取大量 Weight。

如果 AI Core 运算速度非常快,但显存只能慢慢把权重送过来,那么芯片大部分时间就在 等数据。

所以现代 AI Accelerator 已经越来越像 Compute Engine + Memory System。

RNGD 的 1.5TB/s HBM3 就是为了缓解这个问题。

RNGD 最大特点之一:功耗只有约 180W

目前 FuriosaAI 官方页面给出的 RNGD TDP 为 180W。这也是 FuriosaAI 最核心的商业卖点之一。

与很多大型数据中心 GPU 相比,180W 非常低。而且它仍然可以提供 512 TFLOPS FP8 以及 48GB HBM3。

FuriosaAI 因此不只是强调 Performance。更加重视 Performance per Watt。

为什么功耗越来越重要?

AI 数据中心正在遇到一个非常现实的问题:电不够。

一台高端 AI 服务器可能消耗 几千瓦。一个大型 AI Rack 可能消耗 几十甚至上百千瓦。整个 AI 数据中心可能需要 数百兆瓦。甚至未来可能进入 Gigawatt 级别。

但是大量传统企业数据中心仍然只有 十几 kW 每机柜 的供电和空气冷却能力。

如果为了部署 AI 必须重新建设 供电、变压器、液冷,甚至整个数据中心,成本会非常高。

FuriosaAI 因此提出一个很现实的市场定位:不要让企业为了运行 AI 去重建数据中心。

RNGD 可以继续使用空气冷却

因为 RNGD 单卡只有大约 180W。它可以继续采用 Passive Air Cooling。也就是服务器风道空气冷却。

这让 FuriosaAI 可以直接进入大量现有 企业数据中心、金融数据中心、运营商机房 和 私有云。不需要首先建设复杂液冷系统。

这可能是 RNGD 最重要的商业优势之一。

NXT RNGD Server:8 张 RNGD 组成一台服务器

FuriosaAI 已经不只销售单张 AI 卡。

公司推出:NXT RNGD Server。

一台 NXT RNGD Server 安装 8 张 RNGD。

因此整台服务器拥有 384GB HBM3

总显存带宽 12TB/s。

FP8 算力达到 4096 TFLOPS

也就是约 4.1 PFLOPS。

FP16 算力 2048 TFLOPS。

整机功耗 约 3kW。

3kW 为什么很重要?

一台服务器功耗只有约 3kW。意味着一个普通 15kW Air-Cooled Rack,理论上可以安装 5 台 RNGD Server。也就是 40 张 RNGD。

这样 FuriosaAI 就能够充分利用 传统企业机房。

这与很多需要特殊高功率机柜和液冷设施的高端 GPU 系统形成明显区别。

FuriosaAI 押注的是:世界上绝大多数企业数据中心不会为了 AI 全部重新建设。

如果这个判断成立,那么低功耗 AI Inference Accelerator 会拥有非常大的市场。

RNGD 可以虚拟成 8 个独立 NPU

RNGD 另外一个很有意思的功能是:Multi-Instance。

一张 RNGD 可以划分成 2 个、4 个 或者 8 个独立 NPU Instance。并支持 SR-IOV。

每个虚拟 NPU 拥有自己独立的 计算核心 和 内存带宽。这对于 Cloud AI 特别重要。

因为云服务商并不总是希望 一名客户占用整张 AI 卡。可能 客户 A 使用 1/8,客户 B 使用 1/8,其他客户继续使用剩余资源。

这可以明显提高 Hardware Utilization。

FuriosaAI 软件栈

真正决定 RNGD 能不能成功的,很可能不是芯片。而是 Software。

FuriosaAI 已经建立一套完整 AI 软件平台。

其中包括 Furiosa Compiler,负责把神经网络模型映射到 TCP 架构。

Furiosa Runtime,负责实际管理 NPU。

Furiosa LLM负责大型语言模型推理和 Serving。

还有 量化工具、模型优化工具、Profiler 以及 Model Zoo。

FuriosaAI 没有试图让用户重新学习一套 AI 框架

这一点很重要。

如果开发者为了使用 RNGD 必须放弃 PyTorch,重新学习 Furiosa Language,这几乎是不现实的。

所以 FuriosaAI 软件战略非常明确:尽量保留开发者已经熟悉的生态。

目前 RNGD 软件已经支持 PyTorch 2.x 以及 torch.compile。

Furiosa LLM 则采用 vLLM-compatible 接口,同时支持 OpenAI-compatible API。

也就是说,理想情况下 原来使用 PyTorch + vLLM + OpenAI API 的应用,不需要完全重新设计。

Furiosa SDK 更新速度很快

FuriosaAI 近年来明显加快软件开发。

2026 年 6 月,公司发布:Furiosa SDK 2026.3。

继续增加新的 Kernel Framework 和模型支持。

这说明 FuriosaAI 已经认识到一个现实:AI 芯片最大的竞争不是 Tape-Out。

而是:模型每天都在变。

今天是 Llama,明天是 DeepSeek,后天又可能是 Qwen、Gemma、gpt-oss 或者新的 MoE 模型。芯片必须迅速跟上。

RNGD 已经运行 120B 参数 gpt-oss

FuriosaAIOpenAI 的公开活动中展示过 gpt-oss 120B。运行在 RNGD 上。

公司表示,只需要 两张 RNGD 卡,即可运行这一 120B 参数模型。

这里需要说明,运行一个模型,并不代表性能一定全面超过 GPU

但它至少证明 RNGD 已经真正从传统 NPU 进入 Frontier LLM Inference。

LG AI Research 是 FuriosaAI 最重要的商业突破之一

2025 年 7 月,LG AI Research 正式宣布采用 RNGD。这是 FuriosaAI 发展历史中非常重要的一笔订单。

LG AI Research 使用自己的 EXAONE 大型语言模型对 RNGD 进行了长期测试。最终决定采用 RNGD 运行 企业 AI 推理。

这件事比任何 FuriosaAI 自己公布的 Benchmark 都更加重要。

因为这是 真实大型企业客户测试以后做出的商业选择。

LG 测试中性能功耗比提高 2.25 倍

根据 LG AI Research 与 FuriosaAI 公布的测试:

在 EXAONE LLM 推理中 RNGD 的 Performance per Watt, 达到此前 GPU 方案的 2.25 倍。

在相同 Rack 电力限制下,RNGD 系统可以产生 约 3.75 倍 Token。

这里需要注意 这是 LG 针对特定 EXAONE 模型和部署环境进行的测试。

不能简单理解成 “RNGD 比所有 Nvidia GPU 快 2.25 倍。”

更加准确的说法是:

在 LG AI Research 测试的特定 LLM 推理场景中,RNGD 展现出了明显的性能功耗优势。

EXAONE 32B 已经实际运行

LG AI Research 还使用 4 张 RNGD 运行 EXAONE 3.5 32B。

在 Batch Size 1 条件下:

4K Context 约达到 60 tokens/s。

32K Context 约达到 50 tokens/s。

这种 Benchmark 比只公布 TFLOPS 更有意义。

因为最终用户真正关心的是:一个模型到底每秒能生成多少 Token。

2026 年 RNGD 正式进入量产

FuriosaAI2026 年 1 月 27 日 宣布 RNGD 正式进入规模量产。

公司表示已经收到首批 4000 颗 RNGD 量产产品。

制造和供应链合作伙伴包括 TSMC 和 ASUS。这对于 FuriosaAI 是一个非常重要的里程碑。

AI 芯片创业公司最困难的事情之一,就是从 Demo 跨越到 Mass Production。

很多创业公司能够设计芯片。真正做到 稳定制造几千、几万颗,并交付企业客户,则困难得多。

FuriosaAI 已经开始进入欧洲

2026 年 7 月 FuriosaAI 宣布在 Equinix Lisbon LS2 数据中心 部署 RNGD Server。

企业客户可以在欧洲直接测试 RNGD 和 FuriosaAI 软件平台。公司同时在葡萄牙里斯本建立欧洲旗舰办公室。

这表明 FuriosaAI 已经不再满足于韩国市场。它正在进入 Europe Enterprise AI

Furiosa Access 已经覆盖多个地区

截至 2026 年,企业可以通过 Furiosa Access 在多个地区测试 RNGD。

包括:Seoul,Bay Area,Lisbon 以及 Johor Bahru。

这使 FuriosaAI 从韩国创业公司逐渐建立 Global Evaluation Infrastructure。

对于 AI 芯片公司而言,这非常重要。

因为企业通常不会仅凭网页参数购买数百万美元服务器。

它们首先需要:运行自己的模型,测试自己的 Context Length,测试自己的 Batch Size。然后比较 性能、功耗 和 TCO。

Samsung SDS 推出韩国首个国产 NPUaaS

2026 年,FuriosaAI 又获得一个非常重要的商业突破:Samsung SDS。

Samsung SDS 宣布基于 Furiosa RNGD,推出韩国首个国产 NPU-as-a-Service,NPUaaS。

也就是说 客户不需要自己购买 RNGD Server。可以像租 GPU Cloud 一样,直接租用 FuriosaAI NPU 算力。这对于 FuriosaAI 的生态意义很大。

开发者可以先 使用云端 RNGD,等业务规模扩大后再考虑 On-Premise 部署。

Samsung 对 FuriosaAI 的意义不只是客户

Samsung 与 FuriosaAI 的关系其实已经持续很长时间。

第一代 Warboy 就使用:Samsung Foundry 14nm。

到了 RNGD,则转向:TSMC 5nm。

Samsung 体系继续通过 Samsung SDS 等业务与 FuriosaAI 合作。

这说明 FuriosaAI 并没有把自己绑定在单一韩国供应链,而是根据不同产品选择 最适合的 Foundry 和系统合作伙伴。

SK Hynix 也是重要生态伙伴

RNGD 使用 HBM3。

韩国恰好拥有全球最重要的 HBM 企业 SK Hynix。

FuriosaAI 官方已经把 SK Hynix 列为其全球生态合作伙伴之一。

这也是韩国 AI 芯片产业天然拥有的一项优势:

韩国已经拥有非常成熟的 DRAM、HBM 和 先进半导体供应链。

2026 年与 Broadcom 合作开发第三代 AI 芯片

FuriosaAI 已经开始准备下一代产品。

2026 年 5 月,公司宣布与 Broadcom 建立战略合作。双方将共同开发 第三代 AI Accelerator。

新一代产品重点针对 Agentic AI 以及 大规模推理基础设施。这是一个非常重要的发展方向。

因为 RNGD 仍然主要是一张 PCIe Accelerator。

下一代产品将更加重视 Scale-Up。

为什么 Agentic AI 会改变芯片?

普通 Chatbot 可能是 用户问一次,模型回答一次。

但是 AI Agent 可能需要 规划、搜索、调用工具、重新推理、验证、调用第二个 Agent,然后再次推理。

一个用户任务可能触发 几十次,甚至 几百次模型调用。

因此 Agentic AI 可能导致 Token 需求出现指数级增长。

这意味着下一代 AI 芯片真正重要的不只是 单颗芯片 TFLOPS。

还包括 MemoryData Reuse,Chip-to-Chip Communication 以及 Scale-Up。

FuriosaAIBroadcom 的合作正是针对这一问题。

第三代芯片可能使用 HBM4

韩国政府 2026 年披露的产业支持资料还透露:FuriosaAI 正在开发基于 HBM4 的下一代产品。

项目暂称:Stork。该产品属于 FuriosaAI RNGD 之后的下一代 AI Accelerator 计划。

因此 FuriosaAI 的路线已经大致可以看成:

Warboy

RNGD

下一代 HBM4 / Scale-Up AI Accelerator。

Meta 曾经考虑收购 FuriosaAI

FuriosaAI 在 2025 年还有一件事情获得全球媒体大量关注。

Meta 曾与 FuriosaAI 讨论收购。2025 年 3 月,多家媒体报道称 Meta 提出的潜在收购价格大约 8 亿美元。但 FuriosaAI 最终没有继续完成交易。

根据当时报道,谈判失败并不主要是价格问题。

双方对于 收购后的业务方向 和 公司组织结构 存在分歧。

FuriosaAI 最终选择 继续独立发展。

为什么 Meta 会对 FuriosaAI 感兴趣?

这其实并不难理解。

Meta 每天运行极其庞大的 推荐模型、广告模型、Llama 大语言模型 以及 AI 服务。它已经成为全球最大的 AI 计算买家之一。

如果所有 AI Inference 都依赖 Nvidia 成本会极其巨大。

因此 Meta 一直在开发自己的 MTIA AI Accelerator。

如果收购 FuriosaAI,就可能获得 成熟 NPU 团队、TCP 架构、编译器 和 RNGD 技术。

所以 Meta 的兴趣本身,说明 FuriosaAI 的技术已经引起全球大型 AI 企业关注。

FuriosaAI 拒绝 Meta 后继续融资

2025 年 7 月,FuriosaAI 完成 1.25 亿美元 Series C Bridge。

参与投资者包括:Korea Development Bank,Industrial Bank of Korea,Keistone Partners,PI Partners 以及 Kakao Investment。

融资完成以后,公司累计融资达到 2.46 亿美元。当时公开报道的公司估值约 7.35 亿美元。

2026 年韩国政府又决定大规模支持 FuriosaAI

2026 年 5 月,韩国 National Growth Fund,也就是 国民成长基金,批准了针对 FuriosaAI 的大规模资金支持方案。

韩国政府资料显示,围绕 FuriosaAI 的直接股权投资计划规模 约 8000 亿韩元。其中包括先进战略产业基金等政策资金。按当时汇率大致相当于 5 亿多美元。

这笔资金主要用于 RNGD 扩大量产 以及 下一代 HBM4 AI 芯片研发。

这里需要注意 这与公司 2025 年已经完成的 1.25 亿美元 Series C Bridge 不完全是一回事。

更加准确的说法是:2026 年韩国政府已经批准对 FuriosaAI 的大型产业投资支持计划。

FuriosaAI 估值已经明显提高

随着 RNGD 开始量产,以及国家基金参与,韩国资本市场在 2026 年对 FuriosaAI 的估值预期明显提高。

韩国媒体报道,在新一轮融资和 Pre-IPO 讨论中,FuriosaAI 的估值已经被讨论到 约 3 万亿韩元甚至更高。不过这些数字仍与正在进行的融资和未来 IPO 有关。

因此不应该简单把它写成 已经确定的公开市场市值。

截至 2026 年 8 月 ,FuriosaAI 仍然是一家私人公司。

FuriosaAI 正在考虑 IPO

随着公司规模扩大,FuriosaAI 也开始进入 Pre-IPO 阶段。

韩国媒体报道,公司正在评估 韩国上市,以及 美国 Nasdaq 等不同资本市场方案。

但截至 2026 年 8 月,FuriosaAI 仍未正式成为上市公司。

因此目前最准确的状态是:

Private AI Semiconductor Company,正在为未来 IPO 扩大融资和业务规模。

FuriosaAI 与 Rebellions 是韩国最值得关注的两家 AI 芯片企业

如果观察韩国 AI 芯片产业,目前最受关注的两家公司就是:FuriosaAI 和 Rebellions

两家公司都主要针对 AI Inference。但路线非常不同。

Rebellions 当前旗舰 Rebel100 采用:4 Chiplet + UCIe + HBM3E,并向 RebelServer、RebelRack、RebelPOD 扩展。

FuriosaAI RNGD 则更加突出 TCP Architecture + 低功耗 + 现有空气冷却数据中心。

简单来说:

Rebellions 越来越强调 Scale-Up AI Infrastructure。

FuriosaAI 目前则更强调 Performance per Watt 和部署效率。

FuriosaAI 与 Groq 有什么不同?

Groq 同样专门做 AI Inference。但技术哲学也不同。

GroqLPU,强调 确定性执行、超低延迟 以及 极高 Token Generation Speed。

FuriosaAI 则更加关注 Tensor Contraction 和 计算资源利用率。

Groq 更像是在问 怎样让 Token 尽可能快地产生?

FuriosaAI 更像是在问 怎样让整个数据中心用更少的电产生更多 Token?

FuriosaAI 与 Nvidia 最大的区别

Nvidia 的路线是:GPU + CUDA + HBM + NVLink + Networking + DGX。

FuriosaAI 则是:TCP NPU + HBM + Compiler + Furiosa LLM + RNGD Server。

Nvidia 最大优势仍然是:General Purpose。

同一张 Nvidia GPU 可以 训练 LLM、运行 LLM、进行科学计算、运行图形程序 以及 大量其他 CUDA 工作负载。

RNGD 则专门优化 AI Inference。这种专用性既是优势,也是风险。

专用 NPU 的优势是什么?

假设一家银行已经决定 未来五年这套服务器只负责运行 大型语言模型,那么它并不一定需要 图形功能、HPC 功能 或者 训练能力。

它真正需要的是 每美元产生最多 Token。每瓦产生最多 Token。

在这种情况下,专门 AI Inference NPU ,理论上可以比通用 GPU 更有效率。

这就是 FuriosaAI 的商业机会。

FuriosaAI 最大优势之一:极低功耗

RNGD 只有大约 180W。

而一台 8 卡服务器大约 3kW。

这使普通 15kW Air-Cooled Rack 可以部署多台服务器。

对于已经存在几十年的 银行数据中心、电信机房、政府数据中心、普通企业机房 而言,这个优势可能比 “峰值算力多 20%” 更加重要。

因为重新建设数据中心的成本可能远远超过芯片本身。

第二个优势:架构真正不同

很多所谓 Nvidia Challenger 实际上仍然沿着 GPU Matrix Engine 思路设计。

FuriosaAI 的 TCP 至少是一种真正从 Tensor Contraction 重新思考计算的数据流架构。

该架构研究还进入 ISCA 2024 等国际计算机体系结构会议。

这说明 FuriosaAI 并不只是做 “便宜版 GPU”,它真正拥有自己的 Computer Architecture。

第三个优势:已经有大型商业客户

LG AI Research 正式采用 RNGD,

Samsung SDS 推出 RNGD NPUaaS,

欧洲 Equinix 开始部署测试环境。

这些都说明 FuriosaAI 已经逐渐跨过 只有 Benchmark,没有客户 这一阶段。

对于一家 AI 芯片创业公司而言,这非常重要。

第四个优势:已经进入量产

2026 年第一批 4000 颗 RNGD 进入量产交付。

这说明 FuriosaAI 已经开始解决 Yield、封装、HBM、PCB、Server Qualification 以及 Supply Chain 等现实问题。

这些工程能力往往比芯片 Demo 更难建立。

第五个优势:韩国政府正在给予战略支持

韩国已经意识到:虽然自己拥有世界领先的 Samsung 和 SK Hynix,但真正高端 AI Processor 仍然高度依赖国外企业。

因此韩国近年来明显加强 国产 AI Semiconductor 战略。

FuriosaAIRebellions 都成为重点支持企业。

2026 年批准的约 8000 亿韩元 FuriosaAI 投资计划,说明 AI Logic Chip 已经被放到韩国国家产业战略层面。

FuriosaAI 最大挑战仍然是 CUDA

所有 Nvidia Challenger 最终都会遇到同一个问题:CUDA。

AI 企业并不只是购买 GPU

它们已经围绕 Nvidia 建立 PyTorch、CUDA、cuDNN、NCCL、TensorRT、Triton 和 各种模型部署工具。

如果换成 RNGD 以后,模型不能跑,性能工具不好用,模型支持慢半年,那么即使芯片更加省电,也很难迁移。

因此 FuriosaAI 必须持续投资 Compiler 和 Software。

这也是公司近年来大量招聘软件和编译器专家的原因。

第二个挑战:48GB 显存并不算特别大

RNGD 拥有 48GB HBM3。

对于很多 7B、8B、32B 模型已经非常实用。但是对于 70B、120B 以及 更大型模型,就需要 多卡并行。

一旦进入多卡,PCIe P2P、通信效率、Tensor Parallelism 就变得非常重要。

FuriosaAI 已经在软件中加入多卡 Tensor Parallelism,但未来能不能扩大到更大规模,仍然是重要挑战。

这也是第三代产品为什么越来越重视:Scale-Up。

第三个挑战:FuriosaAI 目前主要还是推理公司

RNGD 是 Inference Accelerator。这让它可以围绕推理做极强优化。

但也意味着客户如果同时需要 Training,仍然可能需要 NvidiaAMD 或其他训练平台。

企业可能面临 训练使用一个生态,推理又迁移到另一个生态。

是否值得承担这部分软件和运维复杂度,需要取决于 推理规模到底有多大。

第四个挑战:未来 GPU 也会越来越省电

FuriosaAI 现在最大的优势之一是 Performance per Watt。

NvidiaAMD 不会停止进步。GPU 架构、低精度计算、HBM、先进封装 和 推理软件 都会持续优化。

所以 FuriosaAI 必须做到 不仅今天比 GPU 更节能,而且下一代仍然保持足够大的差距。

这也是为什么公司必须迅速从 RNGD,进入 第三代 HBM4 产品。

第五个挑战:量产规模仍然需要扩大

4000 颗 RNGD 是重要里程碑。

但是与 Nvidia 每年巨大的数据中心 GPU 出货相比,仍然非常小。

真正进入 Hyperscaler 市场以后,客户需要的可能是 1 万颗、10 万颗,甚至更多。

FuriosaAI 必须证明自己的 晶圆、HBM、CoWoS、板卡和 服务器供应链 能够支持真正大规模增长。

为什么 FuriosaAI 值得长期关注?

FuriosaAI 最有意思的地方不是 “韩国又出现一家 Nvidia Challenger。”

而是它提出了一个越来越重要的问题:未来 AI 数据中心最稀缺的资源到底是什么?

过去答案可能是:算力。

但未来答案越来越可能是:电力。

当一座 AI 数据中心拥有足够资金购买 GPU,却没有更多电可以供给服务器时,峰值 FLOPS 就不再是唯一重要指标。

真正重要的是:Tokens per Watt。而这恰好是 FuriosaAI 从 RNGD 开始最集中攻击的问题。

AI 推理可能比训练形成更大的长期市场

训练一个模型可能只发生 一次,或者 几年内训练很多次。

但是模型部署以后,每天可能被 几百万、几千万,甚至 数亿用户 反复调用。

AI Agent 又会让每个用户请求产生 更多 Token。

所以长期来看 Inference Compute 完全可能成为比训练更加庞大的计算需求。

这也是为什么 GroqRebellions、SambaNova 以及 FuriosaAI 都在押注 Inference。

FuriosaAI 最终并不需要取代 Nvidia 才能成功

FuriosaAI 不需要让全球所有数据中心 把 Nvidia GPU 全部扔掉。

只要它能够证明 在企业 LLM Inference 中,RNGD 可以实现 足够高性能、明显更低功耗、更低 TCO,并且 软件迁移足够简单,就可能获得相当大的市场。

尤其是在Enterprise AIPrivate AISovereign AI 和 传统空气冷却数据中心 这几个市场中。

总结

FuriosaAI 是韩国 AI 芯片产业中技术路线非常独特的一家公司。

公司从:2017 年开始研发, 到 2021 年 Warboy, 再到 2024 年 RNGD,以及 2026 年 RNGD 正式量产,已经完成从传统 Computer Vision NPU 向大型语言模型 AI Accelerator 的转型。

第一代:Warboy。主要解决 图像识别、物体检测 和 Vision AI

第二代:RNGD。则直接进入 LLM、VLM、Generative AI 和 Agentic AI

RNGD 当前拥有:

TSMC 5nm

512 TFLOPS FP8

48GB HBM3

1.5TB/s HBM 带宽

256MB SRAM

以及 约 180W TDP。

一台 NXT RNGD Server,可以安装 8 张 RNGD,提供 384GB HBM3 和 约 4.1 PFLOPS FP8。

同时整机功耗控制在约 3kW。

在商业化方面:

LG AI Research 已经采用 RNGD 运行 EXAONE;

Samsung SDS 已经推出基于 RNGD 的 NPUaaS;

欧洲 Equinix 数据中心开始提供测试和部署环境;

2026 年首批约 4000 颗 RNGD 已进入量产交付。

更加值得注意的是:

2025 年 FuriosaAI 拒绝了媒体报道中 Meta8 亿美元的潜在收购方案,选择继续独立发展。

随后,公司完成 1.25 亿美元 Series C Bridge

累计融资达到 2.46 亿美元。

到了 2026 年,韩国国家成长基金又批准了围绕 FuriosaAI、规模约 8000 亿韩元 的战略投资支持方案,用于扩大 RNGD 量产并开发基于 HBM4 的下一代 AI 芯片

FuriosaAI 下一阶段真正需要证明的,并不是 RNGD 的 TOPS 数字够不够漂亮。

而是几个更加重要的问题:

TCP 架构能不能持续适应快速变化的 AI 模型?

Furiosa SDK 能不能把从 CUDA 迁移过来的成本降到足够低?

RNGD 能不能从几千颗扩大到数万甚至十万颗商业部署?

下一代 HBM4 + Scale-Up 产品能不能真正进入大型 Agentic AI 数据中心?

如果这些问题能够逐步解决,FuriosaAI 很可能不会只是 “另一家韩国 NPU 公司”。

它可能代表 AI 芯片行业一条越来越重要的路线:

不用最大功耗追求最高峰值算力,而是用更高的计算利用率,在有限电力下产生更多 Token。

而在 AI 数据中心越来越受制于电力和散热的时代,这条路线可能比单纯追求更大的 GPU 更有价值。

Entires个相关