Menu Close

Groq

Groq:用LPU挑战GPU的高速AI推理企业

Groq

Groq 是美国一家非常具有代表性的人工智能芯片AI推理基础设施企业。

如果说 NVIDIA GPU 的最大优势是同时兼顾AI训练和推理,那么Groq选择了一条更加专注的路线:

不追求通用GPU,而是从芯片架构开始专门为AI推理设计处理器。

Groq把自己的AI处理器称为:

LPU——Language Processing Unit

也就是:

语言处理单元。

LPU最重要的目标不是训练一个大模型,而是让已经训练完成的大模型能够:

更快、更稳定、更低延迟地生成Token。

随着ChatGPT大语言模型、Reasoning Model以及AI Agent快速发展,AI产业正在从“训练模型”逐渐进入“海量运行模型”的阶段。

这使:

AI Inference——人工智能推理

成为越来越重要的AI芯片市场。

Groq也因此成为全球AI推理芯片AI基础设施领域最值得关注的企业之一。

不过,截至2026年,Groq已经发生了一个非常重要的战略变化:

它正在从一家纯AI芯片公司,转向一家以高速AI推理为核心的Neocloud——新型AI云基础设施公司。

一、Groq公司简介

Groq成立于:

2016年

总部位于美国加利福尼亚州硅谷地区。

公司创始人为:

Jonathan Ross

Jonathan Ross在创立Groq之前曾经任职Google,是Google早期AI处理器:

TPU——Tensor Processing Unit

核心开发团队成员之一。

这段经历非常重要。

因为TPU代表Google第一次证明:

AI计算不一定必须使用GPU

完全可以针对机器学习计算特点重新设计专用处理器。

Jonathan Ross离开Google之后创立Groq,本质上延续了这个思路:

如果专用AI处理器能够提高训练效率,那么是否可以进一步设计一种专门针对AI推理优化的计算架构?

Groq由此诞生。

不过,2025年底Groq发生重大变化。

2025年12月,Groq与NVIDIA签署了一项非独家技术授权协议NVIDIA获得Groq部分AI推理技术授权,同时Jonathan Ross以及Groq多名核心人员加入NVIDIA。Groq本身并没有被NVIDIA收购,而是继续作为一家独立企业运营。

截至2026年,Groq CEO已经变更为:

Adam Winter

公司目前的核心战略也从单纯开发LPU芯片,进一步转向:

建设全球高速AI推理云。

二、什么是LPU?

Groq最重要的技术就是:

LPU——Language Processing Unit。

虽然名称中有“Language”,但LPU并不是只能处理自然语言。

更加准确地说,它是一种:

专门面向AI推理和线性代数计算设计的处理器。

AI模型中最常见的计算包括:

  • Matrix Multiplication
  • Vector Operations
  • Tensor Operations
  • Attention
  • Linear Algebra

GPU当然可以完成这些工作。

GPU最初是为了计算机图形设计的通用并行处理器。

随着时间发展,GPU增加了:

CUDA Core

Tensor Core

HBM

NVLink

以及各种AI软件。

最终演变成现代AI计算平台。

Groq则采取完全不同的路线:

从第一天开始就只考虑AI推理。

因此LPU设计追求的不是最大程度的通用性,而是:

可预测的执行时间

极低延迟

极高Token生成速度

高片上内存带宽

容易扩展到大量LPU

Groq将LPU的核心设计原则概括为:

  • Software First
  • Programmable Assembly Line
  • Deterministic Compute
  • Deterministic Networking
  • On-Chip Memory

也就是说:

软件优先、流水线执行、确定性计算、确定性网络和片上内存。

三、Groq最大的特点:Software First

传统处理器通常首先设计:

Hardware

然后再开发:

Compiler和Software

让软件适应硬件。

Groq却反过来:

先考虑编译器和软件如何执行AI模型,再设计硬件。

这就是Groq所谓:

Software-First Architecture。

LPU的工作方式有点像一个巨大的:

Assembly Line——流水线。

编译器在AI模型正式运行之前,就已经决定:

每一步计算在哪里执行;

数据什么时候到达;

什么时候进行乘法;

什么时候进行加法;

什么时候把数据发送到下一颗LPU。

因此在程序真正运行时:

不需要大量动态调度。

这和GPU存在明显区别。

GPU需要处理:

线程

Warp

Kernel

Cache

Scheduler

Memory Hierarchy

大量运行时行为。

而Groq希望尽可能在编译阶段就把这些事情确定下来。

这使LPU拥有一个非常重要的特点:

Deterministic Execution——确定性执行。

四、什么叫“确定性执行”?

假设某个AI模型执行一次需要:

1毫秒。

传统GPU由于:

缓存命中

线程调度

内存冲突

网络拥堵

其他任务

等因素影响,实际运行时间可能产生一定变化。

Groq希望做到:

编译器在模型运行之前,就知道每一步需要多少时间。

因此系统可以预测:

第一个计算什么时候结束;

第二个计算什么时候开始;

数据什么时候进入下一颗芯片

最终Token什么时候产生。

这对于:

Real-Time AI

尤其重要。

例如:

AI语音助手

自动驾驶

金融交易

工业控制

机器人

实时翻译

AI Agent

这些应用不仅需要:

平均速度很快

还需要:

每次都很快。

Groq把这种可预测性视为LPU区别于GPU的重要优势。

五、为什么Groq大量使用SRAM?

这是理解Groq架构非常重要的一点。

现代GPU通常使用:

HBM——High Bandwidth Memory

作为大容量高速显存。

例如AI GPU可能配置:

80GB

96GB

144GB

甚至更多HBM。

HBM容量很大,但是它位于GPU计算核心之外。

数据需要不断:

GPU

HBM

GPU

来回移动。

而数据移动本身需要时间和电力。

Groq采取了不同方法:

大量使用片上SRAM

SRAM容量比HBM小得多,但是:

速度非常快。

而且距离计算单元非常近。

Groq认为,从本地SRAM读取数据的能耗远低于访问外部HBM,因此可以大幅降低AI推理中的数据移动成本。

这实际上反映了现代AI计算越来越重要的一个问题:

真正的瓶颈往往已经不是计算,而是Memory

也就是:

如何把数据及时送给计算单元。

六、GroqChip

Groq早期推出的核心芯片叫:

GroqChip。

Groq曾公开披露第一代GroqChip采用:

14nm工艺

拥有:

230MB片上SRAM

芯片片上内存带宽最高达到:

80TB/s

峰值性能达到:

750 TOPS INT8

以及:

188 TFLOPS FP16

芯片通过:

RealScale

高速芯片互联技术进行扩展。

这些数字今天已经不是判断Groq技术水平的唯一标准,因为Groq正在进入更新一代LPU和LPX系统。

但第一代GroqChip很好地体现了Groq最核心的设计哲学:

不要依赖复杂Cache层级和大量外部HBM,而是通过片上SRAM、高带宽互联和确定性执行来提高AI推理效率。

七、RealScale:把很多LPU连接起来

一颗LPU的SRAM容量有限。

但大型语言模型可能拥有:

70B

120B

400B

甚至更多参数。

因此仅靠单颗LPU显然无法运行非常大的模型。

Groq的解决方法是:

把大量LPU连接成一个统一计算系统。

这套技术称为:

RealScale。

传统GPU集群通常需要:

GPU

NVLink

NVSwitch

InfiniBand / Ethernet

其他GPU服务器

Groq则利用自己的确定性网络,让编译器提前知道:

数据什么时候从一颗LPU传输到另一颗LPU。

这样多颗LPU可以像一个大型流水线一样共同执行模型。

Groq将这种系统描述为:

Shared Resource Fabric

也就是很多LPU共同组成一个大型计算资源。

这也是Groq能够运行大型语言模型的重要技术基础。

八、Groq真正擅长的是Inference

Groq与NVIDIA最大的区别之一,就是战略重点不同。

NVIDIA的数据中心GPU主要同时支持:

Training

和:

Inference。

而Groq从很早就明确押注:

Inference。

什么是Inference?

简单来说:

训练阶段是:

大量数据

GPU计算

产生AI模型

而推理阶段则是:

用户输入问题

AI模型计算

产生答案。

例如你向一个大型语言模型输入:

“What is Linux?”

随后模型生成答案。

整个生成过程就是:

Inference。

ChatGPTAI搜索、AI编程、AI客服、AI Agent绝大多数日常计算,其实都是推理。

九、为什么AI推理正在变得越来越重要?

过去AI产业最大的投资集中在:

Training。

因为训练GPT级大型模型需要大量GPU

但训练完成之后,真正长期发生的计算则是:

Inference。

假设一个模型训练一次花费:

数亿美元。

但模型上线后拥有:

1亿用户。

每个用户每天提出几十个问题。

这些问题可能持续几年。

那么长期来看:

推理计算量可能远远超过训练计算量。

Groq在2026年的公司战略中明确认为,推理最终需要的计算资源可能达到训练的:

15至20倍。

这也解释了为什么包括:

NVIDIA

AMD

Groq

Cerebras

Google

Amazon

Microsoft

越来越多企业开始把注意力转向:

Inference Infrastructure。

十、Token速度为什么这么重要?

大型语言模型生成内容的基本单位是:

Token。

例如一个AI模型可能达到:

50 Tokens/s

100 Tokens/s

300 Tokens/s

500 Tokens/s

甚至:

1,000 Tokens/s。

对于传统聊天机器人:

100 Tokens/s已经非常快。

AI正在进入:

Reasoning

和:

Agentic AI

时代。

AI Agent可能需要:

思考

调用工具

搜索

分析

再次调用模型

执行程序

再次推理

一个任务可能生成:

几千

几万

甚至更多Token。

这样一来:

Token速度就直接决定AI Agent完成工作的速度。

如果模型只能生成:

50 Tokens/s

一个复杂任务可能需要一分钟。

如果达到:

1,000 Tokens/s

很多工作可能几秒钟完成。

因此Groq最核心的商业卖点之一就是:

Fast Inference。

十一、Groq曾经一夜爆红

Groq真正进入大众AI市场视野,是在2024年。

当时Groq公开展示:

Llama 2 70B

Mixtral

Gemma

等大型语言模型的高速推理。

2024年Artificial Analysis的独立测试中,Groq运行Llama 2 70B曾达到约:

241 Tokens/s

明显高于当时很多其他云端AI推理服务。

随后Groq继续提升性能。

在2025年与Meta合作支持Llama API时,Groq披露某些Llama模型工作负载可以达到最高约:

625 Tokens/s。

高速Token生成从此成为Groq最鲜明的品牌标签。

十二、GroqCloud

Groq随后发现:

真正容易扩大市场的方法可能不是直接销售AI芯片

而是:

让开发者直接使用AI算力。

因此Groq推出:

GroqCloud。

开发人员不需要购买:

GroqChip

GroqCard

GroqNode

或者GroqRack。

只需要通过:

API

即可调用Groq提供的大型语言模型。

这和:

OpenAI API

Anthropic API

Google Gemini API

在使用方式上非常类似。

但区别在于:

Groq主要出售的并不是自己训练的大模型。

Groq的核心产品是:

Inference Infrastructure。

也就是:

帮别人把模型跑得更快。

因此开发人员可以在GroqCloud上运行:

Llama

Qwen

Gemma

以及其他开放模型。

十三、Groq正在从芯片企业转型为Neocloud

到2026年,Groq的公司定位已经发生明显变化。

过去Groq经常被称为:

AI Chip Startup。

现在Groq自己越来越强调:

AI Inference Cloud

以及:

Neocloud。

所谓Neocloud,可以理解为:

专门围绕AI计算建立的新型云服务公司。

传统云计算市场主要是:

AWS

Microsoft Azure

Google Cloud

而新一代AI Neocloud则专门建设:

GPU

AI Accelerator

AI Inference

大型模型

相关计算基础设施。

Groq现在把自己定位成:

Premier Neocloud for Fast Inference。

换句话说:

Groq未来真正卖的可能越来越不是:

一颗芯片

而是:

每秒多少Token。

这是理解今天Groq最重要的变化。

十四、Groq全球数据中心

截至2026年8月,Groq已经运营:

13个数据中心

覆盖:

  • 北美
  • 欧洲
  • 中东
  • 亚太地区

Groq在2026年8月披露,平台已经服务超过:

600万开发者

以及大量AI原生企业和Fortune 500客户。

Groq正在建设数百MW级AI推理基础设施。

公司2026年6月提出的目标是:

到2027年扩展到约200MW推理容量。

这说明Groq正在快速从:

芯片设计公司

转变为:

全球AI数据中心运营商。

十五、加拿大也是Groq的重要市场

Groq在加拿大也进行了较大规模布局。

2025年,Groq宣布与:

Bell Canada

合作建设加拿大主权AI基础设施。

Groq成为Bell AI Network的重要AI推理技术供应商。

该项目计划形成多个加拿大数据中心节点。

其中包括:

Kamloops, British Columbia

也就是加拿大BC省Kamloops。

Groq披露,Bell AI Fabric整体规划包括六个站点,并计划建设最高约500MW清洁能源计算基础设施。

这类项目体现了AI行业正在出现的另一个重要市场:

Sovereign AI——主权人工智能

越来越多国家希望:

AI模型

AI数据

AI计算

全部运行在本国数据中心中。

Groq正在积极进入这一市场。

十六、沙特阿拉伯成为Groq重要客户

Groq在中东的发展也非常快。

2025年2月,Groq宣布获得沙特阿拉伯:

15亿美元

AI基础设施扩展承诺。

Groq此前已经在沙特Dammam建设大型AI推理集群,并通过GroqCloud向全球用户提供服务。

Groq还成为沙特AI公司:

HUMAIN

的重要AI推理基础设施供应商之一。

中东拥有:

资本

能源

土地

数据中心建设能力

因此正在成为全球AI基础设施竞争的重要地区。

十七、Groq与Meta

Groq还与Meta建立了重要合作。

2025年,Meta推出官方:

Llama API

Groq成为其中的AI推理基础设施合作伙伴之一。

开发人员可以通过Meta官方Llama API使用由Groq LPU加速的Llama模型。

这对Groq具有重要意义。

因为Meta Llama已经成为全球最重要的开放模型生态之一。

如果Groq能够成为大量Llama应用背后的推理基础设施,其商业价值就不再只是卖AI芯片,而是进入:

AI Model Serving

这个长期市场。

十八、2025年底Groq与NVIDIA发生重大变化

这是今天介绍Groq绝对不能忽略的一件事。

2025年12月,NVIDIA与Groq达成了一项重大协议。

NVIDIA获得Groq的:

非独家AI推理技术授权。

同时,Groq创始人Jonathan Ross以及公司多位核心技术和管理人员加入NVIDIA

当时市场甚至一度出现:

NVIDIA将以约200亿美元收购Groq

的报道。

但最终双方明确表示:

Groq没有被NVIDIA整体收购。

Groq继续作为独立公司存在。

这项交易实际上非常特殊:

NVIDIA获得Groq技术授权和核心人才;

Groq投资者获得巨大回报;

Groq自身继续独立运营AI推理云。

可以把它理解为:

Technology Licensing + Talent Transfer

而不是传统意义上的完整公司收购。

十九、NVIDIA Groq 3 LPX

双方合作之后,Groq技术开始进一步进入NVIDIA生态。

目前Groq公开展示的重要平台之一是:

NVIDIA Groq 3 LPX。

LPX将Groq下一代LPU与NVIDIA的新一代AI平台结合起来。

Groq目前公开的平台数据显示,一套LPX Rack可以配置:

256颗LPU

提供约:

128GB片上SRAM

SRAM带宽达到:

40 PB/s

FP8推理性能达到:

315 PFLOPS

并以:

1,000 Tokens/s/User

作为重要性能定位。

这说明Groq未来与NVIDIA之间可能不仅是竞争关系。

更可能出现:

GPU + LPU

共同工作的AI数据中心架构。

二十、为什么GPU和LPU可以一起工作?

GPU最擅长:

大规模并行计算。

尤其适合:

AI Training

大规模矩阵计算

Batch Processing。

LPU则强调:

低延迟顺序计算。

尤其适合:

AI Inference

Token Generation

Real-Time AI

因此未来一个AI数据中心完全可能采用:

GPU负责:

训练模型

然后LPU负责:

运行模型。

甚至同一个推理任务也可以根据计算特点拆分到不同处理器。

这和计算机行业长期发展的:

Heterogeneous Computing——异构计算

趋势非常一致。

未来AI服务器很可能不是只有一种处理器,而是:

CPU

GPU

LPU

DPU

其他AI Accelerator

共同组成。

二十一、Groq 2026年融资

Groq在完成NVIDIA技术授权之后并没有停止融资。

2026年6月,公司宣布获得:

6.5亿美元

新增长资本。

资金主要用于扩大Groq全球AI推理云。

随后在:

2026年8月17日

Groq再次宣布完成:

3.5亿美元Series A融资。

这一轮融资对公司的估值为:

35亿美元。

由Disruptive领投,NVIDIA计划参与投资。

两轮融资合计达到:

10亿美元。

之所以2026年的融资重新被称为“Series A”,与Groq在NVIDIA技术授权交易之后进行业务重组有关。

换句话说,今天的Groq与2025年之前纯粹以LPU芯片公司身份发展的Groq,商业结构已经发生明显变化。

二十二、为什么估值从69亿美元变成35亿美元?

2025年9月,Groq融资:

7.5亿美元

当时公司估值达到:

69亿美元。

但2026年8月新一轮融资中,公司估值为:

35亿美元。

表面看起来似乎下降很多。

但这里不能简单理解为公司价值“腰斩”。

原因是:

2025年底NVIDIA已经通过技术授权交易取得部分Groq技术权利,并吸收Jonathan Ross等核心人才。

因此2026年的Groq实际上已经变成:

Post-NVIDIA Licensing Groq

也就是:

经过NVIDIA技术授权交易之后重新形成的公司。

新的35亿美元估值主要对应今天以:

GroqCloud + AI Infrastructure

为核心的新Groq。

二十三、Groq目前最大的优势

Groq最大的优势首先是:

极强的AI推理定位。

NVIDIA必须同时服务:

图形

HPC

AI Training

AI Inference

科学计算

很多市场。

Groq则把大量技术资源集中在:

Inference。

第二个优势是:

Deterministic Architecture。

确定性执行使系统可以提供非常稳定的低延迟。

第三个优势是:

SRAM

大量片上SRAM能够减少AI推理中昂贵的数据搬运。

第四个优势是:

Token速度。

对于:

AI Agent

语音AI

实时翻译

AI编程

Reasoning

超高速Token生成拥有非常直接的用户价值。

第五个优势是:

GroqCloud。

用户并不需要购买Groq芯片,只需要调用API。

这大幅降低了Groq技术进入市场的门槛。

二十四、Groq面临的挑战

Groq的技术很有特色,但它面临的挑战同样非常明显。

1. NVIDIA

最大的竞争者仍然是:

NVIDIA

而且现在这个关系变得更加复杂。

NVIDIA既是:

Groq竞争者

又是:

Groq技术授权合作伙伴

甚至还是Groq投资者。

NVIDIA本身也正在大规模加强AI推理产品。

因此Groq必须证明:

即使NVIDIA已经获得部分LPU技术授权,GroqCloud依然拥有长期独立竞争力。

2. SRAM容量

SRAM非常快。

但它最大的问题是:

昂贵,而且面积很大。

因此单颗LPU上的SRAM容量远小于GPU的HBM容量。

大型模型需要跨很多LPU运行。

这要求:

编译器

芯片互联

模型分割

数据调度

必须非常高效。

3. AI模型越来越复杂

最早的大语言模型主要是:

Transformer。

现在开始出现:

Mixture of Experts

Multimodal Models

Reasoning Models

AI Agents

Long Context

各种新架构。

Groq必须不断证明LPU可以适应快速变化的模型结构。

4. 数据中心资本投入

Groq正在从芯片企业转向Neocloud。

这意味着未来需要建设:

数据中心

电力系统

液冷

网络

服务器

全球节点。

这是非常资本密集的业务。

因此未来Groq不仅需要优秀的芯片工程师,还需要具备类似:

AWS

Microsoft Azure

Google Cloud

那样的数据中心运营能力。

二十五、Groq与Cerebras有什么区别?

Groq和Cerebras经常被放在一起讨论。

因为两家公司都在挑战GPU

但它们的方法完全不同。

Cerebras的方法是:

把处理器做到极大。

核心技术是:

Wafer-Scale Engine。

直接把整片晶圆做成一个超大型AI处理器。

Groq的方法则是:

使用很多相对较小、结构简单、确定性的LPU。

然后通过高速互联组成大型AI系统。

所以:

Cerebras强调:

Scale Up。

把单个计算单元做到巨大。

Groq强调:

Deterministic Scale Out。

通过确定性互联把很多LPU组合起来。

两家公司最终都希望解决GPU时代越来越明显的问题:

Memory Bandwidth

Interconnect

Latency

Energy Efficiency

但解决方案完全不同。

二十六、Groq与GPU真正的区别

传统GPU

大量线程并行执行。

Groq LPU:

确定性流水线执行。

GPU强调:

Throughput。

LPU更加重视:

Latency + Predictability。

GPU大量依赖:

HBM。

LPU强调:

On-Chip SRAM

GPU运行:

图形

科学计算

AI训练

AI推理

Groq主要针对:

AI Inference。

因此Groq并不是:

“另一家GPU公司”。

更加准确地说,它代表一种新的:

Inference Processor Architecture。

二十七、为什么Groq值得关注?

Groq真正值得关注的地方,并不是它是否能够“打败NVIDIA”。

更加重要的问题是:

AI产业是否需要专门的推理处理器?

过去十年AI产业最重要的任务是:

训练越来越大的模型。

因此GPU成为AI时代最重要的芯片

未来十年可能发生变化。

模型训练完成之后,几亿甚至几十亿用户每天都要运行这些模型。

AI Agent还可能自动进行:

搜索

写代码

调用工具

分析数据

生成内容

完成任务。

这意味着真正最大的计算市场最终可能变成:

Inference。

如果这个判断成立,那么:

专门针对Inference设计处理器

就可能成为一个独立的巨大半导体市场。

Groq正是在押注这个未来。

二十八、未来发展

未来几年,Groq最值得关注的方向主要有以下几个。

第一:

GroqCloud。

这是目前公司最重要的业务。

未来Groq能否从几百万开发者进一步扩大到真正的大规模企业AI市场,将决定公司的商业价值。

第二:

NVIDIA合作。

Groq技术已经进入NVIDIA LPX系统。

未来Groq和NVIDIA到底会形成:

竞争

合作

还是更深层融合,

值得持续观察。

第三:

全球AI数据中心。

Groq计划建设数百MW推理容量。

这意味着公司正在从芯片企业进入大型AI基础设施竞争。

第四:

AI Agent。

Agent需要大量连续推理。

如果未来AI Agent成为主流应用:

每秒Token数量

以及:

推理延迟

可能变得比今天更加重要。

这将非常有利于Groq的技术定位。

第五:

Sovereign AI

加拿大、沙特以及其他国家都开始建设自己的AI基础设施。

Groq可以通过相对独立于传统GPU云的AI推理平台进入这些市场。

结语

Groq是AI芯片产业中非常值得关注的一家公司。

它并没有选择重新制造一颗传统GPU,而是从AI推理本身的特点重新设计处理器。

Groq的LPU通过:

Software-First Architecture

Deterministic Execution

On-Chip SRAM

Programmable Assembly Line

RealScale Interconnect

建立了一套不同于GPUAI计算架构。

早期Groq主要是一家:

AI Chip Company。

但截至2026年,这个定位已经发生重大变化。

NVIDIA获得Groq部分AI推理技术的非独家授权,创始人Jonathan Ross等核心人员加入NVIDIA之后,Groq依然保持独立,并把战略重点进一步转向:

GroqCloud。

因此今天最准确的Groq定位已经从:

LPU芯片公司

逐渐变成:

AI Inference Infrastructure Company。

或者更准确地说:

AI Inference Neocloud。

截至2026年8月,公司已经运营13个数据中心,服务超过600万开发者,并在2026年6月至8月完成合计10亿美元新融资。

未来AI产业真正值得关注的一个变化可能是:

过去的竞争问题是:

谁能最快训练一个模型?

未来的问题可能变成:

谁能最快、最便宜地把这个模型运行几十亿次?

如果AI真正从实验室进入每个人、每家公司、每台设备,那么:

Inference可能最终比Training更大。

而Groq从成立第一天开始,押注的正是这个市场。