Groq 是美国一家非常具有代表性的人工智能芯片和AI推理基础设施企业。
如果说 NVIDIA GPU 的最大优势是同时兼顾AI训练和推理,那么Groq选择了一条更加专注的路线:
不追求通用GPU,而是从芯片架构开始专门为AI推理设计处理器。
Groq把自己的AI处理器称为:
LPU——Language Processing Unit
也就是:
语言处理单元。
LPU最重要的目标不是训练一个大模型,而是让已经训练完成的大模型能够:
更快、更稳定、更低延迟地生成Token。
随着ChatGPT、大语言模型、Reasoning Model以及AI Agent快速发展,AI产业正在从“训练模型”逐渐进入“海量运行模型”的阶段。
这使:
Groq也因此成为全球AI推理芯片和AI基础设施领域最值得关注的企业之一。
不过,截至2026年,Groq已经发生了一个非常重要的战略变化:
它正在从一家纯AI芯片公司,转向一家以高速AI推理为核心的Neocloud——新型AI云基础设施公司。
一、Groq公司简介
Groq成立于:
2016年
总部位于美国加利福尼亚州硅谷地区。
公司创始人为:
Jonathan Ross
Jonathan Ross在创立Groq之前曾经任职Google,是Google早期AI处理器:
TPU——Tensor Processing Unit
核心开发团队成员之一。
这段经历非常重要。
因为TPU代表Google第一次证明:
完全可以针对机器学习计算特点重新设计专用处理器。
Jonathan Ross离开Google之后创立Groq,本质上延续了这个思路:
如果专用AI处理器能够提高训练效率,那么是否可以进一步设计一种专门针对AI推理优化的计算架构?
Groq由此诞生。
不过,2025年底Groq发生重大变化。
2025年12月,Groq与NVIDIA签署了一项非独家技术授权协议,NVIDIA获得Groq部分AI推理技术授权,同时Jonathan Ross以及Groq多名核心人员加入NVIDIA。Groq本身并没有被NVIDIA收购,而是继续作为一家独立企业运营。
截至2026年,Groq CEO已经变更为:
Adam Winter
公司目前的核心战略也从单纯开发LPU芯片,进一步转向:
建设全球高速AI推理云。
二、什么是LPU?
Groq最重要的技术就是:
LPU——Language Processing Unit。
虽然名称中有“Language”,但LPU并不是只能处理自然语言。
更加准确地说,它是一种:
专门面向AI推理和线性代数计算设计的处理器。
AI模型中最常见的计算包括:
- Matrix Multiplication
- Vector Operations
- Tensor Operations
- Attention
- Linear Algebra
GPU当然可以完成这些工作。
但GPU最初是为了计算机图形设计的通用并行处理器。
随着时间发展,GPU增加了:
CUDA Core
Tensor Core
HBM
NVLink
以及各种AI软件。
最终演变成现代AI计算平台。
Groq则采取完全不同的路线:
从第一天开始就只考虑AI推理。
因此LPU设计追求的不是最大程度的通用性,而是:
可预测的执行时间
极低延迟
极高Token生成速度
高片上内存带宽
容易扩展到大量LPU
Groq将LPU的核心设计原则概括为:
- Software First
- Programmable Assembly Line
- Deterministic Compute
- Deterministic Networking
- On-Chip Memory
也就是说:
软件优先、流水线执行、确定性计算、确定性网络和片上内存。
三、Groq最大的特点:Software First
传统处理器通常首先设计:
Hardware
然后再开发:
Compiler和Software
让软件适应硬件。
Groq却反过来:
先考虑编译器和软件如何执行AI模型,再设计硬件。
这就是Groq所谓:
Software-First Architecture。
LPU的工作方式有点像一个巨大的:
Assembly Line——流水线。
编译器在AI模型正式运行之前,就已经决定:
每一步计算在哪里执行;
数据什么时候到达;
什么时候进行乘法;
什么时候进行加法;
什么时候把数据发送到下一颗LPU。
因此在程序真正运行时:
不需要大量动态调度。
这和GPU存在明显区别。
GPU需要处理:
线程
Warp
Kernel
Cache
Scheduler
Memory Hierarchy
大量运行时行为。
而Groq希望尽可能在编译阶段就把这些事情确定下来。
这使LPU拥有一个非常重要的特点:
Deterministic Execution——确定性执行。
四、什么叫“确定性执行”?
假设某个AI模型执行一次需要:
1毫秒。
传统GPU由于:
缓存命中
线程调度
内存冲突
网络拥堵
其他任务
等因素影响,实际运行时间可能产生一定变化。
Groq希望做到:
编译器在模型运行之前,就知道每一步需要多少时间。
因此系统可以预测:
第一个计算什么时候结束;
第二个计算什么时候开始;
数据什么时候进入下一颗芯片;
最终Token什么时候产生。
这对于:
Real-Time AI
尤其重要。
例如:
AI语音助手
自动驾驶
金融交易
工业控制
机器人
实时翻译
AI Agent
这些应用不仅需要:
平均速度很快
还需要:
每次都很快。
Groq把这种可预测性视为LPU区别于GPU的重要优势。
五、为什么Groq大量使用SRAM?
这是理解Groq架构非常重要的一点。
现代GPU通常使用:
HBM——High Bandwidth Memory
作为大容量高速显存。
80GB
96GB
144GB
甚至更多HBM。
HBM容量很大,但是它位于GPU计算核心之外。
数据需要不断:
↓
HBM
↓
来回移动。
而数据移动本身需要时间和电力。
Groq采取了不同方法:
大量使用片上SRAM。
SRAM容量比HBM小得多,但是:
速度非常快。
而且距离计算单元非常近。
Groq认为,从本地SRAM读取数据的能耗远低于访问外部HBM,因此可以大幅降低AI推理中的数据移动成本。
这实际上反映了现代AI计算越来越重要的一个问题:
真正的瓶颈往往已经不是计算,而是Memory。
也就是:
如何把数据及时送给计算单元。
六、GroqChip
Groq早期推出的核心芯片叫:
GroqChip。
Groq曾公开披露第一代GroqChip采用:
14nm工艺
拥有:
230MB片上SRAM
单芯片片上内存带宽最高达到:
80TB/s
峰值性能达到:
750 TOPS INT8
以及:
188 TFLOPS FP16
芯片通过:
RealScale
高速芯片互联技术进行扩展。
这些数字今天已经不是判断Groq技术水平的唯一标准,因为Groq正在进入更新一代LPU和LPX系统。
但第一代GroqChip很好地体现了Groq最核心的设计哲学:
不要依赖复杂Cache层级和大量外部HBM,而是通过片上SRAM、高带宽互联和确定性执行来提高AI推理效率。
七、RealScale:把很多LPU连接起来
一颗LPU的SRAM容量有限。
但大型语言模型可能拥有:
70B
120B
400B
甚至更多参数。
因此仅靠单颗LPU显然无法运行非常大的模型。
Groq的解决方法是:
把大量LPU连接成一个统一计算系统。
这套技术称为:
RealScale。
传统GPU集群通常需要:
↓
NVLink
↓
NVSwitch
↓
InfiniBand / Ethernet
↓
其他GPU服务器
Groq则利用自己的确定性网络,让编译器提前知道:
数据什么时候从一颗LPU传输到另一颗LPU。
这样多颗LPU可以像一个大型流水线一样共同执行模型。
Groq将这种系统描述为:
Shared Resource Fabric
也就是很多LPU共同组成一个大型计算资源。
这也是Groq能够运行大型语言模型的重要技术基础。
八、Groq真正擅长的是Inference
Groq与NVIDIA最大的区别之一,就是战略重点不同。
Training
和:
Inference。
而Groq从很早就明确押注:
Inference。
什么是Inference?
简单来说:
训练阶段是:
大量数据
↓
GPU计算
↓
产生AI模型
而推理阶段则是:
用户输入问题
↓
AI模型计算
↓
产生答案。
例如你向一个大型语言模型输入:
“What is Linux?”
随后模型生成答案。
整个生成过程就是:
Inference。
ChatGPT、AI搜索、AI编程、AI客服、AI Agent绝大多数日常计算,其实都是推理。
九、为什么AI推理正在变得越来越重要?
过去AI产业最大的投资集中在:
Training。
因为训练GPT级大型模型需要大量GPU。
但训练完成之后,真正长期发生的计算则是:
Inference。
假设一个模型训练一次花费:
数亿美元。
但模型上线后拥有:
1亿用户。
每个用户每天提出几十个问题。
这些问题可能持续几年。
那么长期来看:
推理计算量可能远远超过训练计算量。
Groq在2026年的公司战略中明确认为,推理最终需要的计算资源可能达到训练的:
15至20倍。
这也解释了为什么包括:
Groq
Cerebras
越来越多企业开始把注意力转向:
Inference Infrastructure。
十、Token速度为什么这么重要?
大型语言模型生成内容的基本单位是:
Token。
例如一个AI模型可能达到:
50 Tokens/s
100 Tokens/s
300 Tokens/s
500 Tokens/s
甚至:
1,000 Tokens/s。
对于传统聊天机器人:
100 Tokens/s已经非常快。
但AI正在进入:
Reasoning
和:
Agentic AI
时代。
AI Agent可能需要:
思考
↓
调用工具
↓
搜索
↓
分析
↓
再次调用模型
↓
执行程序
↓
再次推理
一个任务可能生成:
几千
几万
甚至更多Token。
这样一来:
Token速度就直接决定AI Agent完成工作的速度。
如果模型只能生成:
50 Tokens/s
一个复杂任务可能需要一分钟。
如果达到:
1,000 Tokens/s
很多工作可能几秒钟完成。
因此Groq最核心的商业卖点之一就是:
Fast Inference。
十一、Groq曾经一夜爆红
Groq真正进入大众AI市场视野,是在2024年。
当时Groq公开展示:
Llama 2 70B
Mixtral
Gemma
等大型语言模型的高速推理。
2024年Artificial Analysis的独立测试中,Groq运行Llama 2 70B曾达到约:
241 Tokens/s
明显高于当时很多其他云端AI推理服务。
随后Groq继续提升性能。
在2025年与Meta合作支持Llama API时,Groq披露某些Llama模型工作负载可以达到最高约:
625 Tokens/s。
高速Token生成从此成为Groq最鲜明的品牌标签。
十二、GroqCloud
Groq随后发现:
而是:
让开发者直接使用AI算力。
因此Groq推出:
GroqCloud。
开发人员不需要购买:
GroqChip
GroqCard
GroqNode
或者GroqRack。
只需要通过:
API
即可调用Groq提供的大型语言模型。
这和:
OpenAI API
Anthropic API
Google Gemini API
在使用方式上非常类似。
但区别在于:
Groq主要出售的并不是自己训练的大模型。
Groq的核心产品是:
Inference Infrastructure。
也就是:
帮别人把模型跑得更快。
因此开发人员可以在GroqCloud上运行:
Llama
Qwen
Gemma
以及其他开放模型。
十三、Groq正在从芯片企业转型为Neocloud
到2026年,Groq的公司定位已经发生明显变化。
过去Groq经常被称为:
AI Chip Startup。
现在Groq自己越来越强调:
AI Inference Cloud
以及:
Neocloud。
所谓Neocloud,可以理解为:
专门围绕AI计算建立的新型云服务公司。
传统云计算市场主要是:
AWS
Microsoft Azure
Google Cloud
而新一代AI Neocloud则专门建设:
AI Accelerator
AI Inference
大型模型
相关计算基础设施。
Groq现在把自己定位成:
Premier Neocloud for Fast Inference。
换句话说:
Groq未来真正卖的可能越来越不是:
一颗芯片。
而是:
每秒多少Token。
这是理解今天Groq最重要的变化。
十四、Groq全球数据中心
截至2026年8月,Groq已经运营:
13个数据中心
覆盖:
- 北美
- 欧洲
- 中东
- 亚太地区
Groq在2026年8月披露,平台已经服务超过:
600万开发者
以及大量AI原生企业和Fortune 500客户。
Groq正在建设数百MW级AI推理基础设施。
公司2026年6月提出的目标是:
到2027年扩展到约200MW推理容量。
这说明Groq正在快速从:
芯片设计公司
转变为:
全球AI数据中心运营商。
十五、加拿大也是Groq的重要市场
Groq在加拿大也进行了较大规模布局。
2025年,Groq宣布与:
Bell Canada
合作建设加拿大主权AI基础设施。
Groq成为Bell AI Network的重要AI推理技术供应商。
该项目计划形成多个加拿大数据中心节点。
其中包括:
Kamloops, British Columbia
也就是加拿大BC省Kamloops。
Groq披露,Bell AI Fabric整体规划包括六个站点,并计划建设最高约500MW清洁能源计算基础设施。
这类项目体现了AI行业正在出现的另一个重要市场:
越来越多国家希望:
AI模型
AI数据
AI计算
全部运行在本国数据中心中。
Groq正在积极进入这一市场。
十六、沙特阿拉伯成为Groq重要客户
Groq在中东的发展也非常快。
2025年2月,Groq宣布获得沙特阿拉伯:
15亿美元
AI基础设施扩展承诺。
Groq此前已经在沙特Dammam建设大型AI推理集群,并通过GroqCloud向全球用户提供服务。
Groq还成为沙特AI公司:
HUMAIN
的重要AI推理基础设施供应商之一。
中东拥有:
资本
能源
土地
数据中心建设能力
因此正在成为全球AI基础设施竞争的重要地区。
十七、Groq与Meta
Groq还与Meta建立了重要合作。
2025年,Meta推出官方:
Llama API
Groq成为其中的AI推理基础设施合作伙伴之一。
开发人员可以通过Meta官方Llama API使用由Groq LPU加速的Llama模型。
这对Groq具有重要意义。
因为Meta Llama已经成为全球最重要的开放模型生态之一。
如果Groq能够成为大量Llama应用背后的推理基础设施,其商业价值就不再只是卖AI芯片,而是进入:
AI Model Serving
这个长期市场。
十八、2025年底Groq与NVIDIA发生重大变化
这是今天介绍Groq绝对不能忽略的一件事。
2025年12月,NVIDIA与Groq达成了一项重大协议。
NVIDIA获得Groq的:
非独家AI推理技术授权。
同时,Groq创始人Jonathan Ross以及公司多位核心技术和管理人员加入NVIDIA。
当时市场甚至一度出现:
NVIDIA将以约200亿美元收购Groq
的报道。
但最终双方明确表示:
Groq没有被NVIDIA整体收购。
Groq继续作为独立公司存在。
这项交易实际上非常特殊:
NVIDIA获得Groq技术授权和核心人才;
Groq投资者获得巨大回报;
Groq自身继续独立运营AI推理云。
可以把它理解为:
Technology Licensing + Talent Transfer
而不是传统意义上的完整公司收购。
十九、NVIDIA Groq 3 LPX
双方合作之后,Groq技术开始进一步进入NVIDIA生态。
目前Groq公开展示的重要平台之一是:
NVIDIA Groq 3 LPX。
LPX将Groq下一代LPU与NVIDIA的新一代AI平台结合起来。
Groq目前公开的平台数据显示,一套LPX Rack可以配置:
256颗LPU
提供约:
128GB片上SRAM
SRAM带宽达到:
40 PB/s
FP8推理性能达到:
315 PFLOPS
并以:
1,000 Tokens/s/User
作为重要性能定位。
这说明Groq未来与NVIDIA之间可能不仅是竞争关系。
更可能出现:
GPU + LPU
共同工作的AI数据中心架构。
二十、为什么GPU和LPU可以一起工作?
GPU最擅长:
大规模并行计算。
尤其适合:
大规模矩阵计算
Batch Processing。
LPU则强调:
低延迟顺序计算。
尤其适合:
AI Inference
Token Generation
Real-Time AI。
因此未来一个AI数据中心完全可能采用:
GPU负责:
训练模型
然后LPU负责:
运行模型。
甚至同一个推理任务也可以根据计算特点拆分到不同处理器。
这和计算机行业长期发展的:
Heterogeneous Computing——异构计算
趋势非常一致。
未来AI服务器很可能不是只有一种处理器,而是:
LPU
DPU
其他AI Accelerator
共同组成。
二十一、Groq 2026年融资
Groq在完成NVIDIA技术授权之后并没有停止融资。
2026年6月,公司宣布获得:
6.5亿美元
新增长资本。
资金主要用于扩大Groq全球AI推理云。
随后在:
2026年8月17日
Groq再次宣布完成:
3.5亿美元Series A融资。
这一轮融资对公司的估值为:
35亿美元。
由Disruptive领投,NVIDIA计划参与投资。
两轮融资合计达到:
10亿美元。
之所以2026年的融资重新被称为“Series A”,与Groq在NVIDIA技术授权交易之后进行业务重组有关。
换句话说,今天的Groq与2025年之前纯粹以LPU芯片公司身份发展的Groq,商业结构已经发生明显变化。
二十二、为什么估值从69亿美元变成35亿美元?
2025年9月,Groq融资:
7.5亿美元
当时公司估值达到:
69亿美元。
但2026年8月新一轮融资中,公司估值为:
35亿美元。
表面看起来似乎下降很多。
但这里不能简单理解为公司价值“腰斩”。
原因是:
2025年底NVIDIA已经通过技术授权交易取得部分Groq技术权利,并吸收Jonathan Ross等核心人才。
因此2026年的Groq实际上已经变成:
Post-NVIDIA Licensing Groq
也就是:
经过NVIDIA技术授权交易之后重新形成的公司。
新的35亿美元估值主要对应今天以:
GroqCloud + AI Infrastructure
为核心的新Groq。
二十三、Groq目前最大的优势
Groq最大的优势首先是:
极强的AI推理定位。
NVIDIA必须同时服务:
图形
HPC
AI Inference
科学计算
很多市场。
Groq则把大量技术资源集中在:
Inference。
第二个优势是:
Deterministic Architecture。
确定性执行使系统可以提供非常稳定的低延迟。
第三个优势是:
SRAM。
第四个优势是:
Token速度。
对于:
AI Agent
语音AI
实时翻译
AI编程
Reasoning
超高速Token生成拥有非常直接的用户价值。
第五个优势是:
GroqCloud。
用户并不需要购买Groq芯片,只需要调用API。
这大幅降低了Groq技术进入市场的门槛。
二十四、Groq面临的挑战
Groq的技术很有特色,但它面临的挑战同样非常明显。
1. NVIDIA
最大的竞争者仍然是:
而且现在这个关系变得更加复杂。
NVIDIA既是:
Groq竞争者
又是:
Groq技术授权合作伙伴
甚至还是Groq投资者。
因此Groq必须证明:
即使NVIDIA已经获得部分LPU技术授权,GroqCloud依然拥有长期独立竞争力。
2. SRAM容量
SRAM非常快。
但它最大的问题是:
昂贵,而且面积很大。
大型模型需要跨很多LPU运行。
这要求:
编译器
芯片互联
模型分割
数据调度
必须非常高效。
3. AI模型越来越复杂
最早的大语言模型主要是:
Transformer。
现在开始出现:
Mixture of Experts
Multimodal Models
Reasoning Models
AI Agents
Long Context
各种新架构。
Groq必须不断证明LPU可以适应快速变化的模型结构。
4. 数据中心资本投入
Groq正在从芯片企业转向Neocloud。
这意味着未来需要建设:
数据中心
电力系统
液冷
网络
服务器
全球节点。
这是非常资本密集的业务。
因此未来Groq不仅需要优秀的芯片工程师,还需要具备类似:
AWS
Microsoft Azure
Google Cloud
那样的数据中心运营能力。
二十五、Groq与Cerebras有什么区别?
Groq和Cerebras经常被放在一起讨论。
因为两家公司都在挑战GPU。
但它们的方法完全不同。
Cerebras的方法是:
把处理器做到极大。
核心技术是:
Wafer-Scale Engine。
直接把整片晶圆做成一个超大型AI处理器。
Groq的方法则是:
使用很多相对较小、结构简单、确定性的LPU。
然后通过高速互联组成大型AI系统。
所以:
Cerebras强调:
Scale Up。
把单个计算单元做到巨大。
Groq强调:
Deterministic Scale Out。
通过确定性互联把很多LPU组合起来。
两家公司最终都希望解决GPU时代越来越明显的问题:
Memory Bandwidth
Interconnect
Latency
Energy Efficiency
但解决方案完全不同。
二十六、Groq与GPU真正的区别
传统GPU:
大量线程并行执行。
Groq LPU:
确定性流水线执行。
GPU强调:
Throughput。
LPU更加重视:
Latency + Predictability。
GPU大量依赖:
HBM。
LPU强调:
On-Chip SRAM。
GPU运行:
图形
科学计算
AI训练
AI推理
Groq主要针对:
AI Inference。
因此Groq并不是:
“另一家GPU公司”。
更加准确地说,它代表一种新的:
Inference Processor Architecture。
二十七、为什么Groq值得关注?
Groq真正值得关注的地方,并不是它是否能够“打败NVIDIA”。
更加重要的问题是:
AI产业是否需要专门的推理处理器?
过去十年AI产业最重要的任务是:
训练越来越大的模型。
未来十年可能发生变化。
模型训练完成之后,几亿甚至几十亿用户每天都要运行这些模型。
AI Agent还可能自动进行:
搜索
写代码
调用工具
分析数据
生成内容
完成任务。
这意味着真正最大的计算市场最终可能变成:
Inference。
如果这个判断成立,那么:
专门针对Inference设计处理器
就可能成为一个独立的巨大半导体市场。
Groq正是在押注这个未来。
二十八、未来发展
未来几年,Groq最值得关注的方向主要有以下几个。
第一:
GroqCloud。
这是目前公司最重要的业务。
未来Groq能否从几百万开发者进一步扩大到真正的大规模企业AI市场,将决定公司的商业价值。
第二:
NVIDIA合作。
Groq技术已经进入NVIDIA LPX系统。
未来Groq和NVIDIA到底会形成:
竞争
合作
还是更深层融合,
值得持续观察。
第三:
全球AI数据中心。
Groq计划建设数百MW推理容量。
第四:
AI Agent。
Agent需要大量连续推理。
如果未来AI Agent成为主流应用:
每秒Token数量
以及:
推理延迟
可能变得比今天更加重要。
这将非常有利于Groq的技术定位。
第五:
Sovereign AI。
加拿大、沙特以及其他国家都开始建设自己的AI基础设施。
Groq可以通过相对独立于传统GPU云的AI推理平台进入这些市场。
结语
它并没有选择重新制造一颗传统GPU,而是从AI推理本身的特点重新设计处理器。
Groq的LPU通过:
Software-First Architecture
Deterministic Execution
On-Chip SRAM
Programmable Assembly Line
RealScale Interconnect
早期Groq主要是一家:
AI Chip Company。
但截至2026年,这个定位已经发生重大变化。
NVIDIA获得Groq部分AI推理技术的非独家授权,创始人Jonathan Ross等核心人员加入NVIDIA之后,Groq依然保持独立,并把战略重点进一步转向:
GroqCloud。
因此今天最准确的Groq定位已经从:
LPU芯片公司
逐渐变成:
AI Inference Infrastructure Company。
或者更准确地说:
AI Inference Neocloud。
截至2026年8月,公司已经运营13个数据中心,服务超过600万开发者,并在2026年6月至8月完成合计10亿美元新融资。
未来AI产业真正值得关注的一个变化可能是:
过去的竞争问题是:
谁能最快训练一个模型?
未来的问题可能变成:
谁能最快、最便宜地把这个模型运行几十亿次?
如果AI真正从实验室进入每个人、每家公司、每台设备,那么:
Inference可能最终比Training更大。
而Groq从成立第一天开始,押注的正是这个市场。
