Menu Close

Groq

Groq:用LPU挑战GPU的高速AI推理企业

Groq

Groq 是美国一家非常具有代表性的人工智能芯片AI推理基础设施企业。

如果说 NVIDIA GPU 的最大优势是同时兼顾AI训练和推理,那么Groq选择了一条更加专注的路线:

不追求通用GPU,而是从芯片架构开始专门为AI推理设计处理器。

Groq把自己的AI处理器称为:LPU——Language Processing Unit

也就是:语言处理单元。

LPU最重要的目标不是训练一个大模型,而是让已经训练完成的大模型能够 更快、更稳定、更低延迟地生成Token。

随着ChatGPT大语言模型、Reasoning Model以及AI Agent快速发展,AI产业正在从“训练模型”逐渐进入“海量运行模型”的阶段。

这使 AI Inference——人工智能推理 成为越来越重要的AI芯片市场。

Groq也因此成为全球AI推理芯片AI基础设施领域最值得关注的企业之一。

不过,截至2026年,Groq已经发生了一个非常重要的战略变化:

它正在从一家纯AI芯片公司,转向一家以高速AI推理为核心的Neocloud——新型AI云基础设施公司。

一、Groq公司简介

Groq成立于 2016年。

总部位于美国加利福尼亚州硅谷地区。

公司创始人为 Jonathan Ross。

Jonathan Ross在创立Groq之前曾经任职Google,是Google早期AI处理器 TPU——Tensor Processing Unit 核心开发团队成员之一。这段经历非常重要。

因为TPU代表Google第一次证明:AI计算不一定必须使用GPU完全可以针对机器学习计算特点重新设计专用处理器。

Jonathan Ross离开Google之后创立Groq,本质上延续了这个思路:

如果专用AI处理器能够提高训练效率,那么是否可以进一步设计一种专门针对AI推理优化的计算架构?

Groq由此诞生。

不过,2025年底Groq发生重大变化。

2025年12月,Groq与NVIDIA签署了一项非独家技术授权协议NVIDIA获得Groq部分AI推理技术授权,同时Jonathan Ross以及Groq多名核心人员加入NVIDIA。Groq本身并没有被NVIDIA收购,而是继续作为一家独立企业运营。

截至2026年,Groq CEO已经变更为:Adam Winter

公司目前的核心战略也从单纯开发LPU芯片,进一步转向 建设全球高速AI推理云。

二、什么是LPU?

Groq最重要的技术就是:LPU——Language Processing Unit。

虽然名称中有“Language”,但LPU并不是只能处理自然语言。

更加准确地说,它是一种 专门面向AI推理和线性代数计算设计的处理器。

AI模型中最常见的计算包括:

  • Matrix Multiplication
  • Vector Operations
  • Tensor Operations
  • Attention
  • Linear Algebra

GPU当然可以完成这些工作。但GPU最初是为了计算机图形设计的通用并行处理器。

随着时间发展,GPU增加了:

CUDA Core

Tensor Core

HBM

NVLink

以及各种AI软件。

最终演变成现代AI计算平台。

Groq则采取完全不同的路线:从第一天开始就只考虑AI推理。

因此LPU设计追求的不是最大程度的通用性,而是:

可预测的执行时间

极低延迟

极高Token生成速度

高片上内存带宽

容易扩展到大量LPU

Groq将LPU的核心设计原则概括为:

  • Software First
  • Programmable Assembly Line
  • Deterministic Compute
  • Deterministic Networking
  • On-Chip Memory

也就是说:软件优先、流水线执行、确定性计算、确定性网络和片上内存。

三、Groq最大的特点:Software First

传统处理器通常首先设计 Hardware,然后再开发 Compiler和Software。 让软件适应硬件。

Groq却反过来,先考虑编译器和软件如何执行AI模型,再设计硬件。

这就是Groq所谓:Software-First Architecture。

LPU的工作方式有点像一个巨大的 Assembly Line——流水线。

编译器在AI模型正式运行之前,就已经决定:

每一步计算在哪里执行;

数据什么时候到达;

什么时候进行乘法;

什么时候进行加法;

什么时候把数据发送到下一颗LPU。

因此在程序真正运行时 不需要大量动态调度。这和GPU存在明显区别。

GPU需要处理 线程, Warp, Kernel, Cache, Scheduler, Memory Hierarchy,大量运行时行为。

而Groq希望尽可能在编译阶段就把这些事情确定下来。

这使LPU拥有一个非常重要的特点:Deterministic Execution——确定性执行。

四、什么叫“确定性执行”?

假设某个AI模型执行一次需要 1毫秒。

传统GPU由于 缓存命中, 线程调度, 内存冲突, 网络拥堵 ,其他任务 等因素影响,实际运行时间可能产生一定变化。

Groq希望做到:编译器在模型运行之前,就知道每一步需要多少时间。

因此系统可以预测:

第一个计算什么时候结束;

第二个计算什么时候开始;

数据什么时候进入下一颗芯片

最终Token什么时候产生。

这对于 Real-Time AI 尤其重要。

例如 AI语音助手, 自动驾驶, 金融交易, 工业控制, 机器人, 实时翻译, AI Agent。

这些应用不仅需要 平均速度很快,还需要 每次都很快。

Groq把这种可预测性视为LPU区别于GPU的重要优势。

五、为什么Groq大量使用SRAM?

这是理解Groq架构非常重要的一点。

现代GPU通常使用:HBM——High Bandwidth Memory 作为大容量高速显存。

例如AI GPU可能配置 80GB, 96GB, 144GB, 甚至更多HBM。

HBM容量很大,但是它位于GPU计算核心之外。

数据需要不断:

GPU

HBM

GPU

来回移动。而数据移动本身需要时间和电力。

Groq采取了不同方法:大量使用片上SRAM

SRAM容量比HBM小得多,但是 速度非常快。而且距离计算单元非常近。

Groq认为,从本地SRAM读取数据的能耗远低于访问外部HBM,因此可以大幅降低AI推理中的数据移动成本。

这实际上反映了现代AI计算越来越重要的一个问题:真正的瓶颈往往已经不是计算,而是Memory也就是:如何把数据及时送给计算单元。

六、GroqChip

Groq早期推出的核心芯片叫:GroqChip。

Groq曾公开披露第一代GroqChip采用:14nm工艺

拥有:230MB片上SRAM

芯片片上内存带宽最高达到:80TB/s

峰值性能达到:750 TOPS INT8

以及 188 TFLOPS FP16

芯片通过 RealScale

高速芯片互联技术进行扩展。

这些数字今天已经不是判断Groq技术水平的唯一标准,因为Groq正在进入更新一代LPU和LPX系统。

但第一代GroqChip很好地体现了Groq最核心的设计哲学:

不要依赖复杂Cache层级和大量外部HBM,而是通过片上SRAM、高带宽互联和确定性执行来提高AI推理效率。

七、RealScale:把很多LPU连接起来

一颗LPU的SRAM容量有限。

但大型语言模型可能拥有 70B, 120B, 400B 甚至更多参数。因此仅靠单颗LPU显然无法运行非常大的模型。

Groq的解决方法是:把大量LPU连接成一个统一计算系统。

这套技术称为:RealScale。

传统GPU集群通常需要:

GPU

NVLink

NVSwitch

InfiniBand / Ethernet

其他GPU服务器

Groq则利用自己的确定性网络,让编译器提前知道:数据什么时候从一颗LPU传输到另一颗LPU。

这样多颗LPU可以像一个大型流水线一样共同执行模型。

Groq将这种系统描述为 Shared Resource Fabric,也就是很多LPU共同组成一个大型计算资源。

这也是Groq能够运行大型语言模型的重要技术基础。

八、Groq真正擅长的是Inference

Groq与NVIDIA最大的区别之一,就是战略重点不同。

NVIDIA的数据中心GPU主要同时支持 Training 和 Inference。

而Groq从很早就明确押注 Inference。

什么是Inference?

简单来说,训练阶段是:

大量数据

GPU计算

产生AI模型

而推理阶段则是:

用户输入问题

AI模型计算

产生答案。

例如你向一个大型语言模型输入:“What is Linux?” 随后模型生成答案。

整个生成过程就是 Inference。

ChatGPTAI搜索、AI编程、AI客服、AI Agent绝大多数日常计算,其实都是推理。

九、为什么AI推理正在变得越来越重要?

过去AI产业最大的投资集中在 Training。

因为训练GPT级大型模型需要大量GPU

但训练完成之后,真正长期发生的计算则是 Inference。

假设一个模型训练一次花费 数亿美元。

但模型上线后拥有 1亿用户,每个用户每天提出几十个问题,这些问题可能持续几年。

那么长期来看,推理计算量可能远远超过训练计算量。

Groq在2026年的公司战略中明确认为,推理最终需要的计算资源可能达到训练的 15至20倍。

这也解释了为什么包括:

NVIDIA

AMD

Groq

Cerebras

Google

Amazon

Microsoft

越来越多企业开始把注意力转向 Inference Infrastructure。

十、Token速度为什么这么重要?

大型语言模型生成内容的基本单位是:Token。

例如一个AI模型可能达到:

50 Tokens/s

100 Tokens/s

300 Tokens/s

500 Tokens/s

甚至 1,000 Tokens/s。

对于传统聊天机器人 100 Tokens/s已经非常快。

AI正在进入 Reasoning 和 Agentic AI 时代。

AI Agent可能需要:

思考

调用工具

搜索

分析

再次调用模型

执行程序

再次推理

一个任务可能生成:

几千

几万

甚至更多Token。

这样一来,Token速度就直接决定AI Agent完成工作的速度。

如果模型只能生成 50 Tokens/s,一个复杂任务可能需要一分钟。

如果达到 1,000 Tokens/s,很多工作可能几秒钟完成。

因此Groq最核心的商业卖点之一就是:Fast Inference。

十一、Groq曾经一夜爆红

Groq真正进入大众AI市场视野,是在2024年。

当时Groq公开展示:

Llama 2 70B

Mixtral

Gemma

等大型语言模型的高速推理。

2024年Artificial Analysis的独立测试中,Groq运行Llama 2 70B曾达到约 241 Tokens/s,明显高于当时很多其他云端AI推理服务。

随后Groq继续提升性能。

在2025年与Meta合作支持Llama API时,Groq披露某些Llama模型工作负载可以达到最高约 625 Tokens/s。

高速Token生成从此成为Groq最鲜明的品牌标签。

十二、GroqCloud

Groq随后发现 真正容易扩大市场的方法可能不是直接销售AI芯片。而是 让开发者直接使用AI算力。

因此Groq推出 GroqCloud。

开发人员不需要购买:

GroqChip

GroqCard

GroqNode

或者GroqRack。

只需要通过 API,即可调用Groq提供的大型语言模型。

这和:

OpenAI API

Anthropic API

Google Gemini API

在使用方式上非常类似。

但区别在于:

Groq主要出售的并不是自己训练的大模型。

Groq的核心产品是:Inference Infrastructure。

也就是:帮别人把模型跑得更快。

因此开发人员可以在GroqCloud上运行:

Llama

Qwen

Gemma

以及其他开放模型。

十三、Groq正在从芯片企业转型为Neocloud

到2026年,Groq的公司定位已经发生明显变化。

过去Groq经常被称为:AI Chip Startup。

现在Groq自己越来越强调:AI Inference Cloud,以及 Neocloud。

所谓Neocloud,可以理解为:专门围绕AI计算建立的新型云服务公司。

传统云计算市场主要是:

AWS

Microsoft Azure

Google Cloud

而新一代AI Neocloud则专门建设:

GPU

AI Accelerator

AI Inference

大型模型

相关计算基础设施。

Groq现在把自己定位成:Premier Neocloud for Fast Inference。

换句话说,Groq未来真正卖的可能越来越不是 一颗芯片而是 每秒多少Token。

这是理解今天Groq最重要的变化。

十四、Groq全球数据中心

截至2026年8月,Groq已经运营 13个数据中心

覆盖:

  • 北美
  • 欧洲
  • 中东
  • 亚太地区

Groq在2026年8月披露,平台已经服务超过 600万开发者 以及大量AI原生企业和Fortune 500客户。

Groq正在建设数百MW级AI推理基础设施。

公司2026年6月提出的目标是:到2027年扩展到约200MW推理容量。

这说明Groq正在快速从 芯片设计公司 转变为全球AI数据中心运营商。

十五、加拿大也是Groq的重要市场

Groq在加拿大也进行了较大规模布局。

2025年,Groq宣布与 Bell Canada 合作建设加拿大主权AI基础设施。Groq成为Bell AI Network的重要AI推理技术供应商。

该项目计划形成多个加拿大数据中心节点。其中包括:Kamloops, British Columbia,也就是加拿大BC省Kamloops。

Groq披露,Bell AI Fabric整体规划包括六个站点,并计划建设最高约500MW清洁能源计算基础设施。

这类项目体现了AI行业正在出现的另一个重要市场:Sovereign AI——主权人工智能

越来越多国家希望 AI模型, AI数据, AI计算,全部运行在本国数据中心中。

Groq正在积极进入这一市场。

十六、沙特阿拉伯成为Groq重要客户

Groq在中东的发展也非常快。

2025年2月,Groq宣布获得沙特阿拉伯 15亿美元 AI基础设施扩展承诺。

Groq此前已经在沙特Dammam建设大型AI推理集群,并通过GroqCloud向全球用户提供服务。

Groq还成为沙特AI公司 HUMAI的重要AI推理基础设施供应商之一。

中东拥有 资本, 能源, 土地, 数据中心建设能力。

因此正在成为全球AI基础设施竞争的重要地区。

十七、Groq与Meta

Groq还与Meta建立了重要合作。

2025年,Meta推出官方:Llama API

Groq成为其中的AI推理基础设施合作伙伴之一。

开发人员可以通过Meta官方Llama API使用由Groq LPU加速的Llama模型。这对Groq具有重要意义。

因为Meta Llama已经成为全球最重要的开放模型生态之一。

如果Groq能够成为大量Llama应用背后的推理基础设施,其商业价值就不再只是卖AI芯片,而是进入 AI Model Serving 这个长期市场。

十八、2025年底Groq与NVIDIA发生重大变化

这是今天介绍Groq绝对不能忽略的一件事。

2025年12月,NVIDIA与Groq达成了一项重大协议。

NVIDIA获得Groq的 非独家AI推理技术授权。

同时,Groq创始人Jonathan Ross以及公司多位核心技术和管理人员加入NVIDIA

当时市场甚至一度出现 NVIDIA将以约200亿美元收购Groq 的报道。

但最终双方明确表示:Groq没有被NVIDIA整体收购。Groq继续作为独立公司存在。

这项交易实际上非常特殊:

NVIDIA获得Groq技术授权和核心人才;

Groq投资者获得巨大回报;

Groq自身继续独立运营AI推理云。

可以把它理解为:Technology Licensing + Talent Transfer, 而不是传统意义上的完整公司收购。

十九、NVIDIA Groq 3 LPX

双方合作之后,Groq技术开始进一步进入NVIDIA生态。

目前Groq公开展示的重要平台之一是:NVIDIA Groq 3 LPX。

LPX将Groq下一代LPU与NVIDIA的新一代AI平台结合起来。

Groq目前公开的平台数据显示,一套LPX Rack可以配置 256颗LPU

提供约 128GB片上SRAM

SRAM带宽达到 40 PB/s

FP8推理性能达到 315 PFLOPS

并以 1,000 Tokens/s/User 作为重要性能定位。

这说明Groq未来与NVIDIA之间可能不仅是竞争关系。

更可能出现 GPU + LPU 共同工作的AI数据中心架构。

二十、为什么GPU和LPU可以一起工作?

GPU最擅长 大规模并行计算。尤其适合 AI Training ,大规模矩阵计算,Batch Processing。

LPU则强调 低延迟顺序计算。尤其适合 AI Inference, Token Generation, Real-Time AI

因此未来一个AI数据中心完全可能采用:

GPU负责 训练模型

然后LPU负责 运行模型。

甚至同一个推理任务也可以根据计算特点拆分到不同处理器。

这和计算机行业长期发展的 Heterogeneous Computing——异构计算 趋势非常一致。

未来AI服务器很可能不是只有一种处理器,而是:

CPU

GPU

LPU

DPU

其他AI Accelerator

共同组成。

二十一、Groq 2026年融资

Groq在完成NVIDIA技术授权之后并没有停止融资。

2026年6月,公司宣布获得 6.5亿美元 新增长资本。资金主要用于扩大Groq全球AI推理云。

随后在 2026年8月17日,Groq再次宣布完成 3.5亿美元Series A融资。

这一轮融资对公司的估值为 35亿美元。

由Disruptive领投,NVIDIA计划参与投资。

两轮融资合计达到 10亿美元。

之所以2026年的融资重新被称为“Series A”,与Groq在NVIDIA技术授权交易之后进行业务重组有关。

换句话说,今天的Groq与2025年之前纯粹以LPU芯片公司身份发展的Groq,商业结构已经发生明显变化。

二十二、为什么估值从69亿美元变成35亿美元?

2025年9月,Groq融资 7.5亿美元

当时公司估值达到 69亿美元。

但2026年8月新一轮融资中,公司估值为 35亿美元。

表面看起来似乎下降很多。但这里不能简单理解为公司价值“腰斩”。

原因是:2025年底NVIDIA已经通过技术授权交易取得部分Groq技术权利,并吸收Jonathan Ross等核心人才。

因此2026年的Groq实际上已经变成 Post-NVIDIA Licensing Groq。也就是 经过NVIDIA技术授权交易之后重新形成的公司。

新的35亿美元估值主要对应今天以 GroqCloud + AI Infrastructure 为核心的新Groq。

二十三、Groq目前最大的优势

Groq最大的优势首先是 极强的AI推理定位。

NVIDIA必须同时服务 图形, HPC, AI Training, AI Inference, 科学计算 很多市场。

Groq则把大量技术资源集中在 Inference。

第二个优势是 Deterministic Architecture。确定性执行使系统可以提供非常稳定的低延迟。

第三个优势是 SRAM大量片上SRAM能够减少AI推理中昂贵的数据搬运。

第四个优势是 Token速度。对于 AI Agent, 语音AI, 实时翻译, AI编程, Reasoning, 超高速Token生成拥有非常直接的用户价值。

第五个优势是 GroqCloud。用户并不需要购买Groq芯片,只需要调用API。这大幅降低了Groq技术进入市场的门槛。

二十四、Groq面临的挑战

Groq的技术很有特色,但它面临的挑战同样非常明显。

1. NVIDIA

最大的竞争者仍然是 NVIDIA而且现在这个关系变得更加复杂。

NVIDIA既是 Groq竞争者,又是 Groq技术授权合作伙伴,甚至还是Groq投资者。

NVIDIA本身也正在大规模加强AI推理产品。

因此Groq必须证明:即使NVIDIA已经获得部分LPU技术授权,GroqCloud依然拥有长期独立竞争力。

2. SRAM容量

SRAM非常快。

但它最大的问题是 昂贵,而且面积很大。

因此单颗LPU上的SRAM容量远小于GPU的HBM容量。

大型模型需要跨很多LPU运行。

这要求 编译器, 芯片互联, 模型分割, 数据调度 必须非常高效。

3. AI模型越来越复杂

最早的大语言模型主要是 Transformer。

现在开始出现:

Mixture of Experts

Multimodal Models

Reasoning Models

AI Agents

Long Context

各种新架构。

Groq必须不断证明LPU可以适应快速变化的模型结构。

4. 数据中心资本投入

Groq正在从芯片企业转向Neocloud。

这意味着未来需要建设 数据中心, 电力系统, 液冷, 网络, 服务器 全球节点。这是非常资本密集的业务。

因此未来Groq不仅需要优秀的芯片工程师,还需要具备类似 AWS,Microsoft Azure,Google Cloud 那样的数据中心运营能力。

二十五、Groq与Cerebras有什么区别?

Groq和Cerebras经常被放在一起讨论。因为两家公司都在挑战GPU。但它们的方法完全不同。

Cerebras的方法是 把处理器做到极大。

核心技术是 Wafer-Scale Engine。直接把整片晶圆做成一个超大型AI处理器。

Groq的方法则是 使用很多相对较小、结构简单、确定性的LPU。然后通过高速互联组成大型AI系统。

所以:

Cerebras强调 Scale Up。把单个计算单元做到巨大。

Groq强调 Deterministic Scale Out。通过确定性互联把很多LPU组合起来。

两家公司最终都希望解决GPU时代越来越明显的问题:

Memory Bandwidth

Interconnect

Latency

Energy Efficiency

但解决方案完全不同。

二十六、Groq与GPU真正的区别

传统GPU 大量线程并行执行。

Groq LPU 确定性流水线执行。

GPU强调 Throughput。

LPU更加重视 Latency + Predictability。

GPU大量依赖 HBM。

LPU强调 On-Chip SRAM

GPU运行 图形, 科学计算, AI训练, AI推理。

Groq主要针对 AI Inference。

因此Groq并不是 “另一家GPU公司”。更加准确地说,它代表一种新的 Inference Processor Architecture。

二十七、为什么Groq值得关注?

Groq真正值得关注的地方,并不是它是否能够“打败NVIDIA”。

更加重要的问题是 AI产业是否需要专门的推理处理器?

过去十年AI产业最重要的任务是 训练越来越大的模型。

因此GPU成为AI时代最重要的芯片,未来十年可能发生变化。

模型训练完成之后,几亿甚至几十亿用户每天都要运行这些模型。

AI Agent还可能自动进行:

搜索

写代码

调用工具

分析数据

生成内容

完成任务。

这意味着真正最大的计算市场最终可能变成 Inference。

如果这个判断成立,那么 专门针对Inference设计处理器 就可能成为一个独立的巨大半导体市场。

Groq正是在押注这个未来。

二十八、未来发展

未来几年,Groq最值得关注的方向主要有以下几个。

第一:GroqCloud。这是目前公司最重要的业务。

未来Groq能否从几百万开发者进一步扩大到真正的大规模企业AI市场,将决定公司的商业价值。

第二:NVIDIA合作。Groq技术已经进入NVIDIA LPX系统。

未来Groq和NVIDIA到底会形成 竞争, 合作 还是更深层融合,值得持续观察。

第三:全球AI数据中心。Groq计划建设数百MW推理容量。

这意味着公司正在从芯片企业进入大型AI基础设施竞争。

第四:AI Agent。Agent需要大量连续推理。

如果未来AI Agent成为主流应用 每秒Token数量 以及 推理延迟,可能变得比今天更加重要。这将非常有利于Groq的技术定位。

第五:Sovereign AI加拿大、沙特以及其他国家都开始建设自己的AI基础设施。

Groq可以通过相对独立于传统GPU云的AI推理平台进入这些市场。

结语

Groq是AI芯片产业中非常值得关注的一家公司。

它并没有选择重新制造一颗传统GPU,而是从AI推理本身的特点重新设计处理器。

Groq的LPU通过:

Software-First Architecture

Deterministic Execution

On-Chip SRAM

Programmable Assembly Line

RealScale Interconnect

建立了一套不同于GPUAI计算架构。

早期Groq主要是一家 AI Chip Company。

但截至2026年,这个定位已经发生重大变化。

NVIDIA获得Groq部分AI推理技术的非独家授权,创始人Jonathan Ross等核心人员加入NVIDIA之后,Groq依然保持独立,并把战略重点进一步转向:GroqCloud。

因此今天最准确的Groq定位已经从 LPU芯片公司,逐渐变成 AI Inference Infrastructure Company。

或者更准确地说 AI Inference Neocloud。

截至2026年8月,公司已经运营13个数据中心,服务超过600万开发者,并在2026年6月至8月完成合计10亿美元新融资。

未来AI产业真正值得关注的一个变化可能是:

过去的竞争问题是 谁能最快训练一个模型?

未来的问题可能变成 谁能最快、最便宜地把这个模型运行几十亿次?

如果AI真正从实验室进入每个人、每家公司、每台设备,那么 Inference可能最终比Training更大。

而Groq从成立第一天开始,押注的正是这个市场。