昆仑芯(Kunlunxin):从百度自研 AI 芯片走向独立算力平台
昆仑芯(北京)科技股份有限公司,Kunlunxin,是中国重要的云端 AI 芯片企业之一。
昆仑芯的技术历史可以追溯到:
2011 年。
当时百度已经开始使用 FPGA 研究人工智能计算加速。
经过十多年发展,昆仑芯已经从:
FPGA AI 加速器
逐渐发展到:
再进一步扩展到:
2021 年,百度将昆仑芯业务独立出来融资,成立独立公司。不过百度至今仍然是昆仑芯的重要股东,昆仑芯也仍属于百度体系中的重要 AI 算力资产。2026 年,昆仑芯正在同时推进香港上市和科创板上市准备。
昆仑芯并不是突然出现的一家 AI 芯片公司
理解昆仑芯,首先需要理解百度为什么这么早就开始自己设计 AI 芯片。
百度的核心业务长期涉及:
搜索、
广告、
推荐、
语音识别、
自然语言处理、
图像识别
以及后来出现的:
这些业务有一个共同特点:
需要极其庞大的计算量。
但是随着深度学习计算量迅速增加,百度开始研究:
能不能针对自己的 AI 工作负载设计更加高效的处理器?
2011 年,百度启动 FPGA AI 加速器。
到了 2015 年,FPGA 部署规模已经超过:
5000 片。
2017 年超过:
1.2 万片。
同年,百度在 Hot Chips 会议上公开了自己的:
XPU 架构。
这意味着昆仑芯真正的技术历史,远远早于今天的大模型热潮。
2018 年:百度正式发布“昆仑”
2018 年,百度正式发布第一代:
当时发布的产品包括:
昆仑 818-100
以及:
昆仑 818-300。
百度将其定位为:
当时官方公布的峰值 AI 算力达到约:
260 TOPS。
相比百度此前使用的 FPGA AI 加速方案,性能实现了大幅提升。
这是百度第一次从:
使用通用芯片加 FPGA 加速
真正跨入:
自主设计 AI ASIC
阶段。
昆仑芯一代:从芯片 Demo 进入真正业务系统
昆仑芯第一代产品于:
2019 年流片
并于:
2020 年规模量产。
它并不是停留在实验室里的芯片。
昆仑芯一代后来大量部署到百度:
搜索引擎、
小度、
百度智能云
等真实业务中。
百度曾披露,第一代昆仑芯量产超过:
2 万片。
很多芯片可以:
Tape-Out,
点亮,
甚至跑 Benchmark。
但是:
能够连续几年运行在大型互联网公司的核心业务中,是完全不同的一件事。
搜索和推荐业务拥有海量实时请求。
芯片必须解决:
稳定性、
驱动程序、
编译器、
内存管理、
故障恢复、
服务器兼容
等大量工程问题。
昆仑芯因此拥有一个非常特殊的优势:
它从诞生开始就拥有百度这样的大规模实际应用环境。
昆仑芯一代采用 XPU 架构
昆仑芯并不是传统 GPU。
它采用百度自主研发的:
XPU 架构。
这里的 XPU 可以理解为:
面向人工智能和异构计算设计的一种可编程计算架构。
其目标并不是:
运行游戏图形。
而是处理:
矩阵运算、
向量运算、
神经网络、
推荐算法、
自然语言处理
以及各种 AI 工作负载。
因此从技术分类来看,昆仑芯更加接近:
而不是传统 Graphics GPU。
第一代昆仑芯的代表产品 K100
昆仑芯第一代产品包括:
K100
和:
K200。
其中 K100 更加偏向:
边缘 AI 推理。
官方规格显示:
K100 提供:
128 TOPS INT8
32 TFLOPS FP16
配备:
8GB HBM
内存带宽:
256GB/s
功耗:
75W。
从今天的大模型时代来看,这些参数已经不算惊人。
但是要注意:
这是第一代昆仑芯产品。
它真正的重要意义是:
建立昆仑芯自己的芯片、板卡和软件体系。
K200:开始进入云数据中心
K200 则更加偏向:
数据中心 AI。
K200 提供:
256 TOPS INT8
64 TFLOPS FP16
16GB HBM
内存带宽达到:
512GB/s。
采用:
14nm 制程
板卡功耗约:
150W。
K200 可以用于:
AI 推理,
也支持:
AI 训练。
这让昆仑芯从第一代开始就没有把自己限制成:
纯推理芯片。
2021 年:昆仑芯从百度内部部门走向独立公司
昆仑芯历史上非常关键的一步发生在:
2021 年。
2021 年 3 月,百度昆仑芯片业务完成独立融资。
投资方包括:
CPE 源峰
IDG 资本
君联资本
元禾璞华
等机构。
当时投后估值约:
130 亿元人民币。
随后百度昆仑芯业务正式成立独立公司:
昆仑芯(北京)科技有限公司。
原百度芯片首席架构师:
欧阳剑
出任公司 CEO。
截至 2026 年,欧阳剑仍然担任昆仑芯 CEO。
为什么昆仑芯要独立?
把芯片部门留在百度内部,有一个天然问题:
其他互联网公司为什么要购买竞争对手内部部门的芯片?
长期供应、
技术路线、
商业中立性
以及:
数据和业务安全。
如果昆仑芯永远只是“百度内部芯片部门”,市场边界就会非常有限。
因此独立化的意义不仅是:
融资。
更加重要的是:
让昆仑芯从百度自用芯片逐渐变成面向整个市场的 AI 芯片供应商。
这一转型到了 2025—2026 年开始变得越来越明显。
昆仑芯二代:XPU-R
2021 年 8 月:
昆仑芯二代正式量产。
第二代产品采用新一代:
XPU-R 架构。
其中一个重要变化是:
更加重视:
通用性和易编程性。
官方表示,相比第一代产品,第二代通用计算核心能力提高:
约 2—3 倍。
芯片不能只跑几个固定神经网络。
AI 模型变化速度太快。
从:
CNN
到:
Transformer,
再到:
MoE、
LLM、
VLM
和 AI Agent,
如果芯片只能执行某一种固定模型,很容易迅速淘汰。
因此昆仑芯越来越强调:
Programmability。
R200:第二代代表性 AI 加速卡
昆仑芯二代的重要产品之一是:
R200 系列。
官方公布的 R200 规格包括:
256 TOPS INT8
128 TFLOPS FP16
32 TFLOPS FP32
显存:
16GB 或 32GB GDDR6
内存带宽:
512GB/s
接口:
PCIe Gen4 ×16
制程:
7nm
功耗:
150W—160W。
R200 可以用于:
自然语言处理、
计算机视觉、
语音识别、
机器学习
以及:
AI 训练和推理。
RG800:更加接近数据中心通用 AI 加速卡
昆仑芯后来推出:
RG800。
RG800 同样采用:
XPU-R
架构。
它提供:
256 TOPS INT8
128 TFLOPS FP16
以及:
32GB GDDR6。
板卡功耗约:
130W。
它同时整合比较强的视频编解码能力。
因此适合:
视频分析、
推荐系统、
AI 推理
以及其他数据中心工作负载。
R480-X8:昆仑芯很早就开始做 8 卡 AI 系统
昆仑芯另外一个非常重要的产品是:
R480-X8。
它已经不是一张普通 PCIe 卡。
R480-X8 基于:
UBB 服务器基板
安装:
8 个昆仑芯二代 OAM 模组。
8 颗处理器可以共同执行:
大型模型训练和推理。
这代表昆仑芯技术方向上的一个重要变化:
从:
开始进入:
AI System。
这个变化后来在大模型时代变得更加重要。
第三代昆仑芯:真正进入大模型时代
2024 年,昆仑芯第三代产品开始量产。
第三代产品的重点已经与前两代明显不同。
AI 行业发生了巨大变化。
图像识别、
推荐、
语音识别。
现在核心工作负载越来越变成:
Large Language Model。
也就是:
更大的模型、
更多参数、
更高显存需求、
更复杂的 Attention、
更高互联带宽
以及:
数千、数万张 AI 卡共同运行。
第三代昆仑芯的代表性产品,就是:
P800。
P800 是昆仑芯目前最重要的产品
P800 使用昆仑芯自主研发的:
XPU-P 架构。
官方资料显示,P800 已经实现大规模商业部署,并成为昆仑芯目前最重要的大模型算力平台之一。
截至 2025 年,P800 累计部署已经达到数万卡级别,最大单集群规模超过:
3 万卡。
这使昆仑芯开始真正进入:
中国大型 AI 数据中心市场。
2025 年,P800 点亮万卡集群
2025 年 2 月:
百度智能云正式点亮:
昆仑芯三代万卡集群。
百度随后又继续建设:
3 万卡集群。
一万张卡组成一个集群
与:
制造一张 AI 加速卡
是完全不同的技术难度。
因为万卡系统会出现一个非常现实的问题:
即使每张卡只有极低故障率,
当数量达到:
10,000 张
以后,
几乎每一天都可能有:
某张卡、
某个网络模块、
某条链路
发生故障。
所以真正的大模型 AI 系统必须拥有:
故障检测、
任务恢复、
checkpoint、
网络容错、
通信优化
以及:
分布式训练调度。
百度披露的昆仑芯万卡平台有效训练率已经达到非常高的水平,这说明昆仑芯正在从“AI 芯片”进一步进入真正的:
AI Supercomputing。
2025 年 4 月,集群规模进一步达到 3 万卡
2025 年 4 月,百度进一步点亮:
P800 3 万卡集群。
部分百度大模型开始直接使用这一国产 AI 芯片集群进行训练。
这点非常重要。
Inference。
也就是模型训练完成以后进行推理。
而真正的大模型:
Pretraining
对稳定性、通信和软件生态的要求远远更高。
昆仑芯开始进入大规模训练市场,意味着国产 AI 芯片的竞争已经从:
“能不能运行大模型”
逐渐进入:
“能不能训练大模型”。
DeepSeek 成为国产 AI 芯片的重要转折点
2025 年 DeepSeek 爆发以后,中国 AI 芯片市场出现一个非常明显的变化。
大量企业开始重新考虑:
的完整部署。
昆仑芯也很快完成了:
DeepSeek-V3、
DeepSeek-R1
以及相关蒸馏模型的适配。
这件事情真正重要的不是:
“DeepSeek 能不能跑”。
而是:
新模型出来以后,国产芯片需要多久才能完成适配。
Day 0 Model Support。
昆仑芯已经从百度内部走向外部市场
昆仑芯早期最大的客户当然就是:
百度。
这是优势,也是限制。
优势在于:
百度提供了海量实际工作负载。
限制在于:
一家芯片公司如果只有母公司一个客户,很难成为真正独立的平台企业。
但这个情况正在发生明显变化。
2026 年 6 月,昆仑芯研发副总裁漆维公开表示:
公司外部业务比重已经超过向百度内部供货。
这是昆仑芯发展中一个非常重要的里程碑。
它意味着昆仑芯已经开始真正从:
“百度自研芯片”
转变成:
P800 已进入多个大型客户
昆仑芯的外部客户已经逐渐覆盖:
互联网、
运营商、
金融、
能源、
汽车、
高端制造
以及:
央企智算中心。
百度此前公开表示:
国家电网
中国钢研
招商银行
等客户已经开始规模部署昆仑芯 P800。
昆仑芯官方也表示,目前已经服务:
百余家头部客户。
这对于昆仑芯非常关键。
百度自己愿不愿意用。
更加重要的是:
没有百度关系的企业愿不愿意掏钱购买。
为什么大型互联网客户尤其重要?
因为互联网公司的 AI 工作负载通常包括:
推荐、
搜索、
广告、
大模型、
语音、
图像、
视频
以及:
实时推理。
这相当于一个非常残酷的芯片测试场。
驱动、
Runtime、
编译器、
内存系统、
服务器
以及:
集群软件
都必须相当成熟。
这也是昆仑芯拥有百度背景的一个特殊竞争优势。
昆仑芯与百度飞桨形成软硬件协同
昆仑芯另外一个天然优势是:
PaddlePaddle,也就是百度飞桨。
百度既有:
又有:
深度学习框架,
还拥有:
文心大模型,
以及:
百度智能云。
因此形成了一条完整技术链:
昆仑芯
↓
深度学习框架
↓
文心大模型
↓
百度智能云
↓
AI 应用。
这种结构和 Google 非常相似。
Google 拥有:
TPU
TensorFlow / JAX
Gemini
Google Cloud。
但昆仑芯不能只支持飞桨
如果昆仑芯只支持:
PaddlePaddle,
那它很难真正进入开放市场。
因为今天 AI 开发最重要的框架仍然包括:
PyTorch。
大模型推理还大量依赖:
vLLM、
SGLang、
Triton
以及其他开源软件。
所以昆仑芯独立以后,一个非常重要的方向,就是逐渐扩大自己的:
通用 AI 软件生态。
这将直接决定第三方客户采用昆仑芯的难度。
XPU Link:昆仑芯自己的高速互联
随着 AI 模型越来越大,AI 芯片之间的互联已经成为最重要的技术之一。
昆仑芯开发了自己的:
XPU Link。
它用于:
昆仑芯同时推动 XPU Link 兼容开放 Scale-Up 通信标准,希望建立更加开放的国产超节点生态。
这个方向和 Nvidia:
NVLink
非常类似。
当然,目前 NVLink 的生态和成熟度仍然明显领先。
Chip-to-Chip Interconnect。
什么是 AI 超节点?
传统 AI Server 通常是一台服务器安装:
8 张 GPU。
但是今天一个大型模型可能需要:
数百张 AI 卡。
于是行业开始发展:
Supernode,超节点。
超节点希望让:
32 张、
64 张、
256 张
甚至:
通过高速互联形成一个巨大的统一计算域。
这样做能够显著降低:
GPU 之间通信产生的瓶颈。
2025 年,昆仑芯已经落地:
32 卡和 64 卡超节点。
同时发布:
256 卡和 512 卡超节点技术。
天池 256:昆仑芯进入大型超节点时代
百度把基于昆仑芯构建的新一代超节点称为:
天池。
其中一个重要产品是:
天池 256。
它可以连接:
256 张昆仑芯 AI 卡。
2026 年 4 月,天池 256 已经完成点亮。
百度随后宣布其将在 2026 年正式进入市场。
与上一代超节点相比,天池 256 进一步提高:
卡间互联带宽、
整体吞吐量
以及:
大模型推理效率。
天池 512:单节点瞄准万亿参数模型
下一步则是:
天池 512。
它最高支持:
512 张 AI 卡高速互联。
百度提出的目标是:
让一个超节点本身就能够支撑:
万亿参数级模型训练。
这代表 AI 数据中心架构正在发生巨大变化。
过去:
服务器是计算机。
现在:
整个机柜是计算机。
未来甚至可能:
整个数据中心就是一台计算机。
昆仑芯已经不再只和单张 GPU 比性能
当系统进入:
256 卡、
512 卡,
甚至:
万卡集群以后,
不能只看:
TOPS。
真正需要看:
卡间带宽、
通信效率、
有效训练率、
线性扩展能力、
故障恢复、
集群利用率
以及:
Tokens per Dollar。
这也是 Nvidia 最大的优势之一。
Nvidia 真正卖的已经不仅仅是:
GPU。
而是:
GPU + NVLink + NVSwitch + Network + CUDA + Server。
昆仑芯正在沿着类似的系统化方向发展。
M100:面向大模型推理的新一代昆仑芯
2025 年百度世界大会上,百度正式公布:
昆仑芯 M100。
M100 针对:
大规模 AI 推理
进行专门优化。
它追求的核心方向是:
性能、能效和成本之间的平衡。
到了 2026 年 7 月,M100 芯片实物已经正式公开亮相。
截至 2026 年 8 月,百度管理层继续将 M100 列为昆仑芯下一阶段的重要产品,并表示昆仑芯已经完成三代 AI 芯片的研发和商业化。
因此更准确地说:
现阶段 P800 仍然是昆仑芯经过大规模商业验证的核心产品,而 M100 正在成为下一阶段重点。
为什么 M100 更加重视推理?
AI 行业的计算需求正在发生变化。
2023—2025 年大家最关注的是:
训练越来越大的模型。
但是当大模型开始真正商业化以后,另一个成本可能更加庞大:
Inference。
假设一个模型训练一次花:
1 亿美元。
但如果几亿用户每天调用:
数十亿次,
长期推理费用完全可能超过训练费用。
AI Agent 更会进一步增加 Token 消耗。
高性能、低成本的大模型推理。
M100 就是在这个方向上进行优化。
M300:进一步面向超大规模多模态模型
M100 之后,昆仑芯还计划推出:
M300。
M300 面向:
超大规模多模态模型的训练和推理。
按照百度目前公布的路线图,M300 计划在:
2027 年
进入下一阶段商业化。
M100 与 M300 的定位因此可以简单理解成:
M100:大规模推理
M300:高端训练 + 推理。
昆仑芯开始形成“芯片 + 超节点 + 集群”产品路线
从发展路线来看,昆仑芯现在已经非常明显地形成三个层次。
第一层:
AI Chip
例如:
P800、
M100、
M300。
第二层:
Supernode
例如:
32 卡、
64 卡、
天池 256、
天池 512。
第三层:
AI Cluster
例如:
1 万卡、
3 万卡
以及未来更大规模集群。
这与全球 AI 计算产业正在发生的变化完全一致。
百度甚至提出未来百万卡单集群目标
百度已经进一步公布未来 AI 算力路线。
公司提出未来将继续开发:
千卡级、
4000 卡级
超节点。
同时通过百度百舸 AI 计算平台,把昆仑芯单一 AI 集群规模继续向:
百万卡级别
推进。
百万卡集群目前更多还是:
长期路线图目标。
但它说明昆仑芯的发展方向已经非常明确:
不只是制造中国自己的 AI Processor。
而是建立:
中国自己的大型 AI Computing Infrastructure。
昆仑芯与 Nvidia 最大的区别
Nvidia 的核心路线可以简单理解成:
CUDA
NVLink
NVSwitch
InfiniBand / Ethernet
DGX / HGX。
昆仑芯则希望建立:
XPU
昆仑芯软件栈
XPU Link
天池超节点
百舸 AI 计算平台。
两者目前的技术规模和生态成熟度显然不在一个级别。
但是从系统架构思路来看:
方向正在越来越接近。
单卡 Benchmark
进入:
整个 AI 数据中心的竞争。
昆仑芯与华为昇腾有什么区别?
华为昇腾是昆仑芯在中国市场非常强大的竞争者。
华为拥有:
Ascend NPU
CANN 软件平台
Atlas 服务器
高速互联
超节点
华为云。
昆仑芯则依靠:
百度、
百度智能云、
飞桨、
文心大模型
和:
百舸 AI 平台。
因此两家公司都有一个共同特点:
背后拥有完整云计算和 AI 软件生态。
这与纯芯片创业公司形成明显区别。
昆仑芯与寒武纪有什么区别?
寒武纪是中国最早一批专门开发:
AI Processor
的企业。
它经历过:
终端 AI IP、
边缘 AI、
云端 AI
等多个阶段。
昆仑芯则从一开始就拥有大量:
百度真实工作负载。
这使昆仑芯产品开发更加明显地采用:
Application-Driven
路线。
也就是说:
这也是大型互联网公司自研芯片的一大优势。
昆仑芯与沐曦有什么区别?
沐曦更加接近:
GPGPU。
它同时进入:
AI Inference、
Graphics、
Scientific Computing。
而昆仑芯更加集中:
AI。
它没有重点建设传统:
Graphics Pipeline。
所以技术上更加接近:
专门针对 AI 优化的可编程处理器。
这使昆仑芯可以把更多晶体管用于:
AI Compute、
Interconnect
和:
AI-specific Optimization。
昆仑芯与燧原科技有什么区别?
燧原与昆仑芯其实更加接近。
两家公司都重点面向:
Cloud AI。
都在发展:
加速卡、
多卡系统、
超节点
以及:
大型 AI 集群。
不同之处是:
昆仑芯背后拥有百度这样一个:
搜索 + 云计算 + 大模型
平台。
燧原则拥有更加独立的创业公司身份,并与大型互联网客户深度合作。
两者都会面对同一个问题:
如何在 CUDA 生态之外建立真正可用的大模型算力平台。
昆仑芯最大的优势之一:十五年真实业务积累
2017、
2018、
2020 年。
昆仑芯则从:
2011 年
就开始做 AI 加速。
这使它已经经历:
FPGA、
CNN、
语音识别、
推荐系统、
Transformer、
等多次 AI 计算范式变化。
截至 2026 年,公司官方已经把自己的积累描述为:
十五年 AI 加速技术经验。
第二个优势:百度是天然超级实验室
百度给昆仑芯提供了非常特殊的环境。
假设一个芯片设计团队想测试:
推荐系统,
百度有真实推荐业务。
想测试:
搜索,
百度有搜索引擎。
想测试:
语音,
百度有语音业务。
想测试:
百度有文心。
想测试:
万卡 AI 集群,
百度智能云可以真正建设。
因此昆仑芯拥有一个其他很多创业公司很难复制的:
Hardware-Software Co-Design Environment。
第三个优势:已经跨过规模部署门槛
今天昆仑芯最有价值的指标之一,并不是某一个:
TFLOPS。
而是:
3 万卡集群。
芯片做到十张能工作,
和:
三万张一起工作
完全不是一个技术等级。
三万卡集群意味着:
芯片、
板卡、
驱动、
编译器、
网络、
冷却、
电源、
集群管理
和:
分布式 AI 软件
都需要协同。
这是昆仑芯目前非常重要的商业壁垒。
第四个优势:外部市场开始真正打开
2026 年一个非常关键的变化,是昆仑芯外部业务已经超过内部供货。
这说明它不再只是:
百度的成本中心。
而开始变成:
如果这种趋势继续发展,昆仑芯的企业定位可能发生根本变化:
从:
变成:
Independent Chinese AI Computing Platform。
昆仑芯最大的挑战仍然是 CUDA
CUDA。
Nvidia 最大的优势已经不是:
“某一颗 GPU 快多少”。
而是二十多年形成的:
CUDA、
cuDNN、
NCCL、
TensorRT、
Triton、
PyTorch
以及海量开发者生态。
所以昆仑芯真正需要解决的是:
迁移到昆仑芯以后:
需要修改多少代码?
性能下降多少?
调试是否方便?
模型新版本能不能快速适配?
集群是否稳定?
这些问题决定的是:
Total Cost of Ownership。
第二个挑战:先进制程与 HBM
先进制程、
HBM、
先进封装
以及:
高速 Chip-to-Chip Interconnect。
尤其是大型 Transformer 模型,很多时候真正限制性能的不是:
计算单元不够。
而是:
Memory Bandwidth。
因此未来昆仑芯 M 系列能否持续获得:
足够先进的制造能力和高带宽内存,
将直接影响其高端市场竞争力。
第三个挑战:国产 AI 芯片竞争极其激烈
主要玩家包括:
华为昇腾
海光
以及:
昆仑芯。
最终不太可能所有企业都拥有同样大的市场份额。
未来几年真正决定竞争结果的,会越来越集中在:
商业订单、
软件生态、
供应能力、
产品更新速度
以及:
大型集群稳定性。
第四个挑战:从百度资产变成中立平台
百度既是昆仑芯最大的优势之一,也可能成为商业扩张时需要解决的问题。
其他大型互联网公司可能会问:
昆仑芯独立融资和未来上市,其中一个重要意义就是:
增强市场独立性。
随着外部客户收入提高,这个问题已经开始改善。
但长期来看,昆仑芯必须证明:
它首先是一家芯片平台公司,其次才是百度体系公司。
昆仑芯正在推进香港 IPO
2026 年 1 月 1 日,昆仑芯通过联席保荐人:
以保密形式向香港联交所提交上市申请。
百度随后正式公告确认:
正在推进昆仑芯分拆上市。
百度同时表示,即使分拆完成,预计昆仑芯仍将是百度的附属公司。
截至 2026 年 8 月:
昆仑芯尚未正式完成香港上市。
因此目前不能把它写成:
“香港上市公司”。
更准确的说法是:
正在推进港股 IPO。
同时准备科创板上市
昆仑芯同时也开始准备:
A 股科创板。
2026 年 4 月 29 日:
昆仑芯与中国国际金融股份有限公司签署:
IPO 辅导协议。
2026 年 5 月 7 日:
正式完成:
科创板上市辅导备案。
这意味着昆仑芯目前同时保留:
香港资本市场
和:
中国内地资本市场
两种融资可能。
截至 2026 年 8 月,科创板仍处于:
上市辅导阶段
而不是已经完成 IPO。
为什么 AI 芯片公司都急需资本市场?
原因非常简单:
数百名甚至上千名工程师,
先进 EDA 软件,
IP,
Tape-Out,
封装,
HBM,
服务器设计,
驱动,
编译器,
软件库
以及:
大规模集群验证。
而且公司不能只开发:
一代产品。
当 P800 正在量产时,
M100 已经需要开发。
当 M100 上市时,
M300 必须已经进入后期研发。
同时下一代架构又必须启动。
这是一场:
永远不能停止研发的比赛。
所以港股或者科创板融资,对昆仑芯长期竞争力非常重要。
为什么昆仑芯特别值得关注?
但是昆仑芯有一个非常独特的发展路径:
它是从真实互联网工作负载中长出来的芯片。
它的发展路线可以简单概括成:
2011:FPGA AI 加速
↓
2017:XPU 架构
↓
↓
2020:昆仑芯一代规模部署
↓
2021:昆仑芯二代量产 + 独立融资
↓
2024:昆仑芯三代 P800 量产
↓
2025:万卡、3 万卡集群 + 超节点
↓
2026:M100 + 天池 256 + IPO 推进
↓
2027:M300
这种发展路线说明:
昆仑芯已经不再只是:
一颗 AI ASIC。
昆仑芯未来真正竞争的是 AI 数据中心
未来评价昆仑芯,最好不要只问:
这个问题已经越来越没有意义。
真正的问题应该是:
一个 1000 张卡的昆仑芯集群,与一个 1000 张 GPU 的 Nvidia 集群相比怎么样?
需要比较:
有效训练性能、
推理 Tokens/s、
功耗、
设备价格、
通信效率、
软件迁移成本、
故障率、
模型兼容性
以及:
整个集群的成本。
这才是未来 AI 算力竞争真正的战场。
总结
它虽然在:
2021 年
才真正独立融资,
但是技术历史已经长达:
15 年左右。
它经历了:
FPGA AI Accelerator
↓
XPU
↓
昆仑芯一代
↓
XPU-R / 昆仑芯二代
↓
XPU-P / P800
↓
M100 / M300
的发展过程。
与此同时,昆仑芯的竞争范围正在迅速扩大。
过去是:
一颗芯片。
后来是:
一张 AI 卡。
现在已经变成:
AI 芯片 + XPU Link + 超节点 + 百舸平台 + 万卡集群。
P800 已经完成多个万卡集群的商业验证,最大部署规模突破 3 万卡;2026 年又继续向天池 256 超节点和新一代 M100 推进。
更加值得注意的是:
昆仑芯的外部业务已经开始超过向百度内部供货。
这可能是判断昆仑芯未来最重要的信号之一。
因为这意味着它正在逐渐完成身份转变:
从:
变成:
截至 2026 年 8 月,昆仑芯已经完成三代 AI 芯片研发与商业化,M100 正成为下一阶段面向大规模推理的重要产品,M300 则瞄准更大规模的多模态训练和推理。
与此同时,公司正在推进:
香港 IPO
以及:
科创板上市辅导。
未来真正决定昆仑芯能否成为中国顶级 AI 芯片平台的,并不是某一代芯片的 TOPS 数字。
而是四个更加重要的问题:
M100、M300 能不能保持持续迭代?
XPU Link 和天池超节点能不能稳定扩展到数百、数千甚至数万张卡?
软件生态能不能把 CUDA 用户的迁移成本真正降下来?
昆仑芯能不能继续扩大百度之外的外部客户?
如果这几个问题能够逐步解决,昆仑芯就可能完成一次非常重要的升级:
从:
真正成长为:
中国独立的 AI 计算基础设施平台。
