Menu Close

昆仑芯

昆仑芯(Kunlunxin):从百度自研 AI 芯片走向独立算力平台

昆仑芯

昆仑芯(北京)科技股份有限公司,Kunlunxin,是中国重要的云端 AI 芯片企业之一。

它与很多近几年才成立的 AI 芯片创业公司不同。

昆仑芯的技术历史可以追溯到:

2011 年。

当时百度已经开始使用 FPGA 研究人工智能计算加速。

经过十多年发展,昆仑芯已经从:

FPGA AI 加速器

逐渐发展到:

自研 XPU 架构 AI 芯片

再进一步扩展到:

AI 加速卡、AI 服务器、超节点和万卡级 AI 集群。

2021 年,百度将昆仑芯业务独立出来融资,成立独立公司。不过百度至今仍然是昆仑芯的重要股东,昆仑芯也仍属于百度体系中的重要 AI 算力资产。2026 年,昆仑芯正在同时推进香港上市和科创板上市准备。

昆仑芯并不是突然出现的一家 AI 芯片公司

理解昆仑芯,首先需要理解百度为什么这么早就开始自己设计 AI 芯片

百度的核心业务长期涉及:

搜索、

广告、

推荐、

语音识别、

自然语言处理、

图像识别

以及后来出现的:

大语言模型

这些业务有一个共同特点:

需要极其庞大的计算量。

早期百度主要使用 CPUGPU

但是随着深度学习计算量迅速增加,百度开始研究:

能不能针对自己的 AI 工作负载设计更加高效的处理器?

2011 年,百度启动 FPGA AI 加速器。

到了 2015 年,FPGA 部署规模已经超过:

5000 片。

2017 年超过:

1.2 万片。

同年,百度在 Hot Chips 会议上公开了自己的:

XPU 架构。

这意味着昆仑芯真正的技术历史,远远早于今天的大模型热潮。

2018 年:百度正式发布“昆仑”

2018 年,百度正式发布第一代:

昆仑 AI 芯片

当时发布的产品包括:

昆仑 818-100

以及:

昆仑 818-300。

百度将其定位为:

云端全功能 AI 芯片

当时官方公布的峰值 AI 算力达到约:

260 TOPS。

相比百度此前使用的 FPGA AI 加速方案,性能实现了大幅提升。

这是百度第一次从:

使用通用芯片加 FPGA 加速

真正跨入:

自主设计 AI ASIC

阶段。

昆仑芯一代:从芯片 Demo 进入真正业务系统

昆仑芯第一代产品于:

2019 年流片

并于:

2020 年规模量产。

它并不是停留在实验室里的芯片

昆仑芯一代后来大量部署到百度:

搜索引擎、

小度、

百度智能云

等真实业务中。

百度曾披露,第一代昆仑芯量产超过:

2 万片。

这对于 AI 芯片公司非常重要。

很多芯片可以:

Tape-Out,

点亮,

甚至跑 Benchmark。

但是:

能够连续几年运行在大型互联网公司的核心业务中,是完全不同的一件事。

搜索和推荐业务拥有海量实时请求。

芯片必须解决:

稳定性、

驱动程序、

编译器、

内存管理、

故障恢复、

服务器兼容

等大量工程问题。

昆仑芯因此拥有一个非常特殊的优势:

它从诞生开始就拥有百度这样的大规模实际应用环境。

昆仑芯一代采用 XPU 架构

昆仑芯并不是传统 GPU

它采用百度自主研发的:

XPU 架构。

这里的 XPU 可以理解为:

面向人工智能和异构计算设计的一种可编程计算架构。

其目标并不是:

运行游戏图形。

而是处理:

矩阵运算、

向量运算、

神经网络、

推荐算法、

自然语言处理

以及各种 AI 工作负载。

因此从技术分类来看,昆仑芯更加接近:

Programmable AI Accelerator

而不是传统 Graphics GPU

第一代昆仑芯的代表产品 K100

昆仑芯第一代产品包括:

K100

和:

K200。

其中 K100 更加偏向:

边缘 AI 推理。

官方规格显示:

K100 提供:

128 TOPS INT8

32 TFLOPS FP16

配备:

8GB HBM

内存带宽:

256GB/s

功耗:

75W。

从今天的大模型时代来看,这些参数已经不算惊人。

但是要注意:

这是第一代昆仑芯产品。

它真正的重要意义是:

建立昆仑芯自己的芯片、板卡和软件体系。

K200:开始进入云数据中心

K200 则更加偏向:

数据中心 AI

K200 提供:

256 TOPS INT8

64 TFLOPS FP16

16GB HBM

内存带宽达到:

512GB/s。

采用:

14nm 制程

板卡功耗约:

150W。

K200 可以用于:

AI 推理,

也支持:

AI 训练。

这让昆仑芯从第一代开始就没有把自己限制成:

纯推理芯片

2021 年:昆仑芯从百度内部部门走向独立公司

昆仑芯历史上非常关键的一步发生在:

2021 年。

2021 年 3 月,百度昆仑芯片业务完成独立融资。

投资方包括:

CPE 源峰

IDG 资本

君联资本

元禾璞华

等机构。

当时投后估值约:

130 亿元人民币。

随后百度昆仑芯业务正式成立独立公司:

昆仑芯(北京)科技有限公司。

原百度芯片首席架构师:

欧阳剑

出任公司 CEO。

截至 2026 年,欧阳剑仍然担任昆仑芯 CEO。

为什么昆仑芯要独立?

芯片部门留在百度内部,有一个天然问题:

其他互联网公司为什么要购买竞争对手内部部门的芯片

例如腾讯、运营商或者大型企业在购买 AI 芯片时,会考虑:

长期供应、

技术路线、

商业中立性

以及:

数据和业务安全。

如果昆仑芯永远只是“百度内部芯片部门”,市场边界就会非常有限。

因此独立化的意义不仅是:

融资。

更加重要的是:

让昆仑芯从百度自用芯片逐渐变成面向整个市场的 AI 芯片供应商。

这一转型到了 2025—2026 年开始变得越来越明显。

昆仑芯二代:XPU-R

2021 年 8 月:

昆仑芯二代正式量产。

第二代产品采用新一代:

XPU-R 架构。

其中一个重要变化是:

更加重视:

通用性和易编程性。

官方表示,相比第一代产品,第二代通用计算核心能力提高:

约 2—3 倍。

这其实代表 AI 芯片发展中的一个重要问题:

芯片不能只跑几个固定神经网络。

AI 模型变化速度太快。

从:

CNN

到:

Transformer,

再到:

MoE、

LLM

VLM

AI Agent,

如果芯片只能执行某一种固定模型,很容易迅速淘汰。

因此昆仑芯越来越强调:

Programmability。

R200:第二代代表性 AI 加速卡

昆仑芯二代的重要产品之一是:

R200 系列。

官方公布的 R200 规格包括:

256 TOPS INT8

128 TFLOPS FP16

32 TFLOPS FP32

显存:

16GB 或 32GB GDDR6

内存带宽:

512GB/s

接口:

PCIe Gen4 ×16

制程:

7nm

功耗:

150W—160W。

R200 可以用于:

自然语言处理、

计算机视觉、

语音识别、

机器学习

以及:

AI 训练和推理。

RG800:更加接近数据中心通用 AI 加速卡

昆仑芯后来推出:

RG800。

RG800 同样采用:

XPU-R

架构。

它提供:

256 TOPS INT8

128 TFLOPS FP16

以及:

32GB GDDR6。

板卡功耗约:

130W。

它同时整合比较强的视频编解码能力。

因此适合:

视频分析、

推荐系统、

AI 推理

以及其他数据中心工作负载。

R480-X8:昆仑芯很早就开始做 8 卡 AI 系统

昆仑芯另外一个非常重要的产品是:

R480-X8。

它已经不是一张普通 PCIe 卡。

R480-X8 基于:

UBB 服务器基板

安装:

8 个昆仑芯二代 OAM 模组。

8 颗处理器可以共同执行:

大型模型训练和推理。

这代表昆仑芯技术方向上的一个重要变化:

从:

单颗 AI 芯片

开始进入:

AI System。

这个变化后来在大模型时代变得更加重要。

第三代昆仑芯:真正进入大模型时代

2024 年,昆仑芯第三代产品开始量产。

第三代产品的重点已经与前两代明显不同。

AI 行业发生了巨大变化。

过去 AI 芯片主要运行:

图像识别、

推荐、

语音识别。

现在核心工作负载越来越变成:

Large Language Model。

也就是:

大语言模型

这意味着 AI 芯片必须面对:

更大的模型、

更多参数、

更高显存需求、

更复杂的 Attention、

更高互联带宽

以及:

数千、数万张 AI 卡共同运行。

第三代昆仑芯的代表性产品,就是:

P800。

P800 是昆仑芯目前最重要的产品

P800 使用昆仑芯自主研发的:

XPU-P 架构。

官方资料显示,P800 已经实现大规模商业部署,并成为昆仑芯目前最重要的大模型算力平台之一。

截至 2025 年,P800 累计部署已经达到数万卡级别,最大单集群规模超过:

3 万卡。

这使昆仑芯开始真正进入:

中国大型 AI 数据中心市场。

2025 年,P800 点亮万卡集群

2025 年 2 月:

百度智能云正式点亮:

昆仑芯三代万卡集群。

百度随后又继续建设:

3 万卡集群。

对于 AI 芯片公司来说:

一万张卡组成一个集群

与:

制造一张 AI 加速卡

是完全不同的技术难度。

因为万卡系统会出现一个非常现实的问题:

即使每张卡只有极低故障率,

当数量达到:

10,000 张

以后,

几乎每一天都可能有:

某张卡、

某个网络模块、

某条链路

发生故障。

所以真正的大模型 AI 系统必须拥有:

故障检测、

任务恢复、

checkpoint、

网络容错、

通信优化

以及:

分布式训练调度。

百度披露的昆仑芯万卡平台有效训练率已经达到非常高的水平,这说明昆仑芯正在从“AI 芯片”进一步进入真正的:

AI Supercomputing。

2025 年 4 月,集群规模进一步达到 3 万卡

2025 年 4 月,百度进一步点亮:

P800 3 万卡集群。

部分百度大模型开始直接使用这一国产 AI 芯片集群进行训练。

这点非常重要。

过去国产 AI 芯片更多被用于:

Inference。

也就是模型训练完成以后进行推理。

而真正的大模型:

Pretraining

对稳定性、通信和软件生态的要求远远更高。

昆仑芯开始进入大规模训练市场,意味着国产 AI 芯片的竞争已经从:

“能不能运行大模型”

逐渐进入:

“能不能训练大模型”。

DeepSeek 成为国产 AI 芯片的重要转折点

2025 年 DeepSeek 爆发以后,中国 AI 芯片市场出现一个非常明显的变化。

大量企业开始重新考虑:

国产模型 + 国产 AI 芯片

的完整部署。

昆仑芯也很快完成了:

DeepSeek-V3、

DeepSeek-R1

以及相关蒸馏模型的适配。

这件事情真正重要的不是:

DeepSeek 能不能跑”。

而是:

新模型出来以后,国产芯片需要多久才能完成适配。

未来 AI 芯片软件竞争,很大程度上就是:

Day 0 Model Support。

昆仑芯已经从百度内部走向外部市场

昆仑芯早期最大的客户当然就是:

百度。

这是优势,也是限制。

优势在于:

百度提供了海量实际工作负载。

限制在于:

一家芯片公司如果只有母公司一个客户,很难成为真正独立的平台企业。

但这个情况正在发生明显变化。

2026 年 6 月,昆仑芯研发副总裁漆维公开表示:

公司外部业务比重已经超过向百度内部供货。

这是昆仑芯发展中一个非常重要的里程碑。

它意味着昆仑芯已经开始真正从:

“百度自研芯片

转变成:

“市场化 AI 芯片公司”。

P800 已进入多个大型客户

昆仑芯的外部客户已经逐渐覆盖:

互联网、

运营商、

金融、

能源、

汽车、

高端制造

以及:

央企智算中心。

百度此前公开表示:

国家电网

中国钢研

招商银行

等客户已经开始规模部署昆仑芯 P800。

昆仑芯官方也表示,目前已经服务:

百余家头部客户。

这对于昆仑芯非常关键。

因为最终评价一颗国产 AI 芯片,不能只看:

百度自己愿不愿意用。

更加重要的是:

没有百度关系的企业愿不愿意掏钱购买。

为什么大型互联网客户尤其重要?

如果一家 AI 芯片企业能进入大型互联网公司,意义非常大。

因为互联网公司的 AI 工作负载通常包括:

推荐、

搜索、

广告、

大模型、

语音、

图像、

视频

以及:

实时推理。

这相当于一个非常残酷的芯片测试场。

如果一颗 AI 芯片能够长期稳定运行这些业务,那么:

驱动、

Runtime、

编译器、

内存系统、

服务器

以及:

集群软件

都必须相当成熟。

这也是昆仑芯拥有百度背景的一个特殊竞争优势。

昆仑芯与百度飞桨形成软硬件协同

昆仑芯另外一个天然优势是:

PaddlePaddle,也就是百度飞桨。

百度既有:

AI 芯片

又有:

深度学习框架,

还拥有:

文心大模型,

以及:

百度智能云。

因此形成了一条完整技术链:

昆仑芯

深度学习框架

文心大模型

百度智能云

AI 应用。

这种结构和 Google 非常相似。

Google 拥有:

TPU

TensorFlow / JAX

Gemini

Google Cloud。

这也是为什么大型云计算公司越来越喜欢自己设计 AI 芯片

但昆仑芯不能只支持飞桨

如果昆仑芯只支持:

PaddlePaddle,

那它很难真正进入开放市场。

因为今天 AI 开发最重要的框架仍然包括:

PyTorch。

大模型推理还大量依赖:

vLLM

SGLang、

Triton

以及其他开源软件。

所以昆仑芯独立以后,一个非常重要的方向,就是逐渐扩大自己的:

通用 AI 软件生态。

这将直接决定第三方客户采用昆仑芯的难度。

XPU Link:昆仑芯自己的高速互联

随着 AI 模型越来越大,AI 芯片之间的互联已经成为最重要的技术之一。

昆仑芯开发了自己的:

XPU Link。

它用于:

AI 芯片之间进行高速通信。

昆仑芯同时推动 XPU Link 兼容开放 Scale-Up 通信标准,希望建立更加开放的国产超节点生态。

这个方向和 Nvidia

NVLink

非常类似。

当然,目前 NVLink 的生态和成熟度仍然明显领先。

但所有希望进入大型 AI 系统的芯片公司,都必须解决:

Chip-to-Chip Interconnect。

什么是 AI 超节点?

传统 AI Server 通常是一台服务器安装:

8 张 GPU

但是今天一个大型模型可能需要:

数百张 AI 卡。

于是行业开始发展:

Supernode,超节点。

超节点希望让:

32 张、

64 张、

256 张

甚至:

512 张 AI 芯片

通过高速互联形成一个巨大的统一计算域。

这样做能够显著降低:

GPU 之间通信产生的瓶颈。

2025 年,昆仑芯已经落地:

32 卡和 64 卡超节点。

同时发布:

256 卡和 512 卡超节点技术。

天池 256:昆仑芯进入大型超节点时代

百度把基于昆仑芯构建的新一代超节点称为:

天池。

其中一个重要产品是:

天池 256。

它可以连接:

256 张昆仑芯 AI 卡。

2026 年 4 月,天池 256 已经完成点亮。

百度随后宣布其将在 2026 年正式进入市场。

与上一代超节点相比,天池 256 进一步提高:

卡间互联带宽、

整体吞吐量

以及:

大模型推理效率。

天池 512:单节点瞄准万亿参数模型

下一步则是:

天池 512。

它最高支持:

512 张 AI 卡高速互联。

百度提出的目标是:

让一个超节点本身就能够支撑:

万亿参数级模型训练。

这代表 AI 数据中心架构正在发生巨大变化。

过去:

服务器是计算机。

现在:

整个机柜是计算机。

未来甚至可能:

整个数据中心就是一台计算机。

昆仑芯已经不再只和单张 GPU 比性能

当系统进入:

256 卡、

512 卡,

甚至:

万卡集群以后,

评价 AI 芯片的方法就完全不同了。

不能只看:

TOPS。

真正需要看:

卡间带宽、

通信效率、

有效训练率、

线性扩展能力、

故障恢复、

集群利用率

以及:

Tokens per Dollar。

这也是 Nvidia 最大的优势之一。

Nvidia 真正卖的已经不仅仅是:

GPU

而是:

GPU + NVLink + NVSwitch + Network + CUDA + Server。

昆仑芯正在沿着类似的系统化方向发展。

M100:面向大模型推理的新一代昆仑芯

2025 年百度世界大会上,百度正式公布:

昆仑芯 M100。

M100 针对:

大规模 AI 推理

进行专门优化。

它追求的核心方向是:

性能、能效和成本之间的平衡。

到了 2026 年 7 月,M100 芯片实物已经正式公开亮相。

截至 2026 年 8 月,百度管理层继续将 M100 列为昆仑芯下一阶段的重要产品,并表示昆仑芯已经完成三代 AI 芯片的研发和商业化。

因此更准确地说:

现阶段 P800 仍然是昆仑芯经过大规模商业验证的核心产品,而 M100 正在成为下一阶段重点。

为什么 M100 更加重视推理?

AI 行业的计算需求正在发生变化。

2023—2025 年大家最关注的是:

训练越来越大的模型。

但是当大模型开始真正商业化以后,另一个成本可能更加庞大:

Inference。

假设一个模型训练一次花:

1 亿美元。

但如果几亿用户每天调用:

数十亿次,

长期推理费用完全可能超过训练费用。

AI Agent 更会进一步增加 Token 消耗。

所以未来最大的 AI 芯片市场之一,很可能就是:

高性能、低成本的大模型推理。

M100 就是在这个方向上进行优化。

M300:进一步面向超大规模多模态模型

M100 之后,昆仑芯还计划推出:

M300。

M300 面向:

超大规模多模态模型的训练和推理。

按照百度目前公布的路线图,M300 计划在:

2027 年

进入下一阶段商业化。

M100 与 M300 的定位因此可以简单理解成:

M100:大规模推理

M300:高端训练 + 推理。

昆仑芯开始形成“芯片 + 超节点 + 集群”产品路线

从发展路线来看,昆仑芯现在已经非常明显地形成三个层次。

第一层:

AI Chip

例如:

P800、

M100、

M300。

第二层:

Supernode

例如:

32 卡、

64 卡、

天池 256、

天池 512。

第三层:

AI Cluster

例如:

1 万卡、

3 万卡

以及未来更大规模集群。

这与全球 AI 计算产业正在发生的变化完全一致。

百度甚至提出未来百万卡单集群目标

百度已经进一步公布未来 AI 算力路线。

公司提出未来将继续开发:

千卡级、

4000 卡级

超节点。

同时通过百度百舸 AI 计算平台,把昆仑芯单一 AI 集群规模继续向:

百万卡级别

推进。

百万卡集群目前更多还是:

长期路线图目标。

但它说明昆仑芯的发展方向已经非常明确:

不只是制造中国自己的 AI Processor。

而是建立:

中国自己的大型 AI Computing Infrastructure。

昆仑芯与 Nvidia 最大的区别

Nvidia 的核心路线可以简单理解成:

GPU

CUDA

NVLink

NVSwitch

InfiniBand / Ethernet

DGX / HGX。

昆仑芯则希望建立:

XPU

昆仑芯软件栈

XPU Link

天池超节点

百舸 AI 计算平台。

两者目前的技术规模和生态成熟度显然不在一个级别。

但是从系统架构思路来看:

方向正在越来越接近。

AI 芯片竞争最终会从:

单卡 Benchmark

进入:

整个 AI 数据中心的竞争。

昆仑芯与华为昇腾有什么区别?

华为昇腾是昆仑芯在中国市场非常强大的竞争者。

华为拥有:

Ascend NPU

CANN 软件平台

Atlas 服务器

高速互联

超节点

华为云。

昆仑芯则依靠:

百度、

百度智能云、

飞桨、

文心大模型

和:

百舸 AI 平台。

因此两家公司都有一个共同特点:

背后拥有完整云计算和 AI 软件生态。

这与纯芯片创业公司形成明显区别。

昆仑芯与寒武纪有什么区别?

寒武纪是中国最早一批专门开发:

AI Processor

的企业。

它经历过:

终端 AI IP、

边缘 AI

云端 AI

等多个阶段。

昆仑芯则从一开始就拥有大量:

百度真实工作负载。

这使昆仑芯产品开发更加明显地采用:

Application-Driven

路线。

也就是说:

芯片架构不断根据搜索、推荐、语音、大模型等真实业务迭代

这也是大型互联网公司自研芯片的一大优势。

昆仑芯与沐曦有什么区别?

沐曦更加接近:

GPGPU

它同时进入:

AI Training、

AI Inference、

Graphics、

Scientific Computing。

而昆仑芯更加集中:

AI

它没有重点建设传统:

Graphics Pipeline。

所以技术上更加接近:

专门针对 AI 优化的可编程处理器。

这使昆仑芯可以把更多晶体管用于:

AI Compute、

Memory

Interconnect

和:

AI-specific Optimization。

昆仑芯与燧原科技有什么区别?

燧原与昆仑芯其实更加接近。

两家公司都重点面向:

Cloud AI

都在发展:

AI 芯片

加速卡、

多卡系统、

超节点

以及:

大型 AI 集群。

不同之处是:

昆仑芯背后拥有百度这样一个:

搜索 + 云计算 + 大模型

平台。

燧原则拥有更加独立的创业公司身份,并与大型互联网客户深度合作。

两者都会面对同一个问题:

如何在 CUDA 生态之外建立真正可用的大模型算力平台。

昆仑芯最大的优势之一:十五年真实业务积累

很多 AI 芯片创业公司成立于:

2017、

2018、

2020 年。

昆仑芯则从:

2011 年

就开始做 AI 加速。

这使它已经经历:

FPGA、

CNN、

语音识别、

推荐系统、

Transformer、

大语言模型

等多次 AI 计算范式变化。

截至 2026 年,公司官方已经把自己的积累描述为:

十五年 AI 加速技术经验。

这在 AI 芯片创业公司中非常少见。

第二个优势:百度是天然超级实验室

百度给昆仑芯提供了非常特殊的环境。

假设一个芯片设计团队想测试:

推荐系统,

百度有真实推荐业务。

想测试:

搜索,

百度有搜索引擎。

想测试:

语音,

百度有语音业务。

想测试:

大语言模型

百度有文心。

想测试:

万卡 AI 集群,

百度智能云可以真正建设。

因此昆仑芯拥有一个其他很多创业公司很难复制的:

Hardware-Software Co-Design Environment。

第三个优势:已经跨过规模部署门槛

今天昆仑芯最有价值的指标之一,并不是某一个:

TFLOPS。

而是:

3 万卡集群。

芯片做到十张能工作,

和:

三万张一起工作

完全不是一个技术等级。

三万卡集群意味着:

芯片

板卡、

驱动、

编译器、

网络、

冷却、

电源、

集群管理

和:

分布式 AI 软件

都需要协同。

这是昆仑芯目前非常重要的商业壁垒。

第四个优势:外部市场开始真正打开

2026 年一个非常关键的变化,是昆仑芯外部业务已经超过内部供货。

这说明它不再只是:

百度的成本中心。

而开始变成:

真正能够面向市场销售的 AI 芯片企业。

如果这种趋势继续发展,昆仑芯的企业定位可能发生根本变化:

从:

Baidu AI Chip

变成:

Independent Chinese AI Computing Platform。

昆仑芯最大的挑战仍然是 CUDA

几乎所有国产高性能 AI 芯片都会遇到同一个问题:

CUDA。

Nvidia 最大的优势已经不是:

“某一颗 GPU 快多少”。

而是二十多年形成的:

CUDA、

cuDNN、

NCCL、

TensorRT、

Triton、

PyTorch

以及海量开发者生态。

所以昆仑芯真正需要解决的是:

一个原本在 Nvidia GPU 上运行的大模型,

迁移到昆仑芯以后:

需要修改多少代码?

性能下降多少?

调试是否方便?

模型新版本能不能快速适配?

集群是否稳定?

这些问题决定的是:

Total Cost of Ownership。

第二个挑战:先进制程与 HBM

大模型 AI 芯片越来越依赖:

先进制程、

HBM、

先进封装

以及:

高速 Chip-to-Chip Interconnect。

尤其是大型 Transformer 模型,很多时候真正限制性能的不是:

计算单元不够。

而是:

Memory Bandwidth。

因此未来昆仑芯 M 系列能否持续获得:

足够先进的制造能力和高带宽内存,

将直接影响其高端市场竞争力。

第三个挑战:国产 AI 芯片竞争极其激烈

中国 AI 芯片企业已经进入一个非常拥挤的市场。

主要玩家包括:

华为昇腾

寒武纪

海光

沐曦

壁仞科技

燧原科技

摩尔线程

天数智芯

以及:

昆仑芯。

最终不太可能所有企业都拥有同样大的市场份额。

未来几年真正决定竞争结果的,会越来越集中在:

商业订单、

软件生态、

供应能力、

产品更新速度

以及:

大型集群稳定性。

第四个挑战:从百度资产变成中立平台

百度既是昆仑芯最大的优势之一,也可能成为商业扩张时需要解决的问题。

其他大型互联网公司可能会问:

我的核心 AI 基础设施,是否应该依赖百度控股的芯片企业?

昆仑芯独立融资和未来上市,其中一个重要意义就是:

增强市场独立性。

随着外部客户收入提高,这个问题已经开始改善。

但长期来看,昆仑芯必须证明:

它首先是一家芯片平台公司,其次才是百度体系公司。

昆仑芯正在推进香港 IPO

2026 年 1 月 1 日,昆仑芯通过联席保荐人:

以保密形式向香港联交所提交上市申请。

百度随后正式公告确认:

正在推进昆仑芯分拆上市。

百度同时表示,即使分拆完成,预计昆仑芯仍将是百度的附属公司。

截至 2026 年 8 月:

昆仑芯尚未正式完成香港上市。

因此目前不能把它写成:

“香港上市公司”。

更准确的说法是:

正在推进港股 IPO。

同时准备科创板上市

昆仑芯同时也开始准备:

A 股科创板。

2026 年 4 月 29 日:

昆仑芯与中国国际金融股份有限公司签署:

IPO 辅导协议。

2026 年 5 月 7 日:

正式完成:

科创板上市辅导备案。

这意味着昆仑芯目前同时保留:

香港资本市场

和:

中国内地资本市场

两种融资可能。

截至 2026 年 8 月,科创板仍处于:

上市辅导阶段

而不是已经完成 IPO。

为什么 AI 芯片公司都急需资本市场?

原因非常简单:

AI 芯片太烧钱。

一代高性能 AI 芯片需要:

数百名甚至上千名工程师,

先进 EDA 软件,

IP,

Tape-Out,

封装,

HBM,

服务器设计,

驱动,

编译器,

软件库

以及:

大规模集群验证。

而且公司不能只开发:

一代产品。

当 P800 正在量产时,

M100 已经需要开发。

当 M100 上市时,

M300 必须已经进入后期研发。

同时下一代架构又必须启动。

这是一场:

永远不能停止研发的比赛。

所以港股或者科创板融资,对昆仑芯长期竞争力非常重要。

为什么昆仑芯特别值得关注?

中国目前很多 AI 芯片企业都拥有不错的技术。

但是昆仑芯有一个非常独特的发展路径:

它是从真实互联网工作负载中长出来的芯片

它的发展路线可以简单概括成:

2011:FPGA AI 加速

2017:XPU 架构

2018:昆仑 AI 芯片发布

2020:昆仑芯一代规模部署

2021:昆仑芯二代量产 + 独立融资

2024:昆仑芯三代 P800 量产

2025:万卡、3 万卡集群 + 超节点

2026:M100 + 天池 256 + IPO 推进

2027:M300

这种发展路线说明:

昆仑芯已经不再只是:

一颗 AI ASIC。

昆仑芯未来真正竞争的是 AI 数据中心

未来评价昆仑芯,最好不要只问:

“昆仑芯比 Nvidia 哪一张 GPU 快?”

这个问题已经越来越没有意义。

真正的问题应该是:

一个 1000 张卡的昆仑芯集群,与一个 1000 张 GPUNvidia 集群相比怎么样?

需要比较:

有效训练性能、

推理 Tokens/s、

功耗、

设备价格、

通信效率、

软件迁移成本、

故障率、

模型兼容性

以及:

整个集群的成本。

这才是未来 AI 算力竞争真正的战场。

总结

昆仑芯是中国 AI 芯片企业中非常特殊的一家公司。

它虽然在:

2021 年

才真正独立融资,

但是技术历史已经长达:

15 年左右。

它经历了:

FPGA AI Accelerator

XPU

昆仑芯一代

XPU-R / 昆仑芯二代

XPU-P / P800

M100 / M300

的发展过程。

与此同时,昆仑芯的竞争范围正在迅速扩大。

过去是:

一颗芯片

后来是:

一张 AI 卡。

现在已经变成:

AI 芯片 + XPU Link + 超节点 + 百舸平台 + 万卡集群。

P800 已经完成多个万卡集群的商业验证,最大部署规模突破 3 万卡;2026 年又继续向天池 256 超节点和新一代 M100 推进。

更加值得注意的是:

昆仑芯的外部业务已经开始超过向百度内部供货。

这可能是判断昆仑芯未来最重要的信号之一。

因为这意味着它正在逐渐完成身份转变:

从:

“百度为了自己降低 AI 算力成本开发的芯片

变成:

“能够向整个市场出售算力的独立 AI 芯片平台”。

截至 2026 年 8 月,昆仑芯已经完成三代 AI 芯片研发与商业化,M100 正成为下一阶段面向大规模推理的重要产品,M300 则瞄准更大规模的多模态训练和推理。

与此同时,公司正在推进:

香港 IPO

以及:

科创板上市辅导。

未来真正决定昆仑芯能否成为中国顶级 AI 芯片平台的,并不是某一代芯片的 TOPS 数字。

而是四个更加重要的问题:

M100、M300 能不能保持持续迭代

XPU Link 和天池超节点能不能稳定扩展到数百、数千甚至数万张卡?

软件生态能不能把 CUDA 用户的迁移成本真正降下来?

昆仑芯能不能继续扩大百度之外的外部客户?

如果这几个问题能够逐步解决,昆仑芯就可能完成一次非常重要的升级:

从:

百度自研 AI 芯片

真正成长为:

中国独立的 AI 计算基础设施平台。