昆仑芯(Kunlunxin):从百度自研 AI 芯片走向独立算力平台
昆仑芯(北京)科技股份有限公司,Kunlunxin,是中国重要的云端 AI 芯片企业之一。
它与很多近几年才成立的 AI 芯片创业公司不同。昆仑芯的技术历史可以追溯到 2011 年。当时百度已经开始使用 FPGA 研究人工智能计算加速。
经过十多年发展,昆仑芯已经从 FPGA AI 加速器 逐渐发展到 自研 XPU 架构 AI 芯片。 再进一步扩展到 AI 加速卡、AI 服务器、超节点和万卡级 AI 集群。
2021 年,百度将昆仑芯业务独立出来融资,成立独立公司。不过百度至今仍然是昆仑芯的重要股东,昆仑芯也仍属于百度体系中的重要 AI 算力资产。2026 年,昆仑芯正在同时推进香港上市和科创板上市准备。
昆仑芯并不是突然出现的一家 AI 芯片公司
理解昆仑芯,首先需要理解百度为什么这么早就开始自己设计 AI 芯片。
百度的核心业务长期涉及 搜索、广告、推荐、语音识别、自然语言处理、图像识别 以及后来出现的 大语言模型。
这些业务有一个共同特点:需要极其庞大的计算量。
早期百度主要使用 CPU 和 GPU。但是随着深度学习计算量迅速增加,百度开始研究 能不能针对自己的 AI 工作负载设计更加高效的处理器?
2011 年,百度启动 FPGA AI 加速器。到了 2015 年,FPGA 部署规模已经超过 5000 片。2017 年超过 1.2 万片。
同年,百度在 Hot Chips 会议上公开了自己的 XPU 架构。这意味着昆仑芯真正的技术历史,远远早于今天的大模型热潮。
2018 年:百度正式发布“昆仑”
当时发布的产品包括 昆仑 818-100 以及 昆仑 818-300。
当时官方公布的峰值 AI 算力达到约 260 TOPS。相比百度此前使用的 FPGA AI 加速方案,性能实现了大幅提升。
这是百度第一次从 使用通用芯片加 FPGA 加速 真正跨入 自主设计 AI ASIC 阶段。
昆仑芯一代:从芯片 Demo 进入真正业务系统
昆仑芯第一代产品于 2019 年流片,并于 2020 年规模量产。它并不是停留在实验室里的芯片。
昆仑芯一代后来大量部署到百度 搜索引擎、小度、百度智能云 等真实业务中。
百度曾披露,第一代昆仑芯量产超过 2 万片。这对于 AI 芯片公司非常重要。
很多芯片可以 Tape-Out,点亮,甚至跑 Benchmark。但是 能够连续几年运行在大型互联网公司的核心业务中,是完全不同的一件事。搜索和推荐业务拥有海量实时请求。
芯片必须解决 稳定性、驱动程序、编译器、内存管理、故障恢复、服务器兼容 等大量工程问题。
昆仑芯因此拥有一个非常特殊的优势:它从诞生开始就拥有百度这样的大规模实际应用环境。
昆仑芯一代采用 XPU 架构
昆仑芯并不是传统 GPU。它采用百度自主研发的 XPU 架构。
这里的 XPU 可以理解为 面向人工智能和异构计算设计的一种可编程计算架构。
其目标并不是 运行游戏图形,而是处理 矩阵运算、向量运算、神经网络、推荐算法、自然语言处理 以及各种 AI 工作负载。
因此从技术分类来看,昆仑芯更加接近 Programmable AI Accelerator,而不是传统 Graphics GPU。
第一代昆仑芯的代表产品 K100
昆仑芯第一代产品包括 K100 和 K200。
其中 K100 更加偏向 边缘 AI 推理。
官方规格显示 K100 提供 128 TOPS INT8,32 TFLOPS FP16
配备 8GB HBM
内存带宽 256GB/s
功耗 75W。
从今天的大模型时代来看,这些参数已经不算惊人。
但是要注意 这是第一代昆仑芯产品。它真正的重要意义是 建立昆仑芯自己的芯片、板卡和软件体系。
K200:开始进入云数据中心
K200 则更加偏向 数据中心 AI。
K200 提供 256 TOPS INT8,64 TFLOPS FP16,16GB HBM
内存带宽达到 512GB/s。
采用 14nm 制程
板卡功耗约 150W。
这让昆仑芯从第一代开始就没有把自己限制成 纯推理芯片。
2021 年:昆仑芯从百度内部部门走向独立公司
昆仑芯历史上非常关键的一步发生在 2021 年。
2021 年 3 月,百度昆仑芯片业务完成独立融资。投资方包括 CPE 源峰,IDG 资本,君联资本,元禾璞华 等机构。
当时投后估值约 130 亿元人民币。
随后百度昆仑芯业务正式成立独立公司 昆仑芯(北京)科技有限公司。
原百度芯片首席架构师 欧阳剑 出任公司 CEO。截至 2026 年,欧阳剑仍然担任昆仑芯 CEO。
为什么昆仑芯要独立?
把芯片部门留在百度内部,有一个天然问题:其他互联网公司为什么要购买竞争对手内部部门的芯片?
例如腾讯、运营商或者大型企业在购买 AI 芯片时,会考虑 长期供应、技术路线、商业中立性 以及 数据和业务安全。
如果昆仑芯永远只是“百度内部芯片部门”,市场边界就会非常有限。
因此独立化的意义不仅是 融资。更加重要的是让昆仑芯从百度自用芯片逐渐变成面向整个市场的 AI 芯片供应商。
这一转型到了 2025—2026 年开始变得越来越明显。
昆仑芯二代:XPU-R
2021 年 8 月 昆仑芯二代正式量产。
第二代产品采用新一代 XPU-R 架构。其中一个重要变化是 更加重视 通用性和易编程性。
官方表示,相比第一代产品,第二代通用计算核心能力提高 约 2—3 倍。
这其实代表 AI 芯片发展中的一个重要问题:芯片不能只跑几个固定神经网络。
AI 模型变化速度太快。从 CNN ,到 Transformer,再到 MoE、LLM、VLM 和 AI Agent。如果芯片只能执行某一种固定模型,很容易迅速淘汰。
因此昆仑芯越来越强调:Programmability。
R200:第二代代表性 AI 加速卡
昆仑芯二代的重要产品之一是 R200 系列。
官方公布的 R200 规格包括:
256 TOPS INT8
128 TFLOPS FP16
32 TFLOPS FP32
显存 16GB 或 32GB GDDR6
内存带宽 512GB/s
接口 PCIe Gen4 ×16
制程 7nm
功耗 150W—160W。
R200 可以用于 自然语言处理、计算机视觉、语音识别、机器学习 以及 AI 训练和推理。
RG800:更加接近数据中心通用 AI 加速卡
昆仑芯后来推出 RG800。
RG800 同样采用 XPU-R 架构。
它提供 256 TOPS INT8,128 TFLOPS FP16 以及 32GB GDDR6。
板卡功耗约 130W。
它同时整合比较强的视频编解码能力。因此适合 视频分析、推荐系统、AI 推理 以及其他数据中心工作负载。
R480-X8:昆仑芯很早就开始做 8 卡 AI 系统
昆仑芯另外一个非常重要的产品是 R480-X8。它已经不是一张普通 PCIe 卡。
R480-X8 基于 UBB 服务器基板
安装 8 个昆仑芯二代 OAM 模组。8 颗处理器可以共同执行 大型模型训练和推理。
这代表昆仑芯技术方向上的一个重要变化 从 单颗 AI 芯片 开始进入 AI System。这个变化后来在大模型时代变得更加重要。
第三代昆仑芯:真正进入大模型时代
2024 年,昆仑芯第三代产品开始量产。第三代产品的重点已经与前两代明显不同。AI 行业发生了巨大变化。
现在核心工作负载越来越变成 Large Language Model。也就是 大语言模型。
这意味着 AI 芯片必须面对 更大的模型、更多参数、更高显存需求、更复杂的 Attention、更高互联带宽 以及 数千、数万张 AI 卡共同运行。
第三代昆仑芯的代表性产品 就是 P800。
P800 是昆仑芯目前最重要的产品
P800 使用昆仑芯自主研发的 XPU-P 架构。
官方资料显示,P800 已经实现大规模商业部署,并成为昆仑芯目前最重要的大模型算力平台之一。
截至 2025 年,P800 累计部署已经达到数万卡级别,最大单集群规模超过 3 万卡。
这使昆仑芯开始真正进入 中国大型 AI 数据中心市场。
2025 年,P800 点亮万卡集群
2025 年 2 月 百度智能云正式点亮 昆仑芯三代万卡集群。
百度随后又继续建设 3 万卡集群。
对于 AI 芯片公司来说 一万张卡组成一个集群 与 制造一张 AI 加速卡 是完全不同的技术难度。
因为万卡系统会出现一个非常现实的问题:
即使每张卡只有极低故障率,当数量达到 10,000 张 以后,几乎每一天都可能有 某张卡、某个网络模块、某条链路 发生故障。
所以真正的大模型 AI 系统必须拥有 故障检测、任务恢复、checkpoint、网络容错、通信优化 以及 分布式训练调度。
百度披露的昆仑芯万卡平台有效训练率已经达到非常高的水平,这说明昆仑芯正在从“AI 芯片”进一步进入真正的 AI Supercomputing。
2025 年 4 月,集群规模进一步达到 3 万卡
2025 年 4 月,百度进一步点亮 P800 3 万卡集群。部分百度大模型开始直接使用这一国产 AI 芯片集群进行训练。这点非常重要。
过去国产 AI 芯片更多被用于 Inference。也就是模型训练完成以后进行推理。
而真正的大模型 Pretraining 对稳定性、通信和软件生态的要求远远更高。
昆仑芯开始进入大规模训练市场,意味着国产 AI 芯片的竞争已经从 “能不能运行大模型” 逐渐进入 “能不能训练大模型”。
DeepSeek 成为国产 AI 芯片的重要转折点
2025 年 DeepSeek 爆发以后,中国 AI 芯片市场出现一个非常明显的变化。
大量企业开始重新考虑 国产模型 + 国产 AI 芯片 的完整部署。
昆仑芯也很快完成了 DeepSeek-V3、DeepSeek-R1 以及相关蒸馏模型的适配。
这件事情真正重要的不是 “DeepSeek 能不能跑”,而是 新模型出来以后,国产芯片需要多久才能完成适配。
未来 AI 芯片软件竞争,很大程度上就是 Day 0 Model Support。
昆仑芯已经从百度内部走向外部市场
昆仑芯早期最大的客户当然就是 百度。这是优势,也是限制。
优势在于 百度提供了海量实际工作负载。
限制在于 一家芯片公司如果只有母公司一个客户,很难成为真正独立的平台企业。但这个情况正在发生明显变化。
2026 年 6 月,昆仑芯研发副总裁漆维公开表示:公司外部业务比重已经超过向百度内部供货。这是昆仑芯发展中一个非常重要的里程碑。
它意味着昆仑芯已经开始真正从 “百度自研芯片” 转变成 “市场化 AI 芯片公司”。
P800 已进入多个大型客户
昆仑芯的外部客户已经逐渐覆盖 互联网、运营商、金融、能源、汽车、高端制造 以及 央企智算中心。
百度此前公开表示 国家电网,中国钢研,招商银行 等客户已经开始规模部署昆仑芯 P800。
昆仑芯官方也表示,目前已经服务 百余家头部客户。这对于昆仑芯非常关键。
因为最终评价一颗国产 AI 芯片,不能只看 百度自己愿不愿意用。
更加重要的是 没有百度关系的企业愿不愿意掏钱购买。
为什么大型互联网客户尤其重要?
因为互联网公司的 AI 工作负载通常包括 推荐、搜索、广告、大模型、语音、图像、视频 以及 实时推理。这相当于一个非常残酷的芯片测试场。
如果一颗 AI 芯片能够长期稳定运行这些业务,那么 驱动、Runtime、编译器、内存系统、服务器 以及 集群软件 都必须相当成熟。
这也是昆仑芯拥有百度背景的一个特殊竞争优势。
昆仑芯与百度飞桨形成软硬件协同
昆仑芯另外一个天然优势是 PaddlePaddle,也就是百度飞桨。
百度既有 AI 芯片,又有 深度学习框架,还拥有 文心大模型,以及 百度智能云。
因此形成了一条完整技术链:
昆仑芯
↓
深度学习框架
↓
文心大模型
↓
百度智能云
↓
AI 应用。
这种结构和 Google 非常相似。
Google 拥有:
TPU
TensorFlow / JAX
Gemini
Google Cloud。
但昆仑芯不能只支持飞桨
如果昆仑芯只支持 PaddlePaddle,那它很难真正进入开放市场。
因为今天 AI 开发最重要的框架仍然包括 PyTorch。
大模型推理还大量依赖 vLLM、SGLang、Triton 以及其他开源软件。
所以昆仑芯独立以后,一个非常重要的方向,就是逐渐扩大自己的 通用 AI 软件生态。这将直接决定第三方客户采用昆仑芯的难度。
XPU Link:昆仑芯自己的高速互联
随着 AI 模型越来越大,AI 芯片之间的互联已经成为最重要的技术之一。
昆仑芯开发了自己的 XPU Link。它用于 AI 芯片之间进行高速通信。
昆仑芯同时推动 XPU Link 兼容开放 Scale-Up 通信标准,希望建立更加开放的国产超节点生态。
这个方向和 Nvidia NVLink 非常类似。当然,目前 NVLink 的生态和成熟度仍然明显领先。
但所有希望进入大型 AI 系统的芯片公司,都必须解决 Chip-to-Chip Interconnect。
什么是 AI 超节点?
传统 AI Server 通常是一台服务器安装 8 张 GPU。
但是今天一个大型模型可能需要 数百张 AI 卡。
于是行业开始发展 Supernode,超节点。
超节点希望让 32 张、64 张、256 张 ,甚至 512 张 AI 芯片 通过高速互联形成一个巨大的统一计算域。
这样做能够显著降低 GPU 之间通信产生的瓶颈。
2025 年,昆仑芯已经落地 32 卡和 64 卡超节点。
同时发布 256 卡和 512 卡超节点技术。
天池 256:昆仑芯进入大型超节点时代
百度把基于昆仑芯构建的新一代超节点称为 天池。
其中一个重要产品是 天池 256。它可以连接 256 张昆仑芯 AI 卡。
2026 年 4 月,天池 256 已经完成点亮。百度随后宣布其将在 2026 年正式进入市场。
与上一代超节点相比,天池 256 进一步提高 卡间互联带宽、整体吞吐量 以及 大模型推理效率。
天池 512:单节点瞄准万亿参数模型
下一步则是 天池 512。
它最高支持 512 张 AI 卡高速互联。
百度提出的目标是 让一个超节点本身就能够支撑 万亿参数级模型训练。这代表 AI 数据中心架构正在发生巨大变化。
过去 服务器是计算机。
现在 整个机柜是计算机。
未来甚至可能 整个数据中心就是一台计算机。
昆仑芯已经不再只和单张 GPU 比性能
当系统进入 256 卡、512 卡,甚至 万卡集群以后,评价 AI 芯片的方法就完全不同了。
不能只看 TOPS,真正需要看 卡间带宽、通信效率、有效训练率、线性扩展能力、故障恢复、集群利用率 以及 Tokens per Dollar。这也是 Nvidia 最大的优势之一。
Nvidia 真正卖的已经不仅仅是 GPU,而是:GPU + NVLink + NVSwitch + Network + CUDA + Server。
昆仑芯正在沿着类似的系统化方向发展。
M100:面向大模型推理的新一代昆仑芯
2025 年百度世界大会上,百度正式公布 昆仑芯 M100。
M100 针对 大规模 AI 推理 进行专门优化。
它追求的核心方向是 性能、能效和成本之间的平衡。
到了 2026 年 7 月,M100 芯片实物已经正式公开亮相。
截至 2026 年 8 月,百度管理层继续将 M100 列为昆仑芯下一阶段的重要产品,并表示昆仑芯已经完成三代 AI 芯片的研发和商业化。
因此更准确地说:现阶段 P800 仍然是昆仑芯经过大规模商业验证的核心产品,而 M100 正在成为下一阶段重点。
为什么 M100 更加重视推理?
AI 行业的计算需求正在发生变化。
2023—2025 年大家最关注的是 训练越来越大的模型。
但是当大模型开始真正商业化以后,另一个成本可能更加庞大 Inference。
假设一个模型训练一次花 1 亿美元。但如果几亿用户每天调用 数十亿次,长期推理费用完全可能超过训练费用。AI Agent 更会进一步增加 Token 消耗。
所以未来最大的 AI 芯片市场之一,很可能就是 高性能、低成本的大模型推理。
M100 就是在这个方向上进行优化。
M300:进一步面向超大规模多模态模型
M100 之后,昆仑芯还计划推出 M300。
M300 面向 超大规模多模态模型的训练和推理。
按照百度目前公布的路线图,M300 计划在 2027 年 进入下一阶段商业化。
M100 与 M300 的定位因此可以简单理解成:
M100:大规模推理
M300:高端训练 + 推理。
昆仑芯开始形成“芯片 + 超节点 + 集群”产品路线
从发展路线来看,昆仑芯现在已经非常明显地形成三个层次。
第一层 AI Chip。例如 P800、M100、M300。
第二层 Supernode。例如 32 卡、64 卡、天池 256、天池 512。
第三层 AI Cluster。例如 1 万卡、3 万卡 以及未来更大规模集群。
这与全球 AI 计算产业正在发生的变化完全一致。
百度甚至提出未来百万卡单集群目标
公司提出未来将继续开发 千卡级、4000 卡级,超节点。
同时通过百度百舸 AI 计算平台,把昆仑芯单一 AI 集群规模继续向 百万卡级别 推进。
百万卡集群目前更多还是 长期路线图目标。
但它说明昆仑芯的发展方向已经非常明确 不只是制造中国自己的 AI Processor。而是建立 中国自己的大型 AI Computing Infrastructure。
昆仑芯与 Nvidia 最大的区别
Nvidia 的核心路线可以简单理解成:
CUDA
NVLink
NVSwitch
InfiniBand / Ethernet
DGX / HGX。
昆仑芯则希望建立:
XPU
昆仑芯软件栈
XPU Link
天池超节点
百舸 AI 计算平台。
两者目前的技术规模和生态成熟度显然不在一个级别。
但是从系统架构思路来看方向正在越来越接近。
AI 芯片竞争最终会从 单卡 Benchmark 进入 整个 AI 数据中心的竞争。
昆仑芯与华为昇腾有什么区别?
华为昇腾是昆仑芯在中国市场非常强大的竞争者。
华为拥有:
Ascend NPU
CANN 软件平台
Atlas 服务器
高速互联
超节点
华为云。
昆仑芯则依靠 百度、百度智能云、飞桨、文心大模型 和 百舸 AI 平台。
因此两家公司都有一个共同特点:背后拥有完整云计算和 AI 软件生态。
这与纯芯片创业公司形成明显区别。
昆仑芯与寒武纪有什么区别?
寒武纪是中国最早一批专门开发 AI Processor 的企业。它经历过 终端 AI IP、边缘 AI、云端 AI 等多个阶段。
昆仑芯则从一开始就拥有大量 百度真实工作负载。
这使昆仑芯产品开发更加明显地采用 Application-Driven 路线。也就是说 芯片架构不断根据搜索、推荐、语音、大模型等真实业务迭代。
这也是大型互联网公司自研芯片的一大优势。
昆仑芯与沐曦有什么区别?
沐曦更加接近 GPGPU。它同时进入 AI Training、AI Inference、Graphics、Scientific Computing。
而昆仑芯更加集中 AI。它没有重点建设传统 Graphics Pipeline。所以技术上更加接近 专门针对 AI 优化的可编程处理器。
这使昆仑芯可以把更多晶体管用于 AI Compute、Memory、Interconnect 和 AI-specific Optimization。
昆仑芯与燧原科技有什么区别?
燧原与昆仑芯其实更加接近。
两家公司都重点面向 Cloud AI。
都在发展 AI 芯片、加速卡、多卡系统、超节点 以及 大型 AI 集群。
不同之处是:昆仑芯背后拥有百度这样一个 搜索 + 云计算 + 大模型 平台。
燧原则拥有更加独立的创业公司身份,并与大型互联网客户深度合作。
两者都会面对同一个问题:如何在 CUDA 生态之外建立真正可用的大模型算力平台。
昆仑芯最大的优势之一:十五年真实业务积累
很多 AI 芯片创业公司成立于2017、2018、2020 年。
昆仑芯则从 2011 年 就开始做 AI 加速。
这使它已经经历 FPGA、CNN、语音识别、推荐系统、Transformer、大语言模型 等多次 AI 计算范式变化。
截至 2026 年,公司官方已经把自己的积累描述为 十五年 AI 加速技术经验。
第二个优势:百度是天然超级实验室
百度给昆仑芯提供了非常特殊的环境。
想测试 搜索,百度有搜索引擎。
想测试 语音,百度有语音业务。
因此昆仑芯拥有一个其他很多创业公司很难复制的:Hardware-Software Co-Design Environment。
第三个优势:已经跨过规模部署门槛
今天昆仑芯最有价值的指标之一,并不是某一个 TFLOPS,而是 3 万卡集群。
芯片做到十张能工作 和 三万张一起工作 完全不是一个技术等级。
三万卡集群意味着 芯片、板卡、驱动、编译器、网络、冷却、电源、集群管理 和 分布式 AI 软件 都需要协同。
这是昆仑芯目前非常重要的商业壁垒。
第四个优势:外部市场开始真正打开
2026 年一个非常关键的变化,是昆仑芯外部业务已经超过内部供货。
这说明它不再只是 百度的成本中心,而开始变成 真正能够面向市场销售的 AI 芯片企业。
如果这种趋势继续发展,昆仑芯的企业定位可能发生根本变化。从 Baidu AI Chip 变成 Independent Chinese AI Computing Platform。
昆仑芯最大的挑战仍然是 CUDA
几乎所有国产高性能 AI 芯片都会遇到同一个问题:CUDA。
Nvidia 最大的优势已经不是 “某一颗 GPU 快多少”。而是二十多年形成的 CUDA、cuDNN、NCCL、TensorRT、Triton、PyTorch 以及海量开发者生态。
所以昆仑芯真正需要解决的是 一个原本在 Nvidia GPU 上运行的大模型,迁移到昆仑芯以后 需要修改多少代码?性能下降多少?调试是否方便?模型新版本能不能快速适配?集群是否稳定?
这些问题决定的是:Total Cost of Ownership。
第二个挑战:先进制程与 HBM
大模型 AI 芯片越来越依赖 先进制程、HBM、先进封装 以及 高速 Chip-to-Chip Interconnect。
尤其是大型 Transformer 模型,很多时候真正限制性能的不是 计算单元不够。而是 Memory Bandwidth。
因此未来昆仑芯 M 系列能否持续获得 足够先进的制造能力和高带宽内存,将直接影响其高端市场竞争力。
第三个挑战:国产 AI 芯片竞争极其激烈
主要玩家包括 华为昇腾,寒武纪,海光,沐曦,壁仞科技,燧原科技,摩尔线程,天数智芯 以及 昆仑芯。
最终不太可能所有企业都拥有同样大的市场份额。
未来几年真正决定竞争结果的,会越来越集中在 商业订单、软件生态、供应能力、产品更新速度 以及 大型集群稳定性。
第四个挑战:从百度资产变成中立平台
百度既是昆仑芯最大的优势之一,也可能成为商业扩张时需要解决的问题。
其他大型互联网公司可能会问:我的核心 AI 基础设施,是否应该依赖百度控股的芯片企业?
昆仑芯独立融资和未来上市,其中一个重要意义就是 增强市场独立性。
随着外部客户收入提高,这个问题已经开始改善。
但长期来看,昆仑芯必须证明:它首先是一家芯片平台公司,其次才是百度体系公司。
昆仑芯正在推进香港 IPO
2026 年 1 月 1 日,昆仑芯通过联席保荐人 以保密形式向香港联交所提交上市申请。
百度随后正式公告确认 正在推进昆仑芯分拆上市。百度同时表示,即使分拆完成,预计昆仑芯仍将是百度的附属公司。
截至 2026 年 8 月,昆仑芯尚未正式完成香港上市。
因此目前不能把它写成 “香港上市公司”。更准确的说法是 正在推进港股 IPO。
同时准备科创板上市
昆仑芯同时也开始准备 A 股科创板。
2026 年 4 月 29 日,昆仑芯与中国国际金融股份有限公司签署 IPO 辅导协议。
2026 年 5 月 7 日 正式完成 科创板上市辅导备案。
这意味着昆仑芯目前同时保留 香港资本市场 和 中国内地资本市场 两种融资可能。
截至 2026 年 8 月,科创板仍处于 上市辅导阶段,而不是已经完成 IPO。
为什么 AI 芯片公司都急需资本市场?
一代高性能 AI 芯片需要 数百名甚至上千名工程师,先进 EDA 软件,IP,Tape-Out,封装,HBM,服务器设计,驱动,编译器,软件库 以及 大规模集群验证。
而且公司不能只开发 一代产品。
当 P800 正在量产时,M100 已经需要开发。
当 M100 上市时,M300 必须已经进入后期研发。同时下一代架构又必须启动。
这是一场 永远不能停止研发的比赛。
所以港股或者科创板融资,对昆仑芯长期竞争力非常重要。
为什么昆仑芯特别值得关注?
但是昆仑芯有一个非常独特的发展路径:它是从真实互联网工作负载中长出来的芯片。
它的发展路线可以简单概括成:
2011:FPGA AI 加速
↓
2017:XPU 架构
↓
↓
2020:昆仑芯一代规模部署
↓
2021:昆仑芯二代量产 + 独立融资
↓
2024:昆仑芯三代 P800 量产
↓
2025:万卡、3 万卡集群 + 超节点
↓
2026:M100 + 天池 256 + IPO 推进
↓
2027:M300
这种发展路线说明:昆仑芯已经不再只是 一颗 AI ASIC。
昆仑芯未来真正竞争的是 AI 数据中心
未来评价昆仑芯,最好不要只问:“昆仑芯比 Nvidia 哪一张 GPU 快?”这个问题已经越来越没有意义。
真正的问题应该是:一个 1000 张卡的昆仑芯集群,与一个 1000 张 GPU 的 Nvidia 集群相比怎么样?
需要比较 有效训练性能、推理 Tokens/s、功耗、设备价格、通信效率、软件迁移成本、故障率、模型兼容性 以及 整个集群的成本。
这才是未来 AI 算力竞争真正的战场。
总结
它虽然在 2021 年 才真正独立融资,但是技术历史已经长达 15 年左右。
它经历了:
FPGA AI Accelerator
↓
XPU
↓
昆仑芯一代
↓
XPU-R / 昆仑芯二代
↓
XPU-P / P800
↓
M100 / M300 的发展过程。
与此同时,昆仑芯的竞争范围正在迅速扩大。
过去是 一颗芯片。
后来是 一张 AI 卡。
现在已经变成 AI 芯片 + XPU Link + 超节点 + 百舸平台 + 万卡集群。
P800 已经完成多个万卡集群的商业验证,最大部署规模突破 3 万卡;2026 年又继续向天池 256 超节点和新一代 M100 推进。
更加值得注意的是:昆仑芯的外部业务已经开始超过向百度内部供货。
这可能是判断昆仑芯未来最重要的信号之一。
因为这意味着它正在逐渐完成身份转变,从 “百度为了自己降低 AI 算力成本开发的芯片” 变成 “能够向整个市场出售算力的独立 AI 芯片平台”。
截至 2026 年 8 月,昆仑芯已经完成三代 AI 芯片研发与商业化,M100 正成为下一阶段面向大规模推理的重要产品,M300 则瞄准更大规模的多模态训练和推理。
与此同时,公司正在推进 香港 IPO 以及 科创板上市辅导。
未来真正决定昆仑芯能否成为中国顶级 AI 芯片平台的,并不是某一代芯片的 TOPS 数字。
而是四个更加重要的问题:
M100、M300 能不能保持持续迭代?
XPU Link 和天池超节点能不能稳定扩展到数百、数千甚至数万张卡?
软件生态能不能把 CUDA 用户的迁移成本真正降下来?
昆仑芯能不能继续扩大百度之外的外部客户?
如果这几个问题能够逐步解决,昆仑芯就可能完成一次非常重要的升级。从 百度自研 AI 芯片 真正成长为 中国独立的 AI 计算基础设施平台。
