GPU企业:摩尔线程(Moore Threads)
摩尔线程智能科技(北京)股份有限公司(Moore Threads Technology) 是中国最具代表性的自主GPU企业之一,核心技术路线是公司自研的:
MUSA GPU架构与软件生态。
与一些主要面向AI训练和推理的国产加速芯片企业不同,摩尔线程从成立之初就提出:
“全功能GPU”
路线。
按照公司的定义,一颗全功能GPU同时覆盖:
AI计算
3D图形渲染
科学计算与物理仿真
以及:
超高清视频编解码。
因此,摩尔线程希望建立的并不只是一颗“国产AI卡”,而是一套更加接近NVIDIA传统GPU发展逻辑的:
GPU + 软件栈 + 显卡 + 服务器 + 集群 + AI平台
完整计算体系。
一、摩尔线程基本情况
摩尔线程成立于:
2020年6月。
公司于:
2020年10月正式运营。
总部位于:
北京。
公司创始人、董事长兼总经理为:
张建中。
张建中在创办摩尔线程之前,曾长期任职于NVIDIA,2006年至2020年担任英伟达全球副总裁、大中华区总经理。
2020年离开NVIDIA以后,他创立摩尔线程。
因此,从公司成立开始,摩尔线程就带有非常明显的:
GPU产业背景。
二、摩尔线程已经成为上市GPU企业
2025年12月5日,摩尔线程正式登陆:
上海证券交易所科创板。
股票简称:
摩尔线程
股票代码:
688795。
公司首次公开发行7000万股人民币普通股。
这一步非常重要。
因为摩尔线程从一家高投入的GPU创业公司,进一步进入:
公开资本市场。
GPU研发需要持续投入:
芯片设计
软件
驱动
编译器
AI框架
大规模集群
先进封装
以及验证。
因此,资金规模对于GPU企业长期竞争非常关键。
三、摩尔线程真正特殊的地方:全功能GPU
理解摩尔线程,最重要的关键词不是:
而是:
全功能GPU。
所谓“全功能GPU”是摩尔线程自己的产品定位,强调一套GPU架构同时可以完成多种任务:
Graphics
负责3D图形。
负责神经网络训练与推理。
Compute
负责科学计算和通用并行计算。
Video
负责视频编解码和多媒体处理。
这与只针对神经网络矩阵运算设计的专用NPU存在明显区别。
四、为什么“全功能”很重要?
GPU最早是:
Graphics Processing Unit。
主要负责:
3D图形。
后来GPU强大的并行计算能力被用于:
科学计算。
再后来进入:
深度学习。
所以现代GPU已经逐渐变成:
Graphics + Compute + AI
综合并行处理器。
NVIDIA就是最典型的例子。
一套GPU架构可以同时进入:
游戏显卡
工作站
AI服务器
科学计算
数字孪生
视频
云计算。
摩尔线程试图建立的正是类似的:
统一GPU架构。
五、MUSA:摩尔线程最核心的技术
摩尔线程最重要的底层技术叫:
MUSA。
全称:
Meta-computing Unified System Architecture
中文通常称:
元计算统一系统架构。
MUSA不仅是一套硬件架构。
它同时包括:
GPU指令体系
并行计算模型
Driver
Runtime
Compiler
Math Libraries
AI Libraries
以及:
Developer Tools。
因此,MUSA更像一个完整:
GPU Computing Platform。
六、为什么软件比GPU芯片本身更难?
但现代GPU产业真正可怕的壁垒是:
软件生态。
NVIDIA拥有:
CUDA。
CUDA经过多年发展已经形成:
Compiler
Runtime
cuBLAS
cuDNN
NCCL
Developer Tools
以及海量应用程序。
所以一家新GPU公司即使设计出性能不错的硬件,也会立刻面对一个问题:
现有软件为什么要迁移过来?
这正是摩尔线程开发MUSA的原因。
七、MUSIFY:降低CUDA迁移成本
为了减少CUDA软件迁移难度,摩尔线程推出:
MUSIFY。
它可以帮助开发者把CUDA程序转换并移植到:
MUSA平台。
例如在MTT S4000平台上,官方文档明确提供了通过MUSIFY转换CUDA代码并重新编译到MUSA环境的方法。
这个方向非常关键。
因为国产GPU真正需要解决的并不仅仅是:
“我能不能跑AI?”
还要解决:
“原来的CUDA程序迁移过来要花多少成本?”
八、MUSA软件栈正在越来越完整
目前MUSA已经拥有大量软件组件。
包括:
MUSA SDK
Torch-MUSA
MCCL
muDNN
muBLAS
muFFT
以及:
Moore Perf System。
其中Moore Perf System用于分析GPU性能瓶颈,已经支持Windows和Linux,并能够跟踪:
MUSA API
OpenGL
OpenGL ES
Vulkan
Direct3D 11
以及Direct3D 12等工作负载。
这说明摩尔线程的竞争已经不只是:
芯片。
而是开始进入:
Developer Ecosystem。
九、摩尔线程第一代GPU:苏堤
摩尔线程的发展速度非常快。
2021年11月,公司宣布:
首颗全功能GPU研制成功。
随后在2022年3月正式推出第一代MUSA产品。
这一代GPU架构被称为:
苏堤。
基于这一代架构,摩尔线程推出了:
MTT S50
以及面向数据中心的:
MTT S2000。
从公司成立到第一代GPU产品发布,时间非常短。
十、第二代GPU:春晓
春晓。
春晓成为摩尔线程进入消费级GPU市场的重要一步。
代表产品包括:
MTT S80
以及:
MTT S3000。
其中MTT S80尤其受到关注。
因为这是中国国产GPU企业少有的真正直接进入:
Gaming Graphics Card
市场的产品。
十一、MTT S80:国产游戏GPU的重要代表
MTT S80搭载完整春晓GPU。
主要规格包括:
4096个MUSA核心
GPU频率:
1.8GHz
FP32计算能力约:
14.7 TFLOPS
显存:
16GB GDDR6
显存位宽:
256-bit
显存带宽:
448GB/s
同时使用:
PCIe 5.0 ×16。
十二、MTT S80不仅是一张游戏显卡
MTT S80很有意思的地方在于:
它并不只定位于游戏。
它同时拥有:
3D图形
通用计算
以及:
视频处理
能力。
支持:
AV1
H.264
H.265
VP9
等视频格式。
同时最高支持:
8K显示输出。
因此,MTT S80可以很好地解释摩尔线程所谓的:
全功能GPU。
十三、但是消费级GPU真正难的是驱动
设计一颗游戏GPU只是第一步。
真正让GPU变成一张好用的游戏显卡,需要:
Driver。
因为PC游戏数量巨大。
每个游戏可能使用不同:
DirectX版本
Shader
Rendering Engine
Memory Management
以及特殊图形功能。
所以一张GPU可能拥有不错的理论TFLOPS,
但如果:
驱动不成熟
游戏兼容性不足
Shader编译优化不足,
最终游戏体验仍然会受到很大影响。
这也是新GPU企业进入消费级市场最困难的壁垒之一。
十四、NVIDIA真正强大的地方并不只有GPU硬件
如果研究NVIDIA,就会发现:
NVIDIA的真正优势其实是:
Hardware + Software。
对于游戏来说,它有:
GeForce Driver。
对于AI来说,它有:
CUDA。
对于科学计算来说,有:
各种数学库。
对于开发者来说,有:
Profiler
Debugger
SDK。
所以摩尔线程最终真正需要建立的,也不是:
一张国产显卡。
而是:
整个GPU软件世界。
这也是MUSA长期价值所在。
十五、第三代GPU:曲院
2023年9月,摩尔线程推出新一代GPU架构:
曲院。
这一代的重点明显从消费级图形进一步转向:
AI和大模型。
代表产品:
MTT S4000。
S4000采用:
第三代MUSA核心
并加入新一代:
Tensor Core。
支持:
FP64
FP32
TF32
FP16
BF16
INT8
等多种数据精度。
十六、MTT S4000:进入大模型计算
MTT S4000是摩尔线程进入大模型训练和推理市场的重要产品。
主要规格包括:
8192个MUSA核心
FP32:
25 TFLOPS
FP16 Tensor:
100 TFLOPS
INT8 Tensor:
200 TOPS
显存:
48GB
显存带宽:
768GB/s
接口:
PCIe 5.0 ×16。
这已经明显不是传统PC显卡。
而是:
数据中心AI计算卡。
十七、MTLink:GPU之间必须高速通信
需要:
8张
64张
1000张
甚至:
10000张GPU
一起工作。
问题来了:
GPU之间怎么交换数据?
如果通信速度太慢,
GPU就会大量时间等待数据。
因此NVIDIA开发:
NVLink。
而摩尔线程开发:
MTLink。
MTT S4000已经使用MTLink进行多卡互联。
这说明GPU竞争已经从:
单卡算力
进一步进入:
GPU Interconnect。
十八、夸娥KUAE:从GPU卡进入GPU集群
2023年,摩尔线程推出:
KUAE(夸娥)智算集群。
这一步对于公司非常关键。
因为它意味着摩尔线程开始从:
GPU Chip
↓
GPU Card
进一步进入:
GPU Cluster。
官方目前的产品体系已经能够覆盖:
千卡
以及:
万卡级
AI基础设施。
这也是今天GPU产业竞争的核心方向。
十九、为什么“集群能力”比单卡越来越重要?
在GPT、DeepSeek、Qwen等大型模型时代,
真正的AI基础设施通常不是:
一张GPU。
而是:
Thousands of GPUs。
所以GPU企业最终必须解决:
显存
互联
网络
通信库
集群管理
故障恢复
模型训练框架
资源调度
以及:
云原生。
它卖的是:
AI Infrastructure。
摩尔线程也正在沿着类似方向发展。
二十、第四代GPU:平湖
到了2026年,摩尔线程进一步推出:
平湖
第四代MUSA GPU架构。
这一代的设计重点已经非常明确:
AI + HPC。
官方把平湖描述为专门针对:
大模型
Transformer
训练
推理
以及高性能计算
设计的新一代GPU架构。
二十一、平湖架构的三个核心引擎
平湖重点发展三类新引擎:
TCE
Tensor Compute Engine
张量计算引擎。
TME
Tensor Memory Engine
张量访存引擎。
以及:
ACE
Asynchronous Communication Engine
异步通信引擎。
它们分别解决:
计算
数据搬运
以及:
GPU之间的通信。
二十二、为什么现在AI GPU越来越重视“数据搬运”?
TOPS有多高。
其实并不完全如此。
如果Tensor Core非常快,
但是数据迟迟送不过来,
计算单元仍然只能:
等待。
同样,
如果多张GPU之间通信太慢,
整个集群性能也会大幅下降。
因此现代GPU设计越来越强调:
Compute + Memory + Interconnect
协同设计。
平湖的设计重点正是这个方向。
二十三、PH100:摩尔线程新一代GPU芯片
基于平湖架构,
摩尔线程推出:
PH100。
PH100成为新一代旗舰智算卡:
MTT S5000
的核心芯片。
公司目前把PH100和S5000作为生成式AI、大模型以及高性能计算的重要平台。
二十四、MTT S5000:2026年的旗舰GPU
截至2026年,摩尔线程最新的重要数据中心产品之一是:
MTT S5000。
它主要面向:
大模型训练
大模型推理
科学计算
AI4S
以及高性能计算。
官方公布的主要规格包括:
80GB显存
显存带宽:
1.6TB/s
AI稠密算力最高:
1000 TFLOPS
支持:
FP8到FP64
多种计算精度。
二十五、FP8为什么越来越重要?
早期深度学习大量使用:
FP32。
后来变成:
FP16
BF16。
现在大模型训练和推理越来越重视:
FP8。
原因很简单。
数据精度降低之后:
一次可以计算更多数据。
显存占用减少。
显存带宽压力降低。
计算吞吐提高。
原生FP8。
MTT S5000已经加入硬件级FP8计算能力。
二十六、第二代MTLink
MTT S5000还使用:
第二代MTLink。
官方资料显示,8卡互联系统的GPU间互联带宽可以达到:
784GB/s。
这再次说明摩尔线程正在从:
转向:
大型AI系统公司。
因为到了万卡集群时代,
互连能力已经和GPU计算能力一样重要。
二十七、从千卡进一步走向万卡
摩尔线程目前已经把夸娥体系进一步扩展到:
万卡级GPU集群。
官方公布的S5000平台目标之一,就是服务:
千亿
乃至:
万亿参数
模型训练。
需要特别说明:
公司官网公布的很多国际旗舰产品性能对比属于厂商自己的测试数据和测试条件,更适合用于了解产品定位,而不宜简单当作独立第三方性能结论。
但从产品路线本身已经可以看出:
摩尔线程正在把竞争重心快速转向:
大模型基础设施。
二十八、MTT SGX5000:不再只卖GPU卡
基于MTT S5000,摩尔线程还推出:
MTT SGX5000。
它是一套面向:
AI训练
推理
以及HPC
的一体化GPU服务器。
服务器可以搭载:
8颗MTT S5000
计算模组。
这意味着客户甚至不一定自己搭建整套服务器。
摩尔线程正在直接提供:
完整计算节点。
二十九、摩尔线程的产品已经覆盖很多市场
目前摩尔线程产品已经大致可以分成:
游戏GPU
MTT S80
MTT S70
专业图形
MTT X300
MTT S50
数字办公
MTT S30
MTT S10
AI和数据中心
MTT S5000
MTT S4000
MTT S3000
MTT S2000
服务器
MTT SGX5000
智算集群
MTT KUAE
以及:
因此,公司已经不再只有一条:
显卡产品线。
三十、摩尔线程开始从“云”向“边”和“端”扩展
2025年至2026年,摩尔线程又开始推出:
MTT AIBOOK
AI算力本,
以及:
MTT AICUBE
家庭AI中枢。
同时还有:
MTT E300
AI模组。
Cloud
进一步向:
Edge
以及:
Device
扩张。
也就是:
云—边—端。
三十一、GPU为什么会成为AI终端的重要处理器?
未来AI并不一定全部运行在数据中心。
很多模型可能直接运行在:
PC
机器人
汽车
家庭服务器
工业设备
以及个人AI终端。
这些设备需要:
图形
视频
通用计算
同时存在。
而“全功能GPU”的优势恰恰就是:
一颗处理器同时承担很多任务。
这可能是摩尔线程坚持统一GPU架构的长期价值。
三十二、摩尔线程可以运行哪些CPU平台?
摩尔线程另一个有意思的地方,是它并没有把GPU锁定到一种CPU。
例如服务器产品可以适配:
x86
以及:
LoongArch
等处理器平台。
因此未来可以看到很多组合:
这也是独立GPU公司的优势。
三十三、图形GPU和GPGPU最大的区别是什么?
有些国产GPU企业主要做:
GPGPU。
也就是说重点是:
科学计算
并行计算。
但是它们可能并不重点支持:
Windows游戏
3D Graphics
显示输出
视频编解码。
摩尔线程则希望同时覆盖:
Graphics
Compute
Video。
这也是公司一直强调:
Full-Function GPU
的原因。
三十四、摩尔线程和沐曦有什么区别?
沐曦目前重点更加偏向:
数据中心GPU。
主要攻击:
AI训练
推理
以及:
高性能计算。
摩尔线程则同时拥有:
消费级显卡
专业图形
数据中心
视频
以及科学计算。
因此:
而:
摩尔线程更偏完整GPU平台。
数据中心AI
领域的竞争会越来越直接。
三十五、摩尔线程和壁仞有什么区别?
壁仞同样是一家中国高性能GPU企业。
它从一开始就非常强调:
数据中心
以及:
AI计算。
摩尔线程的产品覆盖面则更加广泛:
游戏
桌面
工作站
云计算
视频
数字孪生
科学计算。
简单来说:
壁仞更像:
High Performance GPGPU。
摩尔线程更加追求:
General Full-Function GPU。
三十六、摩尔线程与景嘉微有什么区别?
长期重点之一是:
图形显示
以及特定行业GPU。
摩尔线程成立时间较晚,
但从一开始就把目标定在:
高性能全功能GPU。
并快速进入:
PC显卡
数据中心
大模型
以及:
GPU集群。
因此两家公司所处的发展阶段和主要目标市场并不完全相同。
三十七、摩尔线程真正想挑战的是谁?
如果从技术路线看,
摩尔线程最容易让人联想到的公司当然是:
因为两家公司都强调:
一套GPU架构
一套统一计算软件平台
消费级GPU
专业GPU
数据中心
集群。
但是必须看到:
CUDA生态已经发展近二十年。
游戏驱动生态更加庞大。
AI开发者数量也远远领先。
所以:
路线相似
并不意味着:
当前整体实力已经相同。
这一点对于客观看待摩尔线程非常重要。
三十八、摩尔线程最大的优势之一:真正覆盖Graphics
它确实长期研发:
3D GPU。
支持:
DirectX
Vulkan
OpenGL
OpenGL ES
等图形API。
这件事情并不简单。
因为完整3D GPU需要:
Geometry
Rasterization
Shader
Texture
Display
Driver
Compiler
以及大量图形API支持。
这意味着摩尔线程建立的是一套真正意义上的:
GPU Architecture。
三十九、第二个优势:统一架构
MUSA并不是为:
游戏
科学计算
分别设计四颗芯片。
它试图使用:
统一架构
覆盖多个市场。
这种路线一旦成功,会产生明显规模优势。
同一套底层技术可以不断扩展到:
PC
Workstation
Data Center
Edge
Digital Twin
Cloud。
NVIDIA过去几十年的成功很大程度也来自类似的:
Architecture Reuse。
四十、第三个优势:已经从芯片进入系统
摩尔线程目前已经不是只提供:
GPU Chip。
它已经拥有:
显卡
AI卡
服务器
集群
云平台
开发工具
以及:
AI软件栈。
官方目前直接把产品体系描述为:
从芯片到显卡到集群。
这一步非常重要。
而是:
System-Level Computing。
四十一、第四个优势:大模型市场增长非常快
2026年上半年,摩尔线程实现营业收入约:
17.36亿元人民币
同比增长:
147.42%。
其中云端产品收入约:
16.93亿元
已经占据公司收入的绝大部分。
同期归属于上市公司股东的净利润仍为亏损,约:
-1156万元
但相比2025年同期约-2.71亿元的亏损已经明显收窄。
这组数据说明一个非常明显的变化:
AI数据中心已经成为摩尔线程目前真正的商业主战场。
四十二、研发投入仍然非常高
2026年上半年,摩尔线程研发费用达到约:
7.69亿元人民币
同比继续增长。
原因是公司需要同时研发:
硬件
驱动
编译器
数学库
AI软件
服务器
互联
以及集群技术。
因此,摩尔线程短期的核心矛盾仍然是:
快速扩大商业收入,同时保持极高研发投入。
四十三、摩尔线程最大的挑战之一:CUDA生态
真正与NVIDIA竞争,
最大的困难甚至可能不是:
而是:
CUDA。
CUDA已经存在大量:
开发者
科研代码
AI项目
HPC软件
数学库
深度学习框架
以及商业应用。
用户已经熟悉:
CUDA。
所以替代GPU必须回答:
现有代码怎么迁?
MUSA和MUSIFY就是摩尔线程对这个问题的回答。
四十四、第二个挑战:游戏生态
消费级GPU市场还有另外一座大山:
Game Compatibility。
今天PC游戏可能涉及:
DirectX 9
DirectX 11
DirectX 12
Vulkan
不同游戏引擎
不同Shader
以及几十年的Windows软件历史。
GPU硬件只需要设计一次。
驱动却必须:
不断更新。
所以消费级GPU竞争本质上是一场:
长期软件工程。
摩尔线程要真正扩大S80、S70这一类产品的公开消费市场,驱动和游戏兼容性仍然是长期任务。
四十五、第三个挑战:先进制造和供应链
高端GPU非常依赖:
先进制程
HBM
高速显存
先进封装
高速互连
IP
服务器供应链。
现代AI GPU已经不是单独一家芯片设计公司可以完全决定的产品。
它是:
全球半导体供应链共同构成的系统。
因此供应链能力同样会直接决定国产GPU能够做到什么性能、什么成本以及多快迭代。
四十六、第四个挑战:国际巨头迭代速度非常快
GPU行业还有一个非常困难的问题:
对手不会停下来等你。
都在不断推出新架构。
特别是在AI市场,
一代GPU生命周期已经越来越短。
所以国产GPU企业不仅需要:
追赶现有产品。
还必须建立:
持续迭代能力。
从苏堤、春晓、曲院到平湖,可以看出摩尔线程正在努力建立这种架构迭代节奏。
四十七、第五个挑战:AI软件变化速度极快
AI本身也在快速变化。
早期是:
CNN。
后来是:
Transformer。
现在又出现:
MoE
多模态
视频生成
世界模型
Agent
以及各种新架构。
它必须拥有:
Programmability。
摩尔线程坚持MUSA统一GPU平台,本质上也是希望获得这种:
可编程性。
四十八、摩尔线程为什么值得特别关注?
因为它代表中国GPU产业中一条非常少见的路线:
不只做AI卡。
而是试图建立:
完整GPU产业栈。
从:
Gaming
到:
Professional Graphics
再到:
AI Inference
HPC
Video
Virtualization
Cloud
以及:
Large-Scale GPU Cluster。
这条路线非常困难。
但一旦建立起来,GPU的市场范围也会非常大。
四十九、摩尔线程在中国GPU企业中的位置
如果把中国主要GPU企业简单划分:
芯原——Vivante GPU IP
那么摩尔线程最大的特色就是:
产品线最接近完整独立GPU公司。
五十、摩尔线程已经不是单纯“国产显卡公司”
如果只把摩尔线程理解为:
“做MTT S80显卡的公司”
已经明显落后于它现在的发展方向。
2022年摩尔线程确实大量受到消费级显卡关注。
但是到了2026年,
真正推动公司业务快速增长的核心已经明显转向:
AI算力。
当前官网的重点产品已经包括:
MTT S5000
MTT SGX5000
MTT KUAE
AI训练套件
AI推理套件
以及:
所以更加准确的定义应该是:
五十一、未来最值得关注的几个方向
未来几年,摩尔线程有几个方向特别值得观察。
第一:S5000和平湖架构。
它能否在真实AI训练和推理市场形成规模化商业部署。
第二:MUSA。
软件兼容性和开发者生态能否继续扩大。
第三:万卡集群。
单GPU性能之外,大规模集群的稳定性、通信效率和利用率将决定其数据中心竞争力。
第四:消费级显卡。
摩尔线程是否继续发展下一代游戏GPU,以及Windows游戏兼容性能够提高到什么程度。
第五:Edge AI。
AIBOOK、AICUBE和E300等产品说明公司已经开始从数据中心向端侧AI扩张。
第六:科学计算。
S5000已经支持FP64,意味着摩尔线程正在进一步进入HPC和AI for Science市场。
五十二、如何看待摩尔线程?
如果只从一张GPU的跑分去判断摩尔线程,
其实很容易低估这家公司真正想做的事情。
它真正尝试建立的是:
MUSA ISA
GPU Architecture
Graphics
Tensor Compute
Video
Compiler
Driver
Math Libraries
MTLink
Server
GPU Cluster
最终形成:
完整GPU计算生态。
这是一个极其庞大的工程。
结论
摩尔线程是中国GPU产业中非常值得长期观察的一家公司。
它的发展路线已经非常清楚:
2020——成立
↓
2022——苏堤 / MUSA / MTT S50 / S2000
↓
2022——春晓 / MTT S80 / S3000
↓
2023——曲院 / MTT S4000 / KUAE千卡集群
↓
2025——科创板上市
↓
2026——平湖 / PH100 / MTT S5000 / 万卡AI基础设施。
从这条路线可以明显看出:
摩尔线程正在从:
逐渐向:
“国产GPU计算平台公司”
转变。
而到了AI时代,真正决定一家GPU公司能否成功的,也已经不只是:
GPU有多少TFLOPS。
更加重要的是:
能不能运行现有软件?
能不能支撑大模型?
多张GPU能不能高效互联?
千卡、万卡集群能不能稳定工作?
开发者愿不愿意使用这套平台?
这也是为什么MUSA的重要性可能并不低于任何一颗摩尔线程GPU芯片。
如果摩尔线程未来能够持续缩小与国际头部GPU平台在:
硬件性能
软件兼容
开发工具
游戏驱动
AI框架
以及大规模集群
方面的差距,那么它在中国GPU产业中的价值可能远远不只是:
“又一家国产显卡厂商。”
更加值得关注的定位是:
