Menu Close

MemryX

AI加速器企业:MemryX——用数据流架构和近存计算做低功耗边缘AI

MemryX

MemryX 是一家美国 AI 加速器芯片企业,总部位于密歇根州安娜堡,主要开发面向 Edge AI 的低功耗神经网络推理加速器。

NVIDIAAMD 等主要依靠 GPU 进行大规模 AI 训练和推理的企业不同,MemryX 从一开始就把重点放在摄像头、工业计算机、机器人、汽车、IoT、视频管理系统和边缘服务器等实时 AI 场景,希望通过专门设计的数据流架构,让神经网络在较低功耗下持续处理来自摄像头和传感器的数据。

MemryX 最重要的产品是 MX3 AI Accelerator。它不是传统意义上具有大量通用计算核心的 GPU,而是一颗专门为神经网络 inference,也就是 AI 推理设计的处理器。

MemryX 同时提供 MX3 芯片、M.2 加速模块以及其他不同形态的产品,使客户可以把 AI 加速能力加入现有 x86、ARM 或 RISC-V 系统,而不需要彻底重新设计主处理器平台。

MemryX 是一家什么样的公司?

MemryX 成立于 2019 年,由美国密歇根大学教授 Wei Lu 和 Zhengya Zhang 共同创立。

Wei Lu 长期研究新型存储器、神经形态计算和存内/近存计算,Zhengya Zhang 的研究方向则包括 VLSI、电路系统、通信与信号处理。

公司技术本身具有比较明显的大学科研背景。

MemryX 后来逐渐从实验室技术转向商业芯片

2021 年,公司聘请曾经负责 Qualcomm Snapdragon Compute、AI、XR 和游戏等业务的 Keith Kressin 担任 CEO,推动 MX3 从研发进入量产阶段。

2026 年 6 月,公司再次调整管理层,由 Ross Jatou 出任 President & CEO,Wei Lu 继续担任 CTO 和联合创始人。

MemryX 表示,这次管理层调整与公司从传统 Edge AI 市场进一步进入服务器和 AI infrastructure 市场有关。

核心产品:MX3 AI Accelerator

MX3 是 MemryX 第一代真正面向大规模商业市场的 AI 加速器产品。之所以叫 MX3,是因为此前公司内部已经开发过两代原型产品,因此正式量产的一代被称为 MX3。

一颗 MX3 内部拥有 192 个 Compute Engines,也就是计算引擎。

按照 MemryX 2026 年公布的最新 datasheet,单颗 MX3 在 1GHz 工作频率下最高可以达到约 6 TFLOPS 的计算能力,内部拥有大约 10.5MB weight memory 和 5MB feature-map memory,可以保存约 1050 万个 INT8 参数,或者约 2100 万个 INT4 参数。

这里需要注意,MemryX 更喜欢使用 TFLOPS 而不是只宣传 TOPS。

因为 MX3 的 activation 默认采用类似浮点的数据格式,而权重则可以使用 INT8、INT4,并通过软件支持其他格式。

因此单纯把 MemryX 的数字与其他只公布 INT8 TOPS 的 NPU 做直接比较,并不完全公平。

最大特点:Pure Dataflow Architecture

MemryX 最核心的技术并不是简单增加更多 MAC,也不是像 GPU 那样建立大量通用计算核心,而是 Pure Dataflow Architecture,也就是纯数据流架构。

传统 CPUGPU 很大程度上依赖指令控制。处理器不断读取指令、调度任务,然后决定数据应该在哪里计算。

而神经网络本身天然就是一个计算图。输入数据进入网络以后,需要依次流过 convolution、activation、pooling、attention 或其他计算节点。

MemryX 的想法是:既然神经网络本身就是 dataflow graph,那么硬件也应该围绕“数据流动”进行设计。

在 MX3 中,神经网络经过编译以后会被映射到大量 Compute Engines 上。

当摄像头图像或者其他输入数据到来时,数据可以像流水线一样直接穿过已经配置好的计算路径,而不需要传统处理器不断进行复杂的任务调度。

MemryX 官方把这种设计描述为 streaming、many-core、near-memory dataflow architecture。

At-Memory Computing:尽量减少数据搬运

MemryX 另外一个经常强调的概念是 At-Memory Computing,可以理解为“靠近存储器进行计算”。

AI 芯片真正消耗能源的并不只是乘法和加法。

很多时候,把模型权重和 feature map 从外部 DRAM 搬到计算单元,再把计算结果写回存储器,本身就会产生很大的功耗和延迟。

因此现代 AI 加速器越来越强调减少 data movement。

MX3 在芯片内部把计算引擎和分布式存储紧密结合,让模型参数尽可能保存在计算单元附近。

对于适合 MX3 的模型,这可以显著减少访问外部 DRAM 的需求。

MemryX 的四芯片 M.2 模块甚至可以利用芯片内部存储处理最高约 8000 万个 INT4 权重参数,而不需要为模型权重增加独立外部 DRAM

从这个角度来看,MemryX 与很多传统 AI 芯片最大的区别之一,就是它不是只关注“算多少次”,而是非常关注“数据需要搬多少次”。

功耗只有大约0.5到3瓦一颗

功耗是 MX3 最突出的优势之一。

按照 MemryX 最新 MX3 datasheet,根据工作频率、供电以及 AI workload 不同,单颗 MX3 的典型功耗大约为 0.5W 到 3W。

工作频率可以在 200MHz 到 1GHz 之间调节,因此系统厂商可以根据性能和功耗要求进行配置。

这使 MX3 非常适合不方便安装大型散热器和风扇的系统。

例如一个工厂摄像头、一台 NVR、一台机器人或者车载计算机,可能一天 24 小时连续处理视频。

在这些系统中,20W、50W 和几瓦功耗之间的区别非常明显。

因此 MemryX 并不是试图用 MX3 替代所有 GPU,而是瞄准那些“GPU 可以运行,但是功耗、成本和散热并不划算”的 AI inference workload。

MX3特别适合实时视频AI

MX3 的数据流架构特别适合连续不断的数据输入,因此计算机视觉是 MemryX 最重要的市场之一。

典型应用包括目标识别、人脸识别、车辆检测、工业质量检查、姿态识别、OCR、语义分割、深度估计、交通监控和智能安防。

摄像头的视频流具有一个非常适合 dataflow processor 的特点:数据持续进入,而且同一个 AI 模型需要一次又一次运行。

MX3 可以把模型提前映射到硬件,然后持续让每一帧图像经过已经配置好的处理流水线。

这与 GPU 每次不断调度大量 kernel 的工作方式并不完全一样。

因此在 batch size 等于 1 的实时 inference 场景中,MemryX 特别强调低延迟和 deterministic,也就是性能比较稳定、可预测。

一块M.2模块集成四颗MX3

为了降低客户采用 AI 加速器的难度,MemryX 不仅销售芯片,还推出了标准 M.2 AI Accelerator Module。

这块板卡采用常见的 M.2 2280 规格,一块模块集成四颗 MX3,通过 PCIe Gen 3 接口连接主机。系统可以使用 x86、ARM 或 RISC-V 主处理器,因此客户不需要绑定某一种 CPU 平台。

四颗 MX3 理论上可以提供最高约 24 TFLOPS 的计算能力,同时模型容量也随芯片数量增加。

这种设计对于已经拥有工业 PC、边缘服务器或者嵌入式计算平台的企业非常方便:不需要换掉 CPU,也不一定需要安装大型 GPU,只要增加一个 M.2 模块,就可以把大量神经网络推理任务从 CPU 卸载出去。

最多可以把16颗MX3连接起来

MX3 另外一个很有意思的特点是 scalability,也就是可扩展性。

单颗 MX3 可以独立运行,但多个 MX3 也可以通过 chip-to-chip interface 连接起来。

在官方 datasheet 中,MemryX 表示单块板卡最多可以使用 16 颗 MX3,并通过一个接口连接主机。

这意味着客户不一定需要设计一颗巨大的 AI 芯片

小模型可以使用一颗 MX3,中型系统可以使用四颗,而更高性能的边缘服务器可以继续增加 MX3。

对于神经网络来说,多个芯片可以共同承担模型不同部分,或者同时运行多个不同模型。

这种“很多颗小型 AI accelerator 组合”的方式,与 NVIDIA 依靠越来越大型 GPU 的路线形成了比较明显的区别。

软件可能比硬件更重要

很多 AI 芯片初创企业最终失败,并不是因为芯片完全不能运行,而是因为软件太难用。

如果开发者必须重新训练模型、修改神经网络、重新量化、手工调整每一层,企业通常不会愿意为了节省几瓦功耗而投入大量软件工程师。

因此 MemryX 从一开始就非常强调 software-first。

MemryX SDK 提供 Neural Compiler、runtime、driver、bit-accurate simulator、benchmark、Model Explorer 和各种开发工具。

开发者可以使用常见的 TensorFlow、TensorFlow Lite、PyTorch、ONNX 和 Keras 模型,然后由 compiler 自动把模型映射到 MX3。

MemryX 特别强调,很多已有模型可以直接部署,不需要 pruning、compression、retraining 或手工重新量化。

对于企业客户来说,这其实可能比多几个 TOPS 更重要。

支持x86、ARM和RISC-V

MX3 本身是 companion accelerator,也就是说它通常不会取代系统里的 CPU

主机仍然负责 Linux、Windows、Android、应用程序、网络、存储以及其他控制工作,而 MX3 只负责 AI inference。

因此 MemryX 可以搭配 IntelAMDARM 甚至 RISC-V 处理器使用。

MX3 提供 PCIe Gen 3 和 USB 3 接口,操作系统支持包括 Linux、Windows 和 Android。

2026 年 MemryX 还进一步加强了 Yocto 等嵌入式 Linux 平台支持,例如已经针对 Renesas RZ/G3E 平台提供集成方案。

这使 MemryX 很适合工业 PC 和嵌入式市场,因为这些领域使用的 CPU 架构非常多样。

Cascade平台:从Raspberry Pi扩展到边缘服务器

进入 2026 年以后,MemryX 已经开始把 MX3 从单纯的一颗 AI 芯片扩展成完整产品平台。

2026 年 6 月,公司宣布扩展 Cascade 平台,推出多种基于相同架构的产品形态,从适合 Raspberry Pi 等设备的小型模块和 USB accelerator,一直到集成 16 颗芯片、面向高密度 edge server 的 PCIe 加速卡。

这种产品策略很容易理解。

同一个软件环境可以从开发板一直延伸到服务器。开发者可以先在小型设备开发 AI 应用,如果未来摄像头数量或者模型数量增加,再升级到更多 MX3 的平台,而不需要完全更换软件架构。

这也是 MemryX 现在越来越强调“scalable architecture”的原因。

MX4:下一代开始挑战更大的AI市场

MX3 主要针对 Edge AI 和 computer vision,但是 MemryX 已经不满足于只做传统边缘视觉加速器。

2025 年 12 月,公司公布了下一代 MX4 roadmap。

按照 MemryX 公布的方向,MX4 将引入新的 3D Memory 技术以及 distributed asynchronous dataflow architecture,也就是分布式异步数据流架构,并把应用范围从传统 Edge AI 进一步扩展到更高性能的服务器和数据中心 AI inference。

这一变化非常重要。

因为生成式 AI 和 Transformer 模型对内存容量和带宽的要求远远超过传统 CNN。MX3 的片上存储设计非常适合视觉模型,但是面对越来越大的语言模型,仅靠十几 MB 的本地 memory 显然不够。

MX4 引入 3D Memory,正是在尝试解决下一代模型的内存问题。

如果 MX4 能够成功,MemryX 就可能从一家“边缘视觉 AI 加速器公司”,进一步变成一家覆盖 Edge 和 Data Center inference 的 AI processor 企业。

2025年完成4400万美元Series B融资

2025 年 3 月,MemryX 宣布完成 4400 万美元 Series B 融资。

公司表示,这笔资金将用于扩大 MX3 的量产和商业部署,同时完成下一代 MX4 的设计。

MemryX 的投资者和战略支持者包括 HarbourVest、Arm IoT Fund、eLab Ventures、M Ventures、Motus Ventures 等机构。

2025 年,NEOM Investment Fund 又与 MemryX 建立投资和战略合作关系,希望把低功耗 Edge AI 技术应用到 NEOM 的智能基础设施中。

对于一家 AI 芯片公司来说,4400 万美元并不是特别夸张的融资金额。

在很多生成式 AI 芯片企业一轮融资就可以达到几亿美元。

这反而说明 MemryX 走的是相对务实的路线:先把一颗功耗很低、可以实际销售的 MX3 做出来,再逐渐扩展产品。

已经进入实际量产阶段

MemryX 目前与很多仍停留在 prototype 阶段的 AI accelerator startup 有一个明显区别:MX3 已经进入正式生产。

2025 年宣布 Series B 融资时,MemryX 表示 MX3 已达到 production quality,并且已有超过十家公司选择 MemryX 产品进入生产项目。

公司也已经与多家工业计算机、嵌入式平台和 AI 软件企业建立合作,包括不同的工业 PC、服务器和 SoM 厂商。

2025 年,MX3 M.2 AI Accelerator Module 还获得 Edge AI and Vision Alliance 的 Edge AI Computers and Boards 类别 Product of the Year Award。

这些信息至少说明 MX3 已经不只是实验室展示芯片,而开始进入真正的边缘 AI 产品生态。

MemryX和Hailo有什么不同?

MemryX 和 Hailo 都属于典型的 Edge AI Accelerator 企业,而且都强调低功耗计算机视觉,因此两家公司经常容易被放在一起比较。

但它们的设计理念并不完全一样。

Hailo 已经建立比较完整的 AI processor 产品线,例如 Hailo-8 和后续产品,其商业模式更加接近传统 AI 芯片企业。

MemryX 则更加突出 Pure Dataflow、At-Memory Computing、模型直接部署以及多个小型 accelerator 之间的扩展。

如果简单概括:

Hailo 更像一颗高度优化的独立 Edge NPU。

MemryX 更像一种可以不断组合和扩展的 dataflow AI accelerator。

两者解决的是类似问题,但是底层架构和软件思路有所不同。

MemryX和Quadric、Expedera也不一样

如果把最近几家边缘 AI 公司放在一起看,就更容易理解它们各自的定位。

Quadric 强调 GPNPU 的可编程性,希望同一处理器同时承担 AI、DSP 和其他计算任务。

Expedera 主要通过 NPU IP 授权进入其他厂商的 SoC,特别强调 processor utilization、PPA 和低功耗 AI inference。

MemryX 则直接提供 MX3 芯片和加速模块,并且非常强调 Pure Dataflow、At-Memory Computing 和多芯片扩展。

因此三家公司虽然都可以归入 AI Accelerator,但实际上走的是三条不同路线。

这也说明今天的 AI 加速器市场还远远没有像 CPU 那样形成统一架构。

MemryX面临的挑战

MemryX 最大的挑战首先来自竞争。

Edge AI 已经成为半导体行业非常拥挤的市场。NVIDIA Jetson、QualcommIntelAMDHailoAxelera AIKneronDEEPX、Ambarella,以及大量 SoC 内置 NPU 都在争夺相同或者相邻市场。

第二个挑战来自 AI 模型本身。

MX3 的架构非常适合 streaming computer vision,但是 AI 正快速向 Transformer、Vision Transformer、多模态模型和大语言模型发展。

如果未来边缘 AI 主要由更大的 Transformer 模型主导,那么 MX3 现有架构需要不断扩展软件和硬件能力。

这也是为什么 MemryX 已经把下一代 MX4 的重点放到 3D Memory、异步数据流和更高性能 inference 上。

第三个挑战是生态。

对于一家 AI 芯片企业来说,芯片性能只是一部分。真正决定长期竞争力的是有多少客户愿意长期使用、有多少模型能够顺利运行,以及软件工具能不能持续跟上 PyTorch、ONNX 和新 AI architecture 的发展。

MemryX值得关注吗?

MemryX 是目前边缘 AI 加速器行业中一家非常值得关注的企业。

它最有意思的地方不是宣称拥有行业最高 TOPS,而是对 AI 计算问题采用了一个非常不同的理解:

AI 的核心问题不只是计算,还包括数据移动。

如果可以让模型权重尽可能靠近计算单元,让数据按照神经网络本身的结构直接流过硬件,就可能减少传统 CPUGPU 中大量指令调度、数据搬运以及外部内存访问。

这就是 MemryX Pure Dataflow 和 At-Memory Computing 的基本逻辑。

MX3 单颗芯片并不是一颗算力惊人的巨型 AI processor,它最高大约 6 TFLOPS,典型功耗只有约 0.5W 到 3W。

但是多颗 MX3 可以组合,而且 M.2、USB、PCIe 和边缘服务器产品可以共享同一套软件架构。

对于需要同时处理多路摄像头、工业机器视觉、机器人、智能交通、NVR、智能零售和其他实时 Edge AI 应用的系统来说,这种架构具有比较明显的吸引力。

截至 2026 年,MemryX 已经从密歇根大学技术背景的一家 AI 芯片初创企业,发展到拥有量产 MX3、M.2 加速模块、Cascade 平台以及下一代 MX4 roadmap 的 AI accelerator 公司。

公司也正在从传统 Edge AI 向高密度 edge server 甚至 data center inference 扩展。

如果说 NVIDIA 的路线是把 GPU 做得越来越强,那么 MemryX 走的是另一条路:让很多小型、低功耗、靠近存储的数据流计算单元高效率地持续运行 AI

这条路线最终能做到多大规模还需要市场验证,但在今天大量采用不同架构的 AI Accelerator 企业中,MemryX 无疑是一家技术路线非常鲜明、值得长期观察的公司。