AI加速器企业:Expedera——专注低功耗边缘AI的NPU IP公司
Expedera 是一家专注于人工智能推理处理器 IP 的美国半导体公司,总部位于加利福尼亚州圣克拉拉。
与 NVIDIA、AMD 这类直接销售 GPU 或 AI 芯片的企业不同,Expedera 主要不自己制造芯片,而是向手机芯片、汽车芯片、消费电子和其他 SoC 厂商提供可以集成到芯片内部的 NPU(Neural Processing Unit,神经网络处理器)IP。
它的核心目标是在尽可能小的芯片面积和较低功耗下,实现高效率的本地 AI 推理。
Expedera 成立于 2018 年,由 Da Chuang、Siyad Ma 和 Sharad Chole 三位工程师共同创立。
三人此前曾在 Cisco 共事,并拥有 ASIC、网络处理器、存储器 IP 和软硬件协同设计方面的经验。
现任 CEO 是联合创始人 Siyad Ma,原 CEO Da Chuang 在 2024 年转任 Executive Chairman。
Expedera 已经从一家硅谷初创企业发展成为一家全球化的 AI 半导体 IP 企业,在美国、英国、中国、印度、台湾、新加坡等地拥有研发或客户支持团队。
Expedera 是做什么的?
简单来说,Expedera 是一家“卖 NPU 设计”的公司,而不是一家主要“卖 NPU 芯片”的公司。
现代 SoC 通常包含 CPU、GPU、DSP、ISP、视频编解码器以及越来越重要的 NPU。
手机、智能摄像头、汽车、机器人和各种边缘设备需要运行图像识别、目标检测、语音处理、大语言模型等 AI 工作负载,因此芯片公司需要在 SoC 内部增加专门的 AI 加速器。
问题是,从零开始设计一颗高效率 NPU 并不容易。除了硬件本身,还需要编译器、模型转换、量化、内存管理、软件 API 和完整开发工具链。
Expedera 提供的正是这一整套技术。芯片公司可以获得 Expedera 的 NPU semiconductor IP,把它集成到自己的 SoC 中,然后根据需要选择三星、台积电或者其他晶圆厂和不同制程进行生产。
这种商业模式和 ARM 提供 CPU IP 有一些相似之处,只不过 Expedera 专注的是 AI 推理加速器。
核心产品:Origin NPU
Expedera 的核心产品系列叫做 Origin。
Origin 是一种面向 AI inference,也就是 AI 推理的 NPU IP。
它可以根据客户产品对性能、功耗和芯片面积的不同要求进行调整,从低功耗边缘设备一直扩展到高性能汽车和数据中心应用。
Expedera 早期的 Origin 产品包括针对不同市场的 E1、E2、E6 和 E8 等系列。
其中 E1 面向成本和功耗非常敏感的应用;
E2 面向智能手机和一般边缘设备;
E6、E8 则进一步面向汽车和高性能 AI 系统。
按照 Expedera 公布的数据,Origin 架构可以从 GOPS 级别一直扩展到单核心 128 TOPS,高性能版本还能通过多个核心进一步扩展。
公司公布的 Origin 架构典型持续处理器利用率约为 80%,部分新一代产品可以达到大约 70%到90%的利用率。
需要注意,这些性能和效率数字主要来自 Expedera 自己公布的产品测试,不同模型、制程和实际芯片实现的结果会有所不同。
Packet-Based Architecture:Expedera 最重要的技术特点
Expedera 最值得关注的地方,是它采用了一种自己称为 packet-based architecture,也就是“基于数据包的执行架构”。
许多传统 AI 加速器以神经网络的一层为基本调度单位,例如完成一整层卷积以后,再处理下一层。这种方式比较容易理解,但是在实际运行复杂神经网络时,不同层的计算规模和内存需求差别可能非常大,因此部分计算单元可能处于空闲状态。
Expedera 的方法是把神经网络划分成更加灵活的数据片段,也就是所谓的 packet,并让不同网络部分能够更加高效地流过处理器。
通过这种设计,Expedera 希望让处理单元尽可能保持工作,同时减少中间数据不断写入和读取外部存储器的需要。
对于边缘 AI 来说,这一点非常重要,因为真正消耗功耗的往往不仅是矩阵计算本身,大量数据在 DRAM、SRAM 和计算单元之间来回移动,同样会消耗大量能量并增加延迟。
高处理器利用率
AI 芯片经常使用 TOPS 来表示理论计算能力,但是理论 TOPS 并不等于实际 AI 性能。
例如,一颗理论性能为 100 TOPS 的 NPU,如果运行真实神经网络时只有 30%的计算单元能够持续工作,那么真正发挥出来的计算能力就可能与理论指标存在很大差距。
因此 Expedera 特别强调 processor utilization,也就是处理器利用率。
公司表示,其 packet-based 架构能够让不同网络层并行运行,从而让 Origin NPU 在实际 AI 工作负载中维持较高的持续利用率。
Expedera 公布的 Origin 产品平均利用率大约可以达到 80%,而 Origin Evolution 则公布了约 70%到90%的典型利用率范围。
Expedera 把没有被充分利用的 AI 计算单元称为“dark silicon waste”。它的设计思想并不是简单堆更多乘法器,而是尽可能提高已经存在的硬件使用效率。
18 TOPS/W 的能效目标
功耗是 Expedera 另外一个重点。
根据公司公布的 silicon-proven 测试结果,其 Origin 架构最高可以实现大约 18 TOPS/W 的 AI 推理效率。
Expedera 很早就把低功耗作为主要卖点,因为它最初瞄准的正是智能手机、摄像头、智能家居和汽车等边缘 AI 市场。
对于数据中心而言,多几十瓦甚至几百瓦功耗在某些情况下可以通过大型散热系统解决,但对于手机、摄像头和汽车里的芯片来说,功耗直接关系到电池续航、散热、芯片封装和整机成本。
因此 Expedera 并不单纯追求最大 TOPS,而是不断强调 PPA,也就是 Performance、Power、Area——性能、功耗和芯片面积三者之间的平衡。
这也是它与很多追求极限 AI 算力企业不同的地方。
可以针对客户量身定制NPU
Expedera 的另一个特点是高度强调 customization,也就是定制化。
不同产品对 AI 的需求其实差别非常大。一个智能门铃可能只需要运行几个图像识别模型,一辆自动驾驶汽车却可能同时运行目标检测、道路分割、驾驶员监控和传感器融合等大量神经网络。
如果所有产品都使用同样规模的 NPU,低端设备可能浪费大量芯片面积,高端设备又可能算力不足。
Expedera 因此根据客户需要运行的神经网络以及功耗、面积和性能目标配置 Origin NPU。这样理论上可以避免在芯片里放入大量永远不会使用的计算资源。
对于成本敏感的 SoC 来说,这一点尤其重要,因为增加几平方毫米的芯片面积,在数百万甚至数千万颗芯片的大规模生产中,都可能带来显著成本差异。
Origin Evolution:开始进入生成式AI
随着 ChatGPT 和大语言模型兴起,边缘 AI 加速器已经不再只是运行 CNN 图像识别模型。
2025 年,Expedera 推出了新一代 Origin Evolution NPU IP,把产品范围进一步扩展到 LLM 和生成式 AI。
Origin Evolution 除了传统 CNN 和 RNN 之外,也针对 Transformer 和大语言模型的计算以及内存访问特点进行了优化。
这是 Expedera 战略上的一个重要变化。
过去边缘 NPU 的典型任务通常是图像分类、目标检测、人脸识别、语音识别和图像增强。
而现在手机、汽车、机器人、PC 和各种智能设备开始直接运行语言模型、多模态模型和 AI Agent,本地 AI 所需要处理的数据量和模型规模大幅增加。
传统 CNN 与 LLM 在内存访问方式方面存在很大差异,因此仅仅增加 TOPS 并不能解决所有问题。
Origin Evolution 因此特别加强了 attention processing 和 memory management。
其 Edge 版本单核心可以扩展到最高 32 TFLOPS,而更高性能的 Origin Evolution 架构单核心可以达到最高 128 TFLOPS,并可以通过多个核心继续扩展。
同一架构同时运行 LLM、CNN 和 RNN
Origin Evolution 的一个重要目标,是尽可能让一套 NPU 架构同时处理不同类型的 AI 模型。
过去很多 NPU 主要针对卷积神经网络设计,因此运行 CNN 很高效,但遇到 Transformer、LLM 或未来出现的新模型时,效率可能下降。
Expedera 希望 Origin Evolution 能够同时支持 LLM、CNN、RNN 和其他神经网络,并通过软件和硬件协同设计适应未来模型变化。
这对于汽车尤其有吸引力,因为一款汽车 SoC 的设计和使用周期可能达到很多年,而 AI 算法的发展周期却可能只有几个月。
芯片厂商显然不希望汽车量产以后才发现 NPU 无法支持几年后出现的新模型。
软件生态:基于TVM和Relax
硬件只是 AI 加速器的一半,另外一半是软件。
Expedera 提供完整的软件开发平台,其 Origin 系列长期采用基于 Apache TVM 的工具链,新一代 Origin Evolution 又进一步采用 TVM 和 Relax。
开发者可以从 PyTorch、TensorFlow、ONNX 等常见 AI 框架导入已经训练完成的神经网络,然后通过 Expedera 的编译工具完成模型优化、量化、编译、性能估算和 profiling。
Origin Evolution 目前还支持 Hugging Face、Llama.cpp、PyTorch、ONNX、TensorFlow 和 TVM 等主流 AI 开发生态。
这对于半导体 IP 企业非常重要,因为客户真正购买的不只是一个 RTL 模块,而是一整套可以让芯片运行真实 AI 模型的开发环境。
已经进入超过1000万台设备
与很多仍然主要停留在样片或者开发板阶段的 AI 芯片初创企业相比,Expedera 一个比较重要的特点是它已经进入实际量产产品。
根据 Expedera 公布的数据,Origin NPU IP 已经部署在超过 1000 万台消费电子设备中。公司还表示,其客户覆盖智能手机、汽车以及其他边缘设备市场。
早在 2021 年 Origin 产品正式公开时,Expedera 就曾披露,一家全球前五的智能手机厂商已经获得其 IP 授权。出于客户保密等原因,公司并没有公开这家手机厂商的名字。
对于一家半导体 IP 初创企业来说,超过千万台设备的实际部署比实验室 benchmark 更重要,因为这至少说明其 NPU 架构、编译工具链以及芯片集成流程已经经过实际量产验证。
汽车市场是Expedera的重要方向
汽车正在成为 Expedera 非常重要的增长方向。
现代汽车特别是 ADAS 和自动驾驶系统,需要同时处理多个摄像头、雷达以及其他传感器的数据,并同时运行多个 AI 神经网络,因此需要高算力、低延迟和低功耗的 AI 加速器。
Expedera 的 E6、E8 和 Origin Evolution for Automotive 都针对这类市场设计。
公司还针对汽车功能安全进行了开发,其中 Origin Evolution 已获得 ASIL-B readiness certification。
2024 年,汽车半导体企业 indie Semiconductor 对 Expedera 进行了战略投资,并宣布计划把 Expedera 的 Origin NPU 技术集成到未来的 ADAS 和传感器处理产品中。
这种合作对于 Expedera 的意义不仅是融资,更重要的是帮助其 NPU IP 进入实际汽车半导体平台。
从边缘设备向数据中心扩展
Expedera 最初非常明确地定位于 Edge AI,但是随着 Origin 架构性能不断提高,公司现在已经把市场扩大到数据中心。
Origin E8 单核心最高可以达到 128 TOPS,并可以通过多核心架构进一步扩展到 PetaOPS 级别。新一代 Origin Evolution 同样覆盖从低功耗边缘设备到高性能数据中心 AI inference。
不过,从目前公司的产品和客户基础来看,边缘 AI、智能手机、汽车以及嵌入式 SoC 仍然是 Expedera 最有特色的领域。
在大型云端训练市场直接与 NVIDIA GPU 竞争并不是 Expedera 当前最主要的优势。
Expedera 的融资情况
2024 年 5 月,Expedera 宣布完成 2000 万美元 Series B 融资,由汽车半导体企业 indie Semiconductor 领投,同时包括原有和新的投资者参与。
完成这一轮融资以后,公司累计融资超过 4700 万美元。
资金主要用于继续开发 Origin NPU IP、扩大产品能力并扩展全球研发和客户支持体系。
与一些融资数亿美元甚至几十亿美元的 AI 芯片初创企业相比,Expedera 的融资规模并不算特别巨大。
这也与它的 IP 商业模式有关:Expedera 不需要自己建设晶圆厂,也不需要像完整芯片公司那样承担大规模流片、封装、库存和板卡生产成本。
2026年获得Edge AI处理器IP奖项
2026 年 4 月,Expedera 的 Origin Evolution 获得 Edge AI and Vision Alliance 评选的 2026 Edge AI and Vision Product of the Year Awards 中“Best Edge AI Processor IP”奖项。
评选特别强调了 Origin Evolution 在边缘生成式 AI、内存效率以及可扩展 NPU IP 方面的设计。
这也反映出 Expedera 的技术定位正在从传统低功耗 CNN 加速器,逐渐升级为能够支持边缘 LLM 和生成式 AI 的综合 NPU 平台。
Expedera 和 Quadric 有什么不同?
Expedera 和 Quadric 都属于值得关注的 AI Processor IP 公司,而且客户都可以把它们的处理器技术集成到自己的 SoC 中,但是两家公司的设计理念并不完全相同。
Quadric 更强调 GPNPU,也就是 General-Purpose Neural Processing Unit,希望通过高度可编程的处理器同时执行神经网络、DSP 和通用计算任务。
Expedera 则更加专注于把 AI inference 本身做到极高效率,特别强调 processor utilization、内存效率、低功耗以及针对具体客户神经网络进行优化。
简单地说,Quadric 更强调“可编程和通用性”,而 Expedera 更强调“AI 推理效率和 PPA”。
两种路线都在解决一个共同的问题:未来越来越多的 SoC 都需要 AI,但是并不是所有芯片公司都有能力自己开发完整的 NPU。
Expedera 的主要竞争对手
Expedera 所在的 NPU IP 市场竞争非常激烈。
ARM、Cadence、Synopsys、CEVA、Imagination Technologies 等传统半导体 IP 企业都在提供或者扩展 AI 加速器技术;
Quadric、EdgeCortix 等新兴企业也在开发不同类型的边缘 AI 处理器。
另一方面,Qualcomm、MediaTek、Apple、Samsung、NVIDIA、AMD 和 Intel 等大型半导体公司都拥有自己的 AI 处理器架构。
因此 Expedera 真正需要证明的不只是某一个 benchmark 上拥有更高 TOPS/W,而是能否让更多大型 SoC 企业长期采用 Origin 架构。
半导体 IP 一旦进入客户 SoC,生命周期通常很长,但是从 IP 授权到芯片设计、流片、验证再到最终终端设备量产,也可能需要数年时间。
因此设计订单和量产设备数量将是衡量 Expedera 长期发展的重要指标。
Expedera 值得关注吗?
Expedera 是目前边缘 AI 加速器领域一家比较有特点的企业。
它没有选择直接与 NVIDIA 在大型 GPU 市场正面竞争,而是专注于一个更加底层的市场:成为其他芯片公司的 NPU 技术供应商。
它的核心竞争力可以概括为几个方面:高处理器利用率、低功耗、较小芯片面积、低内存带宽需求、可定制 NPU 架构,以及完整的软件工具链。
更重要的是,Expedera 已经不再只是一个停留在 PPT 和测试芯片阶段的 AI 初创企业。
按照公司公开资料,其 Origin NPU 已经部署在超过 1000 万台消费设备中,并开始进入智能手机、汽车以及其他 SoC 市场。
随着生成式 AI 从云端逐渐进入手机、汽车、机器人、摄像头和各种智能终端,Edge AI 对 NPU 的需求可能持续增长。
很多传统芯片公司并不愿意投入数亿美元从头设计自己的 AI 架构,因此第三方 NPU IP 很可能成为一个越来越重要的半导体市场。
Expedera 正是在押注这个趋势。
如果未来“每一颗 SoC 都需要一个 NPU”逐渐成为现实,那么像 Expedera 这样提供独立 AI Processor IP 的企业,其角色可能越来越像 CPU 市场中的 ARM——自己不一定制造最终芯片,却有机会让自己的处理器架构进入大量不同厂商的 SoC。
截至 2026 年,Expedera 已经从最初的低功耗边缘 AI NPU 公司,逐渐发展成为覆盖智能手机、消费电子、汽车、生成式 AI 和部分数据中心应用的 AI Accelerator IP 企业。
