Penguin Solutions:AI 内存、CXL 内存扩展与高性能计算基础设施企业
Penguin Solutions 是一家面向人工智能、高性能计算和数据中心市场提供计算基础设施与先进内存解决方案的美国科技企业。
Penguin Solutions 通过 SMART Modular Technologies 品牌提供 DRAM 模块、CXL 内存扩展产品、企业级 SSD 和闪存产品,并进一步把这些技术整合到面向大型语言模型推理的 MemoryAI 系统中。
Penguin Solutions 的前身是 SMART Global Holdings,也就是 SGH。
2024 年 10 月,公司正式完成品牌转型,将企业名称统一为 Penguin Solutions,并把发展重点进一步转向 AI、高性能计算、先进内存和数据中心基础设施。
目前公司股票在纳斯达克交易,代码为 PENG,公司在美国加利福尼亚州 Fremont 设有主要办公地点。
从 SMART 内存业务发展而来的技术基础
Penguin Solutions 与普通 AI 服务器厂商最大的区别之一,是它本身拥有深厚的内存产品背景。
旗下 SMART Modular Technologies 长期从事专业内存模块和存储产品开发。
目前产品覆盖 DDR4、DDR5 DRAM 模块、工业级内存、企业级 SSD、嵌入式闪存,以及近年来越来越重要的 CXL 内存扩展设备。
因此,Penguin Solutions 并不是单纯购买 GPU 然后组装服务器,而是在计算系统、内存系统和 AI 基础设施之间拥有比较完整的技术组合。
随着 AI 模型越来越大,GPU 算力增长速度远高于传统系统内存容量和带宽增长速度,这种内存方面的经验开始变得越来越重要。
Penguin Solutions 与 HBM 的关系
HBM,也就是 High Bandwidth Memory,高带宽存储器,是现代 GPU 和 AI 加速器最重要的内存技术之一。
HBM 通常通过先进封装与 GPU 或 AI 芯片紧密连接,可以提供极高的数据传输带宽,因此 NVIDIA、AMD 和其他 AI 加速器大量采用 HBM。
但是 HBM 有两个明显限制:第一是价格昂贵,第二是每颗 GPU 能配置的容量有限。
对于 AI 训练来说,高带宽极其重要,因此 HBM 很难被普通 DDR 内存替代;
但是进入大型 AI 推理以后,模型权重、长上下文以及大量 KV Cache 又会带来巨大的内存容量需求。
Penguin Solutions 所走的路线不是制造另一种 HBM 来与 HBM 厂商竞争,而是在 HBM 外面增加一个更大的内存层。
GPU 继续使用速度极快的 HBM,而大量相对没有必要长期占据 HBM 的数据,可以通过 DDR5 和 CXL 内存扩展到服务器系统中。
因此,从 AI 内存架构角度来看,可以把 HBM 理解为距离 GPU 最近的“超高速小容量内存”。
而 Penguin Solutions 的 CXL 大内存系统更多解决“容量扩展和资源共享”问题。
两者不是简单的替代关系,而是可能共同组成未来 AI 服务器的分层内存体系。
CXL 是 Penguin Solutions AI 内存战略的核心
CXL,全称 Compute Express Link,是一种建立在 PCIe 基础上的高速互连标准,可以让 CPU、GPU、AI 加速器以及内存设备之间建立低延迟、高带宽连接。
对于内存系统来说,CXL 最大的意义是突破传统服务器必须把 DRAM 直接安装在 CPU 内存通道上的限制。
传统 CPU 能安装多少内存,很大程度受到内存控制器、DIMM 插槽数量和 CPU 引脚数量限制。
CXL 则允许服务器通过 PCIe/CXL 接口连接额外的内存设备,从而扩展系统容量,未来还可以实现更复杂的内存池和内存共享。
Penguin Solutions 明确把 CXL 内存扩展、DRAM 和 Flash Storage 作为其 AI 基础设施内存产品的三个重要组成部分。
它代表的是 HBM 之外正在快速形成的另一条 AI 内存技术路线——CXL 大容量内存。
SMART CMM-E3S CXL 内存模块
Penguin Solutions 旗下 SMART Modular Technologies 推出了 CMM-E3S CXL 内存模块。
这款产品采用 CXL 2.0 标准和 E3.S 外形规格,通过 PCIe Gen5 x8 CXL 接口连接服务器,容量包括 64GB、96GB 和 128GB DDR5 DRAM。
E3.S 原本就是针对现代数据中心设计的一种紧凑设备规格,因此 CXL 内存不一定必须采用传统 DIMM 的形态。
将内存做成类似可插拔数据中心设备的形式,可以让服务器设计变得更加灵活。
这意味着未来数据中心中的“内存”可能不再只是插在 CPU 主板旁边的一排 DIMM。
部分内存可以成为独立 CXL 设备,通过高速互连按计算节点需要进行配置,这也是所谓 Memory Disaggregation,也就是“内存解耦”的重要发展方向。
CXA-4F1W:512GB CXL 内存扩展卡
Penguin Solutions 还通过 SMART 推出了 CXA-4F1W,这是一块采用 PCIe Gen5 和 CXL 的 Type 3 内存扩展卡。
CXA-4F1W 可以安装四条 DDR5 RDIMM,单条最高支持 128GB,因此一块卡最高可提供 512GB 内存。
它使用一个 x16 CXL 控制器,并提供最高约 64GB/s 的总数据吞吐能力。
这里的 Type 3 是一个值得理解的专业术语。在 CXL 标准中,Type 3 Device 主要就是面向内存扩展设备。
简单理解,它不像 GPU 那样主要负责计算,而是通过 CXL 向 CPU 或其他处理器提供额外内存。
对于传统服务器而言,增加数百 GB 内存通常意味着增加更多 DIMM 插槽或者更换 CPU 平台。
而 CXL AIC,也就是 Add-In Card,可以像安装 PCIe 扩展卡一样增加系统内存。
CXA-8F2W:单卡最高 1TB DDR5
更高容量的 CXA-8F2W 可以安装八条 DDR5 RDIMM,每条最高支持 128GB,因此单块 CXL 扩展卡最高可以提供 1TB DDR5 内存。
CXA-8F2W 使用两个 x16 CXL 控制器实现两个 x8 CXL 端口,总数据吞吐量同样可达到约 64GB/s,并支持 CXL 2.0。
产品还包括内存镜像、ECC、Memory Migration、温度监控以及多种可靠性和安全功能。
单块扩展卡达到 1TB 这一点非常重要,因为现代 AI 推理面对的已经不只是几十 GB 或几百 GB 内存问题。
大模型权重、长上下文、KV Cache 以及同时服务大量用户,都可能把系统内存需求推向数 TB。
非易失性 CXL 内存
SMART 还开发了 NV-CMM-E3S 非易失性 CXL 内存模块。它把 DRAM、NAND Flash 和板载能源模块结合到一块设备中。
正常运行时,处理器通过 CXL 接口高速访问 DRAM。
如果系统发生严重掉电等故障,设备可以利用板载能源模块提供的电力,把 DRAM 中的数据保存到 NAND Flash。
重新供电以后,再把数据从 NAND 恢复到 DRAM。
这种技术可以理解为试图同时利用 DRAM 的高速性能和 NAND 的非易失特性。
它适合 Checkpoint、Snapshot、写缓存以及其他对数据持久性要求比较高的数据中心应用。
这也说明 Penguin Solutions 的 AI 内存战略不只是简单销售 DDR5 DIMM,而是在探索不同类型内存和存储介质之间的融合。
MemoryAI:直接针对大模型 KV Cache
Penguin Solutions 在 2026 年进一步把 CXL 内存技术推进到了大型语言模型推理市场,推出 MemoryAI KV Cache Server。
KV Cache 是 Transformer 大型语言模型推理中非常重要的一类数据。
模型在生成一个又一个 Token 时,需要保留已经计算过的 Key 和 Value 数据,避免每次重新计算。上下文越长,同时使用模型的用户越多,需要保存的 KV Cache 就越大。
问题是,如果所有 KV Cache 都放进 GPU 的 HBM,就会大量占用本来非常昂贵而且容量有限的 GPU 内存。
一旦 HBM 被 KV Cache 填满,系统可能需要增加更多 GPU,而这些 GPU 很可能不是因为缺少计算能力,而只是因为缺少内存。
这就是 Penguin Solutions MemoryAI 想解决的问题。
最高 11TB 的 MemoryAI KV Cache Server
2026 年 3 月,Penguin Solutions 正式发布 MemoryAI KV Cache Server,并称其为首款面向生产环境的 CXL KV Cache Server。
该设备是一台 4U 机架式服务器,采用双路 AMD EPYC 9005 系列处理器,最高可以配置约 11TB DDR5 内存,其中大量内存通过 SMART CXA-8F2W CXL 扩展卡提供。
Penguin Solutions 在 2026 年 9 月的 AI Infra Summit 上仍在重点展示 MemoryAI,并明确把它作为解决 AI inference“Memory Wall”,也就是“内存墙”问题的重要产品。
公司介绍的系统最高提供约 11TB 的 CXL 内存资源,主要面向企业级 AI 推理和 Agentic AI 工作负载。
11TB 和当前单颗 GPU 的 HBM 容量已经完全不是一个数量级。
这不是因为 CXL DDR5 比 HBM 快,而恰恰是利用 DDR5 容量大、成本相对低的特点建立第二层大内存。
什么是 AI 的“内存墙”
所谓 Memory Wall,中文通常称为“内存墙”,是指处理器计算能力增长速度超过内存供给数据速度以后,整个系统性能开始受制于内存,而不是受制于计算单元。
一颗 GPU 即使拥有极强计算能力,如果它经常等待数据从内存送过来,大量计算单元就只能空闲。
AI 让这个问题变得更加突出。训练模型需要高速读取大量参数和中间数据,推理又需要加载模型权重和 KV Cache。
当几十颗甚至几千颗 GPU 同时工作时,内存容量、内存带宽、网络带宽和数据移动效率都可能成为瓶颈。
Penguin Solutions 因此把 AI 内存问题看成整个计算基础设施的问题,而不仅仅是一颗 DRAM 芯片的问题。
HBM + DDR5 + CXL 可能成为 AI 内存分层架构
未来大型 AI 系统很可能越来越多采用分层内存架构。
最靠近 GPU 的一层仍然是 HBM,因为矩阵计算需要极高带宽;
下一层可以是 CPU 本地 DDR5 内存;
再往外可以使用 CXL 扩展 DDR5,提供数 TB 甚至更大的容量;
更冷的数据则可以进入 NVMe SSD 和更大规模存储系统。
这样,AI 系统就不需要把所有数据都塞进最昂贵的 HBM。
从这个角度看,Penguin Solutions 与 SK hynix、Samsung 和 Micron 等 HBM 厂商并不是简单竞争关系。
HBM 厂商负责提供最靠近计算芯片的超高带宽内存,而 Penguin Solutions 更侧重大容量 DRAM、CXL 内存扩展和系统级 AI 内存架构。
Penguin Solutions 还是一家 AI 基础设施企业
除了内存,Penguin Solutions 目前还把自己定位为“AI Factory Platform Company”,业务已经扩展到 AI 数据中心的设计、建设、部署和管理。
公司提供 GPU 加速服务器,并参与 NVIDIA DGX 等 AI 基础设施部署,同时将高性能计算、网络、存储和内存整合成完整 AI 系统。
Penguin Solutions 表示,其已经部署和管理超过 99,000 颗 GPU。
因此,它与纯存储器公司的商业模式不同。Penguin Solutions 可以从 DRAM 模块开始,一直参与到 CXL 内存、服务器、GPU 集群以及整个 AI 数据中心。
这种“从内存到系统”的能力也是公司在 AI 时代最重要的特点之一。
SMART Modular Technologies 的作用
理解 Penguin Solutions 时,很容易遇到 SMART Modular Technologies 这个名字。
SMART Modular Technologies 是 Penguin Solutions 旗下的重要内存产品品牌。
大量 DRAM、Flash、SSD 和 CXL 产品仍然使用 SMART 品牌,因此在产品资料中经常会同时看到 SMART 和 Penguin Solutions 两个名称。
简单理解,可以把 Penguin Solutions 看成整个公司的统一品牌和 AI 基础设施平台,而 SMART Modular Technologies 则承担其专业内存产品的重要组成部分。
所以如果研究 AI 内存企业,仅仅搜索“Penguin Solutions”可能会漏掉很多产品;
搜索 SMART Modular Technologies,则可以看到它大量具体的 DDR、Flash 和 CXL 内存设备。
Penguin Solutions 在 AI 存储产业链中的位置
如果按照产业链分类,Penguin Solutions 最适合放在“AI 内存系统、CXL 内存扩展和专业内存模块”这一层,而不是放在 HBM Wafer 或 DRAM 芯片原厂这一层。
SK hynix、Samsung 和 Micron 的核心能力是制造 DRAM Die 和 HBM;
TSMC 等晶圆代工和先进封装企业负责部分 HBM 与 GPU 的集成;
而 Penguin Solutions 则利用 DDR5、CXL、服务器和软件系统,把这些存储资源组合成能够真正服务 AI 工作负载的大容量内存架构。
特别是随着 AI 从模型训练进一步进入大规模推理阶段,内存需求正在发生变化。
训练强调极高的 HBM 带宽,而推理除了带宽之外,还越来越重视内存容量、KV Cache 容量以及每个 Token 的成本。
这可能正是 Penguin Solutions 的机会所在。
总结
Penguin Solutions 不是传统意义上的 HBM 制造商,但它已经成为 AI 内存基础设施领域非常值得关注的企业。
它通过 SMART Modular Technologies 提供 DDR4、DDR5、SSD、Flash 和 CXL 内存产品。
通过 CMM-E3S、CXA-4F1W 和 CXA-8F2W 等产品扩展服务器内存容量,并进一步推出最高约 11TB 的 MemoryAI KV Cache Server,把 CXL 大内存直接应用于大型语言模型推理。
如果说 HBM 解决的是“如何让 GPU 在极短时间内获得大量数据”,那么 Penguin Solutions 正在解决另一个越来越重要的问题:
当 AI 模型需要的内存已经远远超过 GPU HBM 容量时,这些数据应该放在哪里,以及怎样以足够高的速度提供给 AI 系统。
Penguin Solutions 定位为:AI 大内存系统、CXL 内存扩展、DDR5 内存模块、KV Cache 基础设施以及 AI 数据中心解决方案企业。
