Menu Close

NeuReality

AI加速器企业:NeuReality——不再只堆GPU,而是重新设计整个AI推理服务器

NeuReality

NeuReality 是一家以色列 AI 基础设施和半导体企业,成立于 2019 年,总部位于以色列 Caesarea,并在 Tel Aviv 和波兰设有团队。

NVIDIAAMDGroqHailo 等直接把主要精力放在 AI 计算核心上的公司不同,NeuReality 从成立之初就提出一个很不一样的问题:如果 GPU 本身已经足够强,真正限制 AI inference 性能的,会不会其实是 GPU 周围那些传统 CPU、NIC、网络和软件?

因此 NeuReality 并没有简单设计“另一颗更大的 NPU”,而是重新设计 AI inference server 的 head node、网络、数据预处理、调度和软件架构,希望让昂贵的 GPU 和其他 AI accelerator 尽可能一直工作,而不是不断等待 CPU 和网络。

NeuReality 最早以 NR1 Network Addressable Processing Unit,也就是 NR1 NAPU 成名,后来把 NR1 重新定位为 AI-CPU

进入 2025 和 2026 年以后,公司战略进一步扩展:

第一代 NR1 主要解决单台 AI inference server 内部 CPU 和 NIC 成为瓶颈的问题;

第二代 NR2 AI-SuperNIC 开始解决几十颗、几百颗甚至更多 GPU 组成 AI cluster 后的 scale-out networking 问题;

与此同时,公司又推出 NR-NEXUS Inference Operating System,负责更上一层的模型部署、KV Cache、路由、调度、GPU/XPU 利用率和 cost per token。

换句话说,现在的 NeuReality 已经从一家特殊的“AI 芯片初创公司”,逐渐发展成一家横跨 AI CPUAI Networking 和 AI Inference Software 的基础设施企业。

NeuReality是谁创立的?

NeuReality 由 Moshe Tanach、Tzvika Shmueli 和 Yossi Kasus 于 2019 年共同创立。

三位创始人的背景很能解释 NeuReality 为什么没有选择简单复制 GPU

Moshe Tanach 曾在 Marvell 和 Intel 从事芯片和数据中心相关工作;Tzvika Shmueli 和 Yossi Kasus 则拥有 Mellanox、Habana Labs 等网络和 AI 半导体企业的经验。

公司从成立之初就同时具备 AI、网络、服务器和半导体背景,因此它看待 AI accelerator 的角度天然更偏向整个 system architecture,而不是单独看一颗芯片的 TOPS。

NeuReality 的基本观点是,过去的数据中心服务器主要围绕 CPU 设计:

网络请求首先进入 NIC,然后交给 CPUCPU 再负责数据解析、预处理、内存管理、任务调度、GPU communication 和大量其他工作。

但今天最昂贵、最重要的计算资源已经变成 GPU、TPU、LPU 和其他 XPU,如果仍然让几十年前形成的 CPU-centric server architecture 管理所有 AI workload,就可能出现一种非常浪费的情况:几万美元甚至几十万美元的 GPU 在等待几千美元的 CPU 和 NIC。

NeuReality认为传统AI服务器的问题在哪里?

一台传统 AI inference server 大致可以理解为这样工作:用户请求通过网络进入 NIC,NIC 把数据送给 CPUCPU 完成协议处理、数据转换、pre-processing 和任务调度,然后把数据送到 GPUGPU 执行神经网络;结果再返回 CPU进行 post-processing,最后通过 NIC 发回用户。

这种架构的问题是,GPU越来越快。

CPU虽然也越来越快,但 CPU 必须同时处理操作系统、网络、中断、数据复制、虚拟化、pre-processing、post-processing、storage 和各种 management workload。

结果就是 CPU 和 NIC 很容易成为 AI pipeline 的瓶颈。

NeuReality 因此提出一个非常重要的理念:不要再围绕CPU设计AI服务器。

应该改成:围绕AI accelerator设计服务器。

CPU不再是整个系统的中心,GPU、XPU 或其他 AI accelerator 才是中心。

NR1:世界上非常少见的AI-CPU

NeuReality 第一代核心产品是 NR1

公司最初称它为 Network Addressable Processing Unit,也就是 NAPU,后来随着产品定位成熟,又开始把它称为 AI-CPU

NR1 并不是用来替代 GPU执行所有矩阵乘法的。

它真正的工作是:GPU处理所有“不值得GPU处理、但又会让GPU等待”的事情。

NR1 把网络接口、CPU、DSP、AI preprocessing、video、audio、memory management、virtualization 和 inference orchestration 等功能集成到一颗 SoC 中,然后直接连接网络和 AI accelerator。

因此一台 NeuReality 系统可以形成一种非常不同的数据路径:

传统服务器:Network → NIC → CPUGPU

NeuReality:Network → NR1 AI-CPUGPU

很多原来需要通用 CPU 在软件中执行的步骤,被直接移动到专用硬件。

NR1采用7nm工艺

NR1 是一颗采用 7nm 工艺制造的 AI inference server-on-chip,NeuReality 在 2023 年已经获得由 TSMC 制造的芯片

公司在 2024 年融资时也确认,7nm NR1 silicon 已经完成并进入客户部署阶段。

这里特别需要说明:

NR1本身不是 NVIDIA GPU 那种主要负责大型 Transformer matrix multiplication 的 accelerator。

它更像:

AI Server Control Processor + SmartNIC + DPU + DSP + AI Pipeline Processor。

这也是为什么用传统“多少 TOPS”去评价 NR1 并没有太大意义。

NeuReality真正强调的是:GPU Utilization。

为什么GPU利用率这么重要?

假设企业购买了一批理论性能极其强大的 GPU,但是由于 CPUnetwork 或 software bottleneck,GPU 实际只有一半时间真正进行有效计算,那么企业其实浪费了一半最昂贵的硬件投资。

NeuReality 表示,在传统 CPU+NIC inference architecture 中,AI accelerator 的实际利用率可能明显低于理论上限,而 NR1 的目标是把 GPU utilization 推向接近满负载。

公司目前宣传的不同 workload 数据显示,采用其架构后可以明显提高 throughput、price/performance 和 energy efficiency。

具体提高幅度会根据 GPU、模型和部署方式不同而变化,因此不能简单把公司的最高宣传数字理解成所有 AI workload 都一定能够达到的结果。

但其背后的经济逻辑非常简单。

假设:10颗GPU只有50%利用率。实际上相当于只有5颗GPU一直工作。

如果通过系统优化让10颗GPU接近满负载,那么即使 GPU 本身完全没有变快,整个 AI service 的经济效率也可能大幅提升。

NeuReality 赌的就是这个问题。

AI-Hypervisor:把软件任务直接做进硬件

NR1 的一个核心技术叫做 AI-Hypervisor

传统 Hypervisor 主要负责虚拟机和 CPU resource management。

NeuReality 的 AI-Hypervisor 则针对 AI inference pipeline 设计,把很多原来运行在 CPU software stack 中的功能直接放进 hardware datapath。

例如:

network processing、data movement、pre-processing、post-processing、AI pipeline orchestration 和 resource management。

这可以减少 CPU involvement,也减少 data copy 和 context switching。

NeuReality 的思路本质上和 NVIDIA DPU、AMD Pensando、Intel IPU 存在某些相似之处,但它更加专门针对 AI inference,而不是通用云计算网络。

AI-over-Fabric:让网络直接认识AI任务

NeuReality 另外一个重要概念叫做 AI-over-Fabric

传统网络看到的只是:

Packet。

TCP。

RDMA。

Data。

但 NeuReality 希望 network fabric 本身能够理解 AI inference workflow。

请求通过网络进入以后,可以直接被送到适合的 AI processing resource,不需要所有数据都绕过一个中心 CPU

这使 NeuReality 的架构从第一代 NR1 开始,就拥有非常强的 networking DNA。

而这个设计后来直接发展成公司的第二代核心产品:NR2 AI-SuperNIC。

NR1内部其实是一台小型异构服务器

NR1 不是简单的 network chip。

NeuReality 的 NR1 architecture 包含 Arm server-class CPU、DSP、audio processing、video processing、networking engine、memory controller 和其他 accelerator。

在完整 NR1 Inference Appliance 中,多颗 NR1 可以与多颗 AI accelerator 组合。

NeuReality 当前公布的高密度系统最高可以配置多个 NR1 Module 和 10到16颗 GPU,并集成大量 Arm CPU、DSP 和媒体处理能力。

这也是为什么 NeuReality 把 NR1 称为:Server-on-a-Chip。

它不是简单帮 CPU 加速某一个函数,而是尝试把原本需要整台 CPU head node 完成的大量工作压缩到一颗专门为 AI inference 设计的 SoC 中。

NR1 Inference Module

为了方便服务器厂商使用,NeuReality 还提供 NR1 Inference Module

它采用 PCIe 卡形式,里面包含 NR1 AI-CPU,可以与服务器内部的 GPU 或其他 AI accelerator 配合。

这样客户并不一定需要从零设计一台服务器。

现有服务器可以加入 NR1 Module,然后让 NR1承担 AI workflow orchestration、network 和 pipeline offload。

公司把它定位为可以配合不同 AI accelerator 的 companion processor,而不是绑定一种特定 GPU

这一点是 NeuReality 商业模式中的重要优势。

理论上无论客户使用:

NVIDIA GPUAMD GPUQualcomm Cloud AI、其他 XPU,甚至未来的新 AI accelerator,NeuReality 都希望自己的 infrastructure layer 可以继续使用。

NR1 Inference Appliance:直接卖完整AI服务器

NeuReality 后来发现,只卖芯片或者 PCIe module 对很多企业客户来说还不够简单。

企业并不一定想自己研究:

PCIe topology、GPU、driver、container、Kubernetes、model serving、networking 和 thermal design。

因此 NeuReality进一步推出 NR1 Inference Appliance

这是一套 4U AI inference server,把 NR1、GPU/XPU、storage、network、software 和 APIs 集成在一个系统里。

公司最新产品页面给出的高密度配置可以容纳 4到10个 NR1 Inference Module 和 10到16颗 GPU,并提供最高约 1 Tbps 网络连接。

这使 NeuReality 的商业模式从:“卖一颗芯片。”

发展到:“卖一整套AI inference infrastructure。”

支持生成式AI和Agentic AI

NeuReality早期主要针对 Computer Vision、Recommendation、Speech Recognition 等传统 inference workload。

ChatGPT 出现以后,公司很快把产品扩展到:LLM,Generative AI,RAG,Multimodal AI,以及现在非常热门的 Agentic AI

2026 年推出的新一代 Inference Appliance 已经预装和优化部分 Generative AI 与 Agentic AI 模型,并提供类似 OpenAI API 的接口,让企业可以在自己的 data center 中部署本地 AI 服务。

这意味着企业可以建立:Private AI

数据不需要全部送到 OpenAIAnthropic 或其他 Cloud API。

金融、医疗、政府和大型企业尤其可能对这种模式感兴趣。

Qualcomm是NeuReality的重要合作伙伴

NeuReality 第一阶段商业化过程中与 Qualcomm 建立了比较深入的合作。

早期 NR1-S 系统就已经搭配 Qualcomm Cloud AI 100 accelerator,NeuReality SDK 也针对 Qualcomm AI accelerator 完成支持。

到 2025 年,公司继续展示 NR1 与 Qualcomm Cloud AI 100 Ultra 的组合。

Qualcomm 表示,通过 Cloud AI 100 Ultra 与 NeuReality AI-CPU architecture 配合,可以提升 AI performance 和 cost efficiency。

这正好说明 NeuReality 的产品逻辑:

Qualcomm负责:AI计算。

NeuReality负责:AI计算器一直有活干。

也与AMD、Arm、Lenovo、Foxconn等企业建立合作

NeuReality 当前公布的技术和生态合作伙伴包括 ArmQualcommTSMC、Lenovo、Foxconn、Alchip、SynopsysCadence 等企业。

公司投资者中还出现 Samsung Ventures、SK hynix、OurCrowd 等半导体和投资机构。

其中 Arm 尤其重要,因为 NeuReality 的 NR1 和下一代 NR2 都大量使用 Arm server CPU technology。

这也是 NeuReality架构一个值得注意的地方:公司并不认为 CPU完全没有价值。

它认为问题在于:不应该再让传统通用CPU承担整个AI数据路径。

所以 NeuReality 不是“消灭 CPU”。

而是:重新定义 CPUAI server 中的位置。

NR2:NeuReality开始解决GPU之间的网络瓶颈

如果说 NR1 解决的是:一台AI服务器内部CPU和NIC拖慢GPU

那么第二代 NR2 AI-SuperNIC 解决的就是:成百上千颗GPU之间的网络开始拖慢整个AI Cluster。

这是 NeuReality 在 2025 年以后最重要的战略升级。

随着大模型越来越大,一颗 GPU 已经无法运行完整 workload。

系统开始使用:

Tensor Parallelism。

Pipeline Parallelism。

Expert Parallelism。

Prefill/Decode Disaggregation。

KV Cache Sharing。

GPU之间必须不断传输大量数据。

这使 network latency 和 bandwidth 开始直接影响 tokens per second。

因此 NeuReality 又开始重新设计 NIC。

NR2不是普通网卡

传统 Network Interface Card 最重要的工作就是把 packet 从机器 A 传到机器 B。

SmartNIC 和 DPU 则进一步加入 security、virtualization、storage 和 programmable networking。

NeuReality 的 NR2 则专门针对:AI Scale-Out Networking。

公司把它称为:AI-SuperNIC。

NR2 不只是移动数据。

它还可以执行部分 In-Network Compute,也就是数据在网络中传输时,直接进行某些 AI collective operation。

这又是 NeuReality 非常典型的思路:

能不送回 CPU 的事情,就不要送回 CPU

能在网络中直接做完,就在网络中做完。

NR2达到1.6 Tbps网络带宽

NeuReality目前公布的 NR2 AI-SuperNIC 网络吞吐量达到:1.6 Tbps。

它针对下一代大型 GPU/XPU cluster 设计,并支持 Ultra Ethernet,以及相关开放 Ethernet scale-out 技术。

NR2 可以作为:

Die。

独立 Chip。

PCIe Module。

完整 PCIe Card。

甚至成为 switch 或 autonomous network processor 的一部分。

因此服务器和 AI accelerator 企业可以根据自己的 system architecture 进行不同形式集成。

In-Network Compute可能越来越重要

在几十颗或者几千颗 GPU 训练和运行模型时,经常需要执行:

AllReduce。

AllGather。

ReduceScatter。

MoE Dispatch。

这些操作需要大量 GPU 之间通信。

传统方式中,network 只负责搬运数据,最终 mathematical operation 仍然需要 GPU 完成。

NR2 则尝试让一部分 collective calculation 直接在网络中完成。

例如 GPU A、GPU B、GPU C、GPU D 的数据需要进行 Reduce operation 时,不一定所有数据先传到某一颗 GPU 再计算。

网络芯片自己就可以在数据传输途中执行部分 operation。

这就是:In-Network Computing。

对于大规模 AI cluster 来说,这可能同时降低 network traffic 和 GPU overhead。

支持Ultra Ethernet

NeuReality 的 NR2 支持 Ultra Ethernet Consortium,UEC 相关标准。

这是非常重要的一点。

目前 NVIDIA 在大型 GPU cluster 中拥有 NVLink、NVSwitch 和 InfiniBand 等非常强大的专有互连技术。

但是整个产业同时也在建立开放式 Ethernet AI networking ecosystem。

Ultra Ethernet Consortium 成员包括 AMDBroadcomIntelMetaMicrosoft、HPE、Cisco 等大量企业。

它的目标之一就是:让Ethernet也能够支撑超大规模AI Cluster。

NeuReality显然押注这个趋势。

如果未来大量企业不希望完全绑定 NVIDIA proprietary networking,那么开放 Ethernet AI fabric 就会成为很大的市场。

NR2同时针对训练和推理

第一代 NR1 非常明确地针对:Inference。

第二代 NR2 的市场则已经扩大到:Training + Inference。

因为无论训练还是大型分布式 inference,都越来越依赖 GPU-to-GPU communication。

特别是现代 LLM inference 已经不再是一颗 GPU 加载一个模型这么简单。

一个大型模型可能:

Prefill在一组GPU

Decode在另一组GPU

KV Cache存在另外的memory tier。

Mixture-of-Experts 又需要不断把 token 路由到不同 Expert GPU

于是 inference 本身也开始像 HPC workload 一样高度依赖网络。

NeuReality 正是在押注这个变化。

NR-NEXUS:NeuReality开始做AI推理操作系统

2026 年,NeuReality 又迈出非常重要的一步:推出 NR-NEXUS

公司把它称为:Inference Operating System for Token Factories。

NR-NEXUS 不再是一颗芯片。它是软件基础设施。

目标是统一管理大型 AI inference cluster 中的:

Models。

GPUs。

XPUs。

Inference Engines。

KV Cache。

Routing。

Tenants。

Deployment。

Observability。

Cost。

以及整套 production inference lifecycle。

这使 NeuReality 的产品体系变成三层。

底层:NR2 AI-SuperNIC。负责高速数据移动和网络计算。

中间:GPU / XPU。负责真正的大规模神经网络计算。

上层:NR-NEXUS。负责调度、管理和优化整座“Token Factory”。

什么是Token Factory?

现在越来越多 AI infrastructure 企业开始使用 Token Factory 这个概念。

以前评价 Data Center:多少台服务器,多少 CPU,多少 GPU

现在运行大型语言模型以后,真正卖给客户的产品实际上是:Tokens。

因此评价 AI infrastructure 最重要的问题逐渐变成:

每秒能够产生多少 token?

每个 token 多少钱?

每瓦电能够生成多少 token?

每颗 GPU 一天实际工作多少时间?

NeuReality因此把 Cost per Token 作为重要指标。

这种思维与只比较 GPU TFLOPS 完全不同。

一颗 GPU理论算力再强,如果 utilization 只有50%,cost per token 仍然可能很差。

NR-NEXUS支持异构GPU和XPU

NR-NEXUS 一个很重要的设计目标是 Hardware Agnostic。

也就是说,企业未来可能同时拥有:

NVIDIA GPU

AMD GPU

Qualcomm Accelerator。

Custom ASIC。

甚至其他新型 XPU。

传统 software stack 很容易被某一种硬件生态锁定。

NeuReality 则希望 NR-NEXUS 位于不同硬件之上,统一处理 workload routing 和 model serving。

这也是公司长期商业模式里最有意思的地方。

如果成功,它就不需要赌:谁会打败NVIDIA

它赌的是:无论谁生产AI Accelerator,都需要网络和调度。

从NR1到NR2,看得出NeuReality的战略变化

NeuReality 的发展路线非常清楚。

2019:重新设计AI inference server。

2023:NR1 AI-CPU silicon。

2024:NR1 Inference Appliance进入部署。

2025:Generative AI + Agentic AI + NR2。

2026:NR2 AI-SuperNIC + NR-NEXUS Inference OS。

这说明公司不断向更高一层 infrastructure 扩展。

它最早解决:CPU瓶颈。

然后解决:Network瓶颈。

现在又解决:Software Orchestration瓶颈。

最终 NeuReality 想解决的已经不是“怎样制造一颗更快的AI芯片”,而是:怎样让整个AI Factory效率更高。

2021年完成800万美元Seed融资

NeuReality 在 2021 年正式走出 stealth mode,并宣布完成 800万美元 Seed 融资

投资者包括 Cardumen Capital、OurCrowd 和 Varana Capital。

当时前 Intel AI Products Group 负责人、Nervana Systems 创始人 Naveen Rao 也加入了 NeuReality 董事会。

Naveen Rao 是 AI accelerator 行业很重要的人物。

Intel 曾经收购他的 Nervana Systems,用于发展 AI processor。

他的加入也帮助 NeuReality 获得行业关注。

2022年完成3500万美元Series A

2022 年,NeuReality 又宣布完成 3500万美元 Series A 融资

投资者包括 Samsung Ventures、Cardumen Capital、Varana Capital、OurCrowd、XT Hi-Tech、SK hynix、Cleveland Avenue、Korea Investment Partners、StoneBridge 和 Glory Ventures 等。

Samsung 和 SK hynix 两家韩国半导体巨头的参与特别值得注意。

因为 NeuReality 的技术与:

AI Accelerator。

Memory

Networking。

Data Center。

都高度相关。

2024年又融资2000万美元

2024 年 3 月,NeuReality 再次完成 2000万美元融资

这一轮投资者包括 European Innovation Council Fund、Varana Capital、Cleveland Avenue、XT Hi-Tech、OurCrowd、Cardumen Capital、Glory Ventures 和 Alumni Ventures。

按照公司当时公布的数据,这轮融资以后累计融资达到:7000万美元。

资金主要用于推动 NR1 从 Early Deployment 进入更广泛商业部署。

截至目前公开信息中,这仍然是公司已经正式披露的主要累计融资数字之一。

NeuReality 曾计划继续推进 Series B,但评价融资情况时应该以已经完成并公开披露的融资为准,而不是把计划融资计算进去。

NeuReality最大的特点:它并不想和NVIDIA正面打

NeuReality 是目前 AI accelerator 企业中比较聪明的一种商业定位。

很多初创企业的故事是:“我们的芯片NVIDIA GPU 更快。”

这意味着它们必须面对:

CUDA。

PyTorch optimization。

HBM。

NVLink。

NVSwitch。

TensorRT。

Developer ecosystem。

以及 NVIDIA 每年几十亿美元研发投入。

NeuReality选择了另一条路:NVIDIA GPU可以继续存在。

甚至 NVIDIA GPU 越强、越贵:

NeuReality 的价值理论上越明显。

因为一颗几万美元的 GPU 如果经常 idle,本身就是巨大的经济浪费。

NeuReality的产品不是一定要替代 GPU,而是:GPU更值钱。

NeuReality和NVIDIA DPU有什么不同?

NVIDIA 同样拥有 BlueField DPU。

所以一个自然的问题是:NeuReality和DPU有什么区别?

传统 DPU 主要用于:

Networking。

Storage。

Security。

Virtualization。

Cloud Infrastructure Offload。

NeuReality NR1 和 NR2 则从一开始就是:AI-native infrastructure。

NR1特别关注 AI inference pipeline。

NR2特别关注 GPU/XPU collective communication 和 AI scale-out networking。

也就是说:DPU首先是Data Center Infrastructure Processor。

NeuReality则希望成为:AI Infrastructure Processor。

当然,两者的功能边界正在越来越接近,因此未来竞争也会越来越明显。

NeuReality和Lightmatter也在解决类似问题

上一篇介绍的 Lightmatter 同样发现:AI 最大的问题已经不仅是算力。

Lightmatter的解决方法是:Photonic Interconnect。用光连接大量 GPU

NeuReality的解决方法则是:AI-SuperNIC + In-Network Compute + Inference Operating System。

两家公司都不再单纯追求制造“另一颗GPU”。

而是在解决:GPU周围的基础设施。

不同之处是:

Lightmatter重点解决物理连接的 bandwidth 和 power。

NeuReality重点解决 network processing、collective communication、orchestration 和 GPU utilization。

这两种技术实际上未来甚至可能互补,而不一定直接竞争。

NeuReality和Groq、Cerebras也完全不同

Groq 和 Cerebras 主要重新设计的是:AI Compute。

Groq通过特殊 Tensor Streaming Processor 追求极低 latency inference。

Cerebras通过 Wafer Scale Engine 建造巨型 AI processor。

NeuReality则不试图重新设计神经网络最主要的矩阵计算核心。

它重新设计的是:AI System。

因此如果把今天的 AI infrastructure 分层:

Cerebras / Groq / NVIDIACompute。

LightmatterOptical Interconnect。

NeuReality:AI Networking + Orchestration + AI Head Node。

它们实际上位于 AI computer 的不同层。

NeuReality最大的优势

NeuReality 最大的优势首先是它抓住了一个真实存在的问题:GPU并不是永远100%工作。

随着 AI accelerator越来越贵,提高现有硬件 utilization 本身就具有巨大的经济价值。

第二个优势是 Hardware Agnostic。

如果它真的能够长期支持不同 GPU/XPU,那么客户不会因为选择 NeuReality 就必须绑定某一家 accelerator。

第三个优势是公司同时懂:

Semiconductor。

Networking。

Server。

Software。

而未来 AI infrastructure 恰恰越来越需要这种跨领域设计。

第四个优势是产品路线比较完整。

现在 NeuReality 已经形成:NR1 AI-CPU → NR2 AI-SuperNIC → NR-NEXUS Inference OS。

这比单纯拥有一颗 chip 更容易形成长期平台。

NeuReality最大的风险

第一个风险是 NVIDIA 自己也在做类似事情。

NVIDIA不仅拥有 GPU

还拥有:

BlueField DPU。

ConnectX NIC。

NVLink。

NVSwitch。

Spectrum Ethernet

InfiniBand。

CUDA。

TensorRT。

整个 AI Factory stack。

因此 NeuReality进入的每一层,几乎都可能遇到 NVIDIA

第二个风险是客户是否真的愿意增加一种新 processor。

Data center越复杂,运维成本越高。

如果加入 NR1 或 NR2 节省的 GPU cost 不够明显,客户可能继续选择传统 CPU+NIC。

第三个风险是 software ecosystem。

NR-NEXUS 必须与 vLLM、SGLang、TensorRT-LLM、Kubernetes、PyTorch 和不断变化的新 inference framework 保持兼容。

这是一项长期工作。

第四个风险是公司规模。

NeuReality 累计公开融资约7000万美元,与 NVIDIABroadcomAMD 甚至很多大型 AI startup 相比仍然非常小。

因此寻找大型合作伙伴尤其重要。

NeuReality值得关注吗?

NeuReality 是目前 AI Accelerator 行业中非常值得关注的一家公司,因为它提出了一个经常被忽略的问题:

AI性能不等于GPU性能。

真正的 AI application 需要的是:Network,CPUGPUMemory,Storage,Software,Scheduler,Model Server,KV Cache,以及大量不同组件共同工作。

任何一个地方出现瓶颈,昂贵的 GPU 都可能停下来等待。

NeuReality 从一开始就没有试图制造“另一颗更快的 GPU”,而是重新设计 GPU 周围的系统。

第一代 NR1 的核心思想是:不要让传统CPU拖慢AI accelerator。

第二代 NR2 的核心思想是:不要让传统NIC和网络拖慢GPU cluster。

2026 年 NR-NEXUS 的核心思想进一步变成:不要让复杂的软件调度拖慢整座AI Factory。

这条路线和大部分 AI chip startup 非常不同。

它不直接赌哪一种矩阵计算架构最终会胜出。

它赌的是一个更加基础的事实:

无论最终使用NVIDIAAMD还是未来其他XPU,只要AI规模继续扩大,就必须解决数据移动、GPU利用率和调度效率。

截至 2026 年,NeuReality 已经从最初的 NR1 NAPU 公司,逐渐转型成为拥有 AI-CPUAI-SuperNIC 和 Inference Operating SystemAI infrastructure 企业。

公司最新重点已经明显放在 NR2 的 1.6 Tbps AI scale-out networking 和 NR-NEXUS Token Factory architecture 上,而 NR1 则成为证明其“AI-native system architecture”思路的第一代产品。

如果把 NVIDIA 的路线概括为:制造更强的GPU,并建立完整AI Factory。

那么 NeuReality 的路线可以概括为:别再只买更多GPU,先把已经买来的GPU真正用满。

这也正是 NeuReality 最值得关注的地方。