AI加速器企业:NeuReality——不再只堆GPU,而是重新设计整个AI推理服务器
NeuReality 是一家以色列 AI 基础设施和半导体企业,成立于 2019 年,总部位于以色列 Caesarea,并在 Tel Aviv 和波兰设有团队。
与 NVIDIA、AMD、Groq、Hailo 等直接把主要精力放在 AI 计算核心上的公司不同,NeuReality 从成立之初就提出一个很不一样的问题:如果 GPU 本身已经足够强,真正限制 AI inference 性能的,会不会其实是 GPU 周围那些传统 CPU、NIC、网络和软件?
因此 NeuReality 并没有简单设计“另一颗更大的 NPU”,而是重新设计 AI inference server 的 head node、网络、数据预处理、调度和软件架构,希望让昂贵的 GPU 和其他 AI accelerator 尽可能一直工作,而不是不断等待 CPU 和网络。
NeuReality 最早以 NR1 Network Addressable Processing Unit,也就是 NR1 NAPU 成名,后来把 NR1 重新定位为 AI-CPU。
进入 2025 和 2026 年以后,公司战略进一步扩展:
第一代 NR1 主要解决单台 AI inference server 内部 CPU 和 NIC 成为瓶颈的问题;
第二代 NR2 AI-SuperNIC 开始解决几十颗、几百颗甚至更多 GPU 组成 AI cluster 后的 scale-out networking 问题;
与此同时,公司又推出 NR-NEXUS Inference Operating System,负责更上一层的模型部署、KV Cache、路由、调度、GPU/XPU 利用率和 cost per token。
换句话说,现在的 NeuReality 已经从一家特殊的“AI 芯片初创公司”,逐渐发展成一家横跨 AI CPU、AI Networking 和 AI Inference Software 的基础设施企业。
NeuReality是谁创立的?
NeuReality 由 Moshe Tanach、Tzvika Shmueli 和 Yossi Kasus 于 2019 年共同创立。
三位创始人的背景很能解释 NeuReality 为什么没有选择简单复制 GPU。
Moshe Tanach 曾在 Marvell 和 Intel 从事芯片和数据中心相关工作;Tzvika Shmueli 和 Yossi Kasus 则拥有 Mellanox、Habana Labs 等网络和 AI 半导体企业的经验。
公司从成立之初就同时具备 AI、网络、服务器和半导体背景,因此它看待 AI accelerator 的角度天然更偏向整个 system architecture,而不是单独看一颗芯片的 TOPS。
NeuReality 的基本观点是,过去的数据中心服务器主要围绕 CPU 设计:
网络请求首先进入 NIC,然后交给 CPU,CPU 再负责数据解析、预处理、内存管理、任务调度、GPU communication 和大量其他工作。
但今天最昂贵、最重要的计算资源已经变成 GPU、TPU、LPU 和其他 XPU,如果仍然让几十年前形成的 CPU-centric server architecture 管理所有 AI workload,就可能出现一种非常浪费的情况:几万美元甚至几十万美元的 GPU 在等待几千美元的 CPU 和 NIC。
NeuReality认为传统AI服务器的问题在哪里?
一台传统 AI inference server 大致可以理解为这样工作:用户请求通过网络进入 NIC,NIC 把数据送给 CPU;CPU 完成协议处理、数据转换、pre-processing 和任务调度,然后把数据送到 GPU;GPU 执行神经网络;结果再返回 CPU进行 post-processing,最后通过 NIC 发回用户。
这种架构的问题是,GPU越来越快。
CPU虽然也越来越快,但 CPU 必须同时处理操作系统、网络、中断、数据复制、虚拟化、pre-processing、post-processing、storage 和各种 management workload。
结果就是 CPU 和 NIC 很容易成为 AI pipeline 的瓶颈。
NeuReality 因此提出一个非常重要的理念:不要再围绕CPU设计AI服务器。
应该改成:围绕AI accelerator设计服务器。
CPU不再是整个系统的中心,GPU、XPU 或其他 AI accelerator 才是中心。
NR1:世界上非常少见的AI-CPU
NeuReality 第一代核心产品是 NR1。
公司最初称它为 Network Addressable Processing Unit,也就是 NAPU,后来随着产品定位成熟,又开始把它称为 AI-CPU。
它真正的工作是:替GPU处理所有“不值得GPU处理、但又会让GPU等待”的事情。
NR1 把网络接口、CPU、DSP、AI preprocessing、video、audio、memory management、virtualization 和 inference orchestration 等功能集成到一颗 SoC 中,然后直接连接网络和 AI accelerator。
因此一台 NeuReality 系统可以形成一种非常不同的数据路径:
传统服务器:Network → NIC → CPU → GPU。
NeuReality:Network → NR1 AI-CPU → GPU。
很多原来需要通用 CPU 在软件中执行的步骤,被直接移动到专用硬件。
NR1采用7nm工艺
NR1 是一颗采用 7nm 工艺制造的 AI inference server-on-chip,NeuReality 在 2023 年已经获得由 TSMC 制造的芯片。
公司在 2024 年融资时也确认,7nm NR1 silicon 已经完成并进入客户部署阶段。
这里特别需要说明:
NR1本身不是 NVIDIA GPU 那种主要负责大型 Transformer matrix multiplication 的 accelerator。
它更像:
AI Server Control Processor + SmartNIC + DPU + DSP + AI Pipeline Processor。
这也是为什么用传统“多少 TOPS”去评价 NR1 并没有太大意义。
NeuReality真正强调的是:GPU Utilization。
为什么GPU利用率这么重要?
假设企业购买了一批理论性能极其强大的 GPU,但是由于 CPU、network 或 software bottleneck,GPU 实际只有一半时间真正进行有效计算,那么企业其实浪费了一半最昂贵的硬件投资。
NeuReality 表示,在传统 CPU+NIC inference architecture 中,AI accelerator 的实际利用率可能明显低于理论上限,而 NR1 的目标是把 GPU utilization 推向接近满负载。
公司目前宣传的不同 workload 数据显示,采用其架构后可以明显提高 throughput、price/performance 和 energy efficiency。
具体提高幅度会根据 GPU、模型和部署方式不同而变化,因此不能简单把公司的最高宣传数字理解成所有 AI workload 都一定能够达到的结果。
但其背后的经济逻辑非常简单。
假设:10颗GPU只有50%利用率。实际上相当于只有5颗GPU一直工作。
如果通过系统优化让10颗GPU接近满负载,那么即使 GPU 本身完全没有变快,整个 AI service 的经济效率也可能大幅提升。
NeuReality 赌的就是这个问题。
AI-Hypervisor:把软件任务直接做进硬件
NR1 的一个核心技术叫做 AI-Hypervisor。
传统 Hypervisor 主要负责虚拟机和 CPU resource management。
NeuReality 的 AI-Hypervisor 则针对 AI inference pipeline 设计,把很多原来运行在 CPU software stack 中的功能直接放进 hardware datapath。
例如:
network processing、data movement、pre-processing、post-processing、AI pipeline orchestration 和 resource management。
这可以减少 CPU involvement,也减少 data copy 和 context switching。
NeuReality 的思路本质上和 NVIDIA DPU、AMD Pensando、Intel IPU 存在某些相似之处,但它更加专门针对 AI inference,而不是通用云计算网络。
AI-over-Fabric:让网络直接认识AI任务
NeuReality 另外一个重要概念叫做 AI-over-Fabric。
传统网络看到的只是:
Packet。
TCP。
RDMA。
Data。
但 NeuReality 希望 network fabric 本身能够理解 AI inference workflow。
请求通过网络进入以后,可以直接被送到适合的 AI processing resource,不需要所有数据都绕过一个中心 CPU。
这使 NeuReality 的架构从第一代 NR1 开始,就拥有非常强的 networking DNA。
而这个设计后来直接发展成公司的第二代核心产品:NR2 AI-SuperNIC。
NR1内部其实是一台小型异构服务器
NR1 不是简单的 network chip。
NeuReality 的 NR1 architecture 包含 Arm server-class CPU、DSP、audio processing、video processing、networking engine、memory controller 和其他 accelerator。
在完整 NR1 Inference Appliance 中,多颗 NR1 可以与多颗 AI accelerator 组合。
NeuReality 当前公布的高密度系统最高可以配置多个 NR1 Module 和 10到16颗 GPU,并集成大量 Arm CPU、DSP 和媒体处理能力。
这也是为什么 NeuReality 把 NR1 称为:Server-on-a-Chip。
它不是简单帮 CPU 加速某一个函数,而是尝试把原本需要整台 CPU head node 完成的大量工作压缩到一颗专门为 AI inference 设计的 SoC 中。
NR1 Inference Module
为了方便服务器厂商使用,NeuReality 还提供 NR1 Inference Module。
它采用 PCIe 卡形式,里面包含 NR1 AI-CPU,可以与服务器内部的 GPU 或其他 AI accelerator 配合。
这样客户并不一定需要从零设计一台服务器。
现有服务器可以加入 NR1 Module,然后让 NR1承担 AI workflow orchestration、network 和 pipeline offload。
公司把它定位为可以配合不同 AI accelerator 的 companion processor,而不是绑定一种特定 GPU。
这一点是 NeuReality 商业模式中的重要优势。
理论上无论客户使用:
NVIDIA GPU、AMD GPU、Qualcomm Cloud AI、其他 XPU,甚至未来的新 AI accelerator,NeuReality 都希望自己的 infrastructure layer 可以继续使用。
NR1 Inference Appliance:直接卖完整AI服务器
NeuReality 后来发现,只卖芯片或者 PCIe module 对很多企业客户来说还不够简单。
企业并不一定想自己研究:
PCIe topology、GPU、driver、container、Kubernetes、model serving、networking 和 thermal design。
因此 NeuReality进一步推出 NR1 Inference Appliance。
这是一套 4U AI inference server,把 NR1、GPU/XPU、storage、network、software 和 APIs 集成在一个系统里。
公司最新产品页面给出的高密度配置可以容纳 4到10个 NR1 Inference Module 和 10到16颗 GPU,并提供最高约 1 Tbps 网络连接。
这使 NeuReality 的商业模式从:“卖一颗芯片。”
发展到:“卖一整套AI inference infrastructure。”
支持生成式AI和Agentic AI
NeuReality早期主要针对 Computer Vision、Recommendation、Speech Recognition 等传统 inference workload。
ChatGPT 出现以后,公司很快把产品扩展到:LLM,Generative AI,RAG,Multimodal AI,以及现在非常热门的 Agentic AI。
2026 年推出的新一代 Inference Appliance 已经预装和优化部分 Generative AI 与 Agentic AI 模型,并提供类似 OpenAI API 的接口,让企业可以在自己的 data center 中部署本地 AI 服务。
这意味着企业可以建立:Private AI。
数据不需要全部送到 OpenAI、Anthropic 或其他 Cloud API。
金融、医疗、政府和大型企业尤其可能对这种模式感兴趣。
Qualcomm是NeuReality的重要合作伙伴
NeuReality 第一阶段商业化过程中与 Qualcomm 建立了比较深入的合作。
早期 NR1-S 系统就已经搭配 Qualcomm Cloud AI 100 accelerator,NeuReality SDK 也针对 Qualcomm AI accelerator 完成支持。
到 2025 年,公司继续展示 NR1 与 Qualcomm Cloud AI 100 Ultra 的组合。
Qualcomm 表示,通过 Cloud AI 100 Ultra 与 NeuReality AI-CPU architecture 配合,可以提升 AI performance 和 cost efficiency。
这正好说明 NeuReality 的产品逻辑:
NeuReality负责:让AI计算器一直有活干。
也与AMD、Arm、Lenovo、Foxconn等企业建立合作
NeuReality 当前公布的技术和生态合作伙伴包括 Arm、Qualcomm、TSMC、Lenovo、Foxconn、Alchip、Synopsys、Cadence 等企业。
公司投资者中还出现 Samsung Ventures、SK hynix、OurCrowd 等半导体和投资机构。
其中 Arm 尤其重要,因为 NeuReality 的 NR1 和下一代 NR2 都大量使用 Arm server CPU technology。
这也是 NeuReality架构一个值得注意的地方:公司并不认为 CPU完全没有价值。
它认为问题在于:不应该再让传统通用CPU承担整个AI数据路径。
所以 NeuReality 不是“消灭 CPU”。
NR2:NeuReality开始解决GPU之间的网络瓶颈
如果说 NR1 解决的是:一台AI服务器内部CPU和NIC拖慢GPU。
那么第二代 NR2 AI-SuperNIC 解决的就是:成百上千颗GPU之间的网络开始拖慢整个AI Cluster。
这是 NeuReality 在 2025 年以后最重要的战略升级。
随着大模型越来越大,一颗 GPU 已经无法运行完整 workload。
系统开始使用:
Tensor Parallelism。
Pipeline Parallelism。
Expert Parallelism。
Prefill/Decode Disaggregation。
KV Cache Sharing。
GPU之间必须不断传输大量数据。
这使 network latency 和 bandwidth 开始直接影响 tokens per second。
因此 NeuReality 又开始重新设计 NIC。
NR2不是普通网卡
传统 Network Interface Card 最重要的工作就是把 packet 从机器 A 传到机器 B。
SmartNIC 和 DPU 则进一步加入 security、virtualization、storage 和 programmable networking。
NeuReality 的 NR2 则专门针对:AI Scale-Out Networking。
公司把它称为:AI-SuperNIC。
NR2 不只是移动数据。
它还可以执行部分 In-Network Compute,也就是数据在网络中传输时,直接进行某些 AI collective operation。
这又是 NeuReality 非常典型的思路:
能在网络中直接做完,就在网络中做完。
NR2达到1.6 Tbps网络带宽
NeuReality目前公布的 NR2 AI-SuperNIC 网络吞吐量达到:1.6 Tbps。
它针对下一代大型 GPU/XPU cluster 设计,并支持 Ultra Ethernet,以及相关开放 Ethernet scale-out 技术。
NR2 可以作为:
Die。
独立 Chip。
PCIe Module。
完整 PCIe Card。
甚至成为 switch 或 autonomous network processor 的一部分。
因此服务器和 AI accelerator 企业可以根据自己的 system architecture 进行不同形式集成。
In-Network Compute可能越来越重要
在几十颗或者几千颗 GPU 训练和运行模型时,经常需要执行:
AllReduce。
AllGather。
ReduceScatter。
MoE Dispatch。
这些操作需要大量 GPU 之间通信。
传统方式中,network 只负责搬运数据,最终 mathematical operation 仍然需要 GPU 完成。
NR2 则尝试让一部分 collective calculation 直接在网络中完成。
例如 GPU A、GPU B、GPU C、GPU D 的数据需要进行 Reduce operation 时,不一定所有数据先传到某一颗 GPU 再计算。
网络芯片自己就可以在数据传输途中执行部分 operation。
这就是:In-Network Computing。
对于大规模 AI cluster 来说,这可能同时降低 network traffic 和 GPU overhead。
支持Ultra Ethernet
NeuReality 的 NR2 支持 Ultra Ethernet Consortium,UEC 相关标准。
这是非常重要的一点。
目前 NVIDIA 在大型 GPU cluster 中拥有 NVLink、NVSwitch 和 InfiniBand 等非常强大的专有互连技术。
但是整个产业同时也在建立开放式 Ethernet AI networking ecosystem。
Ultra Ethernet Consortium 成员包括 AMD、Broadcom、Intel、Meta、Microsoft、HPE、Cisco 等大量企业。
它的目标之一就是:让Ethernet也能够支撑超大规模AI Cluster。
NeuReality显然押注这个趋势。
如果未来大量企业不希望完全绑定 NVIDIA proprietary networking,那么开放 Ethernet AI fabric 就会成为很大的市场。
NR2同时针对训练和推理
第一代 NR1 非常明确地针对:Inference。
第二代 NR2 的市场则已经扩大到:Training + Inference。
因为无论训练还是大型分布式 inference,都越来越依赖 GPU-to-GPU communication。
特别是现代 LLM inference 已经不再是一颗 GPU 加载一个模型这么简单。
一个大型模型可能:
Prefill在一组GPU。
Decode在另一组GPU。
KV Cache存在另外的memory tier。
Mixture-of-Experts 又需要不断把 token 路由到不同 Expert GPU。
于是 inference 本身也开始像 HPC workload 一样高度依赖网络。
NeuReality 正是在押注这个变化。
NR-NEXUS:NeuReality开始做AI推理操作系统
2026 年,NeuReality 又迈出非常重要的一步:推出 NR-NEXUS。
公司把它称为:Inference Operating System for Token Factories。
NR-NEXUS 不再是一颗芯片。它是软件基础设施。
目标是统一管理大型 AI inference cluster 中的:
Models。
GPUs。
XPUs。
Inference Engines。
KV Cache。
Routing。
Tenants。
Deployment。
Observability。
Cost。
以及整套 production inference lifecycle。
这使 NeuReality 的产品体系变成三层。
底层:NR2 AI-SuperNIC。负责高速数据移动和网络计算。
中间:GPU / XPU。负责真正的大规模神经网络计算。
上层:NR-NEXUS。负责调度、管理和优化整座“Token Factory”。
什么是Token Factory?
现在越来越多 AI infrastructure 企业开始使用 Token Factory 这个概念。
以前评价 Data Center:多少台服务器,多少 CPU,多少 GPU。
现在运行大型语言模型以后,真正卖给客户的产品实际上是:Tokens。
因此评价 AI infrastructure 最重要的问题逐渐变成:
每秒能够产生多少 token?
每个 token 多少钱?
每瓦电能够生成多少 token?
每颗 GPU 一天实际工作多少时间?
NeuReality因此把 Cost per Token 作为重要指标。
这种思维与只比较 GPU TFLOPS 完全不同。
一颗 GPU理论算力再强,如果 utilization 只有50%,cost per token 仍然可能很差。
NR-NEXUS支持异构GPU和XPU
NR-NEXUS 一个很重要的设计目标是 Hardware Agnostic。
也就是说,企业未来可能同时拥有:
Qualcomm Accelerator。
Custom ASIC。
甚至其他新型 XPU。
传统 software stack 很容易被某一种硬件生态锁定。
NeuReality 则希望 NR-NEXUS 位于不同硬件之上,统一处理 workload routing 和 model serving。
这也是公司长期商业模式里最有意思的地方。
如果成功,它就不需要赌:谁会打败NVIDIA?
它赌的是:无论谁生产AI Accelerator,都需要网络和调度。
从NR1到NR2,看得出NeuReality的战略变化
NeuReality 的发展路线非常清楚。
2019:重新设计AI inference server。
2024:NR1 Inference Appliance进入部署。
2025:Generative AI + Agentic AI + NR2。
2026:NR2 AI-SuperNIC + NR-NEXUS Inference OS。
这说明公司不断向更高一层 infrastructure 扩展。
它最早解决:CPU瓶颈。
然后解决:Network瓶颈。
现在又解决:Software Orchestration瓶颈。
最终 NeuReality 想解决的已经不是“怎样制造一颗更快的AI芯片”,而是:怎样让整个AI Factory效率更高。
2021年完成800万美元Seed融资
NeuReality 在 2021 年正式走出 stealth mode,并宣布完成 800万美元 Seed 融资。
投资者包括 Cardumen Capital、OurCrowd 和 Varana Capital。
当时前 Intel AI Products Group 负责人、Nervana Systems 创始人 Naveen Rao 也加入了 NeuReality 董事会。
Naveen Rao 是 AI accelerator 行业很重要的人物。
Intel 曾经收购他的 Nervana Systems,用于发展 AI processor。
他的加入也帮助 NeuReality 获得行业关注。
2022年完成3500万美元Series A
2022 年,NeuReality 又宣布完成 3500万美元 Series A 融资。
投资者包括 Samsung Ventures、Cardumen Capital、Varana Capital、OurCrowd、XT Hi-Tech、SK hynix、Cleveland Avenue、Korea Investment Partners、StoneBridge 和 Glory Ventures 等。
Samsung 和 SK hynix 两家韩国半导体巨头的参与特别值得注意。
因为 NeuReality 的技术与:
AI Accelerator。
Networking。
Data Center。
都高度相关。
2024年又融资2000万美元
2024 年 3 月,NeuReality 再次完成 2000万美元融资。
这一轮投资者包括 European Innovation Council Fund、Varana Capital、Cleveland Avenue、XT Hi-Tech、OurCrowd、Cardumen Capital、Glory Ventures 和 Alumni Ventures。
按照公司当时公布的数据,这轮融资以后累计融资达到:7000万美元。
资金主要用于推动 NR1 从 Early Deployment 进入更广泛商业部署。
截至目前公开信息中,这仍然是公司已经正式披露的主要累计融资数字之一。
NeuReality 曾计划继续推进 Series B,但评价融资情况时应该以已经完成并公开披露的融资为准,而不是把计划融资计算进去。
NeuReality最大的特点:它并不想和NVIDIA正面打
NeuReality 是目前 AI accelerator 企业中比较聪明的一种商业定位。
很多初创企业的故事是:“我们的芯片比 NVIDIA GPU 更快。”
这意味着它们必须面对:
CUDA。
PyTorch optimization。
HBM。
NVLink。
NVSwitch。
TensorRT。
Developer ecosystem。
以及 NVIDIA 每年几十亿美元研发投入。
NeuReality选择了另一条路:NVIDIA GPU可以继续存在。
NeuReality 的价值理论上越明显。
因为一颗几万美元的 GPU 如果经常 idle,本身就是巨大的经济浪费。
NeuReality的产品不是一定要替代 GPU,而是:让GPU更值钱。
NeuReality和NVIDIA DPU有什么不同?
NVIDIA 同样拥有 BlueField DPU。
所以一个自然的问题是:NeuReality和DPU有什么区别?
传统 DPU 主要用于:
Networking。
Storage。
Security。
Virtualization。
Cloud Infrastructure Offload。
NeuReality NR1 和 NR2 则从一开始就是:AI-native infrastructure。
NR1特别关注 AI inference pipeline。
NR2特别关注 GPU/XPU collective communication 和 AI scale-out networking。
也就是说:DPU首先是Data Center Infrastructure Processor。
NeuReality则希望成为:AI Infrastructure Processor。
当然,两者的功能边界正在越来越接近,因此未来竞争也会越来越明显。
NeuReality和Lightmatter也在解决类似问题
上一篇介绍的 Lightmatter 同样发现:AI 最大的问题已经不仅是算力。
Lightmatter的解决方法是:Photonic Interconnect。用光连接大量 GPU。
NeuReality的解决方法则是:AI-SuperNIC + In-Network Compute + Inference Operating System。
两家公司都不再单纯追求制造“另一颗GPU”。
而是在解决:GPU周围的基础设施。
不同之处是:
Lightmatter重点解决物理连接的 bandwidth 和 power。
NeuReality重点解决 network processing、collective communication、orchestration 和 GPU utilization。
这两种技术实际上未来甚至可能互补,而不一定直接竞争。
NeuReality和Groq、Cerebras也完全不同
Groq 和 Cerebras 主要重新设计的是:AI Compute。
Groq通过特殊 Tensor Streaming Processor 追求极低 latency inference。
Cerebras通过 Wafer Scale Engine 建造巨型 AI processor。
NeuReality则不试图重新设计神经网络最主要的矩阵计算核心。
它重新设计的是:AI System。
因此如果把今天的 AI infrastructure 分层:
Cerebras / Groq / NVIDIA:Compute。
Lightmatter:Optical Interconnect。
NeuReality:AI Networking + Orchestration + AI Head Node。
它们实际上位于 AI computer 的不同层。
NeuReality最大的优势
NeuReality 最大的优势首先是它抓住了一个真实存在的问题:GPU并不是永远100%工作。
随着 AI accelerator越来越贵,提高现有硬件 utilization 本身就具有巨大的经济价值。
第二个优势是 Hardware Agnostic。
如果它真的能够长期支持不同 GPU/XPU,那么客户不会因为选择 NeuReality 就必须绑定某一家 accelerator。
第三个优势是公司同时懂:
Semiconductor。
Networking。
Server。
Software。
而未来 AI infrastructure 恰恰越来越需要这种跨领域设计。
第四个优势是产品路线比较完整。
现在 NeuReality 已经形成:NR1 AI-CPU → NR2 AI-SuperNIC → NR-NEXUS Inference OS。
这比单纯拥有一颗 chip 更容易形成长期平台。
NeuReality最大的风险
第一个风险是 NVIDIA 自己也在做类似事情。
还拥有:
BlueField DPU。
ConnectX NIC。
NVLink。
NVSwitch。
Spectrum Ethernet。
InfiniBand。
CUDA。
TensorRT。
整个 AI Factory stack。
因此 NeuReality进入的每一层,几乎都可能遇到 NVIDIA。
第二个风险是客户是否真的愿意增加一种新 processor。
Data center越复杂,运维成本越高。
如果加入 NR1 或 NR2 节省的 GPU cost 不够明显,客户可能继续选择传统 CPU+NIC。
第三个风险是 software ecosystem。
NR-NEXUS 必须与 vLLM、SGLang、TensorRT-LLM、Kubernetes、PyTorch 和不断变化的新 inference framework 保持兼容。
这是一项长期工作。
第四个风险是公司规模。
NeuReality 累计公开融资约7000万美元,与 NVIDIA、Broadcom、AMD 甚至很多大型 AI startup 相比仍然非常小。
因此寻找大型合作伙伴尤其重要。
NeuReality值得关注吗?
NeuReality 是目前 AI Accelerator 行业中非常值得关注的一家公司,因为它提出了一个经常被忽略的问题:
真正的 AI application 需要的是:Network,CPU,GPU,Memory,Storage,Software,Scheduler,Model Server,KV Cache,以及大量不同组件共同工作。
任何一个地方出现瓶颈,昂贵的 GPU 都可能停下来等待。
NeuReality 从一开始就没有试图制造“另一颗更快的 GPU”,而是重新设计 GPU 周围的系统。
第一代 NR1 的核心思想是:不要让传统CPU拖慢AI accelerator。
第二代 NR2 的核心思想是:不要让传统NIC和网络拖慢GPU cluster。
2026 年 NR-NEXUS 的核心思想进一步变成:不要让复杂的软件调度拖慢整座AI Factory。
这条路线和大部分 AI chip startup 非常不同。
它不直接赌哪一种矩阵计算架构最终会胜出。
它赌的是一个更加基础的事实:
无论最终使用NVIDIA、AMD还是未来其他XPU,只要AI规模继续扩大,就必须解决数据移动、GPU利用率和调度效率。
截至 2026 年,NeuReality 已经从最初的 NR1 NAPU 公司,逐渐转型成为拥有 AI-CPU、AI-SuperNIC 和 Inference Operating System 的 AI infrastructure 企业。
公司最新重点已经明显放在 NR2 的 1.6 Tbps AI scale-out networking 和 NR-NEXUS Token Factory architecture 上,而 NR1 则成为证明其“AI-native system architecture”思路的第一代产品。
如果把 NVIDIA 的路线概括为:制造更强的GPU,并建立完整AI Factory。
那么 NeuReality 的路线可以概括为:别再只买更多GPU,先把已经买来的GPU真正用满。
这也正是 NeuReality 最值得关注的地方。
