BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月11日

注册 / 登录

AI狂飙之下,为什么Arm认定CPU才是主角?

2026年9月8日,Arm在上海年度大会上的舞台灯光格外刺眼。在一个GPU几乎垄断了AI算力讨论的行业里,这家设计处理器指令集的公司抛出了两个全新的名词:AGI CPUNeoverse CSS N4

Arm试图向全行业证明一个被大多数人忽略的事实:在真正的AI智能体(Agentic AI)时代,CPU将不再是GPU的附庸,而是算力调度的心脏。

这不仅是一篇新的技术路线图,更是Arm商业模式的全面转型——从“卖面粉”的IP授权商,变身为了“卖系统”的基础设施供应商。它把刀锋对准的,正是x86架构多年来固若金汤的数据中心堡垒。

端侧大模型的“内存墙”与现实困境

要理解Arm的战略意图,必须先看清大模型“下沉”到端侧时遭遇的物理瓶颈。

近两年,AI圈的主流叙事是“模型越来越小”。从动辄几百GB参数的云端巨无霸,缩减到可以在手机、PC甚至汽车上运行的百亿级轻量化模型。然而,随着推理请求向终端转移,硬件层面的矛盾迅速暴露。

首先是被称为“内存墙”的物理极限。NPU(神经网络处理器)虽然擅长处理高并发的矩阵乘法运算,但它极度依赖数据搬运速度。当前移动端或边缘侧设备的内存带宽往往只有几GB/s至几十GB/s。对于大规模Transformer结构来说,模型参数一旦超出片内SRAM的承载范围,必须频繁通过外部总线读取内存。这就导致算力单元经常处于“等待数据”的空转状态——也就是业界常说的“I/O Bound”。

其次是控制逻辑的缺失。这是Arm此次强调的重点。传统的LLM推理往往可以被视为简单的数学计算:输入Prompt,经过层层变换,输出结果。但正在兴起的“AI智能体”(Agentic AI)完全改变了这一范式。

智能体不再只是被动回答问题,而是要自主拆解任务、检索外部数据库、调用API工具、判断下一步动作。这些工作本质上是复杂的条件分支、循环控制和逻辑调度。NPU在处理这种非规则流的数据时效率极低,而GPU又受限于功耗和面积成本无法全量部署所有逻辑层。

在这样的场景下,通用CPU展现出了不可替代的价值。它可以灵活地执行控制代码,管理上下文切换,并将最合适的子任务分发给加速器。正如Arm高管在发布会上所述:“未来的AI基础设施不能只有一块肌肉,还需要有大脑。这块‘大脑’就是CPU。”

据分析,随着端到端推理成本的增加,云服务商开始重新评估算力配比。过去几年,许多CSP(云服务提供商)在采购服务器时倾向于极高比例的GPU配置(部分场景达到1:8,即1颗CPU配8颗GPU)。但面对Agent时代的复杂调度需求,Arm预测这个比例将收敛趋近于1:1。如果这一趋势兑现,将是Arm架构在数据中心份额扩张的最大窗口期。

从“卖面粉”到“造面包”:CSS的商业野心

如果说AGI CPU是Arm对竞争对手发出的挑战书,那么Neoverse CSS N4则是它为自己打造的商业化利器。

回顾过去十年,Arm的核心商业模式极其简单:设计公司内部的处理器架构(如Cortex-X系列、Neoverse V系列),将这些IP核以授权费加版税的方式卖给苹果、高通、联发科等芯片制造商。这相当于Arm负责研发图纸,客户负责买图纸、建工厂、生产最终的芯片。

这种模式让Arm享受了移动互联网爆发的红利,累计出货量突破了3500亿颗。但也带来了天花板:Arm只能收取固定的授权费和极低的单颗芯片版税,无法分享高端芯片带来的超额利润。更重要的是,碎片化的定制导致了严重的兼容性问题,开发者在不同厂商的Arm平台上调试体验差异巨大。

于是,Neoverse CSS(Compute Subsystem,计算子系统)应运而生。

简单来说,CSS N4不再是一块单独的IP核,而是一个打包好的子系统解决方案。它集成了最新的V4核心集群、高速互联架构(Interconnect)、片外缓存控制器以及深度优化的软件栈。这就好比Arm不再只给客户提供小麦种子,而是直接卖给他们一套可以直接开工的面包生产线。

对于正在疯狂建设AI基础设施的云巨头而言,这套方案极具吸引力。自建定制芯片周期长、试错成本高。通过CSS N4,CSP可以用接近标准产品的价格和时间,获得高度定制化硅片的性能优势。据报道,Neoverse CSS N4在特定基准测试下的性能最高较上代提升了约2倍(对比对象为上一代Neoverse平台,具体数值取决于后端工艺节点的缩放及封装技术的改进)。

目前,包括甲骨文(Oracle)在内的多家科技巨头已加入AGI CPU生态系统。Meta也在此前深化了战略合作,意图为数十亿设备构建跨端的统一算力底座。Arm借此将自身角色从边缘的IP提供商,强行拉升到了数据中心基础设施的核心位置。

正面迎战:在x86的后花园里杀出一条血路

尽管愿景诱人,但Arm在数据中心水域里游弋已久。该市场曾长期是英特尔和AMD的绝对禁脔。x86架构凭借其成熟的指令集支持、庞大的软件生态以及在企业级应用中的深厚积累,构建了极高的护城河。

近年来,为了摆脱对单一供应商的依赖并追求更高的能效比,AWS推出了Graviton系列,微软布局了Maia加速器,谷歌则持续迭代其TPU专用阵列。这一轮“去标准化”浪潮给Arm留出了夹缝中生存的空间。

Arm这次的策略并非要在所有参数上击败x86,而是利用其在端侧低功耗领域的统治地位,反哺数据中心。其核心逻辑在于:数据中心不仅要求计算能力,更要求严苛的单位瓦特算力密度。在训练大模型的重度负载区,NVIDIA的H100/A100依然不可撼动;但在推理(Inference)和日常混合负载区,Arm的长尾优势正在凸显。

据统计,全球已有超过2200万名软件开发者在使用Arm架构进行编程。这看似是一个庞大的数字,但真正能将这庞大流量转化为数据中心收入的却寥寥无几。CSS N4的意义在于打通了这条闭环:当开发者习惯了Arm的工具链,当操作系统完成了底层适配,底层的硬件选型就不再面临巨大的迁移阻力。

不过,值得注意的是,Arm提出的“1:1”GPU/CPU配比目标仍然带有强烈的企业愿景色彩。在当前大多数实际的大规模推理集群中,由于CUDA生态的锁定效应和传统网络拓扑设计的惯性,极端偏向GPU的配置仍是主流。即便Arm的硬件架构足够优秀,要让这些庞然大物改变采购习惯,仍需要时间验证。

接下来关注什么

这场围绕算力的重新定义尚未到达终局。对于投资者和行业观察者而言,以下几个指标将成为检验Arm战略成败的关键风向标:

  1. Oracle OCI的实际落地时间表:甲骨文作为目前唯一高调宣布采用Arm AGI CPU生态的云厂商,其是否会在未来的季度财报中体现出相应的资本开支计划,是验证商业可行性的第一块试金石。
  2. 开源框架的对齐进度:像TensorFlow、PyTorch等主流AI框架是否能原生支持CSS N4的高效分发。没有软件层面的无缝衔接,再强大的硬件也只能停留在实验室阶段。
  3. 端侧推理的成本账本:部署了AGI CPU的手机或PC产品,在运行实际Agent时的续航损耗与响应延迟能否达到消费级市场的及格线。这将决定Arm生态能否真正实现从端侧到云端的能量守恒。

在这场AI基础设施的竞赛中,Arm终于不再只是一个沉默的旁观者和收租人。它选择下场做裁判的同时也亲自上场踢球。无论最终结局如何,这场由CPU重新主导计算范式的尝试,已经深刻重塑了整个半导体产业的格局。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。