智东西 作者 王涵 编辑 漠影 2026年,Agent的火爆程度空前。 9月21日,在AICC 2026大会上,IDC发布了一组数字:2026年全球活跃Agent 约7940万个 ,到2030年将达 22.16亿个 。 而同期Token消耗量的增长更为惊人:从2026年的 0.026Peta(千万亿) ,增长到2030年的 152667Peta 。Agent数量增长约28倍,Token消耗却增长 数百万倍 。 需求侧增长如此之快,算力供给能接住吗? 今年有两个案例十分典型: 一是 Kimi K3 。这个总参数量2.8万亿的模型,权重文件达到1.56TB,普通AI服务器的GPU显存连权重都装不下,官方推荐至少64卡甚至更大规模才能运行。 它指向的是 “向上”的困境 :当Agent需要更强推理、更长上下文和更多智能体协同,能力上限越高,部署门槛越从单机走向集群。 二是 DeepSeek 。2026年上半年,它曾将V4-Pro的API价格下调75%,并称调整长期有效;但8月又预告整体提价,理由直指“算力不足”。 它指向的是“ 向广”的困境 :当Agent大规模调用便宜模型,性价比算力的需求被迅速放大,容量不够,低价供给就难以持续。 这两个问题怎么破? 在AICC 2026大会上,浪潮信息给出了自己的回答: 向上,Capability AI Compute;向广,Capacity AI Compute 。 会上,浪潮信息正式发布 元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组 。“向上向广”两个方向齐头并进,通过系统协同,浪潮信息从提供算力走向生产智能。 一、向上,超节点突破智能上限 要理解向上的瓶颈从何而来,我们要先看清AI的需求端发生了什么变化。 过去,人们对AI的需求是回答问题,算力调用是单次且临时的。而在Agent时代,一次用户意图背后,可能是几十次、几百次甚至更多次推理,是多个Agent连续几小时甚至几天的协同工作。 应用形态的变化,直接提高了对算力系统的要求。 与此同时, 前沿模型的Scaling up也在这一时期进入加速期 。 以Kimi K3为例,其参数量已经达到2.8万亿,权重文件 约1.56TB ,普通服务器显存连权重都装不下,更不用说百万Token上下文。官方推荐扩展到64卡甚至更大规模,才能让模型真正运行。更不用说未来可能会扩展到十万亿参数量级的更加前沿的模型。 现如今,芯片之间需要高效通信,内存需要统一寻址,数据搬运需要尽可能减少。 简单地把更多服务器堆在一起,行不通了 。 超节点的意义,就在于 突破传统单机的计算边界 ,把更多芯片和内存纳入一个高效协同的计算域,为前沿智能提供更大的 “有效计算空间” 。 浪潮信息发布的 元脑SD200 Ultra超节点AI服务器 ,正是围绕这一目标设计。 元脑SD200 Ultra 以开放系统设计紧耦合128芯本土AI芯片 ,实现统一内存寻址超低延迟通信,并以对称直连、算子优化等创新技术减少模型运行中的数据搬移与等待。 基于这套系统,SD200 Ultra可以 单机运行 2.8万亿参数的Kimi K3,Token生成时延 首次突破5.85毫秒。 同时随着模型参数规模不断提升,还支持 10万亿参数规模 的前沿模型,为模型规模和上下文长度的持续扩展提供支撑。 从技术实现看,SD200 Ultra基于 128芯本土AI芯片 ,采用 3D HyperMesh架构 ,提供 8TB带宽 和 64TB内存 ,让前沿模型能够充分利用多颗芯片的计算与存储资源。 通信方面,原生内存语义通信把跨芯片通信时延降低到 0.69微秒 ;在推理优化上,浪潮信息构建超级算子库体系,将KDA、Gated MLA、MoE中的众多基础算子融合为计算+通信的大算子,算子数量降低为原先的 1/11 ,大幅减少了Kernel Launch次数,HBM访问开销,并隐藏了通信延迟,提升GPU整体执行效率。 今天,AI已经能够解决困扰学术界几十年的NS方程。能力型智算要做的,就是 让这些前沿能力不只是实验室里的演示,而是可落地、可复制的生产力 。 二、向广,让智能供给“供得上、供得便宜” 如果说Capability解决的是“智能可以有多强”,那么Capacity解决的是“我们究竟能够拥有多少智能”。 随着Agent数量和使用深度增加,Token需求还会继续快速增长。 提高单位计算资源的Token产出,成为规模化供给的关键。 然而,提高Token产出并不容易。 推理不是一种单一计算模式。Prefill和Decode的计算特征不同,Attention和MoE对计算与访存的要求不同。多模态、MTP等模型架构的发展,还会带来更多类型的计算负载。 简单堆更多服务器,不仅不能带来线性能力增长,还可能因为资源浪