留言

300亿参数塞进手机:端侧AI跑出330 Token/s

300亿参数的模型,跑在手机上。这个数字放在两年前,多数人的第一反应是"不可能"——它通常意味着一台服务器级别的显存开销。但在2026骁龙峰会上,高通给出的答案是:不仅跑起来了,预填充吞吐还超过了每秒330个Token。 夏威夷时间9月22日9点,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙8超级至尊版移动平台,完成阶跃StepEdge-Omni 30B-MoE模型的端侧适配与推理优化,并现场演示了相关智能体助手。 MoE是怎么把大模型"瘦身"的 这套方案的核心是混合专家架构。300亿参数并非每次推理都要全部调用,模型会依据任务需要,只激活部分专家模块。计算量和内存带宽需求随之下降,这是大参数模型能落到手机端的前提。 光靠架构还不够。合作三方从推理引擎、异构调度到存储方案做了联合优化,最终让模型运行的内存需求,比行业常规方案降低超过50%,并支持在智能手机上稳定运行。 不联网,能干哪些活 高通表示,该方案无需调用云端服务,本地即可完成一系列任务: 邮件理解与邮件草拟 行程规划与日历同步 航班及酒店推荐 行程分享 这些任务此前大多依赖云端推理。放到端侧之后,数据不出设备,时延也不再受网络波动影响。 性能数据方面,模型预填充吞吐超过每秒330个Token,解码吞吐超过每秒28个Token。预填充吞吐衡量的是推理预填充阶段每秒能处理的输入词元数量,是判断系统处理长提示词和批量请求能力的关键指标——换句话说,它决定了模型"读题"的速度。 规模化还差什么 业内人士认为,大参数MoE模型在手机端部署,有助于推动低时延和隐私保护型智能体应用发展。但判断也留了余地:实际规模化应用仍取决于终端成本、功耗、模型可靠性及用户接受度等因素。 架构优化解决了"能不能跑",成本与功耗决定的是"多少人愿意用"。这两件事之间,还隔着一段距离。 特别

about image
亚运会:时隔12年再封王!王祉怡逆转山口茜,国羽3-0横扫日本夺冠 山东高速男篮新赛季球迷见面会将于10月6日济南举办