共计 1103 个字符,预计需要花费 3 分钟才能阅读完成。
预填充吞吐超 330 Token/s: 高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型
建议按 ” 变化—原因—影响 ” 的顺序阅读。
在夏威夷时间 9 月 22 日开幕的 2026 骁龙峰会上,高通公布了一项面向手机端的端侧 AI 合作成果: 联合阶跃、无量火及江波龙, 基于第六代骁龙 8 超级至尊版移动平台, 完成对阶跃 StepEdge-Omni 30B-MoE 模型的端侧适配与推理优化, 并现场演示了相关智能体助手。
📌 背景: 手机跑大模型, 卡在内存和带宽
长期以来,大参数模型在手机端落地面临两道门槛: 一是运行内存占用过高, 二是推理过程中的计算与带宽压力过大。此次合作正是围绕这两个痛点展开。
StepEdge-Omni 30B-MoE 拥有300 亿参数, 但采用混合专家架构, 并非每次推理都激活全部参数, 而是根据任务需要只调用部分专家模块, 从而压低计算量和内存带宽需求。这一架构思路, 是模型能够塞进手机的关键前提。
🔍 核心信息: 内存降幅超 50%, 吞吐指标公布
据高通介绍,合作方通过推理引擎、异构调度及存储方案三个层面的优化 , 使该模型的运行内存需求较行业常规方案 降低超过 50%, 并支持在智能手机上稳定运行。
性能方面, 测试数据显示:
- 预填充吞吐性能超过 每秒 330 个 Token, 即模型在预填充阶段每秒可处理超过 330 个输入词元;
- 解码吞吐性能超过 每秒 28 个 Token, 对应模型逐词生成输出的速度。
预填充吞吐是衡量系统处理长提示词和批量请求能力的重要指标,这一数值意味着模型在面对较长输入时具备可用的响应效率。
💡 能做什么: 不依赖云端的本地智能体
高通表示,该方案无需调用云端服务, 可在本地完成多种任务, 包括邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等。
换句话说,用户的数据不必离开设备即可完成处理, 这为低时延和隐私保护型智能体应用提供了新的可能。
📊 行业观察: 规模化仍有多重变量
业内人士认为,大参数 MoE 模型在手机端部署, 有助于推动低时延和隐私保护型智能体应用发展。但也要看到, 从演示到规模化落地之间仍有距离。
实际规模化应用仍取决于终端成本、功耗、模型可靠性及用户接受度等因素, 端侧 AI 的普及不会一蹴而就。
对高通而言,此次合作展示了第六代骁龙 8 超级至尊版在端侧 AI 上的承载能力; 对模型方和存储方案商来说, 则是一次从“能跑”到“跑得稳”的联合验证。后续终端厂商如何跟进、功耗表现能否经受日常使用考验, 将是观察重点。
🚀 总结
300 亿参数模型跑进手机,配合内存占用减半和可观的吞吐数据, 让端侧智能体的想象空间进一步打开。但从技术演示到用户手中的实际体验, 仍需在成本、功耗与可靠性上持续打磨。