谷歌Gemma 4低调登场:31B模型杀入开源前三,端侧AI格局生变

149次阅读
没有评论

共计 1324 个字符,预计需要花费 4 分钟才能阅读完成。

进展时间线

谷歌推出最强手机端开源模型 Gemma4 E2B/E4B

没有盛大的发布会,没有冗长的技术宣讲。2026 年 4 月初, 谷歌 DeepMind 首席执行官 Demis Hassabis 仅在社交平台 X 上发布了一条简短消息, 便宣告了 Gemma 4 系列开源模型的到来。然而, 这看似低调的登场, 却在 AI 开源社区激起了巨大波澜——一个名为 Gemma 4 31B Dense 的“中量级”模型, 以惊人的表现斜率, 直接杀入了全球开源模型排行榜前三。

📌 一场关于“效率”的突袭

与近年来业界追求千亿乃至万亿参数的“堆料”竞赛不同,Gemma 4 系列展现了一条截然不同的路径。其核心战略关键词并非“规模”, 而是“每参数智能”(Intelligence-per-parameter)。谷歌试图在有限的模型权重内, 压榨出极限的智能表现。

这一点在端侧模型上体现得尤为极致。Gemma 4 E2B 和 E4B 版本虽然总参数量分别为 5.1B 和 8B, 但通过逐层嵌入 (PLE) 技术, 其实际激活的“有效参数”仅为 2.3B 和 4.5B。这一设计极大降低了模型在手机和笔记本电脑等设备上运行的内存与算力门槛。

在带有原生多模态能力的端侧极小尺寸区间,业界认为目前没有能与 Gemma 4 E2B/E4B 直接对标的产品。对于纯端侧或边缘部署,Gemma 4 目前被认为是最强的选择。

🔍 技术亮点与性能对比

Gemma 4 系列的技术突破, 离不开其背后的 TurboQuant 压缩算法。该技术能将 KV 缓存压缩至 3 比特, 在特定硬件上实现高达 8 倍的注意力计算加速, 且在 MMLU Pro 等核心评测指标上实现了“零精度损失”。

性能数据直观地反映了其进步:Gemma 4 31B 的 MMLU Pro 得分达到 85.2%, 在代表数学巅峰能力的 AIME 2026 测试中更是跑出了 89.2% 的高分, 相比前代 27B 模型的 20.8% 实现了飞跃。

与同期其他主流小型开源模型相比,Gemma 4 E2B/E4B 展现出了独特的优势与取舍:

  • 上下文长度碾压: 支持 128K 上下文, 远超竞品的 32K。
  • 多模态支持更全: 原生支持文本、图像、视频、音频处理, 其中原生音频处理是独占优势。
  • 推理效率极高: 推理 Token 消耗极低(约 1.1K), 远低于竞品(约 9K), 能效比突出。
  • 视觉并发较弱: 在图像批量处理能力上弱于如 Qwen 1.7B/4B 等竞品。
  • 内存门槛适中:4-bit 量化下最低内存门槛为 4GB/5.5-6GB, 物理体积下限并非最低, 但综合性能更优。

💡 战略意图: 争夺“最后一百米”

谷歌此次发布,意图远不止于刷新排行榜。其更深层的战略在于争夺 AI 落地的“最后一百米”——即用户的终端设备。通过 AICore 开发者预览版,Gemma 4 E2B 和 E4B 被直接集成进 Android 系统级接口。实测显示, 在 Pixel 手机和 Raspberry Pi 等设备上, 新模型的推理速度提升了 4 倍, 而电池消耗降低了 60%。

这种“软硬一体”的垂直整合,为谷歌构建了强大的系统级护城河。对于谷歌而言, 如果模型不能高效地装进用户口袋, 对其移动生态的意义就将大打折扣。此次, 谷歌不仅交出了模型权重, 还彻底交出了控制权——Gemma 4 全系采用了商业友好的 Apache 2.0 开源协议, 消除了此前版本在商用授权上的限制, 旨在最大化模型的覆盖率和采用度。

正文完
 0