Bonsai Image 4B 发布:本地图像生成模型可在 iPhone 17 Pro Max 上运行

126次阅读
没有评论

共计 1463 个字符,预计需要花费 4 分钟才能阅读完成。

看点

IT 之家 5 月 27 日消息,PrismML 昨日 (5 月 26 日) 发布公告, 宣布推出 Bonsai Image 4B 系列图像生成模型,…

重点阅读

9.4 秒生成 512×512 图像,Bonsai Image 4B 生图 AI 登陆苹果 iPhone 17 Pro Max

Bonsai Image 4B 把“手机本地生图”又向前推了一步。PrismML 宣布推出 Bonsai Image 4B 系列图像生成模型, 主打在本地设备上运行, 其中在 iPhone 17 Pro Max 生成一张 512×512 图像约需 9.4 秒。

📌 两种版本: 一个追求极限压缩, 一个兼顾画质

此次发布的 Bonsai Image 4B 并不是单一模型, 而是分为 1-bit Bonsai Image 4B 与 Ternary Bonsai Image 4B 两个版本。前者重点是尽可能压缩模型体积, 后者则在保持小体积的基础上, 提升画面质量和对提示词的还原能力。

从定位来看,1-bit 版本更适合对存储、内存极其敏感的设备;Ternary 版本则更像是体积与效果之间的折中方案, 适合希望本地运行但又不愿明显牺牲生成质量的场景。

这类模型的核心看点, 不只是“能生成图片”, 而是能否在手机、笔记本等本地设备上以可接受速度和资源占用完成生成。

🔍 压缩关键: 改变扩散 Transformer 权重表示

Bonsai Image 4B 基于 LUX.2 Klein 4B 构建, 整体架构保持不变, 主要改动集中在扩散 Transformer 的权重表示方式上。

  • 1-bit 版本:采用二值权重, 权重集合为 {-1,+1}, 配合 FP16 分组缩放后, 单权重等效位宽为 1.125bit。
  • Ternary 版本:采用三值权重, 权重集合为 {-1,0,+1}, 等效位宽为 1.71bit, 表示能力更灵活。

这种设计让模型在不大幅改动架构的情况下显著缩小体积。以 1-bit 版本为例, 其二值层相较全精度 Transformer 权重缩小至约十四分之一, 最终 Transformer 体积为 0.93GB; 相比 7.75GB 的全精度 FLUX.2 Klein 4B, 整体约为后者的八分之一左右。

💡 内存和速度: 本地设备运行门槛明显降低

模型体积变小之外,运行时内存占用也大幅下降。生成 512×512 图像时,1-bit 与 Ternary 版本平均活跃内存分别为 1.5GB 和 1.96GB; 作为对比, 全精度 FLUX.2 Klein 4B 为 11.74GB。

  • iPhone 17 Pro Max 生成 512×512 图像约需 9.4 秒;
  • Mac M4 Pro 上生成 512×512 图像约需 6 秒;
  • 在 Mac M4 Pro 平台, 最高可比全精度 MFLUX 流水线快 5.6 倍。

📊 质量评测: 小体积下保留大部分准确性

这组数据说明,极限量化并不意味着完全放弃质量。对于移动端和边缘设备来说, 只要生成效果达到可用范围, 低内存、低体积和离线运行的价值会被进一步放大。

🚀 行业观察: 端侧生图正在从演示走向实用

过去, 图像生成模型往往依赖云端算力,本地运行通常受到模型体积、内存占用和生成速度限制。Bonsai Image 4B 的发布, 显示出端侧 AI 图像生成正在向更轻量、更可部署的方向发展。

  • 隐私优势:本地生成可减少图片提示词和生成过程上传云端的需求。
  • 离线能力:在网络不稳定或无网络环境下, 端侧模型仍有应用空间。
  • 应用想象:手机修图、创意草图、社交内容生成、轻量设计工具都可能受益。

当然, 当前数据仍来自模型发布方披露,实际体验还会受到设备散热、系统调度、应用集成方式等因素影响。但从体积、内存和速度指标看,Bonsai Image 4B 已经为“手机本地生图”提供了一个值得关注的新样本。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0