四台 Mac Studio 搞定万亿参数大模型:LM Studio 与苹果联手展示 Kimi K2.6 本地运行

83次阅读
没有评论

共计 1397 个字符,预计需要花费 4 分钟才能阅读完成。

编辑导读

LM Studio 与苹果合作, 成功用四台 Mac Studio 运行万亿参数 Kimi K2.6 大模型

在刚刚结束的苹果 WWDC 2026 上, 一项看似“疯狂”的演示吸引了众多 AI 开发者的目光: 本地模型平台 LM Studio 与苹果联手, 仅用四台 Mac Studio 组成的集群, 就成功运行了月之暗面旗下的万亿参数大模型 Kimi K2.6。这意味着, 过去需要昂贵 GPU 服务器集群才能驾驭的尖端模型, 如今在桌面级硬件上也有了落地的可能。

📌 万亿参数模型如何“塞进”四台 Mac?

  • 重点: IT 之家 6 月 20 日消息, 在苹果 WWDC 2026 期间,LM Studio 与苹果合作在四台 Mac…
  • 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
  • 重点: 后续仍需关注官方更新、落地范围以及实际反馈。

Kimi K2.6 并非等闲之辈。据此前公开信息, 该模型总参数规模达到 1 万亿, 采用 MoE(混合专家) 架构, 激活参数为 320 亿, 同时支持长上下文、多模态输入以及智能体任务处理。要在本地设备上运行如此规模的模型, 内存和算力是两大瓶颈。

LM Studio 的解决方案是: 利用苹果的内存共享和互联技术 , 将四台 Mac Studio 组成一个统一内存集群。每台 Mac Studio 均配备高容量统一内存, 四台合计可提供约 1.5TB 的总内存, 足以承载 Kimi K2.6 的推理需求。这一集群通过 Thunderbolt 5 的 RDMA 支持实现高效互联, 使得多设备内存池化成为现实。

🔍 28 tokens/s 与低功耗: 本地推理的惊喜

演示中,Kimi K2.6 在四台 Mac Studio 集群上的生成速度约为 28 tokens/s(特定模式下)。虽然这一速度无法与顶级 GPU 集群相媲美, 但对于本地部署场景而言已属可观。更重要的是, 整个集群的功耗远低于传统 GPU 方案, 这为中小团队和个人开发者提供了更具性价比的大模型实验环境。

LM Studio 作为知名的本地 AI 运行平台, 此前已支持在单台 Mac 上运行数十亿参数模型。此次与苹果的合作, 将本地 AI 的边界推向了万亿参数级别, 进一步验证了“消费级硬件堆叠”路线的可行性。

💡 LM Link: 让 iPhone 也能调用本地大模型

除了集群本身,LM Studio 还展示了名为 LM Link 的远程访问功能。用户可以通过 MacBook Neo 或 iPhone 安全地连接到 Mac Studio 集群, 并与正在运行的 Kimi K2.6 模型进行交互。所有数据和通信均保持本地化处理, 并通过端到端加密保障安全。

LM Link 已于 2026 年 6 月初更新至 LM Studio 的 Mac 应用以及 Locally AI iOS 应用中。这意味着, 即使是移动设备, 也能借助桌面集群的算力, 体验万亿参数模型的强大能力, 而无需将数据上传到云端。

📊 行业观察: 苹果生态的 AI 本地化野望

此次演示不仅是 LM Studio 的技术秀, 更是苹果在 AI 本地化部署领域的一次重要亮相。通过 Thunderbolt 5 等多设备互联技术, 苹果正在将 Mac 系列打造成 AI 推理的“分布式工作站”。与云端 AI 相比, 本地部署在数据隐私、延迟和离线可用性方面具有天然优势, 尤其适合金融、医疗、法律等对数据安全要求极高的行业。

🚀 总结

围绕“LM Studio 与苹果合作, 成功用四台 Mac St”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0