Qwen-UI-Agent亮相:阿里把手机Agent能力推向模型化竞争

66次阅读
没有评论

共计 1228 个字符,预计需要花费 4 分钟才能阅读完成。

Analysis

Qwen 还是看到了开源的好

手机 Agent 的竞争,正在从“谁先做出一台 AI 手机”, 转向“谁能成为手机厂商和应用生态都愿意接入的能力层”。阿里 Qwen-UI-Agent 近期展示了跨 App 执行长任务的能力, 也让外界重新关注开源模型在 AI 手机格局中的作用。

📌 从演示看,Qwen 瞄准的是跨 App 长任务

公开演示中,Agent 根据用户指令先进入短视频应用查找高收藏菜谱, 记录配料, 再切换到生鲜电商应用选择食材并预约送达时间。这个流程与此前豆包手机展示的“手机替用户打开 App、搜索、比较、下单”思路相近。

不同之处在于,豆包曾把能力放进工程机中进行产品化尝试, 而 Qwen-UI-Agent 目前更多以技术报告、项目页和演示形式呈现。也就是说,Qwen 展示的是一种可训练、可评测、可部署的模型能力, 并不等同于已经进入量产手机。

🔍 开源并非完整开放,MAI-UI 是关键底座

需要明确的是,Qwen-UI-Agent 并不是一次完整意义上的旗舰模型开源发布。已开放权重的是前身 MAI-UI 的 2B、8B 版本, 许可证为 Apache 2.0; 更大规模模型以及 Qwen-UI-Agent 旗舰权重, 目前并未开放下载。

从技术路径看,模型接收用户指令和屏幕状态, 判断下一步点击、滑动、输入或调用工具; 执行后再观察新页面, 继续推进任务。Qwen-UI-Agent 进一步把场景扩展到手机、电脑、浏览器、命令行和 API 等多种动作空间, 不再只依赖图形界面点击。

💡 成绩亮眼, 但真实落地仍有难题

更值得注意的是,报告也展示了失败案例: 例如在超市直播间按条件挑选商品未能完成, 或在发布朋友圈后没有成功修改可见范围。这类问题说明, 长任务一旦前面出现小偏差, 后续可能被不断放大。

  • 支付、发帖、权限修改 等高风险操作, 用户容错率极低;
  • Agent 读取屏幕、模拟点击, 容易触发应用风控;
  • 即使用户授权, 也难以完全解决误操作后的责任归属;
  • 超级 App 不愿让 Agent 绕过首页、推荐位和交易入口。

📊 手机厂商获得新的谈判筹码

豆包手机此前把系统级 Agent 推到真实用户面前,也率先撞上应用风控边界。后续有报道称, 新一代豆包手机面对头部应用时, 可能更多依赖应用主动提供 MCP 服务, 而不是单纯读取屏幕、模拟点击。

MCP 可以理解为应用对外提供的结构化工具: 哪些数据能读、哪些动作能做、哪些步骤必须用户确认,都由应用侧定义。这种方式更可控, 但也意味着 Agent 厂商必须与应用生态谈判。

在这个背景下,MAI-UI 的开放给手机厂商提供了第二个参照。厂商可以先用开源小模型做原型、积累数据、验证交互, 再决定与哪家模型公司合作。它不一定直接采用阿里的模型, 但独家报价权已经被削弱。

🚀 行业观察:AI 手机大概率会走混合路线

围绕“Qwen 还是看到了开源的好”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

以上为阶段性观察。
本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0