共计 1228 个字符,预计需要花费 4 分钟才能阅读完成。
Qwen 还是看到了开源的好
手机 Agent 的竞争,正在从“谁先做出一台 AI 手机”, 转向“谁能成为手机厂商和应用生态都愿意接入的能力层”。阿里 Qwen-UI-Agent 近期展示了跨 App 执行长任务的能力, 也让外界重新关注开源模型在 AI 手机格局中的作用。
📌 从演示看,Qwen 瞄准的是跨 App 长任务
公开演示中,Agent 根据用户指令先进入短视频应用查找高收藏菜谱, 记录配料, 再切换到生鲜电商应用选择食材并预约送达时间。这个流程与此前豆包手机展示的“手机替用户打开 App、搜索、比较、下单”思路相近。
不同之处在于,豆包曾把能力放进工程机中进行产品化尝试, 而 Qwen-UI-Agent 目前更多以技术报告、项目页和演示形式呈现。也就是说,Qwen 展示的是一种可训练、可评测、可部署的模型能力, 并不等同于已经进入量产手机。
🔍 开源并非完整开放,MAI-UI 是关键底座
需要明确的是,Qwen-UI-Agent 并不是一次完整意义上的旗舰模型开源发布。已开放权重的是前身 MAI-UI 的 2B、8B 版本, 许可证为 Apache 2.0; 更大规模模型以及 Qwen-UI-Agent 旗舰权重, 目前并未开放下载。
从技术路径看,模型接收用户指令和屏幕状态, 判断下一步点击、滑动、输入或调用工具; 执行后再观察新页面, 继续推进任务。Qwen-UI-Agent 进一步把场景扩展到手机、电脑、浏览器、命令行和 API 等多种动作空间, 不再只依赖图形界面点击。
💡 成绩亮眼, 但真实落地仍有难题
更值得注意的是,报告也展示了失败案例: 例如在超市直播间按条件挑选商品未能完成, 或在发布朋友圈后没有成功修改可见范围。这类问题说明, 长任务一旦前面出现小偏差, 后续可能被不断放大。
- 支付、发帖、权限修改 等高风险操作, 用户容错率极低;
- Agent 读取屏幕、模拟点击, 容易触发应用风控;
- 即使用户授权, 也难以完全解决误操作后的责任归属;
- 超级 App 不愿让 Agent 绕过首页、推荐位和交易入口。
📊 手机厂商获得新的谈判筹码
豆包手机此前把系统级 Agent 推到真实用户面前,也率先撞上应用风控边界。后续有报道称, 新一代豆包手机面对头部应用时, 可能更多依赖应用主动提供 MCP 服务, 而不是单纯读取屏幕、模拟点击。
MCP 可以理解为应用对外提供的结构化工具: 哪些数据能读、哪些动作能做、哪些步骤必须用户确认,都由应用侧定义。这种方式更可控, 但也意味着 Agent 厂商必须与应用生态谈判。
在这个背景下,MAI-UI 的开放给手机厂商提供了第二个参照。厂商可以先用开源小模型做原型、积累数据、验证交互, 再决定与哪家模型公司合作。它不一定直接采用阿里的模型, 但独家报价权已经被削弱。
🚀 行业观察:AI 手机大概率会走混合路线
围绕“Qwen 还是看到了开源的好”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。