共计 1267 个字符,预计需要花费 4 分钟才能阅读完成。
AI 对话可能正在告别“你一句、我一句”的回合制。 由前 OpenAI 首席技术官 Mira Murati 创立的 Thinking Machines Lab, 近期公布了 TML-Interaction-Small, 将重点放在实时、多模态的人机协作上, 而不只是继续堆叠参数与算力。
📌 从文本问答转向实时协作
当前多数 AI 产品仍接近“邮件式”交互: 用户输入后等待模型生成, 再进入下一轮沟通 。材料中指出, 这种方式会损失语气、停顿、表情和环境变化等信息, 也难以应对真正连续的人类协作场景。
Thinking Machines Lab 试图解决的正是这个问题。其新模型 TML-Interaction-Small 被描述为一个原生面向实时交互的多模态模型, 参数规模为 2760 亿, 采用混合专家架构, 推理时活跃参数约为 120 亿。报告称, 该模型可同时处理听、看、想、说, 并将交互延迟压低到约 0.4 秒。
🔍 核心变化: 把交互能力做进模型内部
传统多模态系统往往由多个模块拼接而成, 例如语音识别、语言模型、语音合成和视觉识别分别工作 , 再通过流程串联。材料认为, 这种“外挂式”架构会带来延迟, 也会在各环节丢失信息。
- 微轮转机制: 将连续音视频切分为约 200 毫秒的片段, 让模型在极短周期内同步接收与输出。
- 原生多模态: 音频与画面信息更早进入统一模型, 减少串行处理带来的时差。
- 双轨系统: 前台模型负责快速响应, 复杂任务可交由后台异步处理。
- 流式会话优化: 通过保留会话序列降低频繁内存分配的开销, 相关优化已贡献给 SGLang 框架。
💡 主动视觉与时间感成为评测重点
材料中提到,TML 团队还引入了一些传统模型不太擅长的新评测维度 。例如, 用户要求 AI 每隔 4 秒提醒一次深呼吸,TML-Small reportedly 能取得超过 60% 的准确率, 而部分现有模型在类似任务中表现不佳。
另一个值得注意的方向是主动视觉。 不同于必须听到唤醒词或明确指令才“看”的语音助手 ,TML-Small 被描述为可以持续关注屏幕或环境变化, 并在用户达成目标时主动给出提示。这类能力如果成熟, 将让 AI 更接近“在场”的助手, 而不是被动回复工具。
📊 可能影响哪些应用场景
- 数字员工: 客服和销售场景可根据用户语气、停顿和反应调整表达节奏。
- 空间计算:AR 眼镜或头显中的智能体可结合用户所见内容进行提示、翻译或辅助操作。
- 游戏互动:NPC 有望摆脱固定脚本, 基于玩家行为进行更自然的即时反馈。
- 具身智能: 机器人需要连续感知和决策, 低延迟交互架构可能更适配现实环境。
🚀 仍需观察的限制
材料也提到, TML 在报告中承认该路线仍存在挑战 , 包括超长会话中的上下文管理, 以及对高质量网络环境的依赖。公司还计划在今年晚些时候推出更大规模模型, 但具体效果仍要等待更多公开测试和实际产品验证。
围绕“她曾掌舵 OpenAI 技术, 如今要颠覆 OpenAI 的规则”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。