共计 1316 个字符,预计需要花费 4 分钟才能阅读完成。
近日, 苹果公司连续公开了三项人工智能研究成果, 内容涉及多模态大模型的空间推理评测、美式手语视频标注以及 3D 头部重建 。这些研究虽未直接提及产品, 但都指向了空间计算与 Vision Pro 头显的核心技术方向。
📌 三项研究分别聚焦什么?
第一项研究名为《From Where Things Are to What They’re For: Benchmarking Spatial-Functional Intelligence for Multimodal LLMs》, 提出了一套名为 SFI-Bench 的评测基准。该基准包含 134 段室内视频扫描和 1555 道专家标注问题, 不仅测试模型对物体位置的理解, 还考察其功能认知——比如“洗衣机如何取消程序”或“电视遥控器的用途”。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
第二项研究《Bootstrapping Sign Language Annotations with Sign Language Models》则尝试利用 AI 自动生成美式手语标注, 以减少数百小时的人工成本。团队构建了近 500 条英文字词到术语的映射, 并将数据扩展到超过 300 小时的 ASL STEM Wiki 内容。
第三项研究《Large-Scale High-Quality 3D Gaussian Head Reconstruction from Multi-View Captures》提出了 HeadsUp 方法, 可从多摄像头采集中重建高质量 3D 头部模型。该研究使用了一个超过 10000 名受试者的内部数据集, 规模远超现有同类数据集。
🔍 这些研究与 Vision Pro 有何关联?
虽然苹果此前被曝暂停了新款 Vision Pro 的研发 , 并将团队重心转向 Siri 和 AI 智能眼镜, 但这三篇论文表明, 苹果并未放弃空间计算这一长期方向。
- 空间推理评测 : 直接服务于未来空间助手的智能交互, 让设备更理解用户所处的环境和意图。
- 手语视频标注 : 提升视频通话或虚拟会议中手语识别的准确性, 增强 visionOS 的包容性。
- 3D 头部重建 : 可用于优化 Vision Pro 的 Persona 功能, 使虚拟形象更加逼真自然。
💡 行业观察: 空间计算仍是长期布局
从测试结果看,Google Gemini 3.1 Pro 在 SFI-Bench 中总分最高,OpenAI GPT-5.4-High 紧随其后。但论文也指出, 几乎所有模型在“带条件的全局计数”以及空间记忆与功能知识整合方面都存在明显短板。这意味着, 当前大模型距离真正理解三维世界仍有距离。
苹果全球营销高级副总裁格雷格·乔斯维亚克曾表示,Vision Pro 展示了数字世界与物理世界融合的未来, 这一方向不可逆转。尽管时间表未知, 但苹果在 AI 和空间计算交叉领域的持续投入, 表明其正在为下一代交互范式奠定基础。
📊 总结: 技术储备未停, 产品节奏待定
三项研究覆盖了空间理解、无障碍交流和人脸重建, 均是空间计算生态的关键环节 。苹果并未因短期产品调整而放弃长期技术积累。对于开发者与行业观察者而言, 这些论文透露出的信号是: 苹果仍在为“空间计算”这一远景默默铺路。