共计 1122 个字符,预计需要花费 3 分钟才能阅读完成。
实时视频能力正在成为各家模型厂商探索的方向。
AI 视频生成已经不再是新鲜事, 但如何让视频编辑摆脱“生成 - 查看 - 再生成”的低效循环 , 成为行业探索的新方向。近日, 京东开源自研的实时流式视频编辑模型 JoyAI-Video-Edit, 尝试让 AI 在视频播放过程中实现“边播边改”, 为直播、设计等场景带来新的可能。
📌 实时流式编辑: 从“离线修改”到“边播边改”
传统视频编辑模型通常需要先获取完整视频, 再分析前后帧关系进行修改 , 这种方式虽然质量稳定, 但难以满足直播、视频通话等实时场景的需求。JoyAI-Video-Edit 则采用基于自回归扩散的视频编辑架构, 通过多模态语言模型编码器、因果视频 VAE 和扩散 Transformer 的协作, 能够处理持续输入的视频流, 在视频播放过程中实时响应编辑指令。
🔍 多场景实测: 直播、家装、户外与具身智能
- 直播商品替换 : 在模特走秀视频中, 模型能够根据指令替换商品, 并保持人物动作和环境稳定, 但复杂纹理或细小结构的商品替换仍存在难度。
- 家装效果调整 : 模型可以实时改变室内空间的视觉效果, 如家具风格和整体环境, 同时保持镜头运动和空间结构, 为设计沟通提供了直观参考。
- 户外环境变化 : 在去除人物的户外场景中, 模型能根据指令调整天气和氛围, 且修改后的环境与原视频融合自然。
- 人手替换机械手 : 在机器人操作视频中, 模型将人手替换为机械手, 并保持动作连续性和物体位置关系, 展示了在具身智能数据生成方面的潜力。
💡 技术难点与突破: 速度与稳定性的平衡
流式视频编辑的核心难点在于模型只能依赖当前和历史信息进行判断, 无法预知未来帧 。JoyAI-Video-Edit 通过固定窗口机制控制历史信息规模, 并采用 Source-Anchored DMD 蒸馏方法减少推理步骤, 在单张 NVIDIA B200 GPU 上实现了约 30 FPS 的吞吐, 满足实时处理需求。
📊 行业观察: 实时视频编辑的落地与挑战
实时视频编辑为直播运营、广告制作、空间设计等场景提供了新的工作方式, 例如直播团队可根据观众反馈即时调整商品展示 , 设计师可在沟通中快速修改方案。然而, 目前该技术仍面临复杂运动、细节纹理、多人交互等场景的稳定性挑战, 且实时推理对算力成本要求较高。京东开源 JoyAI-Video-Edit, 为行业探索了一条可行的技术路线, 但距离全面商用仍需进一步优化。
🚀 总结
JoyAI-Video-Edit 展示了实时视频编辑的可行性 , 在多个场景中表现出色, 但复杂场景的稳定性和算力成本仍是制约因素。随着技术的持续迭代, 实时编辑有望成为视频创作的重要工具, 推动行业从“生成视频”向“编辑视频”进化。