共计 1376 个字符,预计需要花费 4 分钟才能阅读完成。
撸猫撸出 SOTA!3 个 00 后 2 个月, 造出史上最快流式音视频社交模型
建议按 ” 变化—原因—影响 ” 的顺序阅读。
一觉醒来,AI 圈的新潮流变成了“养猫”? 这并非玩笑 。一家名为 Catnip(猫薄荷) 的中国初创团队, 仅用两个月时间, 便打造出流式音视频社交模型 MaineCoon(缅因猫), 在速度、成本和质量上全面碾压现有方案, 迅速引发业界关注。
📌 速度与成本双杀: 单卡 H100 跑出 47.5 FPS
- 重点: 速度快 7 倍, 成本只有 Veo 3 的 1 /2000
- 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
- 重点: 后续仍需关注官方更新、落地范围以及实际反馈。
MaineCoon 拥有 22B 参数,却能在单张 H100 上实现 47.5 FPS 的推理速度, 是同类流式模型的 7 倍以上。即使在成本仅为 H100 一半的 RTX Pro 6000 上, 也能稳定保持 30 FPS 以上。生成 10 秒短视频, 首帧在 3 秒内出现, 随后流式输出, 延迟极低。成本方面更是惊人: 每秒生成成本控制在 0.001 美元以内,GPU 满载时低至 0.00025 美元, 仅为 Google Veo 3 的 1 /2000、字节 Seedance 的 1 /560。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
🔍 社交场景专属优化: 活人感与无限时长
与通用视频模型不同,MaineCoon 专为社交交互设计 , 强调“活人感”。它实现了三方面突破: 音视频流式生成, 亚秒级首帧输出, 音画同步, 支持实时指令切换; 业界最快推理, 单卡部署, 速度是轻量级模型(1.3B) 的 2 倍以上; 无限时长生成, 连续生成 10 分钟以上, 画质、一致性和音画同步不崩, 架构上可无限延伸。在自建基准 SocialVideo Bench 上,MaineCoon 综合得分 0.934, 超越 SoulX-FlashTalk 等 7 款主流模型, 刷新 SOTA。
💡 三层训练 + 三层推理: 技术拆解
MaineCoon 的成功源于创新的训练和推理框架。训练分三步: 自重采样解决训练与推理间的偏差, 让模型适应不完美历史帧; 流式表征对齐利用冻结的 V -JEPA 2 编码器加速音画联合训练; 域感知偏好优化 + 强化在线策略蒸馏针对不同社交场景训练专家模型, 再统一蒸馏。推理侧采用 Agentic 框架, 包含三个智能控制器:Director 负责叙事规划与质量纠错, 防止畸变;Cache Manager 管理 KV 缓存, 保留长期记忆锚点;Buffer Controller 控制前瞻缓冲区, 平衡实时性与响应延迟。整个模型在 64 张 H100 上训练, 仅用 10k GPU 小时和不到 100 万条数据, 效率极高。
📊 从模型到平台:Catnip 的社交世界野心
Catnip 首次提出“社交世界模型”概念,以人为中心 , 模拟社交行为并实时生成音视频。MaineCoon 仅是渲染层的突破, 下一步将实现全双工实时双向交互, 并落地为可交互内容平台。这支 10 人团队(含 3 位 00 后) 的视野和执行力, 正为 AI 社交开辟新路径。值得注意的是,Catnip 已获 LTX 官方主动寻求合作, 其技术路线和商业前景值得持续关注。
“你以为你在撸猫,其实猫也在撸你。”MaineCoon 的社交互动哲学, 或许正是未来 AI 交互的缩影。这一成果不仅展示了中国年轻创业团队的创新能力, 也预示着低成本、高实时性的社交 AI 即将进入大众视野。