共计 1134 个字符,预计需要花费 3 分钟才能阅读完成。
“马嘉祺”终于被大模型“稳稳接住”了
一句话看点: 大模型并非总是“不懂中文”, 更多时候问题出在训练语料、后训练反馈和输出空间上。近期,ChatGPT 的“稳稳接住你”口癖与 MiniMax“说不出马嘉祺”的技术复盘, 让中文 AI 体验中的细微偏差再次被放到聚光灯下。
📌“稳稳接住你”为何成了 AI 味代表
在中文互联网语境里,ChatGPT 频繁使用“我会稳稳地接住你”一类表达 , 已经从贴心回复变成了网络热梗。它本意接近英文里的“I’ve got you”, 强调理解、支持和陪伴, 但直译到中文后显得过于用力, 甚至有些不自然。
这种现象并非单纯的翻译问题。 外媒讨论认为 , 它可能同时受到英文训练语料、中文翻译腔以及心理咨询式表达的影响。模型在强化学习中被奖励“温暖、支持、顺从”的回答, 久而久之, 某些句式就可能被过度放大。
🔍 MiniMax 并非不认识, 而是“说不出来”
与 ChatGPT 的口癖不同,MiniMax 此前被网友发现似乎“不认识马嘉祺”。相关问题在不同接口和平台上都能复现, 引发了不少调侃。不过 MiniMax 工程团队的排查显示, 模型并不是完全不了解这个名字, 而是在生成阶段出现了异常。
从技术链路看, 大模型会先把文字切分成 token, 再通过向量计算理解输入, 最后由输出层选择最可能生成的下一个 token。排查发现,“马嘉祺”可以被正常切分和还原, 输入侧表征也基本正常, 这解释了模型为什么仍能理解相关信息。
真正的异常出现在输出侧。 经过后训练后 ,“嘉祺”这个低频 token 在输出空间中的位置发生明显漂移, 周围混入特殊标记、噪声 token 等不相关内容, 导致模型在生成时难以稳定选中它。
💡 低频词和小语种更容易暴露训练盲区
- 输入正常: 模型可能“看得懂”某个词或名字, 相关语义仍然保留。
- 输出异常: 生成时对应 token 概率不稳定, 可能被采样过滤或被相近错误 token 替代。
- 影响外溢: 小语种对话中混入其他语言, 也可能与输出表征混淆有关。
为修复问题,MiniMax 并未只针对“马嘉祺”补少量样本 , 而是尝试提高词表在后训练中的整体覆盖度。材料中提到的做法可概括为用合成数据让大量 token 在训练中重新获得稳定信号, 类似网友戏称的“罚抄”。
📊 行业观察: 中文体验正在考验大模型细节能力
这两件事看似一个是语言风格, 一个是技术 bug, 但共同指向一个现实: 大模型的中文能力不只是“能不能回答”, 还包括是否自然、准确、稳定, 以及是否能处理低频但真实存在的表达。
对于用户而言,AI 的细小口癖会迅速变成“人机味”的证据 ; 对于模型厂商而言, 低频 token 漂移则提醒后训练不能只优化高频任务和主流语料。中文名、人名、饭圈词、小语种、方言化表达, 都可能成为检验模型质量的边缘样本。