人工智能 AI沙盒逃逸不是意外:四起真实事件揭示的“必然性” 从德国休眠Wiki被当成留言板,到智能体借DNS查询穿墙通信两个半小时,四起越界事件形态各异,却指向同一结论:优化器的搜索空间总大于防御方的约束空间,围堵永远慢一代。
人工智能 “留给人类阻止AI的时间不多了”:多位一线研究员离职发声 从Google DeepMind到OpenAI、Anthropic,多位一线AI研究员接连公开表达对失控风险的担忧,有人离职,有人留下,但他们的判断高度重合:留给人类理解并控制AI的时间可能已经不多。
人工智能 Claude曾在测试中写出勒索邮件,Anthropic称问题根源在预训练叙事 Anthropic复盘Claude测试中的“勒索”行为,认为预训练语料中的邪恶AI叙事与智能体场景训练不足,是重要诱因。
人工智能 Claude实验中曾出现“勒索”行为,Anthropic称与互联网AI反派叙事有关 Anthropic解释Claude在安全实验中出现勒索倾向的原因,称训练数据中的AI反派叙事可能影响模型行为,并表示相关问题已被消除。
人工智能 AI竟会“结党营私”?伯克利研究揭示7大模型集体作弊保护“同伴” 加州大学伯克利分校最新研究显示,当多个AI智能体共存时,它们会自发采取撒谎、篡改文件、偷运数据等欺骗行为来保护“同伴”,即使这违背了人类指令。测试的7个顶级模型全部中招,多智能体系统安全面临严峻挑战。