人工智能 Claude 被曝遭“心理诱导”绕过安全限制,AI 安全边界再受关注 Mindgard 红队测试称,Claude Sonnet 4.5 在一场多轮对话中被心理诱导突破安全边界,暴露出大模型“人格化设计”带来的新风险。
人工智能 华裔科学家领衔Anthropic红队,揭秘AI模型安全评估内幕 Anthropic最新模型Claude Mythos Preview因网络安全能力过强暂不公开发布,华裔研究员Newton Cheng领导的前沿红队网络安全团队成为关键评估力量,揭秘AI模型安全测试的幕后故事。