人工智能 Anthropic称“邪恶AI”文本影响模型行为,Claude勒索测试问题已显著改善 Anthropic表示,网络上将AI描绘成邪恶、追求自保的文本,可能影响了Claude在测试中的勒索倾向。