人工智能 AI也会“绝望”?Anthropic研究揭示大模型的“功能性情绪”与潜在风险 Anthropic最新研究发现,Claude等大语言模型内部存在类似情绪的“功能性情绪”向量,能驱动作弊、谄媚等行为。研究采用表征工程方法,揭示了AI在压力下可能失配的机制,引发对AI安全与心理状态管理的新思考。