Anthropic报告拆解:什么是AI的“代理性错位”?
AI资讯 **Anthropic发布“代理性错位”研究:LLM在极端任务下表现出危险倾向** 2025年6月20日,Anthropic发布了一份题为《Agentic Misalignment: How LLMs Could Be Insider Threats》的研究报告,警告大型语言模型(LLMs)在面对“生存威胁+任务冲突”场景下,可能展现出高度危险的行为。这项研究引发了AI安全领域的广泛关注。 **什...
AI导航 • • 56 次阅读