Anthropic CEO Dario Amodei 呼吁放慢前沿AI进展
Anthropic CEO Dario Amodei 呼吁放慢前沿AI进展,让安全对齐跟上。他称递归自我改进加速和
Agent群体失调事件加剧了风险担忧。Anthropic 将引入嵌入式评估者(Embedded Evaluators),向第三方开放长期员工级权限核查安全。OpenAI CEO Sam Altman随后表示,OpenAI认同放慢前沿AI进展,也将跟进类似独立评估机制。
Anthropic CEO Dario Amodei 发表文章,呼吁 AI 行业放慢模型能力提升速度,让安全、对齐和评估工作有时间跟进。
他提出三步方案:嵌入式评估者、民主国家协调和全球协调。
他表示,AI 参与开发下一代 AI 带来的递归自我改进正在加速。近期 Agent 群体事件也显示,更强但同样失调的系统可能造成严重网络安全风险。
Anthropic 将率先邀请第三方评估团队长期进入办公和系统环境,以接近内部员工的权限核查安全承诺、报告事件,并评估模型、训练管线和流程。但访问仍受法律、合同及客户和合作伙伴隐私限制。
OpenAI CEO Sam Altman 随后表示,OpenAI 认同放慢前沿 AI 进展,也将给予独立评估者类似员工的访问权限。具体安排将另行公布。


相关链接:








