核心信息
Hugging Face 联合创始人 Clement Delangue 宣布两项 AI 安全举措:启动由 Thom Wolf 和 Hugging Face 主导的“开放对齐计划”,并申请加入 Anthropic CEO Dario Amodei 刚承诺的“嵌入式评估员”项目。
要点
- 开放对齐计划旨在以公开方式解决 AI 对齐问题,而不是局限于少数前沿实验室的内部。
- Anthropic 单方面承诺为第三方评估员提供永久、员工级系统访问权限,以核实安全措施、报告事件并评估训练过程中的对齐情况。
- 此举呼应 Dario Amodei 的文章《我们必须为前沿减速》,该文主张 AI 行业应放缓步伐并提出三部分计划。