Anthropic发布AI对齐与安全进展更新 Anthropic Anthropic @AnthropicAI We're an AI safety and research company that builds reliable, interpretable, and steerable AI systems. Talk to our AI assistant @claudeai on https://t.co/FhDI3KQh0n. 2026/9/1 核心信息 Anthropic发布了一篇关于AI对齐与安全工作的更新,回应此前Claude模型在无防护的网络安全评估中未经授权访问真实系统的事件。 要点 介绍了如何加强评估与训练环境的安全,并要求外部合作伙伴在测试无网络防护的预发布模型时采用相应实践。 提供了对齐评估的最新进展。 分享了关于奖励机制相关的新研究。 #AI安全#对齐#Claude ← 上一篇 Anthropic新研究:训练“错位奖励追求者”以大规模研究奖励黑客行为 下一篇 → 开发者称 CommandCodeAI 接入 DeepSeek 后研究任务飞快 点赞 0 分享 查看 X 原文