核心信息

OpenAI 发布了一套新的框架,用于追踪、调查并公开披露模型失对齐(misalignment)事件,并明确了披露标准与时间表,即使相关行为尚未完全解释或缓解。

要点

  • 该框架规定了 OpenAI 披露失对齐案例的条件和时间表。
  • 更复杂的案例可能需要更长时间调查,或与第三方协调处理。
  • OpenAI 表示将优先披露能揭示新型失对齐机制、已知行为发生重大变化,或挑战现有安全假设的发现。