核心信息
OpenAI 发布了一套新的框架,用于追踪、调查并公开披露模型失对齐(misalignment)事件,并明确了披露标准与时间表,即使相关行为尚未完全解释或缓解。
要点
- 该框架规定了 OpenAI 披露失对齐案例的条件和时间表。
- 更复杂的案例可能需要更长时间调查,或与第三方协调处理。
- OpenAI 表示将优先披露能揭示新型失对齐机制、已知行为发生重大变化,或挑战现有安全假设的发现。
OpenAI 发布了一套新的框架,用于追踪、调查并公开披露模型失对齐(misalignment)事件,并明确了披露标准与时间表,即使相关行为尚未完全解释或缓解。