核心信息
研究团队构建了一套类似“模型卡”的标准化框架,用于记录AI行为失范事件,并发布了论文与演示。团队正在寻找独立机构长期运营该注册库,并负责与模型提供商跟进。
要点
- 提出结构化“事件卡”格式,提高AI事故与异常行为的透明度。
- 建议字段包括事件发生/发现/报告日期、行为出现频率,以及该行为是在评测还是RL训练阶段出现。
- 目前项目在寻找能全职维护注册库的机构,并与模型提供商进行后续沟通。
研究团队构建了一套类似“模型卡”的标准化框架,用于记录AI行为失范事件,并发布了论文与演示。团队正在寻找独立机构长期运营该注册库,并负责与模型提供商跟进。