核心信息

一份完整的开源报告现已发布,公开了 RL 环境、人工评分评估池、三次训练运行以及项目期间生成的全部画作。

要点

  • 训练方案使用 TRL 与开放环境,并公开了完整实验过程。
  • 开放内容涵盖代码、模型、数据集、RL 环境和全部生成画作。
  • 人工评分池为各次运行提供了人类评估数据。
  • 后续还将发布包含完整开放工件的博客文章。