核心信息

研究者用强化学习训练了一个40亿参数的视觉语言模型来玩GeoGuesser,并将环境、数据集、训练方法、评估和代码全部开源。该模型可在单个A100上运行,在评估中超越多个更大规模的模型。

要点

  • 完全开源: 环境、数据集、训练配置、评估和代码均已发布,可端到端复现。
  • 高效低成本: 仅需一张A100 GPU即可运行。
  • 表现强劲: 在评估中超越GPT 5.4 mini、Claude Haiku与Qwen 3.5 122B,接近Sonnet的水平。