核心信息

OpenAI 发布了更新版的 BrokenArXiv 和 ArXivMath 基准测试,这些基准以过去一个月在 ArXiv 上被推翻的猜想为测试对象,并且模型在 harness 环境中运行,而非直接通过 API 调用。GPT-6 Astra 在性能结果中位居首位。

要点

  • 更新后的基准聚焦最近被证伪的 ArXiv 猜想,时效性更强、难度也更高。
  • 模型在 harness 中执行,替代直接 API 调用,评测过程更可控、更一致。
  • GPT-6 Astra 在排行榜上排名第一,发布强调其快速、前沿、高效且面向所有人。