核心信息

LatchBio 对 Grok 4.6 进行了生物安全监测与对抗性生物任务评估,结果显示该模型能够正确识别并拒绝危险查询,即使这些查询经过恶意混淆,同时仍可回答有益的科学问题。

要点

  • Grok 4.6 能有效识别并拦截危险的生物相关请求,包括经过混淆的对抗性尝试。
  • 有益的科学查询仍可正常回答,体现了兼顾安全与可用性的平衡策略。
  • 完整结果与讨论见 LatchBio 的博客文章。