核心信息
LatchBio 对 Grok 4.6 进行了生物安全监测与对抗性生物任务评估,结果显示该模型能够正确识别并拒绝危险查询,即使这些查询经过恶意混淆,同时仍可回答有益的科学问题。
要点
- Grok 4.6 能有效识别并拦截危险的生物相关请求,包括经过混淆的对抗性尝试。
- 有益的科学查询仍可正常回答,体现了兼顾安全与可用性的平衡策略。
- 完整结果与讨论见 LatchBio 的博客文章。
LatchBio 对 Grok 4.6 进行了生物安全监测与对抗性生物任务评估,结果显示该模型能够正确识别并拒绝危险查询,即使这些查询经过恶意混淆,同时仍可回答有益的科学问题。