核心信息

谷歌DeepMind与普林斯顿大学在《自然·机器智能》发表开放获取论文,提供因果证据表明:大模型会用置信度引导自身行为——增强或抑制置信度会改变模型选择作答还是弃答。

要点

  • 大模型并非被动报告置信度,而是会利用它来影响是否回答的决策。
  • 通过因果干预置信度可以直接改变模型行为,为提升可靠性提供了更清晰的路径。
  • 论文为开放获取,研究结果和方法可免费供研究者和开发者使用。