漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

在大语言模型(LLM)被广泛用作自动评估者的趋势下,一个关键问题正在浮现:当多个LLM裁判给出高度一致判断时,这种一致性是否真的可靠?亚马逊科学博客最新研究指出,如果裁判模型共享提示词、模型架构或存在相似盲点,它们的高度相关输出会显著高估评估置信度。为此,研究团队提出一种依赖感知聚合方法,不再简单进行加权多数投票,而是同时建模每个裁判的可靠性以及裁判之间的成对相关性,并对高度相关的意见进行折扣,以确保评审团反映真正的视角多样性。该研究在三个评估任务上验证,相比加权多数投票,该方法将准确率提升了9%至14%。这一进展对大模型评估、排行榜构建和AI系统对齐具有实用意义,提示业界在采用LLM-as-a-Judge时需关注裁判独立性,而非仅看表面一致。

核心要点

  • 多个LLM裁判高度一致可能因共享提示、架构或盲点而高估置信度
  • 依赖感知聚合方法同时建模裁判可靠性与成对相关性,折扣高度相关意见
  • 在三个评估任务中准确率比加权多数投票提升9%至14%

Read more >