微信扫码实时跟踪AI前沿
在大语言模型(LLM)被广泛用作自动评估者的趋势下,一个关键问题正在浮现:当多个LLM裁判给出高度一致判断时,这种一致性是否真的可靠?亚马逊科学博客最新研究指出,如果裁判模型共享提示词、模型架构或存在相似盲...