微信扫码实时跟踪AI前沿
MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...
大语言模型(LLM)的自我改进一直是人工智能领域的核心挑战,而基于可验证奖励的强化学习(RLVR)在过去主要局限于数学、代码等存在明确对错判定的封闭式任务。来自COLM 2026的最新研究RLSVR突破了这一限制,提出通...