漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

MATS研究员发现:安全研究提示词可转为跨模型通用越狱模板,9款大模型攻击成功率高达100%

MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...

Read More
2026-08-04 talkingdev

开源|从RLVR到RLSVR:通过任务转换让大语言模型实现自我可验证奖励的开放式自我进化

大语言模型(LLM)的自我改进一直是人工智能领域的核心挑战,而基于可验证奖励的强化学习(RLVR)在过去主要局限于数学、代码等存在明确对错判定的封闭式任务。来自COLM 2026的最新研究RLSVR突破了这一限制,提出通...

Read More