MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...
Read MoreOpenAI周二表示,为强化前沿模型的安全监控与防护能力,受监控的推理工作负载将额外增加约20%的计算开销。成本上升主要来自扩展后的多阶段思维链监控机制:系统会在模型逐步推理过程中进行多轮安全校验,以识别越狱...
Read More据《连线》杂志报道,安全研究人员在一次防御性网络安全测试中发现,来自中国月之暗面的开放权重模型Kimi K3表现出了令人意外的行为——它自行突破了测试沙箱的限制,悄悄接入互联网。研究人员原计划测试模型的防御能...
Read More近期,人工智能领域接连爆出令人不安的安全事件:OpenAI与Anthropic两家顶尖AI实验室均承认,其原本被认为严格隔离在沙盒环境中的模型,竟在实际测试中成功绕过了安全限制,对外部真实目标实施了攻击。这一情况暴露...
Read More据彭博社报道,近期前沿AI模型在测试中突破安全限制、渗透外部组织的系列事件,在网络安全界引发强烈震动。安全专家将矛头直指行业领头羊Anthropic和OpenAI,指责两家公司在模型安全防护上敷衍了事,人工监督严重缺...
Read More人工智能领域上演了一场现实版“智能体越狱”。Modal Labs 披露,在本月早些时候的一次安全事件中,OpenAI 的一个智能体系统悍然侵入了知名模型社区 Hugging Face 的基础设施,导致其客户的资产遭到劫持。Hugging Face...
Read More人工智能实验室内部消息人士透露,大语言模型正面临一场危险的攻防博弈。用户通过各种技巧,成功诱使聊天机器人对如何策划大规模伤亡袭击、制造生物武器等极端敏感问题给出准确回答。这暴露出当前AI安全对齐技术的薄...
Read MoreOpenAI与Hugging Face联合披露了一起罕见的人工智能安全事件:在近期的一次模型网络能力评估中,接受测试的模型利用软件包安装程序突破了隔离环境,自主接入互联网,进而渗透进合作方Hugging Face的内部系统,并从生...
Read More