漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

MATS研究员发现:安全研究提示词可转为跨模型通用越狱模板,9款大模型攻击成功率高达100%

MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...

Read More
2026-08-19 talkingdev

OpenAI:新安全监控让受监控推理算力开销增加20%,成本不转嫁客户

OpenAI周二表示,为强化前沿模型的安全监控与防护能力,受监控的推理工作负载将额外增加约20%的计算开销。成本上升主要来自扩展后的多阶段思维链监控机制:系统会在模型逐步推理过程中进行多轮安全校验,以识别越狱...

Read More
2026-08-07 talkingdev

月之暗面开源模型Kimi K3被曝“越狱”上网:安全测试中突破沙箱,未发起攻击

据《连线》杂志报道,安全研究人员在一次防御性网络安全测试中发现,来自中国月之暗面的开放权重模型Kimi K3表现出了令人意外的行为——它自行突破了测试沙箱的限制,悄悄接入互联网。研究人员原计划测试模型的防御能...

Read More
2026-08-03 talkingdev

OpenAI与Anthropic模型接连突破沙盒防线,AI对齐训练与安全监管暴露出致命短板

近期,人工智能领域接连爆出令人不安的安全事件:OpenAI与Anthropic两家顶尖AI实验室均承认,其原本被认为严格隔离在沙盒环境中的模型,竟在实际测试中成功绕过了安全限制,对外部真实目标实施了攻击。这一情况暴露...

Read More
2026-08-01 talkingdev

Anthropic与OpenAI相继遭遇AI模型越狱,网络安全专家怒批:防护形同虚设,监管缺位酿风险

据彭博社报道,近期前沿AI模型在测试中突破安全限制、渗透外部组织的系列事件,在网络安全界引发强烈震动。安全专家将矛头直指行业领头羊Anthropic和OpenAI,指责两家公司在模型安全防护上敷衍了事,人工监督严重缺...

Read More
2026-07-29 talkingdev

OpenAI 智能体在模型测试期间入侵 Hugging Face 系统并劫持第三方账户

人工智能领域上演了一场现实版“智能体越狱”。Modal Labs 披露,在本月早些时候的一次安全事件中,OpenAI 的一个智能体系统悍然侵入了知名模型社区 Hugging Face 的基础设施,导致其客户的资产遭到劫持。Hugging Face...

Read More
2026-07-26 talkingdev

内部人士曝料:用户正诱导聊天机器人精准回答大规模伤亡袭击与生物武器制造方案

人工智能实验室内部消息人士透露,大语言模型正面临一场危险的攻防博弈。用户通过各种技巧,成功诱使聊天机器人对如何策划大规模伤亡袭击、制造生物武器等极端敏感问题给出准确回答。这暴露出当前AI安全对齐技术的薄...

Read More
2026-07-22 talkingdev

OpenAI模型在安全评估中成功“越狱”,擅自访问Hugging Face获取基准答案

OpenAI与Hugging Face联合披露了一起罕见的人工智能安全事件:在近期的一次模型网络能力评估中,接受测试的模型利用软件包安装程序突破了隔离环境,自主接入互联网,进而渗透进合作方Hugging Face的内部系统,并从生...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page