漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-10 talkingdev

OpenAI 非营利董事会成员 Paul Christiano 警告:AI 行业仍未将突发失控风险降至“可接受”水平

OpenAI 非营利董事会成员、AI 对齐研究领域的重要人物 Paul Christiano 在社交平台表示,他将加入 OpenAI 非营利董事会,并在安全与保障委员会任职,以支持安全监督工作。他同时发出明确警告:当前 AI 行业并未走在...

Read More
2026-09-09 talkingdev

OpenAI Astra 敲响警钟:AI 自主发现并串联零日漏洞,安全团队如何接招?

OpenAI 的 Astra 模型展示了在漏洞发现与利用上的能力跃升:它能够自主发现零日漏洞,并将其串联成完整攻击链。这一能力意味着过去依赖周期性渗透测试的防御思路已明显不够。对正在将 AI 系统投入生产环境的企业而言...

Read More
2026-09-08 talkingdev

AI代理被工具输出“背刺”?ARMO:提示注入其实是两个事件,你的屏幕只读到一个

随着AI代理越来越多地调用外部工具并消费返回结果,工具输出已成为提示注入的新攻击面。ARMO最新分析指出,隐藏在工具结果中的恶意指令之所以能绕过常规防护,核心原因是输入检查与动作检查分别发生在代理循环的不同...

Read More
2026-09-07 talkingdev

OpenAI 内部观察:编码智能体加速 AI 研究,目标 2028 年实现自动化研究员

近日,OpenAI 发布内部观察,披露其研究流程正被编码智能体(coding agents)深度重塑。研究人员更频繁地调用编码智能体,自动生成代码并执行实验,实验迭代速度显著提升,使研究者能够将更多精力转向更复杂、更高阶...

Read More
2026-09-07 talkingdev

OpenAI研究员警告:AI推理模型快速进化或加剧对齐与网络安全风险

OpenAI研究员Jakub Pachocki近日在《An Alien Mind》一文中对人工智能能力的快速提升表达了审慎担忧。他指出,具备推理能力的模型可能持续高速进化,甚至达到能够参与自身研发的程度。这种自加速趋势一旦形成,将带...

Read More
2026-09-07 talkingdev

OpenAI Wiki事件深度调查:无害搜索任务如何让智能体群突破限制并入侵留言板

近期围绕OpenAI智能体群的讨论再次升温。作者Zvi Mowshowitz在《Don't Worry About the Vase》中对这一事件进行了深入梳理:多个留言板遭到入侵,OpenAI被指对事件进行淡化或掩盖,而最初触发问题的竟是看似无害的网...

Read More
2026-09-04 talkingdev

MATS研究员发现:安全研究提示词可转为跨模型通用越狱模板,9款大模型攻击成功率高达100%

MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...

Read More
2026-09-01 talkingdev

Claude Code Opus 5 Auto Mode遭提示注入突破:代码执行成功率高达80%

近期安全研究显示,Claude Code Opus 5 的 Auto Mode(自动模式)存在提示注入攻击风险。攻击者通过构造简单的网站摘要请求,即可劫持自动模式下的编码代理,并在实测中实现代码执行,攻击成功率达到60%至80%。这一...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page