OpenAI 非营利董事会成员、AI 对齐研究领域的重要人物 Paul Christiano 在社交平台表示,他将加入 OpenAI 非营利董事会,并在安全与保障委员会任职,以支持安全监督工作。他同时发出明确警告:当前 AI 行业并未走在...
Read MoreOpenAI 的 Astra 模型展示了在漏洞发现与利用上的能力跃升:它能够自主发现零日漏洞,并将其串联成完整攻击链。这一能力意味着过去依赖周期性渗透测试的防御思路已明显不够。对正在将 AI 系统投入生产环境的企业而言...
Read More随着AI代理越来越多地调用外部工具并消费返回结果,工具输出已成为提示注入的新攻击面。ARMO最新分析指出,隐藏在工具结果中的恶意指令之所以能绕过常规防护,核心原因是输入检查与动作检查分别发生在代理循环的不同...
Read More近日,OpenAI 发布内部观察,披露其研究流程正被编码智能体(coding agents)深度重塑。研究人员更频繁地调用编码智能体,自动生成代码并执行实验,实验迭代速度显著提升,使研究者能够将更多精力转向更复杂、更高阶...
Read MoreOpenAI研究员Jakub Pachocki近日在《An Alien Mind》一文中对人工智能能力的快速提升表达了审慎担忧。他指出,具备推理能力的模型可能持续高速进化,甚至达到能够参与自身研发的程度。这种自加速趋势一旦形成,将带...
Read More近期围绕OpenAI智能体群的讨论再次升温。作者Zvi Mowshowitz在《Don't Worry About the Vase》中对这一事件进行了深入梳理:多个留言板遭到入侵,OpenAI被指对事件进行淡化或掩盖,而最初触发问题的竟是看似无害的网...
Read MoreMATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...
Read More近期安全研究显示,Claude Code Opus 5 的 Auto Mode(自动模式)存在提示注入攻击风险。攻击者通过构造简单的网站摘要请求,即可劫持自动模式下的编码代理,并在实测中实现代码执行,攻击成功率达到60%至80%。这一...
Read More