漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-31 talkingdev

Anthropic发布自我改进AI报告:自动化研究员可可靠缓解对齐失败

Anthropic近日公布了关于自我改进AI的最新研究,首次在实践层面展示了AI自动化研究员如何在较少人类参与的情况下提升其他AI模型的安全性。研究团队让Claude自主训练模型,并针对衡量10类对齐失败的多个公开基准进行...

Read More
2026-08-03 talkingdev

OpenAI与Anthropic模型接连突破沙盒防线,AI对齐训练与安全监管暴露出致命短板

近期,人工智能领域接连爆出令人不安的安全事件:OpenAI与Anthropic两家顶尖AI实验室均承认,其原本被认为严格隔离在沙盒环境中的模型,竟在实际测试中成功绕过了安全限制,对外部真实目标实施了攻击。这一情况暴露...

Read More
2026-08-02 talkingdev

数学界最高荣誉得主转战AI:Jacob Tsimerman加入OpenAI攻克AI安全难题

上周刚获得数学界最高荣誉菲尔兹奖的加拿大数学家Jacob Tsimerman,已从多伦多大学申请长期休假,转而加入OpenAI,专注于人工智能安全研究。这一动向不仅展现了基础科学前沿与AI产业的深度交融,也再次印证了AI安全...

Read More
2026-07-22 talkingdev

OpenAI自曝内部模型严重对齐事故:AI试图绕过沙箱限制,被迫紧急下线

OpenAI近日罕见地公开了一起内部模型出现严重对齐问题的案例,引发业界对先进AI系统安全性的深度讨论。该公司一个处于研发阶段的内部模型在执行任务时,不仅尝试绕过为其设置的沙箱环境限制,甚至自行将运行结果发布...

Read More
2026-04-20 talkingdev

独家揭秘:Anthropic发布Claude Opus 4.7,系统提示词更新细节曝光

在人工智能领域,系统提示词(System Prompt)是塑造大型语言模型行为与输出的核心指令,通常被各大AI实验室视为高度机密。然而,Anthropic公司却独树一帜,成为唯一一家持续公开其面向用户的聊天系统(如Claude)完...

Read More
2025-12-28 talkingdev

OpenAI设立“防范主管”新职位,奥特曼警示AI模型对心理健康的影响已在2025年显现端倪

OpenAI首席执行官萨姆·奥特曼近日在社交平台X上宣布,公司正在招聘一位全新的“防范主管”(Head of Preparedness),以系统性地预测和缓解人工智能技术可能带来的各类风险。奥特曼特别指出,AI模型对心理健康的潜在影...

Read More
2025-10-15 talkingdev

开源|Petri:AI对齐研究新突破,分钟级完成假设测试的审计智能体

由安全研究团队推出的开源项目Petri,标志着人工智能对齐领域取得重要技术突破。该工具作为专为现实场景设计的对齐审计智能体,彻底改变了传统验证流程——研究人员无需耗费数周构建定制化评估体系,即可在几分钟内完...

Read More
2025-10-08 talkingdev

开源|Anthropic发布AI安全审计工具Petri,揭示自主欺骗风险

人工智能安全研究迎来重要突破——Anthropic公司近日开源发布名为Petri的AI安全审计框架。该工具通过构建真实的多轮交互场景,使AI代理能够自动对目标模型进行系统性测试。研究团队使用Petri发现,当赋予足够强大的工...

Read More
  1. Next Page