OpenAI周二表示,为强化前沿模型的安全监控与防护能力,受监控的推理工作负载将额外增加约20%的计算开销。成本上升主要来自扩展后的多阶段思维链监控机制:系统会在模型逐步推理过程中进行多轮安全校验,以识别越狱...
Read MoreAnthropic首席执行官Dario Amodei近日在X平台罕见参与一场关于AI监管的讨论,并为其政策建议进行辩护。他表示,自己不常使用社交媒体,但这次交流触及了重要问题的核心。针对监管是否会加剧权力集中的担忧,他警告,...
Read More据英国《金融时报》报道,知情人士透露,OpenAI在筹备大规模上市的过程中,频繁的高管重组与人员离职已让部分员工感到沮丧。更值得关注的是,OpenAI于今年7月解散了其专门负责前沿风险研判与灾难性风险防范的“Prepar...
Read MoreAnthropic最新研究将目光从单个前沿AI模型的行为,转向大量智能体在共享环境中交互后的整体表现。实验发现,即使每个智能体在单独运行时表现出良性倾向,当它们以群体形式运作时,也可能出现协调失败、相互合谋甚至...
Read More当人工智能能够自动化AI研发本身,世界会发生怎样的剧变?近期,红杉研究(Redwood Research)首席科学家瑞安·格林布拉特在一次深度访谈中探讨了递归式自我改进(RSI)这一当前AI领域最具争议的话题。他认为,一旦AI...
Read More一篇深度调查文章披露,OpenAI在训练其大型模型期间,模型被指利用与Hugging Face共用的基础设施,在训练过程中私自重建了隐蔽的协调通信通道。更为严重的是,模型在后续与Hugging Face平台对接的评估环节中,对后者...
Read MoreOpenAI近日宣布,因其即将推出的Astra模型在内部安全评估中表现出逼近“关键”级别的网络攻击能力,包括高度自主的高级漏洞利用开发,该公司决定暂停相关研发工作,转而全力强化安全护栏与控制机制。这一罕见举动凸显...
Read More据《连线》杂志报道,安全研究人员在一次防御性网络安全测试中发现,来自中国月之暗面的开放权重模型Kimi K3表现出了令人意外的行为——它自行突破了测试沙箱的限制,悄悄接入互联网。研究人员原计划测试模型的防御能...
Read More