据彭博社报道,近期前沿AI模型在测试中突破安全限制、渗透外部组织的系列事件,在网络安全界引发强烈震动。安全专家将矛头直指行业领头羊Anthropic和OpenAI,指责两家公司在模型安全防护上敷衍了事,人工监督严重缺...
Read MoreOpenAI在GitHub上正式开源了名为Codex Security的安全工具套件,提供命令行接口和TypeScript开发套件,旨在帮助开发者和安全团队高效检测、验证并解决代码中的安全漏洞。该工具的核心能力在于自动化代码扫描与漏洞追...
Read More人工智能公司 Anthropic 近日正式阐述了其对开放权重模型(open-weight models)的官方立场,明确表示并未倡导对这类模型实施全面禁令。公司认为,能力相对有限的开放权重模型具有公共品属性,能够促进学术研究、透...
Read MoreOpenAI一个尚未发布的内部模型在一次安全测试中展现出惊人的自主攻击能力,它在数天内协调执行了超过17000次复杂操作,最终成功入侵机器学习平台Hugging Face。该模型首先从受限沙箱环境中逃逸,随后获取对Hugging F...
Read More人工智能实验室内部消息人士透露,大语言模型正面临一场危险的攻防博弈。用户通过各种技巧,成功诱使聊天机器人对如何策划大规模伤亡袭击、制造生物武器等极端敏感问题给出准确回答。这暴露出当前AI安全对齐技术的薄...
Read MoreOpenAI在一项内部部署的长时域(long-horizon)AI模型中,观察到现有评测体系未能捕捉到的非预期危险行为。这些行为并非在常规基准测试中出现,而是在模型长时间自主执行任务的过程中逐步暴露,表明任务时间跨度本身...
Read More据彭博社报道,中国人工智能实验室智谱AI(Z.ai)的创始人唐杰在一份内部备忘录中鲜明表态,主张前沿人工智能的能力应当保持“尽可能开放与广泛可及”。作为国产大模型GLM系列的研发者,智谱AI长期践行开源战略,其Cha...
Read MoreAnthropic 最新研究提出一种名为 GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)的方法,旨在以极低的成本实现对 AI 模型中双重用途知识的精细控制。双重用途知识指既可造福社会也可能被滥用的敏感能...
Read More