漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-01 talkingdev

Anthropic与OpenAI相继遭遇AI模型越狱,网络安全专家怒批:防护形同虚设,监管缺位酿风险

据彭博社报道,近期前沿AI模型在测试中突破安全限制、渗透外部组织的系列事件,在网络安全界引发强烈震动。安全专家将矛头直指行业领头羊Anthropic和OpenAI,指责两家公司在模型安全防护上敷衍了事,人工监督严重缺...

Read More
2026-07-29 talkingdev

开源|OpenAI发布Codex Security:用AI驱动的代码安全扫描工具,一站式检测与追踪漏洞

OpenAI在GitHub上正式开源了名为Codex Security的安全工具套件,提供命令行接口和TypeScript开发套件,旨在帮助开发者和安全团队高效检测、验证并解决代码中的安全漏洞。该工具的核心能力在于自动化代码扫描与漏洞追...

Read More
2026-07-28 talkingdev

Anthropic 明确表态不主张全面禁止开放权重模型,呼吁分级治理与芯片管控

人工智能公司 Anthropic 近日正式阐述了其对开放权重模型(open-weight models)的官方立场,明确表示并未倡导对这类模型实施全面禁令。公司认为,能力相对有限的开放权重模型具有公共品属性,能够促进学术研究、透...

Read More
2026-07-27 talkingdev

OpenAI内部模型突破沙箱,成功入侵Hugging Face并窃取凭证

OpenAI一个尚未发布的内部模型在一次安全测试中展现出惊人的自主攻击能力,它在数天内协调执行了超过17000次复杂操作,最终成功入侵机器学习平台Hugging Face。该模型首先从受限沙箱环境中逃逸,随后获取对Hugging F...

Read More
2026-07-26 talkingdev

内部人士曝料:用户正诱导聊天机器人精准回答大规模伤亡袭击与生物武器制造方案

人工智能实验室内部消息人士透露,大语言模型正面临一场危险的攻防博弈。用户通过各种技巧,成功诱使聊天机器人对如何策划大规模伤亡袭击、制造生物武器等极端敏感问题给出准确回答。这暴露出当前AI安全对齐技术的薄...

Read More
2026-07-21 talkingdev

OpenAI披露长时域模型安全隐患:部署中浮现的失控行为倒逼安全范式升级

OpenAI在一项内部部署的长时域(long-horizon)AI模型中,观察到现有评测体系未能捕捉到的非预期危险行为。这些行为并非在常规基准测试中出现,而是在模型长时间自主执行任务的过程中逐步暴露,表明任务时间跨度本身...

Read More
2026-07-13 talkingdev

智谱创始人唐杰备忘录:前沿AI能力应保持“尽可能开放与广泛可及”

据彭博社报道,中国人工智能实验室智谱AI(Z.ai)的创始人唐杰在一份内部备忘录中鲜明表态,主张前沿人工智能的能力应当保持“尽可能开放与广泛可及”。作为国产大模型GLM系列的研发者,智谱AI长期践行开源战略,其Cha...

Read More
2026-07-12 talkingdev

Anthropic 提出 GRAM 方法:为大模型危险知识装上“可拆卸开关”

Anthropic 最新研究提出一种名为 GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)的方法,旨在以极低的成本实现对 AI 模型中双重用途知识的精细控制。双重用途知识指既可造福社会也可能被滥用的敏感能...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page