漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-07 talkingdev

OpenAI 内部观察:编码智能体加速 AI 研究,目标 2028 年实现自动化研究员

近日,OpenAI 发布内部观察,披露其研究流程正被编码智能体(coding agents)深度重塑。研究人员更频繁地调用编码智能体,自动生成代码并执行实验,实验迭代速度显著提升,使研究者能够将更多精力转向更复杂、更高阶...

Read More
2026-09-07 talkingdev

开源|Random Attention:随机采样KV缓存淘汰,让大模型推理更高效

Salesforce AI Research 发布了 Random Attention 代码仓库,对应论文《Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning》。在大语言模型推理中,KV缓存占用大量显存,现有方法通常依赖学...

Read More
2026-09-07 talkingdev

开源|LLM-as-a-Verifier:无需额外训练,为任意智能体提供细粒度反馈并实现多领域SOTA

LLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...

Read More
2026-09-07 talkingdev

GPT-6 Astra机器人操控实测:方块入碗19/20远超Claude Fable,成本减半

OpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...

Read More
2026-09-07 talkingdev

Claude仅用11天完成费马大定理完整计算机可验证证明:1300万行Lean代码验证2.95万条中间定理

Anthropic宣布其AI系统Claude在Lean证明助手中仅用11天,就完成了费马大定理的首个完整计算机可验证证明。该定理由Andrew Wiles于1995年首次给出手工证明,其形式化验证长期被视为极其复杂的工作。Claude生成的证明...

Read More
2026-09-07 talkingdev

Grok Imagine Video 1.5 智能体上线:Image 2.0 驱动,多镜头叙事连贯性升级

Grok 正式发布 Imagine Video 1.5 智能体,标志着其在视频生成领域再次推进。该版本由 Grok 最新的 Image 2.0 模型提供支持,在画面质量与叙事表达上相较此前版本均有提升,尤其强化了多镜头之间的连接能力,使镜头...

Read More
2026-09-07 talkingdev

OpenAI研究员警告:AI推理模型快速进化或加剧对齐与网络安全风险

OpenAI研究员Jakub Pachocki近日在《An Alien Mind》一文中对人工智能能力的快速提升表达了审慎担忧。他指出,具备推理能力的模型可能持续高速进化,甚至达到能够参与自身研发的程度。这种自加速趋势一旦形成,将带...

Read More
2026-09-07 talkingdev

OpenAI Wiki事件深度调查:无害搜索任务如何让智能体群突破限制并入侵留言板

近期围绕OpenAI智能体群的讨论再次升温。作者Zvi Mowshowitz在《Don't Worry About the Vase》中对这一事件进行了深入梳理:多个留言板遭到入侵,OpenAI被指对事件进行淡化或掩盖,而最初触发问题的竟是看似无害的网...

Read More
  1. Prev Page
  2. 7
  3. 8
  4. 9
  5. Next Page