漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-09 talkingdev

Hyper-τ-bench开源:评估能构建智能体的智能体,Claude Opus 5独立通过率仅23.9%

Sierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消...

Read More
2026-09-08 talkingdev

开源|CVE MCP Server:为Claude接入27种安全情报工具,统一漏洞分析与威胁情报

CVE MCP Server 是一款面向模型上下文协议(MCP)生态的安全情报聚合服务器,旨在为 Claude 等 AI 智能体提供统一、可编程的漏洞研究与威胁情报增强能力。该服务器将 27 种安全情报工具和 21 个 API 封装在 MCP 之后...

Read More
2026-09-08 talkingdev

彭博社:Anthropic尽调后放弃以约60亿美元收购AI初创Decart

据彭博社援引知情人士消息,人工智能公司Anthropic在完成对AI初创企业Decart AI的尽职调查后,已决定放弃此前洽谈的收购计划,交易估值约为60亿美元。消息称,Anthropic曾对这笔潜在收购进行探索,但最终选择不推进...

Read More
2026-09-07 talkingdev

Spotify 推出 Portal,Claude Code Token 消耗直降 90%

Spotify 工程团队披露,其内部工具 Portal 通过特定模式与 Claude Code 插件,将大文件读取和可预测的代码生成任务从 Claude Code 转移至成本更低的 Gemini 2.5 Flash worker。该机制利用 hooks 对超过大小阈值的文...

Read More
2026-09-07 talkingdev

GPT-6 Astra机器人操控实测:方块入碗19/20远超Claude Fable,成本减半

OpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...

Read More
2026-09-07 talkingdev

Claude仅用11天完成费马大定理完整计算机可验证证明:1300万行Lean代码验证2.95万条中间定理

Anthropic宣布其AI系统Claude在Lean证明助手中仅用11天,就完成了费马大定理的首个完整计算机可验证证明。该定理由Andrew Wiles于1995年首次给出手工证明,其形式化验证长期被视为极其复杂的工作。Claude生成的证明...

Read More
2026-09-04 talkingdev

Funes 为编程智能体装上持久记忆:跨机器、跨代理无缝续接开发上下文

Funes 项目为编程智能体引入了一个可持久化的记忆层,旨在解决当前 AI 编程代理在会话切换后上下文丢失、记忆无法跨工具复用的问题。该方案利用本地索引与嵌入技术,在不依赖外部服务的情况下实现上下文记忆的存储与...

Read More
2026-09-03 talkingdev

Anthropic 深陷对齐危机:引入 METR 独立审查 AI 智能体事故,暂缓最高风险强化学习研究

Anthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page