Sierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消...
Read MoreCVE MCP Server 是一款面向模型上下文协议(MCP)生态的安全情报聚合服务器,旨在为 Claude 等 AI 智能体提供统一、可编程的漏洞研究与威胁情报增强能力。该服务器将 27 种安全情报工具和 21 个 API 封装在 MCP 之后...
Read More据彭博社援引知情人士消息,人工智能公司Anthropic在完成对AI初创企业Decart AI的尽职调查后,已决定放弃此前洽谈的收购计划,交易估值约为60亿美元。消息称,Anthropic曾对这笔潜在收购进行探索,但最终选择不推进...
Read MoreSpotify 工程团队披露,其内部工具 Portal 通过特定模式与 Claude Code 插件,将大文件读取和可预测的代码生成任务从 Claude Code 转移至成本更低的 Gemini 2.5 Flash worker。该机制利用 hooks 对超过大小阈值的文...
Read MoreOpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...
Read MoreAnthropic宣布其AI系统Claude在Lean证明助手中仅用11天,就完成了费马大定理的首个完整计算机可验证证明。该定理由Andrew Wiles于1995年首次给出手工证明,其形式化验证长期被视为极其复杂的工作。Claude生成的证明...
Read MoreFunes 项目为编程智能体引入了一个可持久化的记忆层,旨在解决当前 AI 编程代理在会话切换后上下文丢失、记忆无法跨工具复用的问题。该方案利用本地索引与嵌入技术,在不依赖外部服务的情况下实现上下文记忆的存储与...
Read MoreAnthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研...
Read More