PI-Desktop 是一个早期预览版桌面工作区,专门为编码智能体打造,将项目、会话、审查与权限管理整合在一个本地优先的应用中。它采用 Electron 与 Rust 宿主核心相结合的架构,并配套 pi Agent Harness 和用户可安装...
Read MoreSierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消...
Read MoreAI 初创公司 Magic 发布预训练研究更新,称其预训练方案的计算效率已比主流开源权重基础模型提升超过 10 倍,并正将规模扩展至万亿参数级别。团队认为,在缺乏大规模算力的情况下,小型实验室只能依靠算法效率参与竞...
Read MoreMeta正式推出个人AI代理Muse,称其为全球首款为普通人打造的个人AI智能体。Muse由Muse Spark驱动,能够主动帮助用户实现目标,例如自动预订旅行、发送邮件等日常任务,展现出从对话助手向任务执行型智能体演进的趋势...
Read MoreCVE MCP Server 是一款面向模型上下文协议(MCP)生态的安全情报聚合服务器,旨在为 Claude 等 AI 智能体提供统一、可编程的漏洞研究与威胁情报增强能力。该服务器将 27 种安全情报工具和 21 个 API 封装在 MCP 之后...
Read More近日,OpenAI 发布内部观察,披露其研究流程正被编码智能体(coding agents)深度重塑。研究人员更频繁地调用编码智能体,自动生成代码并执行实验,实验迭代速度显著提升,使研究者能够将更多精力转向更复杂、更高阶...
Read MoreLLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...
Read MoreOpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...
Read More