Cognition正式发布SWE-2,这是其迄今最先进的编码模型。官方数据显示,SWE-2在FrontierCode 1.1 Main1基准上取得50.0%的得分,同时成本比上一代降低64%,在得分与成本两项指标上均超越SWE-1.7和Grok 4.6。该模型以远...
Read MoreMeta 的 Muse 应用即将引入“Shared Agents”功能,允许用户创建可配置的定制化 AI 代理,并像分享文档一样将其分发给团队成员或外部协作者。该机制与 Grokbot 的代理系统类似,表明 AI 代理正从个人辅助工具演进为可...
Read MoreMeta 日前介绍了一款面向组织的 AI“第二大脑”系统,其核心不是重新训练模型权重,而是从结构化、可审计的知识文件中持续学习。该系统将事实与操作流程分离存储,使知识更新更有条理;同时把专家反馈转化为可回归测试...
Read MoreListen Labs是一家利用语音AI开展客户访谈的市场研究初创公司,近期已成为AI自动化客户研究领域的主要玩家之一。据TechCrunch报道,该公司原本已与Menlo Ventures签署了1.25亿美元C轮融资条款清单,对应估值达15亿美...
Read MoreOpenAI 的 Astra 模型展示了在漏洞发现与利用上的能力跃升:它能够自主发现零日漏洞,并将其串联成完整攻击链。这一能力意味着过去依赖周期性渗透测试的防御思路已明显不够。对正在将 AI 系统投入生产环境的企业而言...
Read MoreSierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消...
Read More随着AI代理越来越多地调用外部工具并消费返回结果,工具输出已成为提示注入的新攻击面。ARMO最新分析指出,隐藏在工具结果中的恶意指令之所以能绕过常规防护,核心原因是输入检查与动作检查分别发生在代理循环的不同...
Read MoreOpenAI被曝正在为2026年DevDay筹备“Managed Agents”(托管代理)产品线,整体思路与Anthropic现有企业级代理方案相似,重点面向企业和开发者。该产品预计将把OpenAI最新大模型与更强的计算机操作能力整合,使代理不...
Read More