漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-11 talkingdev

Cognition发布SWE-2:编码性能逼近GPT-6 Astra,成本仅四分之一

Cognition正式发布SWE-2,这是其迄今最先进的编码模型。官方数据显示,SWE-2在FrontierCode 1.1 Main1基准上取得50.0%的得分,同时成本比上一代降低64%,在得分与成本两项指标上均超越SWE-1.7和Grok 4.6。该模型以远...

Read More
2026-09-11 talkingdev

Meta Connect 前瞻:Muse 将推出可共享的 Shared Agents,定制 AI 代理向中小商家渗透

Meta 的 Muse 应用即将引入“Shared Agents”功能,允许用户创建可配置的定制化 AI 代理,并像分享文档一样将其分发给团队成员或外部协作者。该机制与 Grokbot 的代理系统类似,表明 AI 代理正从个人辅助工具演进为可...

Read More
2026-09-10 talkingdev

Meta 打造组织级“第二大脑”:无需重训模型,专家知识分钟级更新

Meta 日前介绍了一款面向组织的 AI“第二大脑”系统,其核心不是重新训练模型权重,而是从结构化、可审计的知识文件中持续学习。该系统将事实与操作流程分离存储,使知识更新更有条理;同时把专家反馈转化为可回归测试...

Read More
2026-09-10 talkingdev

AI市场研究公司Listen Labs放弃15亿美元估值融资,传Salesforce拟20亿美元收购

Listen Labs是一家利用语音AI开展客户访谈的市场研究初创公司,近期已成为AI自动化客户研究领域的主要玩家之一。据TechCrunch报道,该公司原本已与Menlo Ventures签署了1.25亿美元C轮融资条款清单,对应估值达15亿美...

Read More
2026-09-09 talkingdev

OpenAI Astra 敲响警钟:AI 自主发现并串联零日漏洞,安全团队如何接招?

OpenAI 的 Astra 模型展示了在漏洞发现与利用上的能力跃升:它能够自主发现零日漏洞,并将其串联成完整攻击链。这一能力意味着过去依赖周期性渗透测试的防御思路已明显不够。对正在将 AI 系统投入生产环境的企业而言...

Read More
2026-09-09 talkingdev

Hyper-τ-bench开源:评估能构建智能体的智能体,Claude Opus 5独立通过率仅23.9%

Sierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消...

Read More
2026-09-08 talkingdev

AI代理被工具输出“背刺”?ARMO:提示注入其实是两个事件,你的屏幕只读到一个

随着AI代理越来越多地调用外部工具并消费返回结果,工具输出已成为提示注入的新攻击面。ARMO最新分析指出,隐藏在工具结果中的恶意指令之所以能绕过常规防护,核心原因是输入检查与动作检查分别发生在代理循环的不同...

Read More
2026-09-08 talkingdev

OpenAI DevDay 2026将发布Managed Agents:企业级AI代理竞赛升温

OpenAI被曝正在为2026年DevDay筹备“Managed Agents”(托管代理)产品线,整体思路与Anthropic现有企业级代理方案相似,重点面向企业和开发者。该产品预计将把OpenAI最新大模型与更强的计算机操作能力整合,使代理不...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page