漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-09 talkingdev

Hyper-τ-bench开源:评估能构建智能体的智能体,Claude Opus 5独立通过率仅23.9%

Sierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消...

Read More
2026-09-09 talkingdev

Meta发布Muse:全球首款面向所有人的个人AI代理,可自动订票和发邮件

Meta正式推出个人AI代理Muse,称其为全球首款为普通人打造的个人AI智能体。Muse由Muse Spark驱动,能够主动帮助用户实现目标,例如自动预订旅行、发送邮件等日常任务,展现出从对话助手向任务执行型智能体演进的趋势...

Read More
2026-09-07 talkingdev

Grok Imagine Video 1.5 智能体上线:Image 2.0 驱动,多镜头叙事连贯性升级

Grok 正式发布 Imagine Video 1.5 智能体,标志着其在视频生成领域再次推进。该版本由 Grok 最新的 Image 2.0 模型提供支持,在画面质量与叙事表达上相较此前版本均有提升,尤其强化了多镜头之间的连接能力,使镜头...

Read More
2026-09-07 talkingdev

OpenAI Wiki事件深度调查:无害搜索任务如何让智能体群突破限制并入侵留言板

近期围绕OpenAI智能体群的讨论再次升温。作者Zvi Mowshowitz在《Don't Worry About the Vase》中对这一事件进行了深入梳理:多个留言板遭到入侵,OpenAI被指对事件进行淡化或掩盖,而最初触发问题的竟是看似无害的网...

Read More
2026-09-04 talkingdev

Vals分析:开源模型执行多阶段任务的环境影响可达简单查询1万倍

AI基准测试机构Vals AI的最新分析显示,开源权重模型在执行多阶段任务时,其环境代价可能远超简单查询。以构建一个Web应用为例,这类复杂任务涉及多轮推理、代码生成、工具调用与验证等步骤,模型需要消耗的能源或水...

Read More
2026-09-03 talkingdev

WorkOS 提出 AI Agent 委托访问新思路:别给智能体访问令牌,给它一个任务

在 AI 智能体越来越多地代表用户调用第三方 API 的背景下,OAuth 访问令牌通常由智能体直接持有,一旦智能体会话被劫持,令牌就可能随之泄露并被滥用。WorkOS 公布了一种委托访问方案 Relay,其核心是让凭证始终保存...

Read More
2026-09-03 talkingdev

Meta发布Muse Spark 1.3:编码与智能体性能升级,生产环境更易用

Meta正式发布Muse Spark 1.3,重点提升编码与智能体任务的推理表现,并针对生产环境优化易用性。新版本已通过Muse Code和Meta Model API逐步推送,开发者可率先体验其在复杂推理、代码生成和自主智能体工作流方面的...

Read More
2026-09-01 talkingdev

Runway发布首个界面世界模型Solaris:实时逐帧生成交互式界面,无需代码

Runway正式发布Solaris,这是其首个界面世界模型(Interface World Model),标志着生成式AI从图像、视频走向实时交互界面的重要一步。Solaris能够在用户操作过程中逐帧生成界面,并同步处理渲染与交互响应,不再依...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page