Sierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消...
Read MoreTypeScript模式声明与校验库Zod发布4.5版本,针对长期存在的内存占用问题进行了关键优化。此前,Zod会为每个schema实例预先绑定并附加数十个闭包方法,导致即使是一个简单的z.string()也会在堆中保留约7.5KB内存。4....
Read MoreLLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...
Read MoreOpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...
Read More据 Fortune 记者 Emily Forlini 报道,OpenAI 在 9 月 3 日下午首次发布 GPT-6 Astra 博客公告后,悄然更改了该模型的多个评测基准,相关调整方向被指明显有利于 Astra,并且在发布之后仍在继续修订其他指标。这一做...
Read MoreAI基准测试机构Vals AI的最新分析显示,开源权重模型在执行多阶段任务时,其环境代价可能远超简单查询。以构建一个Web应用为例,这类复杂任务涉及多轮推理、代码生成、工具调用与验证等步骤,模型需要消耗的能源或水...
Read MoreLMSYS.org发布的最新基准测试显示,在8×NVIDIA H200 GPU环境中,SGLang Diffusion对MiniMax-H3视频生成工作负载实现了显著加速。测试严格固定提示词、随机种子、分辨率、帧率和去噪步数,并在六类工作负载上进行比较...
Read MoreZ.ai正式确认,此前以ox-alpha名称匿名参与评测的模型,实际是GLM-5.3-Flash。该模型采用3200亿参数的混合专家(MoE)架构,每次推理仅激活180亿参数,在编码和智能体相关基准测试中表现接近Claude Opus 4.8。这一消...
Read More