漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升至 99.9%。更值得关注的是,Astra 在 96% 的关卡中完成任务所需行动次数少于人类中位数,显示出高效的推理与规划能力。研究显示,Astra 能够将陌生环境压缩为紧凑的符号化世界模型,把游戏机制抽象为逻辑规则,并自行发明简写来跟踪状态和制定计划。这一能力表明模型不只是进行模式匹配,而是在进行结构化抽象和因果推断。该进展对衡量通用人工智能的抽象推理水平具有重要意义,也预示着大模型在复杂任务规划、自主决策和科学发现等领域的应用潜力进一步扩大。

核心要点

  • GPT-6 Astra 在 ARC-AGI-3 半私有集标准测试中取得 62.7%,达到当前最优水平
  • 使用 provider adapter 适配器后成绩达到 99.9%,并在 96% 关卡中行动次数少于人类中位数
  • 模型将陌生环境转化为符号世界模型,用逻辑规则表示游戏机制并自主规划

Read more >