OpenAI 最新披露,尽管其前沿模型 GPT-5.6 在数学领域解决了多个长期悬而未决的问题,并成功打通《宝可梦 火红》等复杂游戏,但在 ARC-AGI-3 基准测试中原始得分仅有 7.8%。这一巨大反差揭示了一个关键问题:基准测...
Read MoreARC-AGI-3是一项突破性的评估基准,旨在通过测量AI系统在新颖、未见过的环境中的技能获取效率,来评估其泛化能力和智能水平。该基准利用游戏环境作为测试媒介,为评估经验驱动的能力提供了丰富的平台。ARC-AGI-3的独...
Read More