Epoch AI推出了名为MirrorCode的基准测试,专门用于评估人工智能在长周期编程任务中的自主重写能力。该基准要求AI模型在完全无法访问原始源代码的情况下,从零开始重新实现完整的软件程序,以此衡量AI在复杂、持续性...
Read More财富科技公司Wealthfront近日披露了其在AI辅助代码审查领域长达数年的探索历程。团队最初对“AI编码只是高级自动补全”的说法充满怀疑,但随后的实验促使他们将AI深度融入代码生命周期。该工程团队构建了一套结构化方...
Read More大语言模型(LLM)的自我改进一直是人工智能领域的核心挑战,而基于可验证奖励的强化学习(RLVR)在过去主要局限于数学、代码等存在明确对错判定的封闭式任务。来自COLM 2026的最新研究RLSVR突破了这一限制,提出通...
Read More微软在GitHub上开源了一款名为Orchard的Agentic建模框架,旨在为智能体研究提供一种统一且可移植的基础设施。Orchard的核心是一个轻量级的、Kubernetes原生的环境服务,它向上层暴露了一套通用的原语,且不对上层的...
Read MoreOpenAI日前披露的未公开模型Astra一口气解决了数学界十个长期悬而未决的开放问题,再次刷新了人们对AI在高级推理领域潜力的认知。长期以来,数学一直是大型语言模型的软肋,人们习惯嘲笑AI连基础运算都频繁出错。然...
Read MoreOpenAI 近期公开了其低延迟实时语音系统 GPT-Live 的技术细节,展示了一套仅用六个月构建的全新架构。区别于传统的轮流发言模式,GPT-Live 采用了全双工语音模型,能够实现一边聆听一边发言的连续对话,大幅减少了交...
Read MoreOpenAI 宣布对旗下 GPT-5.6 系列模型进行新一轮价格调整,进一步推动企业级 AI 应用的价格性能比前沿。其中,轻量版 GPT-5.6 Luna 输入价格降至每百万 token 0.20 美元,输出降至 1.20 美元,降幅高达 80%;均衡版 T...
Read MoreGoogle Chrome Labs 近日在 GitHub 上开源了一个名为 use-webmcp-tool 的 React Hook,旨在通过实验性的 WebMCP 规范,将应用内部功能以可调用工具的形式暴露给运行在浏览器端的人工智能智能体。该项目的核心创新在...
Read More