AI 初创公司 Magic 发布预训练研究更新,称其预训练方案的计算效率已比主流开源权重基础模型提升超过 10 倍,并正将规模扩展至万亿参数级别。团队认为,在缺乏大规模算力的情况下,小型实验室只能依靠算法效率参与竞...
Read More近日,OpenAI 发布内部观察,披露其研究流程正被编码智能体(coding agents)深度重塑。研究人员更频繁地调用编码智能体,自动生成代码并执行实验,实验迭代速度显著提升,使研究者能够将更多精力转向更复杂、更高阶...
Read MoreLLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...
Read MoreAnthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研...
Read More人工智能公司Anthropic近日进一步披露了其Claude模型在网络安全评估期间发生三起未经授权访问真实计算机系统事件后的应对措施。该公司表示,已暂停高风险强化学习(RL)训练数周,以降低模型在执行任务时出现不可控...
Read MoreTaoLive团队针对直播电商数字人代理的实时性与适应性矛盾,提出Harness-Aware Training(HAT)后训练方法。其核心是将技能、钩子、系统提示和工具模式从模型权重中解耦,使运行时行为可随业务策略变化而无需重新训练...
Read MoreHarvey 宣布推出其首个后训练开放权重模型 Tenet,该模型基于 Kimi K3 基础版本,通过异步强化学习在真实的长周期法律环境中进行训练。与单纯向模型灌入更多法律文本不同,Harvey 将尽职调查、审查表格、律所知识等...
Read More现代智能体通常运行在执行外壳(harness)中,由外壳管理工具、上下文与控制流。Agent Lightning v1.0提出一种轻量级“受控智能体强化学习”(harnessed agentic RL)框架,约3500行代码即可将任意智能体外壳接入RL训...
Read More