漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

现代智能体通常运行在执行外壳(harness)中,由外壳管理工具、上下文与控制流。Agent Lightning v1.0提出一种轻量级“受控智能体强化学习”(harnessed agentic RL)框架,约3500行代码即可将任意智能体外壳接入RL训练。其核心特点是:部署时的外壳拥有环境交互循环,训练器仅观察到LLM请求-响应对序列,这与传统智能体强化学习有本质区别,也带来了重新分词、样本合并、优势计算、损失归一化和后端调度等挑战。研究团队在指令跟随、搜索和编码智能体上进行了评估,并提供完整的可复现编码智能体RL流水线。实验显示,仅使用6000个训练样本和适度算力,Qwen3.5-9B在SWE-bench Verified上的表现从41.8%提升至56.4%,绝对提升14.6个百分点。该方法展示了受控智能体强化学习在真实编码任务中的高效性与潜力,同时发布完整工作流和训练脚本,有助于推动可复现研究。

核心要点

  • Agent Lightning v1.0以约3500行代码实现受控智能体强化学习框架,支持任意智能体外壳接入RL训练。
  • 该框架直面重新分词、样本合并、优势计算与后端调度等影响训练稳定性的关键挑战。
  • 仅用6K训练样本,Qwen3.5-9B在SWE-bench Verified上从41.8%提升至56.4%,实现14.6个点绝对增益。

Read more >