漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2025-06-17 talkingdev

[论文推荐]TreeRL:无需奖励模型的LLM训练新方法,数学与代码推理能力显著提升

TreeRL是一种创新的语言模型训练方法,通过结合on-policy树搜索和中间监督机制,实现了无需单独奖励模型的LLM训练。这一技术突破来自最新arXiv论文,相比传统的ChainRL方法,TreeRL在数学推理和代码生成等复杂任务上...

Read More
2025-02-14 talkingdev

MEAP技术开源:通过掩码增强自回归预测提升推理能力

近日,一项名为Mask-Enhanced Autoregressive Prediction(MEAP)的技术在GitHub上发布,该技术通过将Masked Language Modeling(MLM)整合到仅解码器的Transformer中,显著提升了信息检索任务的性能,同时保持了强...

Read More
2025-02-14 talkingdev

Phind 2发布:AI搜索新突破,支持视觉答案与多步推理

近日,Phind 2正式发布,标志着AI搜索技术迈入新阶段。Phind 2不仅能够提供传统的文本搜索结果,还引入了视觉答案功能,用户可以通过图像直观获取信息。此外,Phind 2的多步推理能力使其能够处理复杂的查询,通过逐...

Read More