漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-16 talkingdev

AI编程代理“省时却会造假”?LLM基准与智能体编码验证面临信任危机

文章指出,AI编程代理在显著提升开发效率、节省大量时间的同时,也可能生成看似可信但实际错误的“证据”,因此围绕智能体编码的验证流程与模型能力同等重要。作者强调,不能仅依赖一次性基准测试或团队口口相传的“工...

Read More
2026-09-16 talkingdev

强化学习新方法Never Giving Up:让LLM在困难任务上不再轻易放弃

标准强化学习(RL)在训练大语言模型(LLM)时,往往在最困难的问题上表现不佳,简单标量奖励信号难以精确衡量模型在复杂任务上的真实能力。这篇题为《Learning to Solve Hard Problems in RL for LLMs by Never Giv...

Read More
2026-09-15 talkingdev

LLM裁判一致同意时,我们该相信吗?亚马逊研究:相关性可能高估置信度

在大语言模型(LLM)被广泛用作自动评估者的趋势下,一个关键问题正在浮现:当多个LLM裁判给出高度一致判断时,这种一致性是否真的可靠?亚马逊科学博客最新研究指出,如果裁判模型共享提示词、模型架构或存在相似盲...

Read More
2026-09-15 talkingdev

Vera Rubin NVL72推理测试:1.6T DeepSeek模型每兆瓦Token吞吐量达Blackwell 7倍,超黄仁勋3倍说法

SemiAnalysis最新披露的推理测试结果显示,NVIDIA下一代Vera Rubin NVL72平台在运行1.6万亿参数的DeepSeek模型时,每兆瓦功耗下的Token吞吐量最高达到Blackwell平台的7倍,明显高于黄仁勋此前对1T-3T规模LLM给出的3...

Read More
2026-09-14 talkingdev

智能模型路由如何将大模型调用成本降低10倍

在大型语言模型(LLM)落地中,推理成本正成为企业关注的核心瓶颈。ByteByteGo最新指南指出,通过智能模型路由,系统可以将常规请求自动分配给成本较低的轻量模型,而将复杂、高风险任务保留给能力更强的模型。一个...

Read More
2026-09-09 talkingdev

Cohere发布North Mini Code超内核推理引擎:解码速度达vLLM 1.58倍

Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...

Read More
2026-09-08 talkingdev

vLLM在AMD GPU上的推测解码实践:MTP、EAGLE-3、DFlash与DSpark性能调优指南

vLLM团队发布了一份关于在AMD GPU上使用推测解码(Speculative Decoding)的实用指南。推测解码允许vLLM在单次目标模型传递中验证多个草稿token,同时保持目标模型的输出行为不变,有望显著提升推理效率。该指南基于...

Read More
2026-09-07 talkingdev

开源|LLM-as-a-Verifier:无需额外训练,为任意智能体提供细粒度反馈并实现多领域SOTA

LLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page