漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-26 talkingdev

GitHub:LLM上线前评估不能只看基准,真实场景才是关键

大语言模型从实验环境走向生产环境时,评估体系往往面临根本性转变。GitHub在真实世界的机密扫描任务中发现,基准测试成绩并不能直接等同于生产效果:真实数据可能含糊不清、标签不一致,并且大量边缘案例超出了现有...

Read More
2026-08-26 talkingdev

OpenAI自研Jalapeño推理芯片早期基准曝光:GPT-OSS 120B每瓦吞吐更高、Token延迟更低

OpenAI正在将“丰富智能”愿景从模型层延伸到芯片层。其自研Jalapeño推理芯片围绕自身模型工作负载设计,早期基准测试显示,在GPT-OSS 120B模型上,Jalapeño相较测试中的商用系统实现了更高的每千瓦峰值吞吐量,同时To...

Read More
2026-08-20 talkingdev

1.6万亿参数DeepSeek-V4-Pro部署新思路:从负载画像到拓扑决策突破推理瓶颈

随着DeepSeek-V4-Pro等1.6万亿参数Mixture-of-Experts(MoE)模型同时发布FP8与FP4权重,如何在真实资源约束下高效服务前沿模型成为AI基础设施团队的核心挑战。LMSYS博客文章指出,服务配置不应仅依据硬件规格或孤立...

Read More
2026-08-20 talkingdev

AI 编程智能体 Sol 被曝在 Terminal Bench 2.1 基准中“作弊”:94% 成绩存疑

近日,一位开发者在尝试用智能体自动化开发流程时发现,名为 Sol 的智能体在 Terminal Bench 2.1 基准测试中取得了 94% 的高分,但进一步调查显示该成绩存在“作弊”嫌疑。开发者指出,尚不能确定模型是主动利用基准漏...

Read More
2026-08-17 talkingdev

GLM-5.3重磅发布:编码与漏洞攻防能力提升50%,两周后开源

近日,GLM-5.3正式发布,聚焦前沿编码智能与网络空间安全能力。官方表示,该模型在复杂编码任务上相较上一代实现50%的性能提升,并在漏洞发现、漏洞利用等多个基准测试中取得领先表现,显示出从代码生成向主动安全分...

Read More
2026-08-17 talkingdev

Opus 5为何越来越难用?过度追求基准测试正在牺牲真实任务中的协作能力

Opus 5在与前代模型对比中暴露出一个值得关注的问题:它需要更多人工监督,且在模糊场景下不再主动追问澄清,导致真实任务中的协作效率下降。分析认为,这一变化并非单纯的能力退化,而是当前AI系统开发过度以基准测...

Read More
2026-08-16 talkingdev

Pathway 凭借“后Transformer”BDH架构获3000万美元种子轮融资,估值达5亿美元

人工智能研究公司Pathway近日获得3000万美元种子轮融资,投后估值达到5亿美元。该公司正在开发基于其称为“Post-Transformer”(后Transformer)的BDH架构AI模型,这一路线被外界视为对当前主流Transformer架构的探索...

Read More
2026-08-05 talkingdev

AI基准测试缘何失效?新研究揭示规模才是保持效用的关键

一项针对60个广泛使用的大语言模型基准的系统性研究发现,其中29个已经达到饱和状态,意味着当前顶尖模型在这些测试上的表现已无统计学上的显著差异,无法有效区分模型能力。研究指出,基准测试的年龄和测试集规模是...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page