漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-31 talkingdev

开源权重LLM在生命科学监管任务中准确率比肩闭源模型,成本仅三分之一

一项针对生命科学临床与监管场景的基准测试ClinReg显示,开源权重大语言模型在准确率上已追平顶尖闭源模型。测试中,GLM 5.2、Kimi K3等开源模型在监管和临床任务上的表现与GPT 5.6 Sol等商业模型的差异落在一个标准...

Read More
2026-07-31 talkingdev

谷歌DeepMind推出Gemini Robotics ER 2,重新定义机器人视频理解与多机协作

谷歌DeepMind正式发布了新一代机器人AI系统Gemini Robotics ER 2,该系统在视频理解、工具编排和多机器人协作方面实现了阶跃式突破。ER 2将先进的Gemini大语言模型与机器人深层控制相结合,使机器人不仅能够更精准地...

Read More
2026-07-28 talkingdev

开源|Molt:英伟达发布原生PyTorch智能体强化学习框架,可扩展至万亿参数MoE模型训练

英伟达NeMo团队近日在GitHub上开源了一个名为Molt的智能体强化学习框架。该框架采用PyTorch原生设计,核心理念是将智能体本身视为可执行的程序,而非传统强化学习中固定的策略网络。Molt支持高度灵活的自定义Python...

Read More
2026-07-27 talkingdev

我们终于有了证明自动化:Zstd-Lean 项目用大语言模型攻克依赖类型证明难题

在依赖类型语言的世界里,强大的类型系统往往意味着沉重的证明负担——开发者可能需要花费数小时才能发现要证明的命题根本就是错误的。这种高昂的认知开销使依赖类型编程长期停留在小众领域。如今,这一局面正在被打破...

Read More
2026-07-24 talkingdev

哪款AI真的在读取你的网站?Evil Martians 团队实测两月LLM流量,ChatGPT与Claude行为截然相反

近日,开发者服务公司 Evil Martians 在其团队博客公布了为期两个月的服务器端追踪数据,对 web 流量中人类访客与 AI 爬虫的行为差异进行了量化分析。数据显示,AI 代理请求量达到 26.8 万次,远超同期 10.7 万次的...

Read More
2026-07-20 talkingdev

开源|大模型之战,是数据库战争的重演吗?

该观点将当前的大语言模型竞争与上世纪90年代的数据库之争进行了历史性类比,揭示了技术基础设施演进的一种深层规律。作者认为,大语言模型正沿着数据库的发展轨迹前进:从最初作为引发行业狂热的前沿技术,逐步演化...

Read More
2026-07-20 talkingdev

LLM辅助编程引发“人在回路”疲劳,软件工程师角色正被重塑

随着大语言模型(LLM)在编程领域的广泛应用,一种被称为“人在回路疲劳”的现象开始在开发者群体中蔓延。越来越多的工程师发现,虽然LLM大幅提升了代码生成效率,但也带来了持续性的认知负担。开发者不再仅仅专注于创...

Read More
2026-07-20 talkingdev

Netflix 自研内部 LLM 推理平台:基于 vLLM 与 Triton 的统一服务架构,实现高效模型部署与 A/B 测试

Netflix 近期公开了其内部自研的大语言模型(LLM)推理服务平台的设计与实践。与依赖外部托管 API 不同,该平台将模型部署和推理完全集成到 Netflix 现有的生产环境中,既保障了数据安全与低延迟,又实现了对模型的...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page