漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-25 talkingdev

NVIDIA Groq 3 LPX AI推理加速芯片全面量产,Vera Rubin迎来史上最快Token生成速度

NVIDIA的Groq 3 LPX AI推理加速芯片现已进入全面量产阶段。Groq 3 LPX机架作为NVIDIA Vera Rubin平台的扩展,显著提升了AI推理能力,能够为响应敏感型智能体(Agentic)工作负载提供超高速的Token生成表现。在面向智...

Read More
2026-08-21 talkingdev

论文推荐|TaoLive提出Harness感知训练:35B数字人直播代理实时适应可变接口,P50延迟仅3.4秒

TaoLive团队针对直播电商数字人代理的实时性与适应性矛盾,提出Harness-Aware Training(HAT)后训练方法。其核心是将技能、钩子、系统提示和工具模式从模型权重中解耦,使运行时行为可随业务策略变化而无需重新训练...

Read More
2026-08-20 talkingdev

1.6万亿参数DeepSeek-V4-Pro部署新思路:从负载画像到拓扑决策突破推理瓶颈

随着DeepSeek-V4-Pro等1.6万亿参数Mixture-of-Experts(MoE)模型同时发布FP8与FP4权重,如何在真实资源约束下高效服务前沿模型成为AI基础设施团队的核心挑战。LMSYS博客文章指出,服务配置不应仅依据硬件规格或孤立...

Read More
2026-08-17 talkingdev

英伟达大幅缩减OpenAI俄亥俄数据中心担保:从2500亿降至不到1200亿美元

英伟达与OpenAI正接近敲定一项围绕美国俄亥俄州大型数据中心园区的财务安排。根据最新协议,英伟达将为该项目第一阶段提供财务担保,对应电力规模约5吉瓦;OpenAI则需在后续阶段自行决定剩余部分的融资方式和节奏。...

Read More
2026-08-12 talkingdev

NVIDIA提出WorldTrace:让视频世界模型拥有可寻址记忆,突破长时序生成瓶颈

NVIDIA研究团队近日推出了一项名为WorldTrace的训练无关框架,直指视频世界模型在长时序自回归生成中的关键短板——记忆遗忘与生成质量退化。该工作通过为压缩的键值记忆赋予稳定、分布内位置偏移的方式,确保记忆在远...

Read More
2026-08-12 talkingdev

英伟达发布Switchyard路由器:AI模型可在任务中途动态切换,自测任务成本降至三分之一

英伟达推出了全新的Nemotron 3.5 Lightning模型和NeMo Switchyard开源库,旨在大幅降低AI代理的推理成本并提升效率。Nemotron 3.5 Lightning是一个拥有300亿参数的混合专家模型(MoE),专为高吞吐量的专用代理任务...

Read More
2026-08-07 talkingdev

AMD宣布收购AI芯片初创公司Taalas,定制化硅片将AI模型直接“烧录”进硬件

美国芯片巨头AMD已同意收购多伦多AI芯片创业公司Taalas。这家由前AMD员工及Tenstorrent核心成员创立的公司,专注于将AI模型“硬连线”进定制硅片,从而在前沿推理场景中大幅打破计算与内存瓶颈。与传统依赖通用GPU或庞...

Read More
2026-08-05 talkingdev

论文推荐|DiffusionGemma:基于离散扩散的超高速语言模型,单卡H100每秒生成1500 Token

来自Google的研究团队发布了DiffusionGemma技术报告,提出了一种实验性的开源权重语言模型,通过离散扩散生成文本,速度远超传统自回归模型。DiffusionGemma并未从零训练,而是在专家混合架构Gemma 4(激活参数38亿...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page