漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-09 talkingdev

Cohere发布North Mini Code超内核推理引擎:解码速度达vLLM 1.58倍

Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...

Read More
2026-09-08 talkingdev

谷歌TPUv7 Ironwood第三方推理首测:FP8每美元性能较B200/B300最高提升50%

谷歌TPUv7 Ironwood的第三方推理结果首次在InferenceX官方预览中亮相。在与Nvidia B200/B300进行同口径FP8对比时,Ironwood每美元性能最高可领先50%,意味着单位成本下能够提供明显更强的推理吞吐。值得关注的是,Ir...

Read More
2026-09-04 talkingdev

NVIDIA确认以129.3亿美元收购Hugging Face,AI模型社区进入算力巨头时代

NVIDIA正式确认以129.3亿美元收购全球最大AI模型社区Hugging Face。Hugging Face目前托管约300万个模型,服务超过1800万开发者,是机器学习领域最重要的开源协作平台之一。英伟达CEO黄仁勋表示,收购后平台将继续保...

Read More
2026-08-31 talkingdev

NVIDIA发布DeepSeek-V4-Pro-0813-NVFP4量化模型:MoE架构助力智能体与企业级AI

NVIDIA在Hugging Face平台推出DeepSeek-V4-Pro-0813-NVFP4量化模型,该模型是DeepSeek-V4-Pro-0813的量化版本,采用自回归混合专家(MoE)语言模型架构。通过NVIDIA Model Optimizer量化后,模型在保持高级推理能力...

Read More
2026-08-31 talkingdev

英伟达AI优势正超越GPU:Vera Rubin架构重塑超大规模数据中心效率

英伟达正在将AI竞争优势从单一GPU扩展到整个数据中心系统层面。在最新的Vera Rubin架构中,除GPU外,英伟达引入Vera CPU等专用组件,重点提升数据编排与调度效率。这意味着其战略正从单纯追求更强处理器算力,转向优...

Read More
2026-08-28 talkingdev

SGLang Diffusion加持:MiniMax-H3视频生成在8×H200上无损提速1.95倍,最高6.24倍

LMSYS.org发布的最新基准测试显示,在8×NVIDIA H200 GPU环境中,SGLang Diffusion对MiniMax-H3视频生成工作负载实现了显著加速。测试严格固定提示词、随机种子、分辨率、帧率和去噪步数,并在六类工作负载上进行比较...

Read More
2026-08-27 talkingdev

英伟达下季度营收指引达1080亿美元:年化营收将冲4320亿,应收账款天数升至60天

英伟达(NVIDIA)最新业绩指引显示,下季度营收将达到1080亿美元,首次站上单季千亿美元台阶;按此年化计算,全年营收约4320亿美元,有望成为全球收入第六大公司。公司认为其业务比以往更健康、更多元化。不过,数据...

Read More
2026-08-26 talkingdev

Perplexity联合Nvidia推出Portable Computer:完全本地运行的AI智能体,零Token成本

Perplexity正式发布Portable Computer,这是其智能体计算平台的一个本地化版本,目标是将AI代理任务完全运行在用户自有硬件上。该方案与Nvidia合作,可部署在DGX Spark及RTX系列Linux设备上,模型、用户数据和工作内...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page