Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...
Read More谷歌TPUv7 Ironwood的第三方推理结果首次在InferenceX官方预览中亮相。在与Nvidia B200/B300进行同口径FP8对比时,Ironwood每美元性能最高可领先50%,意味着单位成本下能够提供明显更强的推理吞吐。值得关注的是,Ir...
Read MoreNVIDIA正式确认以129.3亿美元收购全球最大AI模型社区Hugging Face。Hugging Face目前托管约300万个模型,服务超过1800万开发者,是机器学习领域最重要的开源协作平台之一。英伟达CEO黄仁勋表示,收购后平台将继续保...
Read MoreNVIDIA在Hugging Face平台推出DeepSeek-V4-Pro-0813-NVFP4量化模型,该模型是DeepSeek-V4-Pro-0813的量化版本,采用自回归混合专家(MoE)语言模型架构。通过NVIDIA Model Optimizer量化后,模型在保持高级推理能力...
Read More英伟达正在将AI竞争优势从单一GPU扩展到整个数据中心系统层面。在最新的Vera Rubin架构中,除GPU外,英伟达引入Vera CPU等专用组件,重点提升数据编排与调度效率。这意味着其战略正从单纯追求更强处理器算力,转向优...
Read MoreLMSYS.org发布的最新基准测试显示,在8×NVIDIA H200 GPU环境中,SGLang Diffusion对MiniMax-H3视频生成工作负载实现了显著加速。测试严格固定提示词、随机种子、分辨率、帧率和去噪步数,并在六类工作负载上进行比较...
Read More英伟达(NVIDIA)最新业绩指引显示,下季度营收将达到1080亿美元,首次站上单季千亿美元台阶;按此年化计算,全年营收约4320亿美元,有望成为全球收入第六大公司。公司认为其业务比以往更健康、更多元化。不过,数据...
Read MorePerplexity正式发布Portable Computer,这是其智能体计算平台的一个本地化版本,目标是将AI代理任务完全运行在用户自有硬件上。该方案与Nvidia合作,可部署在DGX Spark及RTX系列Linux设备上,模型、用户数据和工作内...
Read More