据路透社报道,中国AI芯片厂商华为、寒武纪、MetaX与Iluvatar CoreX已对当前及下一代芯片产品提价20%-50%,主要原因是高带宽存储器(HBM)成本上升。HBM通过3D堆叠DRAM提供远高于普通内存的带宽,是AI训练和推理芯片...
Read MoreCohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...
Read MoreOpenScreen是一个在GitHub上开放源码的桌面录屏项目,面向Windows、macOS和Linux三大平台,主打无水印、无订阅的屏幕录制体验。该项目采用GPU加速录制,能够降低视频编码过程中的性能占用,适合开发者、产品经理和内...
Read MorevLLM团队发布了一份关于在AMD GPU上使用推测解码(Speculative Decoding)的实用指南。推测解码允许vLLM在单次目标模型传递中验证多个草稿token,同时保持目标模型的输出行为不变,有望显著提升推理效率。该指南基于...
Read More在 QCon London 2026 上,SpiralDB 团队展示了 Vortex 如何将压缩列式数据从 S3 直接流式传输到 GPU 内存,全程仅需一次拷贝。相比传统方案先将数据落盘或依赖 CPU 解压,Vortex 的列式布局能够在传输前对数据进行裁...
Read MoreQwenLM团队在GitHub开源了Qwen-Drive-1.0项目,定位为面向自动驾驶的视觉语言基础模型。该项目采用分阶段训练策略,将感知、语言理解和规划目标融合到统一框架中,使模型既能获得专业驾驶能力,又能保留广泛的视觉理...
Read MoreGoogle在GitHub开源了Accelerator Agents工具包,面向Google Cloud TPU开发场景,利用Gemini模型帮助开发者将PyTorch工作负载迁移到JAX,并优化自定义内核。该工具包包含MaxCode和MaxKernel两个核心模块:MaxCode负...
Read More据《华尔街日报》记者Robbie Whelan报道,知情人士透露,美国谈判代表在去年亚美尼亚与阿塞拜疆的和平斡旋中,曾将“允许亚美尼亚数据中心采购英伟达先进AI芯片”作为激励条件,以推动双方达成初步协议,结束长达数十...
Read More