漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-10 talkingdev

消息称中国AI芯片商华为、寒武纪、MetaX、Iluvatar CoreX提价20%-50%,HBM成本上涨为主因

据路透社报道,中国AI芯片厂商华为、寒武纪、MetaX与Iluvatar CoreX已对当前及下一代芯片产品提价20%-50%,主要原因是高带宽存储器(HBM)成本上升。HBM通过3D堆叠DRAM提供远高于普通内存的带宽,是AI训练和推理芯片...

Read More
2026-09-09 talkingdev

Cohere发布North Mini Code超内核推理引擎:解码速度达vLLM 1.58倍

Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...

Read More
2026-09-08 talkingdev

开源|OpenScreen:免费开源GPU加速录屏工具,支持Windows/macOS/Linux且无水印无订阅

OpenScreen是一个在GitHub上开放源码的桌面录屏项目,面向Windows、macOS和Linux三大平台,主打无水印、无订阅的屏幕录制体验。该项目采用GPU加速录制,能够降低视频编码过程中的性能占用,适合开发者、产品经理和内...

Read More
2026-09-08 talkingdev

vLLM在AMD GPU上的推测解码实践:MTP、EAGLE-3、DFlash与DSpark性能调优指南

vLLM团队发布了一份关于在AMD GPU上使用推测解码(Speculative Decoding)的实用指南。推测解码允许vLLM在单次目标模型传递中验证多个草稿token,同时保持目标模型的输出行为不变,有望显著提升推理效率。该指南基于...

Read More
2026-09-08 talkingdev

Vortex 实现从 S3 到 GPU 的单次拷贝,演示扫描性能较 Parquet 快约 30 倍

在 QCon London 2026 上,SpiralDB 团队展示了 Vortex 如何将压缩列式数据从 S3 直接流式传输到 GPU 内存,全程仅需一次拷贝。相比传统方案先将数据落盘或依赖 CPU 解压,Vortex 的列式布局能够在传输前对数据进行裁...

Read More
2026-09-08 talkingdev

开源|Qwen-Drive-1.0:打通感知、语言与规划的自动驾驶视觉语言基础模型

QwenLM团队在GitHub开源了Qwen-Drive-1.0项目,定位为面向自动驾驶的视觉语言基础模型。该项目采用分阶段训练策略,将感知、语言理解和规划目标融合到统一框架中,使模型既能获得专业驾驶能力,又能保留广泛的视觉理...

Read More
2026-09-08 talkingdev

开源|Google发布Accelerator Agents:用Gemini将PyTorch工作负载迁至JAX并优化TPU内核

Google在GitHub开源了Accelerator Agents工具包,面向Google Cloud TPU开发场景,利用Gemini模型帮助开发者将PyTorch工作负载迁移到JAX,并优化自定义内核。该工具包包含MaxCode和MaxKernel两个核心模块:MaxCode负...

Read More
2026-09-05 talkingdev

AI芯片成外交筹码:美方被曝用英伟达GPU准入推动亚美尼亚-阿塞拜疆和平协议

据《华尔街日报》记者Robbie Whelan报道,知情人士透露,美国谈判代表在去年亚美尼亚与阿塞拜疆的和平斡旋中,曾将“允许亚美尼亚数据中心采购英伟达先进AI芯片”作为激励条件,以推动双方达成初步协议,结束长达数十...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page