漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-09 talkingdev

Cohere发布North Mini Code超内核推理引擎:解码速度达vLLM 1.58倍

Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...

Read More
2026-09-08 talkingdev

开源|Google发布Accelerator Agents:用Gemini将PyTorch工作负载迁至JAX并优化TPU内核

Google在GitHub开源了Accelerator Agents工具包,面向Google Cloud TPU开发场景,利用Gemini模型帮助开发者将PyTorch工作负载迁移到JAX,并优化自定义内核。该工具包包含MaxCode和MaxKernel两个核心模块:MaxCode负...

Read More
2026-08-17 talkingdev

Codex辅助自动研究:GPU Mode qr_v2问题实现232倍内核加速

在近期一场聚焦GPU优化的自动研究竞赛中,参赛者针对批量方阵compact-Householder QR分解(qr_v2)问题展开优化,最终在GPU Mode的qr_v2任务上实现了相对基线高达232倍的内核加速,并在183名参与者中位列第12。该项...

Read More
2025-11-27 talkingdev

开源|逆向工程突破限制:开发者成功在iPod touch 3上运行iOS 6系统

近日,一位开发者通过深度逆向工程,在官方仅支持iOS 5.1.1的iPod touch 3设备上成功运行了iOS 6系统,展现了移动设备越狱领域的重大技术突破。该项目涉及对iOS底层组件的多维度修改:首先通过反编译手段修补了Devic...

Read More
2025-09-20 talkingdev

Linux内核新突破:引入多内核架构支持,提升系统性能与可扩展性

Linux内核社区近日迎来一项重大技术进展,开发者提交了名为“多内核架构支持(Multikernel Architecture Support)”的补丁集。该提案旨在通过多内核设计解决传统单内核架构在众核处理器时代面临的可扩展性瓶颈问题。...

Read More
2025-09-04 talkingdev

AI生成Metal内核将PyTorch在苹果设备推理速度提升87%

研究人员通过前沿AI技术实现了重大突破:利用自主生成的Metal GPU内核,将PyTorch在苹果设备上的推理速度平均提升1.87倍。这项研究测试了215个PyTorch模型,其中部分工作负载甚至达到基线性能的数百倍加速。该技术采...

Read More
2025-08-25 talkingdev

突破跨架构部署难题:Kernel-builder库实现生产级CUDA内核开发

近日,开源社区推出革命性工具库Kernel-builder,专门用于构建和部署跨硬件架构的自定义CUDA内核。该工具通过提供完整的开发框架,显著降低了高性能计算内核从开发到生产环境部署的技术门槛。根据技术文档介绍,开发...

Read More
2025-08-07 talkingdev

Rust编写GPU内核驱动:深入解析GPU驱动工作原理

本文通过Vulkan(VkCube)渲染旋转立方体的实例,深入浅出地讲解了GPU驱动架构的基础知识,重点剖析了用户模式驱动(UMD)与内核模式驱动(KMD)的协作机制。UMD负责将高级API命令转换为底层GPU指令,而KMD则掌管内...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page