漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-10 talkingdev

ZeroModels 发布:基于 Keras 3 的预训练模型库,一套代码跑通 JAX、PyTorch、TensorFlow

ZeroModels 是一个完全基于 Keras 3 构建的预训练模型集合,覆盖图像分类、目标检测、分割、单目深度估计、特征提取、视觉语言模型和语音识别等任务。该项目最大的亮点在于同一套代码可原生运行在 JAX、PyTorch 和 T...

Read More
2026-09-08 talkingdev

开源|Google发布Accelerator Agents:用Gemini将PyTorch工作负载迁至JAX并优化TPU内核

Google在GitHub开源了Accelerator Agents工具包,面向Google Cloud TPU开发场景,利用Gemini模型帮助开发者将PyTorch工作负载迁移到JAX,并优化自定义内核。该工具包包含MaxCode和MaxKernel两个核心模块:MaxCode负...

Read More
2026-09-08 talkingdev

谷歌TPUv7 Ironwood第三方推理首测:FP8每美元性能较B200/B300最高提升50%

谷歌TPUv7 Ironwood的第三方推理结果首次在InferenceX官方预览中亮相。在与Nvidia B200/B300进行同口径FP8对比时,Ironwood每美元性能最高可领先50%,意味着单位成本下能够提供明显更强的推理吞吐。值得关注的是,Ir...

Read More
2026-07-28 talkingdev

开源|Molt:英伟达发布原生PyTorch智能体强化学习框架,可扩展至万亿参数MoE模型训练

英伟达NeMo团队近日在GitHub上开源了一个名为Molt的智能体强化学习框架。该框架采用PyTorch原生设计,核心理念是将智能体本身视为可执行的程序,而非传统强化学习中固定的策略网络。Molt支持高度灵活的自定义Python...

Read More
2026-06-12 talkingdev

PyTorch性能优化新突破:从nn.Linear到融合MLP的深度剖析

本文深入探讨了PyTorch在执行和优化神经网络层方面的最新进展,特别是从单个线性操作逐步过渡到融合多层感知机(MLP)的过程。文章详细剖析了如何通过算子融合技术,将多个连续的线性变换和激活函数合并为一个计算核...

Read More
2026-04-30 talkingdev

DeepSpeed整合AutoSP:自动序列并行技术,轻松训练超长上下文LLM

PyTorch官方博客近日发布了一项名为AutoSP的创新技术,该技术旨在自动化地将标准Transformer训练代码转换为序列并行代码,用于长上下文大语言模型(LLM)的训练。AutoSP已与微软的DeepSpeed框架深度集成,使得开发者...

Read More
2025-12-24 talkingdev

开源|PyTorch推出ExecuTorch:统一移动、嵌入式和边缘设备的端侧AI部署方案

Meta旗下PyTorch团队正式开源ExecuTorch项目,这是一个专为在移动设备、嵌入式系统和边缘计算节点上高效部署人工智能模型而设计的端到端解决方案。ExecuTorch旨在解决AI模型在资源受限环境中的部署难题,其核心价值...

Read More
2025-12-18 talkingdev

谷歌联手Meta推出TorchTPU,剑指英伟达AI软件护城河

谷歌与Meta正联手推进一项关键合作,旨在通过名为“TorchTPU”的新项目,大幅提升谷歌自研的张量处理单元(TPU)对PyTorch深度学习框架的原生支持能力。此举的核心目标是削弱英伟达凭借其CUDA软件生态在AI计算市场建立...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page