Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...
Read MorevLLM团队发布了一份关于在AMD GPU上使用推测解码(Speculative Decoding)的实用指南。推测解码允许vLLM在单次目标模型传递中验证多个草稿token,同时保持目标模型的输出行为不变,有望显著提升推理效率。该指南基于...
Read More据《华尔街日报》记者Robbie Whelan报道,知情人士透露,美国谈判代表在去年亚美尼亚与阿塞拜疆的和平斡旋中,曾将“允许亚美尼亚数据中心采购英伟达先进AI芯片”作为激励条件,以推动双方达成初步协议,结束长达数十...
Read MoreWebLLM 是 MLC AI 推出的高性能浏览器端大语言模型推理引擎,它借助 WebGPU 将开源模型的加载与推理全过程放在用户浏览器内完成,不需要后端服务器。该项目提供兼容 OpenAI 的 API,可支持流式输出、JSON 模式等聊天...
Read MoreTurboKV 是一个基于 Rust 语言实现的异步嵌入式键值数据库项目,源代码已在 GitHub 公开。该数据库的设计目标是在保持简单集成与轻量部署的同时,提供高性能的本地键值存取能力。TurboKV 支持原子操作,有助于保证并...
Read More英伟达的芯片业务正在从训练大语言模型扩展到“物理AI”领域,即驱动机器人、自动驾驶等与真实物理世界交互的智能系统。据华尔街日报援引业内人士消息,英伟达物理AI相关业务年收入已约100亿美元,凸显其从云端训练延...
Read More据彭博社报道,SK海力士已在印第安纳州为其投资40亿美元的先进存储芯片封装工厂举行奠基仪式,并计划于2029年下半年开始量产下一代高带宽内存(HBM)。该工厂将聚焦存储器封装环节,而封装是HBM堆叠、硅中介层集成及...
Read MoreWhip 是 context-labs 在 GitHub 开源的一款基于 Go 语言的高性能编码智能体运行框架。其核心设计围绕工具调用循环展开,并集成了 bubbletea 终端交互界面、MCP(Model Context Protocol)支持以及后台子代理能力,...
Read More