在大型语言模型(LLM)落地中,推理成本正成为企业关注的核心瓶颈。ByteByteGo最新指南指出,通过智能模型路由,系统可以将常规请求自动分配给成本较低的轻量模型,而将复杂、高风险任务保留给能力更强的模型。一个...
Read More近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...
Read MoreZeroModels 是一个完全基于 Keras 3 构建的预训练模型集合,覆盖图像分类、目标检测、分割、单目深度估计、特征提取、视觉语言模型和语音识别等任务。该项目最大的亮点在于同一套代码可原生运行在 JAX、PyTorch 和 T...
Read MoreCohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...
Read MoreQwenLM团队在GitHub开源了Qwen-Drive-1.0项目,定位为面向自动驾驶的视觉语言基础模型。该项目采用分阶段训练策略,将感知、语言理解和规划目标融合到统一框架中,使模型既能获得专业驾驶能力,又能保留广泛的视觉理...
Read MoreSalesforce AI Research 发布了 Random Attention 代码仓库,对应论文《Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning》。在大语言模型推理中,KV缓存占用大量显存,现有方法通常依赖学...
Read MoreLLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...
Read MoreWebLLM 是 MLC AI 推出的高性能浏览器端大语言模型推理引擎,它借助 WebGPU 将开源模型的加载与推理全过程放在用户浏览器内完成,不需要后端服务器。该项目提供兼容 OpenAI 的 API,可支持流式输出、JSON 模式等聊天...
Read More