漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-14 talkingdev

智能模型路由如何将大模型调用成本降低10倍

在大型语言模型(LLM)落地中,推理成本正成为企业关注的核心瓶颈。ByteByteGo最新指南指出,通过智能模型路由,系统可以将常规请求自动分配给成本较低的轻量模型,而将复杂、高风险任务保留给能力更强的模型。一个...

Read More
2026-09-10 talkingdev

GPT-6 Astra与循环Transformer:隐藏推理如何重塑大模型参数效率?

近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...

Read More
2026-09-10 talkingdev

ZeroModels 发布:基于 Keras 3 的预训练模型库,一套代码跑通 JAX、PyTorch、TensorFlow

ZeroModels 是一个完全基于 Keras 3 构建的预训练模型集合,覆盖图像分类、目标检测、分割、单目深度估计、特征提取、视觉语言模型和语音识别等任务。该项目最大的亮点在于同一套代码可原生运行在 JAX、PyTorch 和 T...

Read More
2026-09-09 talkingdev

Cohere发布North Mini Code超内核推理引擎:解码速度达vLLM 1.58倍

Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...

Read More
2026-09-08 talkingdev

开源|Qwen-Drive-1.0:打通感知、语言与规划的自动驾驶视觉语言基础模型

QwenLM团队在GitHub开源了Qwen-Drive-1.0项目,定位为面向自动驾驶的视觉语言基础模型。该项目采用分阶段训练策略,将感知、语言理解和规划目标融合到统一框架中,使模型既能获得专业驾驶能力,又能保留广泛的视觉理...

Read More
2026-09-07 talkingdev

开源|Random Attention:随机采样KV缓存淘汰,让大模型推理更高效

Salesforce AI Research 发布了 Random Attention 代码仓库,对应论文《Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning》。在大语言模型推理中,KV缓存占用大量显存,现有方法通常依赖学...

Read More
2026-09-07 talkingdev

开源|LLM-as-a-Verifier:无需额外训练,为任意智能体提供细粒度反馈并实现多领域SOTA

LLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...

Read More
2026-09-04 talkingdev

开源|WebLLM:基于WebGPU在浏览器中高性能运行开源大模型

WebLLM 是 MLC AI 推出的高性能浏览器端大语言模型推理引擎,它借助 WebGPU 将开源模型的加载与推理全过程放在用户浏览器内完成,不需要后端服务器。该项目提供兼容 OpenAI 的 API,可支持流式输出、JSON 模式等聊天...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page