Baseten 为 GLM-5.2 模型构建的全新 API 在推理速度上取得了突破性进展,峰值速度高达 280 tokens/秒,平均速度约为 100 tokens/秒,整体性能达到发布日初版 API 的两倍以上。这一大幅提升得益于底层的系统级优化与...
Read More预测多个令牌的同时生成是当前被积极研究的一个有趣的范式。如果成功,这将大大提高许多大型语言模型的生成速度。本篇文章中的方法,模仿了图像合成中的一致性模型,试图在精调的LLMs上使用并行解码策略来加快生成速...
Read More语言模型推理通常较慢,因为这些模型的运行严重依赖内存。为了解决这一问题,人们引入了使用较小的草稿模型进行推测性解码,以“提前”提供给大模型的建议。这种方法效果不错,但实现起来复杂,且寻找一个好的草稿模型...
Read More