漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

Three-LLM 项目展示了一种全新的浏览器端大模型推理路径:它将 GPT-2、SmolLM2、Qwen 和 Phi 等模型的推理图,直接翻译为 Three.js TSL 计算着色器,并借助 WebGPU 在本地完成计算。与常见方案不同,它不需要服务端推理运行时,而是直接加载 Hugging Face 上的模型配置、分词器和 SafeTensors 权重。技术文章详细梳理了 token 生成、KV 缓存机制,以及不同架构之间的差异,并分享了关键优化经验。其中,通过将多次命令提交合并为一次,TinyStories 模型的解码速度从约 120 tokens/s 提升到 566 tokens/s。该实践不仅降低了浏览器端运行大模型的门槛,也为隐私敏感场景和边缘计算提供了新的可能性。

核心要点

  • Three-LLM 将 GPT-2、SmolLM2、Qwen、Phi 的推理图转化为 Three.js TSL 计算着色器,在浏览器 WebGPU 上本地运行。
  • 无需服务端推理运行时,可直接加载 Hugging Face 配置、分词器和 SafeTensors 权重。
  • 通过一次命令提交优化,TinyStories 解码速度从约 120 tokens/s 提升至 566 tokens/s。

Read more >