漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

EschaLabs 近日发布了 Escha-W2,这是对 Qwen3.6-35B-A3B 混合专家(MoE)模型进行 2 比特量化后的构建版本。Qwen3.6-35B-A3B 本身是一个包含 256 个专家的庞大架构,总参数量达到 35B,但在每次推理中仅激活 3B 参数,以此平衡性能与效率。Escha-W2 在此基础上进一步压缩,将整个模型打包为 12.3 GB 的磁盘占用,使其能够在单张 24 GB 显存的消费级 GPU(甚至 16 GB 显存显卡)上顺畅运行。项目还配套了与 OpenAI API 完全兼容的 HTTP 服务接口,使开发者几乎无需额外适配即可将这一高性能模型集成到现有工作流中。此举极大降低了部署大规模 MoE 模型的硬件门槛,将原本需要数据中心级别算力的能力下沉到个人开发者桌面,体现了模型压缩与本地化推理技术的最新进展,也延续了开源社区推动 AI 民主化的趋势。

核心要点

  • Escha-W2 是 Qwen3.6-35B-A3B 混合专家模型的 2 比特量化版本,总磁盘占用仅 12.3 GB。
  • 该模型可在单张 24 GB 消费级 GPU 上运行,甚至支持 16 GB 显存的显卡,大幅降低硬件门槛。
  • 项目内置 OpenAI 兼容的 HTTP API,便于开发者快速集成到现有应用中。

Read more >