漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-30 talkingdev

Escha-W2:将35B混合专家模型压缩至12.3GB,单张消费级GPU即可本地运行

EschaLabs 近日发布了 Escha-W2,这是对 Qwen3.6-35B-A3B 混合专家(MoE)模型进行 2 比特量化后的构建版本。Qwen3.6-35B-A3B 本身是一个包含 256 个专家的庞大架构,总参数量达到 35B,但在每次推理中仅激活 3B 参...

Read More
2026-07-29 talkingdev

Kimi K3架构全面公开:LatentMoE、Kimi Delta Attention与原生多模态驱动推理效率跃迁

近日,Kimi K3模型的开放权重发布揭示了其架构的诸多细节。该模型本质上是去年发布的Kimi Linear架构的规模化生产版本,整体设计明显向着更高的推理效率演进。K3现已原生支持多模态输入,进一步拓宽了应用边界。本次...

Read More
2026-07-28 talkingdev

开源|Molt:英伟达发布原生PyTorch智能体强化学习框架,可扩展至万亿参数MoE模型训练

英伟达NeMo团队近日在GitHub上开源了一个名为Molt的智能体强化学习框架。该框架采用PyTorch原生设计,核心理念是将智能体本身视为可执行的程序,而非传统强化学习中固定的策略网络。Molt支持高度灵活的自定义Python...

Read More
2026-07-28 talkingdev

月之暗面发布Kimi K3模型权重与技术报告:2.8T MoE原生视觉理解,百万Token上下文

月之暗面(Moonshot)正式开放其最新旗舰模型Kimi K3的权重,并同步发布详细技术报告。Kimi K3是一个总参数量达到2.8万亿的混合专家(MoE)模型,首次在架构层面原生融合视觉理解能力,可直接处理图像与文本交织的多...

Read More
2026-07-24 talkingdev

如何打造前沿模型工厂:Poolside AI揭示118B MOE模型Laguna S背后的训练体系

Poolside AI联合首席执行官Eiso Kant深度分享了其团队如何以精简但高效的研究架构,构建起能够训练118B参数混合专家模型Laguna S的“模型工厂”。Laguna S在实际表现中据称超越了Thinky近1万亿参数的开放权重模型,显...

Read More
2026-07-22 talkingdev

Poolside 发布 Laguna S 2.1:1180 亿参数 MoE 模型,专攻智能体编程,上下文窗口突破 100 万 token

专攻 AI 编码的初创公司 Poolside 在 Hugging Face 上正式发布了其最新大型语言模型 Laguna S 2.1。该模型采用混合专家架构,总参数量高达 1180 亿,但每个 token 仅激活其中 80 亿个参数,在保持强大能力的同时实现...

Read More
2026-05-20 talkingdev

AI2发布OlmoEarth v1.1:行星级遥感分析成本骤降3倍,性能不变

艾伦人工智能研究所(Ai2)最新发布的OlmoEarth v1.1模型家族,在遥感智能分析领域实现了显著的成本突破。该系列模型通过创新的序列长度优化技术,将处理遥感数据的计算成本最高降低至原来的三分之一(即3倍效率提升...

Read More
2026-04-23 talkingdev

Qwen3.6-27B震撼发布:27B稠密模型实现旗舰级编码性能,超越前代397B MoE巨兽

Qwen团队今日发布了其最新的开源权重模型Qwen3.6-27B,在AI社区引发广泛关注。该模型虽然仅有27B参数(稠密架构),却在智能体编码任务中实现了旗舰级性能。据Qwen团队宣称,Qwen3.6-27B在全部主流编码基准测试中均...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page