近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...
Read More一项针对2019年至2025年预训练进展的拆解分析显示,计算效率提升的主要来源正从模型架构转向数据侧。研究发现,数据改进带来的计算效率增益约为模型改进的3.24倍,且两者基本相互独立、不存在显著交互效应。过去几年...
Read MoreNVIDIA在Hugging Face平台推出DeepSeek-V4-Pro-0813-NVFP4量化模型,该模型是DeepSeek-V4-Pro-0813的量化版本,采用自回归混合专家(MoE)语言模型架构。通过NVIDIA Model Optimizer量化后,模型在保持高级推理能力...
Read MoreRamp Labs近日正式开源了PorTAL框架,这是一个面向共享任务表示与跨模型LoRA适配的前沿工具。PorTAL的核心思路在于将任务知识与基座模型解耦:它首先学习一个与模型架构无关的“任务隐变量”,再通过轻量级的逐模型对...
Read More月之暗面(Moonshot)正式开放其最新旗舰模型Kimi K3的权重,并同步发布详细技术报告。Kimi K3是一个总参数量达到2.8万亿的混合专家(MoE)模型,首次在架构层面原生融合视觉理解能力,可直接处理图像与文本交织的多...
Read More据《华尔街日报》报道,美国企业正经历一场从“tokenmaxxing”(最大化消耗Token)到“thrift-maxxing”(极致节俭)的重大策略转向。越来越多的公司不再单纯依赖 OpenAI 和 Anthropic 的高端模型,而是开始将更便宜的中...
Read More美国能源部与开放智能实验室Arcee AI宣布联合开发Genesis-Science-1(GS1),一个面向科学计算工作流的开放权重AI模型。该项目旨在解决科学研究中计算流程难以复现的长期痛点,通过透明、可定制的模型架构和开放权重...
Read More据The Information报道,微软正酝酿在本月发布一款全新的AI安全产品,内部代号为“Project Perception”。该产品被定位为网络安全公司Mythos的更具成本效益的替代方案,旨在抢占企业日益增长的网络防御支出市场。值得...
Read More