链式思维(Chain-of-Thought, CoT)是当前监督和解读大模型推理过程的重要工具,但一些新型架构变化可能显著降低CoT的可监控性。针对这一问题,Redwood Research提出“不透明串行深度”的可操作化概念,将“文本瓶颈之...
Read MoreRhoda AI 团队围绕视频基础模型与机器人策略的规模化问题展开研究,重点考察扩大模型参数量与预训练计算量,是否能直接提升机器人在真实工业环境中的操作能力。研究采用 Direct Video-Action 模型,直接将视频观测映...
Read MoreOpenAI首席执行官Sam Altman向员工表示,公司对放慢前沿人工智能模型的开发持开放态度。此前,OpenAI已就其先进AI系统可能带来的风险提出警告,认为出于安全考虑,模型开发应适时暂停。这一表态发生在部分研究人员言...
Read More近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...
Read MoreOpenAI 非营利董事会成员、AI 对齐研究领域的重要人物 Paul Christiano 在社交平台表示,他将加入 OpenAI 非营利董事会,并在安全与保障委员会任职,以支持安全监督工作。他同时发出明确警告:当前 AI 行业并未走在...
Read More据路透社报道,中国AI芯片厂商华为、寒武纪、MetaX与Iluvatar CoreX已对当前及下一代芯片产品提价20%-50%,主要原因是高带宽存储器(HBM)成本上升。HBM通过3D堆叠DRAM提供远高于普通内存的带宽,是AI训练和推理芯片...
Read MoreCohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...
Read More一项针对2019年至2025年预训练进展的拆解分析显示,计算效率提升的主要来源正从模型架构转向数据侧。研究发现,数据改进带来的计算效率增益约为模型改进的3.24倍,且两者基本相互独立、不存在显著交互效应。过去几年...
Read More