近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...
Read MoreZeroModels 是一个完全基于 Keras 3 构建的预训练模型集合,覆盖图像分类、目标检测、分割、单目深度估计、特征提取、视觉语言模型和语音识别等任务。该项目最大的亮点在于同一套代码可原生运行在 JAX、PyTorch 和 T...
Read More人工智能研究公司Pathway近日获得3000万美元种子轮融资,投后估值达到5亿美元。该公司正在开发基于其称为“Post-Transformer”(后Transformer)的BDH架构AI模型,这一路线被外界视为对当前主流Transformer架构的探索...
Read More人工智能公司Thinking Machines正式发布了其首个开放权重模型Inkling。这是一个参数规模高达9750亿的混合专家(Mixture-of-Experts)Transformer模型,原生支持文本、图像和音频的多模态输入与理解。Inkling最引人注...
Read More近日,AI2研究团队在Hugging Face博客上发布了DiScoFormer模型,这是一种基于Transformer架构的创新方法,能够在单次前向传播中同时完成数据的密度估计和得分函数估计,而无需针对新分布进行重新训练。与经典的核密...
Read More人工智能领域正经历一场深刻的架构变革,从封闭的垂直集成系统向由标准化接口(如Transformer架构和推理API)支撑的模块化生态系统演进。这种架构上的解构使得开源权重模型能够与封闭系统有效竞争,大幅降低成本,同...
Read More近日,Liquid AI宣布推出其最新基础模型LFM2.5-230M,这是一款参数规模仅为2.3亿的非Transformer架构模型。与当前主流的Transformer模型不同,LFM2.5-230M基于状态空间模型与液态神经网络连续时间公式构建。尽管体积...
Read More大型语言模型(LLM)的核心架构是Transformer,它通过引入自注意力机制,从根本上解决了传统循环神经网络(RNN)在处理长序列数据时面临的顺序计算瓶颈与长距离信息衰减问题。本文深入剖析了Transformer的各个关键组...
Read More