漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-10 talkingdev

GPT-6 Astra与循环Transformer:隐藏推理如何重塑大模型参数效率?

近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...

Read More
2026-09-09 talkingdev

预训练进展主要来自数据:六年计算效率提升中数据改进贡献是模型的3.24倍

一项针对2019年至2025年预训练进展的拆解分析显示,计算效率提升的主要来源正从模型架构转向数据侧。研究发现,数据改进带来的计算效率增益约为模型改进的3.24倍,且两者基本相互独立、不存在显著交互效应。过去几年...

Read More
2026-08-31 talkingdev

NVIDIA发布DeepSeek-V4-Pro-0813-NVFP4量化模型:MoE架构助力智能体与企业级AI

NVIDIA在Hugging Face平台推出DeepSeek-V4-Pro-0813-NVFP4量化模型,该模型是DeepSeek-V4-Pro-0813的量化版本,采用自回归混合专家(MoE)语言模型架构。通过NVIDIA Model Optimizer量化后,模型在保持高级推理能力...

Read More
2026-07-28 talkingdev

Ramp Labs开源PorTAL框架:一次训练即可跨模型复用LoRA任务表示

Ramp Labs近日正式开源了PorTAL框架,这是一个面向共享任务表示与跨模型LoRA适配的前沿工具。PorTAL的核心思路在于将任务知识与基座模型解耦:它首先学习一个与模型架构无关的“任务隐变量”,再通过轻量级的逐模型对...

Read More
2026-07-28 talkingdev

月之暗面发布Kimi K3模型权重与技术报告:2.8T MoE原生视觉理解,百万Token上下文

月之暗面(Moonshot)正式开放其最新旗舰模型Kimi K3的权重,并同步发布详细技术报告。Kimi K3是一个总参数量达到2.8万亿的混合专家(MoE)模型,首次在架构层面原生融合视觉理解能力,可直接处理图像与文本交织的多...

Read More
2026-07-27 talkingdev

美企AI策略急转弯:从“烧Token”到“极致省钱”,混合中国模型冲击OpenAI等实验室IPO估值

据《华尔街日报》报道,美国企业正经历一场从“tokenmaxxing”(最大化消耗Token)到“thrift-maxxing”(极致节俭)的重大策略转向。越来越多的公司不再单纯依赖 OpenAI 和 Anthropic 的高端模型,而是开始将更便宜的中...

Read More
2026-07-23 talkingdev

美国能源部联手Arcee AI推出开放权重模型Genesis-Science-1,助力科学计算可复现

美国能源部与开放智能实验室Arcee AI宣布联合开发Genesis-Science-1(GS1),一个面向科学计算工作流的开放权重AI模型。该项目旨在解决科学研究中计算流程难以复现的长期痛点,通过透明、可定制的模型架构和开放权重...

Read More
2026-07-17 talkingdev

微软计划本月推出多模型AI安全工具,代号“Project Perception”,打造高性价比Mythos替代方案

据The Information报道,微软正酝酿在本月发布一款全新的AI安全产品,内部代号为“Project Perception”。该产品被定位为网络安全公司Mythos的更具成本效益的替代方案,旨在抢占企业日益增长的网络防御支出市场。值得...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page