漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-11 talkingdev

Rhoda AI 研究:扩展网络视频预训练,能否让真实机器人更会干活?

Rhoda AI 团队围绕视频基础模型与机器人策略的规模化问题展开研究,重点考察扩大模型参数量与预训练计算量,是否能直接提升机器人在真实工业环境中的操作能力。研究采用 Direct Video-Action 模型,直接将视频观测映...

Read More
2026-09-10 talkingdev

ZeroModels 发布:基于 Keras 3 的预训练模型库,一套代码跑通 JAX、PyTorch、TensorFlow

ZeroModels 是一个完全基于 Keras 3 构建的预训练模型集合,覆盖图像分类、目标检测、分割、单目深度估计、特征提取、视觉语言模型和语音识别等任务。该项目最大的亮点在于同一套代码可原生运行在 JAX、PyTorch 和 T...

Read More
2026-09-09 talkingdev

预训练进展主要来自数据:六年计算效率提升中数据改进贡献是模型的3.24倍

一项针对2019年至2025年预训练进展的拆解分析显示,计算效率提升的主要来源正从模型架构转向数据侧。研究发现,数据改进带来的计算效率增益约为模型改进的3.24倍,且两者基本相互独立、不存在显著交互效应。过去几年...

Read More
2026-09-09 talkingdev

Magic 预训练效率提升超10倍,剑指万亿参数模型

AI 初创公司 Magic 发布预训练研究更新,称其预训练方案的计算效率已比主流开源权重基础模型提升超过 10 倍,并正将规模扩展至万亿参数级别。团队认为,在缺乏大规模算力的情况下,小型实验室只能依靠算法效率参与竞...

Read More
2026-09-01 talkingdev

谷歌发布TimesFM-3:万亿时间点预训练,多变量预测进入零样本时代

谷歌近日发布TimesFM-3,这是一款拥有3.3亿参数的时间序列基础模型,预训练数据规模超过1万亿个时间点。该模型聚焦零样本预测,可在不进行任务特定微调的情况下对多个目标变量进行联合预测,并支持历史协变量和已知...

Read More
2026-08-11 talkingdev

大模型知识截止日期背后:通过精准探测逆向推演GPT与Claude的训练时间线与数据混合秘辛

一项颇具技术趣味的研究揭示了如何通过向GPT、Claude等前沿大模型提出精心设计的问题,来逆向推断模型训练过程中的隐藏事实。研究人员发现,用特定领域的冷门知识对模型进行评分,可以大致估算出模型的参数量规模;...

Read More
2026-08-10 talkingdev

模型基因组:给大模型做个“DNA鉴定”,一眼看穿是否从零训练

在开源大语言模型百花齐放的今天,一个模型究竟是真正从零开始预训练,还是基于现有开源权重衍生微调,常让外界难以分辨。Hugging Face社区发布的“Model Genome”项目,首次提出用类似生物基因指纹的方式为模型“验明...

Read More
2026-08-07 talkingdev

字节跳动被曝预训练10万亿参数超大模型,规模达Kimi K3的三倍,刷新行业纪录

据《金融时报》援引知情人士消息,TikTok母公司字节跳动正在预训练一个参数量高达10万亿的超大规模人工智能模型。这一数字大约是月之暗面Kimi K3模型参数量的三倍,也超过了Anthropic传闻中Mythos 5约8万亿参数的预...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page