Rhoda AI 研究:扩展网络视频预训练,能否让真实机器人更会干活?
talkingdev • 2026-09-11
1036 views
Rhoda AI 团队围绕视频基础模型与机器人策略的规模化问题展开研究,重点考察扩大模型参数量与预训练计算量,是否能直接提升机器人在真实工业环境中的操作能力。研究采用 Direct Video-Action 模型,直接将视频观测映射为动作输出,并在复杂工业拆包任务中进行实测。结果显示,更大的视频模型和更高的预训练算力带来了稳定的任务性能提升;这种收益主要来自模型对留出网络视频预测能力的增强。值得注意的是,预训练质量指标 DINO FD 可以有效预测下游机器人效率,为后续模型筛选与部署提供了实用依据。该研究为具身智能在大规模视频预训练路径上的可扩展性提供了新的实证支撑,也表明视频预训练质量有望成为工业机器人能力评估和迭代的重要参考。
核心要点
- 更大视频模型与更多预训练计算可稳定提升真实机器人操作表现
- 预训练质量指标 DINO FD 能预测下游机器人效率,为模型筛选提供依据
- 复杂工业拆包等真实场景验证了视频预训练在机器人部署中的可扩展性