Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式
Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy. 大语言模型的成功揭示了一个适用于一维序列数据的清晰 Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。
来自主题: AI技术研报
6613 点击 2026-09-10 10:19