- 1
- 0
- 约9.72千字
- 约 10页
- 2026-08-05 发布于北京
- 举报
VLA、强化学习、世界模型:三者关系的深度解析
1.用概率语言统一三者
1.1一个统一的图模型
三个概念可以通过同一个概率图模型来理解。在时间维度上展开,整个智能体的运作包含这些变量:每一时刻的观测(摄像头图像、力传感器读数、关节角度等),每一时刻的动作(机械臂位移、夹爪开合等),每一时刻的奖励(任务完成度、安全性等),以及一个不可直接观测的潜状态——它是对环境真正发生了什么的压缩表示,也是世界模型运作的核心载体。
三个概念分别对应这个图模型中的不同条件分布。VLA关心的是从观测到动作的映射——看到什么,就做什么。世界模型关心的是给定历史和动作,预测下一时刻的观测和奖励——如果我这样做,接下来会看到什么、得到什么反馈。强化学习关心的则是找到让累积奖励最大化的那个动作选择规则。
1.2核心关系
世界模型的引入从根本上改变了VLA的决策方式。没有世界模型时,VLA是一个纯粹的反射式映射:看到输入,直接输出动作。有了世界模型之后,VLA可以隐式或显式地进行模型预测控制——在脑中推演不同动作序列会带来什么样的未来,选择预期累积奖励最高的那个动作。
强化学习则负责优化这两种形式的参数。区别只在于梯度信号的来源:没有世界模型时,梯度通过真实环境的交互来估计,每一次更新都意味着机器人真的动了一次;有世界模型时,梯度可以通过世界模型的潜空间反向传播,策略可以在内部模拟中大量训练,
您可能关注的文档
最近下载
- 电子装配基础知识培训课件.pptx VIP
- (中联牌)WA7015-10M 塔式起重机操作手册(ETI 2022.pdf VIP
- DBJT 13-534-2026高延性纤维增强水泥基复合材料加固砌体结构技术标准.pdf VIP
- 2026年中国物流集团有限公司校园招聘笔试备考试题及答案解析.docx VIP
- 起亚-索兰托-产品使用说明书-索兰托-索兰托L 2.4L 7座4驱尊贵版-国4-索兰托L产品使用说明书.pdf VIP
- 《应用数学》课程思政示范课程、教学名师和团队申报书.pdf VIP
- 草菇栽培技术课件.ppt VIP
- 03J103-7 石材框架幕墙_标准图集.pdf VIP
- 2026年公安机关人民警察执法资格等级考试题库含完整答案.docx VIP
- 机电设备安装改造工程施工组织设计.pdf
原创力文档

文档评论(0)