具身智能导论_第7章 视觉-语言-动作模型.pptxVIP

  • 1
  • 0
  • 约1.91万字
  • 约 131页
  • 2026-09-16 发布于山东
  • 举报

具身智能导论_第7章 视觉-语言-动作模型.pptx

具身智能导论第7章视觉-语言-动作模型

具身智能导论·第7章视觉-语言-动作模型2“真知即所以为行,不行不足谓之知。”——王阳明《传习录·卷中·答顾东桥书》视觉-语言-动作模型的基本思想把视觉感知、自然语言理解与物理动作执行统一到一个端到端系统中,让机器人能够“看、听、做”,并通过真实环境反馈持续闭环调整。

具身智能导论·第7章视觉-语言-动作模型3VLA模型的三个直观特征多模态输入同时理解图像、语言,并可进一步融合深度、触觉和机器人状态。端到端动作输出从原始观测直接生成关节角度、末端速度或离散动作序列。闭环执行感知环境变化,重新判断与规划,在执行中持续修正动作。目标:把“理解世界”进一步推进到“在世界中行动”。

具身智能导论·第7章视觉-语言-动作模型4学习目标01基本概念理解多模态融合、端到端学习以及“感知-认知-决策-行动”闭环。02视觉抓取掌握视觉抓取原理、YOLO检测、6D姿态、抓取点预测与动作执行。03动作生成理解动作序列规划、生成式动作序列与扩散策略的基本机制。04VLA训练区分模仿学习与强化学习在VLA训练中的互补作用,并评价优势与局限。05实践部署基于开源框架完成轻量级VLA实验,关注泛化、虚实迁移与部署挑战。

具身智能导论·第7章视觉-语言-动作模型5本章目录7.1概述7.2视觉抓取7.3动作序列规划

文档评论(0)

1亿VIP精品文档

相关文档