- 1
- 0
- 约3.66千字
- 约 21页
- 2026-10-08 发布于江苏
- 举报
提纲 OUTLINES一、范式变革:基于多模态大模型的自动驾驶技术二、世界模型驱动的一段式端到端解决方案可望获得突破三、发展趋势:从感知智能到认知智能清华大学人工智能研究院视觉智能研究中心VisualIntelligenceResearchCenter(VIRC),InstituteforArtificialIntelligence,TsinghuaUniversity
提纲 OUTLINES一、范式变革:基于多模态大模型的自动驾驶技术二、世界模型驱动的一段式端到端解决方案可望获得突破三、发展趋势:从感知智能到认知智能清华大学人工智能研究院视觉智能研究中心VisualIntelligenceResearchCenter(VIRC),InstituteforArtificialIntelligence,TsinghuaUniversity
VLA融合了感知空间与动作空间,给出了两个空间与三大任务:两大空间:从感知或观察空间到动作空间,还是从动作空间到感知空间?两个空间之间的单段式或单模型一体化相互作用;三个下游微调模型,即三大任务:具身理解、具身推理与具身动作生成大模型;基于上述三大微调模型,可优化训练更多的下游微调模型本质上将VLM面向数字空间的理解与生成推向了面向物理世界的理解与生成!感知空间动作空间决策推理或策略1、多模态大模型推
原创力文档

文档评论(0)