多模态大模型技术
学习目标知识目标了解多模态大模型的基本概念及架构。掌握多模态大模型的预训练与微调。掌握多模态大模型的推理与生成。技能目标能够完成多模态大模型的部署。能够使用多模态大模型进行图文生成。
情景引入:AI交互的新挑战用户与AI的交互形式正在发生深刻演变:从早期的纯文本指令,逐步升级为“文本+图像+语音+视频”的混合信息输入形式,对AI的理解能力提出了更高要求。旧模型困境基于Transformer的纯文本模型,虽能厘清“地点+景观+等级”等多层次文本关联,但对视觉信息却“视而不见”。新挑战出现用户需求变得更立体:上传一张“玄武湖日落”的照片,要求推
原创力文档

文档评论(0)