- 2
- 0
- 约1.15万字
- 约 10页
- 2026-08-12 发布于湖南
- 举报
增持(维持)
投资要点
n多模态智能的本质,是把文本、图像、音频、视频等映射进统一表示,并在此基础上完成理解、推理、生成与交互。我们认为,多模态是AI2.0“架构、任务、模态三重收敛”在模态维度的集中兑现。
n我们依据“模态对齐发生在流程的哪个阶段”,将多模态的发展过程划分三阶段:2021—2023年为外挂式/组合式阶段,CLIP、Flamingo、BLIP-2、LLaVA等通过视觉编码器、投影层、Q-Former或指令微调把图像接入语言模型;2023—2024年进入原生多模态阶段,Gemini代表多模态能力从接口层前移到预训练阶段;2024年至今进入全
原创力文档

文档评论(0)