04_AI 与前沿科技科普系列_多模态大模型_能看能听会说的AI_完整版.pptxVIP

  • 1
  • 0
  • 约4.57千字
  • 约 32页
  • 2026-08-13 发布于浙江
  • 举报

04_AI 与前沿科技科普系列_多模态大模型_能看能听会说的AI_完整版.pptx

多模态大模型能看、能听、会说的AIAI与前沿科技科普系列·04面向零基础大众的AI科普

目录01从“只会读文字”到“五官全开”多模态定义、与纯文本大模型的区别02多模态如何工作统一表示、编解码器、视觉编码器03代表模型巡礼GPT-4o、Gemini、Claude、通义千问、文心一言04能做什么应用场景图片问答、语音对话、教育医疗等05挑战与未来幻觉、端侧部署、世界模型多模态大模型AI与前沿科技科普系列·042/32

第一章从“只会读文字”到“五官全开”多模态定义、与纯文本大模型的区别

什么是“模态”?“模态”是人类感知世界的不同渠道视觉模态:看图片、视频、文字听觉模态:听语音、音乐、环境声语言模态:读写文本、对话交流触觉/其他:3D模型、传感器数据多模态=同时处理多种信息形式???视觉??听觉???语言?触觉AI与前沿科技科普系列·044/32

纯文本大模型vs多模态大模型纯文本大模型只能处理文字输入和输出无法理解图片、音频、视频好比“只会读书的学者”代表:GPT-3、早期ChatGPT局限:无法感知真实世界多模态大模型同时处理文字、图片、音频、视频能“看懂”图片、“听懂”语音好比“五官全开的全能艺术家”代表:GPT-4o、Gemini、Qwen-VL突破:打通文本与物理世界的壁垒AI与前沿科技科普系列·045/32

多模态大

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档