多模态图文指令微调模型LLaVA技术研究与应用.pdfVIP

  • 0
  • 0
  • 约12.33万字
  • 约 38页
  • 2026-09-15 发布于北京
  • 举报

多模态图文指令微调模型LLaVA技术研究与应用.pdf

视觉指令微调

1

1∗2∗312

,李春元,,李永宰威斯康星大学–麦迪逊分校微

软3哥伦比亚大学

3202rpA7

1

利用机器生成的指令跟随数据对大型语言模型(LLM)进行指令微调,已

提升了其在新任务上的零样本能力,但该思路在多模态领域尚未充分探索。

本文首次尝试使用纯语言模型GPT‑4生成多模态图文指令跟随数据。通过

对生成数据进行指令微调,我们提出了LLaVA:大型语言与视觉助理,这

文档评论(0)

1亿VIP精品文档

相关文档