参考学习资料 AI人工智能 gpt52_finger_counting_deck.pptxVIP

  • 1
  • 0
  • 约4.45千字
  • 约 17页
  • 2026-08-20 发布于广西
  • 举报

参考学习资料 AI人工智能 gpt52_finger_counting_deck.pptx

为什么“六根手指”会被数成五根?以GPT-5.2这一类大型视觉语言模型(VLM)的常见失误模式为例案例图片

先从案例说起:这张图“肉眼”到底像几根?CASE可见的5根手指(图例):①拇指②食指③中指④无名指⑤小指这里的关键“冲突点”用户假设:图片里有6根手指。模型输出:只识别到5根。现实可能:A)图片确实只呈现5根;B)第6根被遮挡/融合/伪影化。本报告要回答的问题为什么“数指头”对VLM很难?为什么它更倾向于输出“五根”这一高频答案?怎样让模型更可靠地“看一根、数一根”?提示:后续原因分析同时覆盖“真实6指”与“视觉呈现像6指”的两类情况。

VLM如何“看图说话”:从像素到文字MECH典型流程(简化)图像被切成patch/token(类似“视觉单词”)。视觉编码器把patch变成向量特征。这些视觉token与文本token在同一“对齐空间”交互。语言解码器生成答案(这里:数字词“5/6”)。图像输入视觉编码器(Transformer/CNN)跨模态对齐(注意力/融合)语言解码器(生成答案)输出:“这是一只手,有5根手指”“数”属于需要精确局部证据的能力,但生成式回答会混入先验与语言偏置。

为什么“计数”对VLM是硬题?WHY研究现象:熟悉目标被“轻微改动”后VLM计数准确率会断崖式下降

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档