基于场景图生成的视觉理解研究综述.docVIP

  • 2
  • 0
  • 约7.33千字
  • 约 8页
  • 2026-10-01 发布于江苏
  • 举报

基于场景图生成的视觉理解研究综述.doc

基于场景图生成的视觉理解研究综述

视觉理解是计算机视觉领域的核心任务,旨在让机器具备像人类一样解析视觉内容的能力,不仅能识别图像中的单个物体,更要理解物体之间的语义关联与空间布局,从而实现对场景的深度认知。场景图(SceneGraph)作为一种结构化的语义表示形式,以“实体-关系-实体”的三元组为基本单元,将图像内容映射为包含节点(物体类别、属性)和边(交互关系、空间关系)的图结构,为视觉理解任务提供了可解释、可推理的信息载体。近年来,随着深度学习技术的发展,场景图生成(SceneGraphGeneration,SGG)技术不断突破,在目标检测、关系预测、多模态融合等领域取得了显著进展,成为连接底层视觉信号与高层语义理解的关键桥梁,广泛应用于图像captioning、视觉问答、机器人导航、跨模态检索等下游任务。

场景图生成的任务定义与基本框架

场景图生成的核心目标是从输入图像中自动提取结构化的语义表示,完整的场景图通常包含三个层次的信息:一是实体节点,对应图像中的每个物体,包含物体的类别标签(如“人”“猫”“桌子”)和属性信息(如“红色的”“坐着的”);二是关系边,连接两个存在关联的实体节点,描述实体之间的交互关系(如“人-骑-自行车”)、空间关系(如“猫-在桌子上-桌子”)、从属关系(如“车轮-属于-汽车”)等;三是全局上下文信息,涵盖场景的整体类别(如“会议室”“海滩

文档评论(0)

1亿VIP精品文档

相关文档