摘要
摘要
在智慧城市建设持续推进的背景下,城市运行数据呈现出来源多样、结构复杂与动态
变化等特征,相关任务往往需要在图像信息与自然语言描述的协同约束下完成对象识别、
空间关系分析及多步骤推理等过程。这类问题对系统的跨模态理解能力与推理能力提出了
更高要求。随着多模态大模型的发展,基于语言驱动的智能体系统逐渐成为解决复杂场景
理解与决策问题的重要技术路径。然而,在开放语言交互环境中,任务目标与约束主要由
自然语言输入给出,系统推
摘要
摘要
在智慧城市建设持续推进的背景下,城市运行数据呈现出来源多样、结构复杂与动态
变化等特征,相关任务往往需要在图像信息与自然语言描述的协同约束下完成对象识别、
空间关系分析及多步骤推理等过程。这类问题对系统的跨模态理解能力与推理能力提出了
更高要求。随着多模态大模型的发展,基于语言驱动的智能体系统逐渐成为解决复杂场景
理解与决策问题的重要技术路径。然而,在开放语言交互环境中,任务目标与约束主要由
自然语言输入给出,系统推
文档评论(0)