- 10
- 0
- 约3.21万字
- 约 33页
- 2023-04-13 发布于浙江
- 举报
基于 VGG 和 LSTM 网络的视觉问答系统研究
与应用
摘 要
随着互联网的发展,人类可以获得的数据信息量呈指数型增长,我们能够
数据中获得的知识也大大增多,人工智能的研究和应用再一次焕发活力。随着人
工智能应用的不断发展,近年来,产生了有关视觉问答 (Visual Question
answering,VQA)的研究,并发展成为人工智能应用的一大热门问题。视觉问答
任务是一个多领域、跨学科的任务,以一张图片和一个关于图片形式自由、开
[1]
放式的自然语言问题作为输入,以生成一条自然语言答案作为输出 。简单来
说,VQA 就是对给定的图片进行问答。本设计结合当前 VQA 的研究现状,基于
深度学习理论,研究了 VGG+LSTM 网络的视觉问答系统,即用VGG 网络对图片进
行特征提取,用 LSTM 网络对问题进行特征提取和系统输出答案的特征生成。最
终将这一复杂的人工智能系统,转化为一个多分类问题,实现了对一张图片用
自然语言句子进行提问,然后用自然语言的一个单词来回
原创力文档

文档评论(0)