- 3
- 0
- 约1.89万字
- 约 13页
- 2023-04-22 发布于四川
- 举报
一种基于多模态特征的视频实体关系及交互识别方法,对影片中实体之间的交互进行预测识别:对影片根据场景划分为中片段,对中片段分别向上聚合为长片段,向下分割为短片段,对于每个中片段,将提取的实体特征、实体对特征、视频片段特征、音频特征和文字特征进行拼接作为该片段的融合特征,取平均作为长片段的特征预测长片段中的实体关系,并将该平均特征连接到每一个中片段特征,用于预测对应的中片段中的实体之间的互动,实体关系和实体互动同时进行预测,并联合训练对应的识别网络。本发明将长视频分为三种长度的视频,对长片段预测实体
(19)中华人民共和国国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 113936236 A
(43)申请公布日 2022.01.14
(21)申请号 202111116334.1 G06V 10/26 (2022.01)
原创力文档

文档评论(0)