基于外部知识的视觉问答研究

  • 打印
  • 收藏
收藏成功


打开文本图片集

摘要:视觉问答(Visual Question Answering, VQA) 是当前融合计算机视觉领域和自然语言处理领域的典型多模态问题之一,而基于知识的视觉问题回答任务要求模型具有关联外部知识的能力,文章采用多模态数据集当作外部知识源,相比从文本知识库中提取单模态的文本语义,多模态数据集能够提供视觉问答所需要的多模态知识,能够更好地利用图像中所蕴含的知识,并将其应用到针对图像中问题的回答中。(剩余8296字)

目录
monitor