Código QR

Context-aware Image Understanding in VQA with Dense-captioning

Visual Question Answering (VQA) is a complex task that requires models to jointly analyze visual and textual inputs to generate accurate answers. Reasoning and inference are critical for addressing questions that involve relationships, spatial arrangements, and contextual details within an image. In...

Descripción completa

Guardado en:
Detalles Bibliográficos
Autores principales: Elham Alighardash, Hassan Khotanlou, Simon Dobnik
Formato: Artigo
Lenguaje:Inglês
Publicado: Iran Telecom Research Center 2025-09-01
Colección:International Journal of Information and Communication Technology Research
Materias:
Acceso en línea:http://ijict.itrc.ac.ir/article-1-740-en.pdf
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!