Context-aware Image Understanding in VQA with Dense-captioning
Visual Question Answering (VQA) is a complex task that requires models to jointly analyze visual and textual inputs to generate accurate answers. Reasoning and inference are critical for addressing questions that involve relationships, spatial arrangements, and contextual details within an image. In...
Guardado en:
| Autores principales: | , , |
|---|---|
| Formato: | Artigo |
| Lenguaje: | Inglês |
| Publicado: |
Iran Telecom Research Center
2025-09-01
|
| Colección: | International Journal of Information and Communication Technology Research |
| Materias: | |
| Acceso en línea: | http://ijict.itrc.ac.ir/article-1-740-en.pdf |
| Etiquetas: |
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
