Transformer guided Multimodal VQA model for Fruit recognitions
Detecting counterfeit agricultural products presents a significant challenge requiring fine-grained visual discrimination, a task where standard Visual Question Answering (VQA) models often fall short. This paper introduces a novel multi-stream, multimodal Transformer architecture designed to addres...
Guardado en:
| Autores principales: | , |
|---|---|
| Formato: | Artigo |
| Lenguaje: | Inglês |
| Publicado: |
Elsevier
2026-04-01
|
| Colección: | ICT Express |
| Materias: | |
| Acceso en línea: | http://www.sciencedirect.com/science/article/pii/S2405959525001055 |
| Etiquetas: |
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
