Transformer guided Multimodal VQA model for Fruit recognitions
Detecting counterfeit agricultural products presents a significant challenge requiring fine-grained visual discrimination, a task where standard Visual Question Answering (VQA) models often fall short. This paper introduces a novel multi-stream, multimodal Transformer architecture designed to addres...
Uloženo v:
| Hlavní autoři: | , |
|---|---|
| Médium: | Artigo |
| Jazyk: | Inglês |
| Vydáno: |
Elsevier
2026-04-01
|
| Edice: | ICT Express |
| Témata: | |
| On-line přístup: | http://www.sciencedirect.com/science/article/pii/S2405959525001055 |
| Tagy: |
Žádné tagy, Buďte první, kdo vytvoří štítek k tomuto záznamu!
|
