QR-koodi

Co-LLaVA: Efficient Remote Sensing Visual Question Answering via Model Collaboration

Large vision language models (LVLMs) are built upon large language models (LLMs) and incorporate non-textual modalities; they can perform various multimodal tasks. Applying LVLMs in remote sensing (RS) visual question answering (VQA) tasks can take advantage of the powerful capabilities to promote t...

Täydet tiedot

Tallennettuna:
Bibliografiset tiedot
Päätekijät: Fan Liu, Wenwen Dai, Chuanyi Zhang, Jiale Zhu, Liang Yao, Xin Li
Aineistotyyppi: Artigo
Kieli:Inglês
Julkaistu: MDPI AG 2025-01-01
Sarja:Remote Sensing
Aiheet:
Linkit:https://www.mdpi.com/2072-4292/17/3/466
Tagit: Lisää tagi
Ei tageja, Lisää ensimmäinen tagi!