QR Kod

PTCR: Knowledge-Based Visual Question Answering Framework Based on Large Language Model

Aiming at the problems of insufficient model input information and poor reasoning performance in knowledge-based visual question answering (VQA), this paper constructs a PTCR knowledge-based VQA framework based on large language model (LLM), which consists of four parts: answer candidate generation,...

Ful tanımlama

Kaydedildi:
Detaylı Bibliyografya
Yazar: XUE Di, LI Xin, LIU Mingshuai
Materyal Türü: Artigo
Dil:Chinês
Baskı/Yayın Bilgisi: Journal of Computer Engineering and Applications Beijing Co., Ltd., Science Press 2024-11-01
Seri Bilgileri:Jisuanji kexue yu tansuo
Konular:
Online Erişim:http://fcst.ceaj.org/fileup/1673-9418/PDF/2406028.pdf
Etiketler: Etiketle
Etiket eklenmemiş, İlk siz ekleyin!