QR Kodea

Mini-InternVL: a flexible-transfer pocket multi-modal model with 5% parameters and 90% performance

Abstract Multi-modal large language models (MLLMs) have demonstrated impressive performance in vision-language tasks across a wide range of domains. However, the large model scale and associated high computational cost pose significant challenges for training and deploying MLLMs on consumer-grade GP...

Deskribapen osoa

Gorde:
Xehetasun bibliografikoak
Egile Nagusiak: Zhangwei Gao, Zhe Chen, Erfei Cui, Yiming Ren, Weiyun Wang, Jinguo Zhu, Hao Tian, Shenglong Ye, Junjun He, Xizhou Zhu, Lewei Lu, Tong Lu, Yu Qiao, Jifeng Dai, Wenhai Wang
Formatua: Artigo
Hizkuntza:Inglês
Argitaratua: Springer 2024-12-01
Saila:Visual Intelligence
Gaiak:
Sarrera elektronikoa:https://doi.org/10.1007/s44267-024-00067-6
Etiketak: Etiketa erantsi
Etiketarik gabe, Izan zaitez lehena erregistro honi etiketa jartzen!