AVCaps: An Audio-Visual Dataset With Modality-Specific Captions
This paper introduces AVCaps, an audio-visual dataset that contains separate textual captions for the audio, visual, and audio-visual contents of video clips. The dataset contains 2061 video clips constituting a total of 28.8 hours. We provide up to 5 captions for the audio, visual, and audio-visual...
-д хадгалсан:
| Үндсэн зохиолчид: | , , , |
|---|---|
| Формат: | Artigo |
| Хэл сонгох: | Inglês |
| Хэвлэсэн: |
IEEE
2025-01-01
|
| Цуврал: | IEEE Open Journal of Signal Processing |
| Нөхцлүүд: | |
| Онлайн хандалт: | https://ieeexplore.ieee.org/document/11029114/ |
| Шошгууд: |
Шошго байхгүй, Энэхүү баримтыг шошголох эхний хүн болох!
|
