QR код

AVCaps: An Audio-Visual Dataset With Modality-Specific Captions

This paper introduces AVCaps, an audio-visual dataset that contains separate textual captions for the audio, visual, and audio-visual contents of video clips. The dataset contains 2061 video clips constituting a total of 28.8 hours. We provide up to 5 captions for the audio, visual, and audio-visual...

Бүрэн тодорхойлолт

-д хадгалсан:
Номзүйн дэлгэрэнгүй
Үндсэн зохиолчид: Parthasaarathy Sudarsanam, Irene Martin-Morato, Aapo Hakala, Tuomas Virtanen
Формат: Artigo
Хэл сонгох:Inglês
Хэвлэсэн: IEEE 2025-01-01
Цуврал:IEEE Open Journal of Signal Processing
Нөхцлүүд:
Онлайн хандалт:https://ieeexplore.ieee.org/document/11029114/
Шошгууд: Шошго нэмэх
Шошго байхгүй, Энэхүү баримтыг шошголох эхний хүн болох!