Text-Guided Visual Representation Optimization for Sensor-Acquired Video Temporal Grounding
Video temporal grounding (VTG) aims to localize a semantically relevant temporal segment within an untrimmed video based on a natural language query. The task continues to face challenges arising from cross-modal semantic misalignment, which is largely attributed to redundant visual content in senso...
Guardat en:
| Autors principals: | , , , |
|---|---|
| Format: | Artigo |
| Idioma: | Inglês |
| Publicat: |
MDPI AG
2025-07-01
|
| Col·lecció: | Sensors |
| Matèries: | |
| Accés en línia: | https://www.mdpi.com/1424-8220/25/15/4704 |
| Etiquetes: |
Sense etiquetes, Sigues el primer a etiquetar aquest registre!
|
