Reno Kriz, Toward Event-Centric Video Retrieval and Summarization: (SCALE 2024 and SCALE 2026

Reno Kriz, Toward Event-Centric Video Retrieval and Summarization: (SCALE 2024 and SCALE 2026

Reno Kriz, Vers la récupération et la synthèse de vidéos centrées sur les événements : (SCALE 2024 et SCALE 2026)

🎙 Reno Kriz 👥 4K 📅 1 septembre 2026 ⏱ 76 min 👁 0 📄 revue d'actualité 🧭 2026-09-01
Disponible en : Français (actuel) English

Mots-clés

retrieval vidéoévénementsmultimodalfusionRAG

Résumé

Cette présentation de Reno Kriz, chercheur au HLTCOE de Johns Hopkins, détaille les travaux menés dans le cadre des ateliers SCALE 2024 et SCALE 2026, consacrés à la recherche et au résumé de vidéos centrés sur les événements. L’orateur commence par contextualiser le problème : la majorité du contenu événementiel en ligne provient désormais de non-professionnels (témoins oculaires, flux en direct), avec des vidéos brutes, non éditées, souvent sans métadonnées descriptives. Il oppose cette difficulté aux vidéos professionnelles (journaux télévisés) qui sont plus faciles à traiter. Il présente ensuite le jeu de données MultiVENT, comprenant environ 2500 vidéos ‘aiguilles’ pour 250 événements, et MultiVENT 2.0, enrichi de 100 000 vidéos distractrices et de requêtes. Les résultats de SCALE 2024 montrent que l’extraction de texte (OCR, transcription vocale) et son traitement par des modèles de résumé (LLM) améliorent nettement la recherche par rapport à l’utilisation seule de caractéristiques visuelles (CLIP). La fusion multimodale, avec une pondération adaptée au type de vidéo (professionnelle vs brute), donne les meilleurs résultats. L’orateur souligne que la recherche sur des vidéos brutes est nettement plus difficile que sur des vidéos éditées. Enfin, il présente les orientations de SCALE 2026, qui se concentre sur les vidéos brutes et introduit une tâche de génération augmentée par récupération (RAG) multimodale, où le système doit générer un résumé cohérent à partir de segments vidéo pertinents. Il mentionne également les ateliers MAGMAR à ACL et le jeu de données WikiVideo pour la RAG multimodale.

243 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’orateur présente des résultats concrets issus d’ateliers de recherche intensifs, avec des comparaisons entre modalités (vision, parole, OCR, texte) et des analyses des forces et faiblesses de chacune. L’argumentation est solide, appuyée par des exemples concrets (incendie de Notre-Dame) et des données chiffrées (améliorations de performance). L’orateur répond également aux questions du public avec précision, clarifiant des points techniques comme la fusion multimodale ou l’utilisation des métadonnées. La démonstration de la supériorité des approches textuelles sur les approches purement visuelles est convaincante, tout en reconnaissant les limites des modèles actuels sur les vidéos brutes.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur est un chercheur impliqué directement dans les projets, et il mentionne des publications (MultiVENT à NeurIPS 2023, MultiVENT 2.0 à CVPR 2025, ateliers MAGMAR à ACL). Cependant, il ne fournit pas de références bibliographiques complètes dans la description, et certains détails techniques (formules exactes, modèles précis) restent vagues. L’adéquation titre/contenu est bonne, le titre reflétant bien le sujet, malgré une parenthèse non fermée. Aucun commentaire n’est fourni, donc aucune tendance du public n’est analysée.

197 mots

Adéquation titre / contenu

Le titre est légèrement incomplet (parenthèse non fermée) mais reflète bien le contenu : présentation des ateliers SCALE 2024 et SCALE 2026 sur la recherche et le résumé de vidéos centrés sur les événements.

Qualité & fiabilité

7/10

Exposé technique par un chercheur impliqué directement dans les projets décrits, avec des résultats chiffrés et des références à des publications. Cependant, les détails méthodologiques sont parfois imprécis (formules, modèles exacts) et aucune source externe n'est citée dans la description.

Moments clés

Sources citées

  • MultiVENT: Multilingual Videos of Events with Aligned Natural Text — Jeu de données présenté comme la base des travaux, publié à NeurIPS 2023.
  • MultiVENT 2.0 — Version étendue du jeu de données, présentée comme acceptée à CVPR 2025.
  • Ateliers MAGMAR à ACL — Ateliers sur la recherche et la génération multimodale, mentionnés comme travaux intermédiaires.

Sources concordantes

Sources discordantes

  • Aucune source discordante identifiée — Aucune source contredisant les propos de l'orateur n'a été mentionnée dans la vidéo.

Apport & nouveautés

L’apport principal est la mise en évidence de l’importance du texte extrait des vidéos (OCR, transcription) pour la recherche événementielle, surpassant les approches purement visuelles. L’idée de fusionner les modalités avec une pondération adaptée au type de vidéo (professionnelle vs brute) est également novatrice. La création de jeux de données à grande échelle (MultiVENT 2.0) et l’orientation vers la RAG multimodale sur vidéos brutes ouvrent de nouvelles perspectives de recherche.

Pour aller plus loin :

  • Recherche d’information multimodale — Concepts de base de la recherche d’information sur plusieurs modalités.
  • Génération augmentée par récupération — Technique clé pour la génération de résumés à partir de contenus récupérés.
  • CLIP (modèle) — Modèle de représentation jointe vision-texte utilisé comme baseline dans les travaux.

120 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et un niveau technique élevé, avec une qualité et une fiabilité globales correctes. La vidéo est dense et technique, mais les points faibles résident dans le manque de références précises et la présentation parfois superficielle de certains détails.

Fiabilité 7/10