Ce que l'IA ne sait toujours pas faire en vidéo

Une technologie se juge autant à ce qu'elle rate qu'à ce qu'elle réussit. État des lieux documenté des limites de la génération vidéo, à partir des fiches techniques des éditeurs et de la recherche publiée.

Partager
Ce que l'IA ne sait toujours pas faire en vidéo
Photo by Steve A Johnson / Unsplash

Nous avons consacré plusieurs articles aux promesses de la génération vidéo, et l'un d'eux racontait la fabrication complète d'un film publicitaire produit pour vingt-deux euros. Il serait malhonnête de s'arrêter là. Une technologie se juge autant à ce qu'elle refuse de faire qu'à ce qu'elle réussit, et l'écart entre les démonstrations soigneusement choisies et le travail quotidien reste considérable à l'été 2026.

Ce qui suit ne relève pas du scepticisme de principe. Les faits rassemblés ici viennent des fiches techniques des éditeurs, de leurs conditions d'utilisation et de la recherche publiée — c'est-à-dire, pour l'essentiel, de sources qui n'ont aucun intérêt à minimiser les capacités de ces outils.

Le plan de huit secondes

La première limite est aussi la plus facile à vérifier, puisqu'elle figure dans la documentation technique des modèles. Veo 3.1, la version courante du modèle de Google DeepMind depuis novembre 2025, génère des plans de quatre, six ou huit secondes, à vingt-quatre images par seconde, dans deux formats seulement, le 16:9 et le 9:16. Runway Gen-4.5, annoncé en décembre 2025, produit des plans de deux à dix secondes en 720p. Kling 3.0 monte à quinze secondes de vidéo continue en 1080p.

Autrement dit, ce que le secteur appelle un film généré par intelligence artificielle reste un assemblage de fragments dont aucun n'atteint la durée d'un plan de cinéma ordinaire. Le montage, la continuité et la direction restent entièrement à la charge de l'humain, et c'est précisément ce travail-là qui occupe la majeure partie d'une production.

Le détail des résolutions mérite au passage d'être regardé de près, parce qu'il contredit le discours ambiant sur le « 4K cinéma ». Le modèle que Runway positionnait fin 2025 au sommet des classements comparatifs sort en 720p. Veo 3.1 propose bien une sortie en 4K, mais sa variante rapide s'arrête à 1080p, et les images d'entrée qu'on lui fournit sont limitées à 1080p.

Un événement plus révélateur encore s'est produit cette année. OpenAI a fermé l'application Sora le 26 avril 2026 et doit arrêter l'interface de programmation correspondante le 24 septembre, en expliquant vouloir concentrer ses ressources de calcul ailleurs et réorienter l'équipe de recherche vers la simulation du monde physique appliquée à la robotique. Le produit vidéo le plus commenté de la période aura donc vécu moins de dix-huit mois sous sa forme grand public.

Le seul éditeur qui publie ses limites

Sur les cinq principaux générateurs, un seul documente publiquement les défaillances de son modèle. Runway publie sur sa page de recherche une section explicitement intitulée « limitations », dont le contenu mérite d'être cité tel quel, parce qu'il est plus sévère que ce qu'écrirait un observateur extérieur.

L'éditeur y reconnaît trois défauts. Le raisonnement causal, d'abord : les effets précèdent parfois les causes, une porte s'ouvrant avant que la poignée ne soit actionnée. La permanence des objets, ensuite : un objet peut disparaître ou apparaître d'une image à l'autre, une tasse s'évanouissant après avoir été masquée. Et enfin ce que Runway nomme le biais de réussite, selon lequel les actions aboutissent de façon disproportionnée — un tir mal ajusté marque quand même le but.

Ce troisième point est le plus intéressant pour quiconque produit des images à vocation documentaire ou publicitaire. Une vidéo générée montre rarement une maladresse, un ratage, une hésitation, parce que le modèle a appris sur des contenus où les gestes réussissent. La conséquence n'est pas seulement esthétique : elle interdit toute une catégorie de plans, ceux qui montrent quelque chose qui ne marche pas.

Runway précise que ces limites sont communes aux modèles de génération vidéo. C'est l'éditeur lui-même qui généralise, et c'est ce qui rend cette page précieuse : les autres documentent leurs capacités et taisent leurs défauts. La connaissance des limites vient donc de la recherche académique, pas des fabricants.

Ce que mesure la recherche

Les travaux d'évaluation ont changé de nature depuis deux ans. La première génération de bancs d'essai mesurait la qualité d'image, la fluidité du mouvement et la cohérence du sujet à l'intérieur d'un plan. Ces dimensions sont aujourd'hui largement saturées, et la recherche s'est déplacée vers ce que le projet VBench 2.0 appelle la fidélité intrinsèque : la question n'est plus de savoir si l'image est plausible, mais si elle est physiquement et logiquement cohérente.

Les dimensions ajoutées par cette seconde génération d'évaluations décrivent assez bien la liste des choses qui résistent : l'anatomie humaine, la constance de l'identité et des vêtements d'un personnage dans la durée, l'ordre des mouvements, l'interaction entre personnes, les changements d'état mécaniques et thermiques, la cohérence géométrique entre points de vue, et la simple rationalité du mouvement. Les scores obtenus sur les intrigues complexes et sur les relations spatiales dynamiques restent, chez tous les modèles évalués, très bas.

Une étude publiée en juin 2026, portant sur vingt-trois modèles et plusieurs milliers de vidéos annotées par des humains, a testé un protocole simple et redoutable : la caméra se détourne, puis revient. L'objet a-t-il continué d'évoluer pendant qu'il n'était pas observé ? La réponse est le plus souvent non. L'objet reste figé dans l'état où il avait été quitté, disparaît, réapparaît ailleurs, ou revient à un état antérieur. Les auteurs relèvent que le problème traverse toutes les familles de modèles et tous les ordres de grandeur, et qu'augmenter le nombre de paramètres ne le corrige pas — dans certains cas, le modèle le plus gros fait moins bien que le plus petit.

Ce résultat rejoint exactement la limite de permanence des objets que Runway reconnaît de son côté, et il formule ce qui est probablement la différence de fond entre ces outils et ce qu'on attend d'eux : un générateur produit des suites d'images plausibles, il ne tient pas un état du monde.

Une précision s'impose sur la portée de ces travaux. Les modèles évalués dans ces publications sont majoritairement des modèles ouverts, auxquels s'ajoutent quelques systèmes commerciaux, mais ni Veo 3.1 ni Gen-4.5 ne figurent dans la plupart de ces protocoles. Il serait abusif d'en déduire un taux d'échec applicable aux modèles de pointe.

Le texte à l'écran, et la question du français

Le texte affiché dans l'image reste un point faible documenté. Un banc d'essai consacré à ce seul sujet, publié en mai 2025 et fondé sur une évaluation humaine portant sur dix systèmes ouverts et commerciaux, conclut que la plupart des modèles peinent à produire un texte lisible et stable d'une image à l'autre. Pour une vidéo publicitaire, où le nom de la marque doit rester identique pendant huit secondes, la limite est rédhibitoire et se contourne en incrustant le texte au montage.

La synchronisation labiale en français demande davantage de prudence, parce que les sources y sont minces et souvent mal lues. Ce qui est établi tient en trois constats. Kling documente cinq langues pour son audio natif — chinois, anglais, japonais, coréen et espagnol — et le français n'en fait pas partie. Google, dans la fiche technique de Veo 3.1, ne mentionne que l'anglais, mais il s'agit de la langue de l'instruction et non de celle du dialogue produit, et la nuance compte. Enfin, un banc d'essai consacré au dialogue multi-locuteurs publié en février 2026 identifie les erreurs de synchronisation labiale comme le type de défaillance le plus fréquent de son corpus, lequel est entièrement anglophone.

Ce qui n'existe pas, en revanche, c'est une évaluation publique de la synchronisation labiale en français sur les générateurs commerciaux. Il faut résister à la tentation d'en conclure que le français serait structurellement mal traité : un travail de recherche publié en octobre 2025, portant sur douze langues dont le français, démontre au contraire qu'une architecture alignant phonèmes et visèmes obtient des performances stables d'une langue à l'autre. Le problème n'est donc pas irréductible ; il n'est simplement pas résolu dans les produits.

À qui appartient ce que vous générez

La question paraît secondaire jusqu'au moment où l'on facture une campagne à un client. Elle n'a pas la même réponse selon le fournisseur, et l'écart entre le discours commercial et le contrat est mesurable.

Runway est le plus clair et le plus favorable : l'utilisateur conserve la propriété de ce qu'il téléverse et de ce qu'il génère, et l'usage commercial est explicitement autorisé, des vidéos monétisées aux publicités, sans obligation de crédit.

Kling présente une configuration beaucoup plus restrictive, et contraire à ce qu'affirment de nombreux guides en ligne. Ses conditions d'utilisation, mises à jour en avril 2026, reconnaissent bien à l'utilisateur la propriété intellectuelle sur ses entrées et ses sorties, mais stipulent également que, sans autorisation écrite, il ne peut ni utiliser, ni reproduire, ni distribuer, ni dériver ces sorties à des fins commerciales. L'éditeur se réserve en outre une licence non exclusive et gratuite sur les contenus, et impose une attribution lors de la diffusion publique. On possède donc la vidéo sans pouvoir l'exploiter.

Pour Google et OpenAI, la situation est moins documentée qu'on ne l'imagine : les conditions applicables dépendent du canal par lequel on accède au modèle, et nous n'avons pas trouvé de clause publique tranchant clairement la titularité des sorties de Veo. La fermeture de Sora pose d'ailleurs une question que personne n'a documentée : que deviennent les droits et l'exploitabilité des vidéos générées sur une plateforme qui ferme et supprime les données.

Le marquage, obligatoire depuis le 2 août

Les obligations de transparence du règlement européen sur l'intelligence artificielle s'appliquent depuis le 2 août 2026, ce qui en fait, au moment où ces lignes sont écrites, une contrainte opérationnelle et non une perspective. L'article 50 impose aux fournisseurs de systèmes un marquage lisible par machine des contenus synthétiques, et aux déployeurs un étiquetage clair des contenus imitant des personnes, objets, lieux ou événements réels d'une manière qui les ferait passer pour authentiques.

Le texte prévoit une atténuation pour les œuvres manifestement artistiques, créatives, satiriques ou fictionnelles, où l'obligation se limite à révéler l'existence du contenu généré d'une manière qui n'entrave pas la jouissance de l'œuvre. Un contenu manifestement impossible ne relève pas davantage de la définition du trucage profond. Une publicité présentant un produit réel dans une situation crédible, en revanche, tombe pleinement dans le champ.

Deux dispositifs techniques structurent ce marquage, et tous deux présentent des limites qu'il faut connaître. Les Content Credentials, promus par la coalition C2PA, encapsulent des métadonnées signées dans le fichier ; le format est largement adopté, mais les chaînes de traitement web courantes suppriment ou recompressent fréquemment ces métadonnées, ce qui détruit le conteneur, et la coexistence de versions différentes du standard crée des incompatibilités entre fabricants. SynthID, le filigrane invisible de Google DeepMind, est conçu pour résister au recadrage, au changement de cadence et à la compression, et il est appliqué à plus de dix milliards d'images ; mais son détecteur n'est toujours pas accessible au public, l'accès se faisant sur liste d'attente. Google reconnaît d'ailleurs explicitement, dans sa propre publication, que la technique ne résoudra pas à elle seule le problème et qu'elle reste vulnérable aux attaques de régénération. Il faut aussi noter que les performances chiffrées publiées portent sur l'image et non sur la vidéo.

Ce que tout cela change concrètement

Rien de ce qui précède ne conduit à écarter ces outils, et l'expérience de la campagne produite pour vingt-deux euros montre au contraire ce qu'ils permettent. Mais l'usage professionnel suppose de connaître le périmètre.

On sait aujourd'hui générer des plans courts, esthétiquement convaincants, sur des sujets où la cohérence à long terme n'est pas requise : une ambiance, un mouvement de caméra sur un décor, une séquence d'illustration. On ne sait pas encore tenir un personnage identique sur une dizaine de plans, produire du texte lisible dans l'image, montrer un geste qui échoue, ni garantir qu'un objet sorti du champ y reviendra dans l'état où il l'a quitté. Le montage, la direction artistique et la vérification restent humains, et ils occupent la plus grande partie du temps de production.

Questions fréquentes

Peut-on obtenir un personnage cohérent d'un plan à l'autre ?

Partiellement, par des techniques d'image de référence que plusieurs modèles proposent, mais aucun banc d'essai public ne mesure aujourd'hui la cohérence d'un personnage entre plans distincts d'un même montage — c'est pourtant le problème central d'un usage professionnel. L'absence d'évaluation standard sur ce point est en soi un indicateur.

Les modèles s'améliorent-ils simplement en grossissant ?

Pas sur les dimensions qui posent problème. Plusieurs travaux indépendants relèvent que la cohérence physique et la persistance de l'état ne progressent pas avec le nombre de paramètres, et régressent parfois. Les auteurs y voient un besoin de changement architectural plutôt que d'échelle.

Faut-il signaler une vidéo générée diffusée en publicité ?

Depuis le 2 août 2026, les obligations de transparence du règlement européen s'appliquent, et une publicité mettant en scène des personnes, lieux ou événements d'apparence réelle relève de l'étiquetage. L'atténuation prévue pour les œuvres manifestement créatives ne couvre pas un contenu qui cherche à paraître authentique.

Le filigrane invisible garantit-il l'authenticité d'une vidéo ?

Non, et c'est une confusion fréquente. Un marquage cryptographique ou un filigrane atteste de l'origine technique d'un fichier, pas de la véracité de ce qu'il montre. Par ailleurs, l'outil de détection du filigrane de Google n'est pas ouvert au public, ce qui laisse le vérificateur ordinaire sans moyen de contrôle.

Sources

  • Google Cloud, fiche technique du modèle veo-3.1-generate-001 ; Google DeepMind, page Veo.
  • Runway, Introducing Runway Gen-4.5 (1er décembre 2025), section « Limitations » ; Runway Help, Creating with Gen-4.5 et Usage rights.
  • Kling AI, Kling VIDEO 3.0 Model Guide et conditions d'utilisation (mises à jour le 21 avril 2026).
  • OpenAI, What to know about the Sora discontinuation.
  • VBench 2.0, arXiv:2503.21755 ; T2VTextBench, arXiv:2505.04946 ; MTAVG-Bench, arXiv:2602.00607 ; étude sur la persistance de l'état, arXiv:2606.20545 ; MuEx (alignement phonème-visème multilingue), arXiv:2510.06612.
  • Commission européenne, Quick Facts: Transparency rules for AI systems — article 50 du règlement (UE) sur l'intelligence artificielle.
  • C2PA, programme de conformité ; Google DeepMind, SynthID et SynthID-Image: Image watermarking at internet scale, arXiv:2510.09263.

Pour aller plus loin

Dans le prolongement de cet article :