Quelques jours après le lancement tonitruant de Seedance 2.0, le modèle IA capable de générer des vidéos, Disney envoie une mise en demeure à Bytedance. L'entreprise n'apprécie pas les vidéos virales qui mettent en scène Dark Vador ou Mickey avec un réalisme effrayant. L'entreprise, pourtant associée à OpenAI, parle d'un « pillage massif » de sa propriété intellectuelle.
Début février 2026, le groupe chinois ByteDance a dévoilé Seedance 2.0, son nouveau modèle de génération vidéo par IA. Capable de produire image, son, voix et musique dans un même pipeline, l’outil impressionne autant par ses performances techniques que par sa stratégie de déploiement grand public.
Le 21 octobre 2025, les équipes techniques de YouTube ont annoncé le lancement au public d’un outil de détection de ressemblance, censé lutter contre les détournements d’identité par l’IA qui prolifèrent sur la plateforme. L’outil présente quelques avantages, mais ne règle pas le fléau.
Google a dévoilé le 15 octobre 2025 Veo 3.1, une mise à jour de son moteur de génération vidéo par IA, intégrée à Flow, sa plateforme de création visuelle. L’entreprise ajoute des outils d’édition et une meilleure fidélité au prompt. Pendant ce temps, OpenAI fait évoluer Sora 2 avec des vidéos plus longues et un système de storyboards.
Google Photos teste actuellement un nouvel onglet « Create » qui permet de modifier ses images facilement. Une nouveauté intéressante est la possibilité de transformer une photo en vidéo grâce au modèle Veo 2.
Quelques semaines après les États-Unis, le nouveau modèle de génération de vidéos de Google débarque en France et dans l'Union européenne. En plus de créer des vidéos plus réalistes, il ajoute des bruitages, de la musique et des paroles aux contenus générés.
C'est lors de sa Google I/O que Google a dévoilé Veo 3, son dernier modèle de génération de vidéos. Il est déjà disponible aux États-Unis et les premières vidéos sont déjà impressionnantes par leur qualité.
Google annonce le lancement d'un nouvel abonnement à Gemini et à l'ensemble de sa palette d'outils pour l'IA générative. Le forfait, intitulé Google AI Ultra, sera proposé à 250 dollars par mois. C'est plus cher que ChatGPT Pro, proposé à 200 dollars mensuels.
Google a sorti Veo 2, son nouveau modèle de génération de vidéos. Chaque internaute peut générer des vidéos jusqu'à 8 secondes avec une simple phrase. Voici comment faire.
Grâce au modèle Veo 2, désormais intégré à l'interface Gemini, Google permet à tous ses utilisateurs, y compris en France, de générer des vidéos de 8 secondes à partir d'une simple phrase écrite. Une prouesse technologique similaire à Sora (OpenAI), mais avec de nombreux défauts dans la gestion de la physique.
Après Gemini 2 quelques jours plus tôt, Google dévoile Veo 2 (vidéos) et Imagen 3 (images), deux modèles de génération ultra-sophistiqués. Le timing de l'annonce n'est certainement pas une coïncidence : Google fait barrage à OpenAI.
Lors de sa conférence Google I/O 2024, Google a présenté VEO, un modèle text-to-video mais les vidéos qu’il génère manquent d’une composante essentielle : le son, ce à quoi DeepMind travaille. Il a dernièrement partagé les avancées de sa technologie vidéo-audio (V2A) qui combine des pixels vidéo avec des invites textuelles pour générer des bandes sonores synchronisées.
Si le modèle V2A peut être associé à des modèles de génération vidéo comme Veo pour créer des effets sonores, de la musique et des dialogues adaptés à chaque scène, il peut également ajouter des bandes sonores à des séquences variées, telles que des films muets, des documents d’archives et plus encore, élargissant ainsi les possibilités créatives.
V2A permet aux utilisateurs d’avoir un contrôle précis sur la sortie audio. Grâce à des invites positives et négatives, les créateurs peuvent orienter la génération sonore vers des sons spécifiques ou éviter ceux qui ne conviennent pas. Cette flexibilité facilite l’expérimentation rapide de différentes options audio, permettant ainsi de choisir la meilleure correspondance pour chaque vidéo.
Processus de Génération
Le système V2A commence par encoder l’entrée vidéo dans une représentation compressée. Ensuite, un modèle de diffusion affine de manière itérative l’audio à partir de bruit aléatoire, guidé par les pixels vidéo et les invites textuelles. Finalement, l’audio généré est décodé en une forme d’onde et synchronisé avec la vidéo.
crédit Google DeepMind
Pour améliorer la qualité et la pertinence des sons générés, V2A utilise des annotations et des transcriptions détaillées lors de son entraînement. Cette méthode permet au système d’apprendre à associer des événements audio spécifiques à diverses scènes visuelles, créant ainsi une synchronisation audio-vidéo convaincante.
Défis et limitations
Selon DeepMind, V2A se distingue des solutions vidéo-audio existantes car elle peut comprendre les pixels bruts et l’ajout d’une invite textuelle est facultatif.
Malgré ses avancées, V2A doit encore surmonter certains défis. La qualité de l’audio généré dépendant de celle de l’entrée vidéo, elle peut être affectée par les artefacts ou distorsions présents dans la vidéo. Il peut y avoir également une mauvaise synchronisation entre les dialogues avec les mouvements des lèvres, si le modèle text-to-vidéo n’est pas aligné avec les transcriptions.
Invite pour l’audio : Musique, Transcription : “cette dinde a l’air incroyable, j’ai tellement faim”.
Engagement éthique et sécurité
DeepMind développe V2A en collaboration avec des créateurs et cinéastes de renom pour s’assurer d’un impact positif. De plus, pour prévenir les abus potentiels, tout contenu généré est filigrané grâce à la boîte à outils SynthID. Avant une diffusion publique, V2A sera soumis à des tests de sécurité rigoureux pour garantir son efficacité et sa sûreté.
Lors de la conférence I/O, Google a présenté Veo, un outil d'intelligence artificielle spécialisé dans la génération de vidéos. Un projet annoncé quelques mois après celui d'OpenAI (Sora).