Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierFlux principal

Disney attaque le modèle Seedance 2.0 qui génère des répliques parfaites de ses films grâce à l’IA

Quelques jours après le lancement tonitruant de Seedance 2.0, le modèle IA capable de générer des vidéos, Disney envoie une mise en demeure à Bytedance. L'entreprise n'apprécie pas les vidéos virales qui mettent en scène Dark Vador ou Mickey avec un réalisme effrayant. L'entreprise, pourtant associée à OpenAI, parle d'un « pillage massif » de sa propriété intellectuelle.

Seedance, le nouveau modèle chinois pour générer des vidéos, défie OpenAI et Google

Début février 2026, le groupe chinois ByteDance a dévoilé Seedance 2.0, son nouveau modèle de génération vidéo par IA. Capable de produire image, son, voix et musique dans un même pipeline, l’outil impressionne autant par ses performances techniques que par sa stratégie de déploiement grand public.

« Détection de ressemblance », YouTube lance un outil pour traquer les chaines IA qui usurpent l’identité des créateurs, mais on reste loin du compte

Le 21 octobre 2025, les équipes techniques de YouTube ont annoncé le lancement au public d’un outil de détection de ressemblance, censé lutter contre les détournements d’identité par l’IA qui prolifèrent sur la plateforme. L’outil présente quelques avantages, mais ne règle pas le fléau.

Google (Veo) et OpenAI (Sora) améliorent leurs outils de génération de vidéos

Google a dévoilé le 15 octobre 2025 Veo 3.1, une mise à jour de son moteur de génération vidéo par IA, intégrée à Flow, sa plateforme de création visuelle. L’entreprise ajoute des outils d’édition et une meilleure fidélité au prompt. Pendant ce temps, OpenAI fait évoluer Sora 2 avec des vidéos plus longues et un système de storyboards.

Il y a deux nouveautés géniales dans Google Photos

Google Photos teste actuellement un nouvel onglet « Create » qui permet de modifier ses images facilement. Une nouveauté intéressante est la possibilité de transformer une photo en vidéo grâce au modèle Veo 2.

Google lance Veo 3 en France, son générateur de vidéos avec du son

Quelques semaines après les États-Unis, le nouveau modèle de génération de vidéos de Google débarque en France et dans l'Union européenne. En plus de créer des vidéos plus réalistes, il ajoute des bruitages, de la musique et des paroles aux contenus générés.

Veo 3 : les exemples impressionnants du Sora de Google

C'est lors de sa Google I/O que Google a dévoilé Veo 3, son dernier modèle de génération de vidéos. Il est déjà disponible aux États-Unis et les premières vidéos sont déjà impressionnantes par leur qualité.

Comment générer des vidéos de 8 secondes avec Google Gemini ?

Google a sorti Veo 2, son nouveau modèle de génération de vidéos. Chaque internaute peut générer des vidéos jusqu'à 8 secondes avec une simple phrase. Voici comment faire.

On a généré 10 vidéos avec Google Gemini et vous allez mourir de rire

Grâce au modèle Veo 2, désormais intégré à l'interface Gemini, Google permet à tous ses utilisateurs, y compris en France, de générer des vidéos de 8 secondes à partir d'une simple phrase écrite. Une prouesse technologique similaire à Sora (OpenAI), mais avec de nombreux défauts dans la gestion de la physique.

Google dévoile Veo 2, un nouvel outil qui fabrique des vidéos sur demande (coucou Sora)

Après Gemini 2 quelques jours plus tôt, Google dévoile Veo 2 (vidéos) et Imagen 3 (images), deux modèles de génération ultra-sophistiqués. Le timing de l'annonce n'est certainement pas une coïncidence : Google fait barrage à OpenAI.

  • ✇ActuIA
  • V2A, la technologie de Google DeepMind qui génère l’audio à partir d’une vidéo
    Lors de sa conférence Google I/O 2024, Google a présenté VEO, un modèle text-to-video mais les vidéos qu’il génère manquent d’une composante essentielle : le son, ce à quoi DeepMind travaille. Il a dernièrement partagé les avancées de sa technologie vidéo-audio (V2A) qui combine des pixels vidéo avec des invites textuelles pour générer des bandes sonores synchronisées. Si le modèle V2A peut être associé à des modèles de génération vidéo comme Veo  pour créer des effets sonores, de la musique et

V2A, la technologie de Google DeepMind qui génère l’audio à partir d’une vidéo

21 juin 2024 à 10:00

Lors de sa conférence Google I/O 2024, Google a présenté VEO, un modèle text-to-video mais les vidéos qu’il génère manquent d’une composante essentielle : le son, ce à quoi DeepMind travaille. Il a dernièrement partagé les avancées de sa technologie vidéo-audio (V2A) qui combine des pixels vidéo avec des invites textuelles pour générer des bandes sonores synchronisées.

Si le modèle V2A peut être associé à des modèles de génération vidéo comme Veo  pour créer des effets sonores, de la musique et des dialogues adaptés à chaque scène, il peut également ajouter des bandes sonores à des séquences variées, telles que des films muets, des documents d’archives et plus encore, élargissant ainsi les possibilités créatives.

V2A permet aux utilisateurs d’avoir un contrôle précis sur la sortie audio. Grâce à des invites positives et négatives, les créateurs peuvent orienter la génération sonore vers des sons spécifiques ou éviter ceux qui ne conviennent pas. Cette flexibilité facilite l’expérimentation rapide de différentes options audio, permettant ainsi de choisir la meilleure correspondance pour chaque vidéo.

Processus de Génération

Le système V2A commence par encoder l’entrée vidéo dans une représentation compressée. Ensuite, un modèle de diffusion affine de manière itérative l’audio à partir de bruit aléatoire, guidé par les pixels vidéo et les invites textuelles. Finalement, l’audio généré est décodé en une forme d’onde et synchronisé avec la vidéo.

crédit Google DeepMind

Pour améliorer la qualité et la pertinence des sons générés, V2A utilise des annotations et des transcriptions détaillées lors de son entraînement. Cette méthode permet au système d’apprendre à associer des événements audio spécifiques à diverses scènes visuelles, créant ainsi une synchronisation audio-vidéo convaincante.

Défis et limitations

Selon DeepMind, V2A se distingue des solutions vidéo-audio existantes car elle peut comprendre les pixels bruts et l’ajout d’une invite textuelle est facultatif.

Malgré ses avancées, V2A doit encore surmonter certains défis. La qualité de l’audio généré dépendant de celle de l’entrée vidéo, elle peut être affectée par les artefacts ou distorsions présents dans la vidéo. Il peut y avoir également une mauvaise synchronisation entre les dialogues avec les mouvements des lèvres, si le modèle text-to-vidéo n’est pas aligné avec les transcriptions.

Invite pour l’audio : Musique, Transcription : “cette dinde a l’air incroyable, j’ai tellement faim”.

Engagement éthique et sécurité

DeepMind développe V2A en collaboration avec des créateurs et cinéastes de renom pour s’assurer d’un impact positif. De plus, pour prévenir les abus potentiels, tout contenu généré est filigrané grâce à la boîte à outils SynthID. Avant une diffusion publique, V2A sera soumis à des tests de sécurité rigoureux pour garantir son efficacité et sa sûreté.

V2A-technologie-Google-DeepMind-audio-video

Google lance Veo, son concurrent de Sora (OpenAI) pour générer des vidéos artificielles

Veo

Lors de la conférence I/O, Google a présenté Veo, un outil d'intelligence artificielle spécialisé dans la génération de vidéos. Un projet annoncé quelques mois après celui d'OpenAI (Sora).

❌
❌