Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierFlux principal
  • ✇ActuIA
  • Black Forest Labs, nouvel acteur européen de l’IA générative, lance FLUX-1, une famille de modèles text-to-image
    Un nouvel acteur de l’IA générative européen vient de faire son apparition : Black Forest Labs. Le 1er août dernier, la start-up annonçait non seulement son lancement officiel et la clôture d’une ronde de financement de démarrage de 31 millions de dollars, mais également FLUX-1, une famille de modèles d’IA text-to-image.  Basée à Fribourg-en-Brisgau, en Allemagne, au pied des montagnes de la Forêt-Noire, la start-up a été cofondée par Robin Rombach, Patrick Esser, Andreas Blattmann, Axel Sauer,

Black Forest Labs, nouvel acteur européen de l’IA générative, lance FLUX-1, une famille de modèles text-to-image

12 août 2024 à 12:00

Un nouvel acteur de l’IA générative européen vient de faire son apparition : Black Forest Labs. Le 1er août dernier, la start-up annonçait non seulement son lancement officiel et la clôture d’une ronde de financement de démarrage de 31 millions de dollars, mais également FLUX-1, une famille de modèles d’IA text-to-image. 

Basée à Fribourg-en-Brisgau, en Allemagne, au pied des montagnes de la Forêt-Noire, la start-up a été cofondée par Robin Rombach, Patrick Esser, Andreas Blattmann, Axel Sauer, Frederic Boesel et Tim Dockhorn. Composée de chercheurs et d’ingénieurs ayant développé des modèles d’IA pionniers comme VQGAN, Latent Diffusion, Stable Diffusion, SDXL, son équipe se concentre sur l’accessibilité et la transparence pour favoriser l’innovation.

Black Forest Labs (BFL) déclare sur son site web :

“Notre mission est de développer et de faire progresser des modèles d’apprentissage profond génératif de pointe pour les médias tels que les images et les vidéos, et de repousser les limites de la créativité, de l’efficacité et de la diversité. Nous pensons que l’IA générative sera un élément fondamental de toutes les technologies futures. En rendant nos modèles accessibles à un large public, nous voulons en faire profiter tout le monde, éduquer le public et renforcer la confiance dans la sécurité de ces modèles”.

Une levée de fonds de 31 millions de dollars

Cette levée témoigne de la confiance de l’industrie dans le potentiel de la start-up à transformer le paysage de l’IA générative. Menée par le fonds de capital-risque Andreessen Horowitz, elle a attiré des contributeurs notables comme Brendan Iribe, Michael Ovitz, Garry Tan, Timo Aila et Vladlen Koltun, des figures reconnues dans le domaine de l’IA et de la création d’entreprises technologiques. Des fonds supplémentaires ont été apportés par General Catalyst et MätchVC, deux sociétés d’investissement qui ont décidé de soutenir la mission de Black Forest Labs de développer et de diffuser des technologies d’IA avancées issues de l’Europe à l’échelle mondiale.

Le conseil consultatif de la start-up comprend Michael Ovitz, qui apporte une vaste expérience dans le secteur de la création de contenu, et le professeur Matthias Bethge, un pionnier du transfert de style neuronal et expert de premier plan dans la recherche européenne ouverte sur l’IA.

FLUX.1 : repousser les frontières de la synthèse texte-image

FLUX.1 est proposé en trois variantes, chacune adaptée à des besoins spécifiques :

  • FLUX.1 [pro] : la version la plus performante, conçue pour offrir des images de qualité supérieure avec un suivi d’invite précis, une diversité de style et une complexité de scène inégalée. Cette version, accessible via l’API de BFL, est idéale pour les entreprises ou les utilisateurs recherchant la meilleure qualité disponible ;
  • FLUX.1 [dev] : Ce modèle est destiné aux applications non commerciales. Il s’agit d’une version distillée de FLUX.1 [pro], offrant une qualité d’image similaire tout en étant plus efficace en termes de ressources. Les utilisateurs peuvent accéder à ses poids ouverts sur HuggingFace pour l’explorer et l’intégrer dans des projets ;
  • FLUX.1 [schnell] : Adapté à un usage personnel et au développement local, ce modèle est le plus rapide de la gamme. Il est disponible gratuitement sous une licence Apache2.0, permettant aux développeurs de l’utiliser pour des projets individuels ou expérimentaux.

Les trois versions sont accessibles via Replicate et fal.ai.

Architecture et performance

Les modèles FLUX.1 reposent sur une architecture hybride avancée combinant des transformateurs de diffusion multimodaux. Comptant 12 milliards de paramètres, ils intègrent des techniques de pointe comme l’appariement de flux (flow matching), les plongements positionnels rotatifs et les couches d’attention parallèles pour améliorer les performances et l’efficacité matérielle. Ces innovations permettent à FLUX.1 de surpasser les modèles concurrents dans diverses catégories, y compris la qualité visuelle, la diversité de sortie, et la complexité des scènes générées.

Crédit : BFL

Selon la start-up, FLUX.1 [pro] et [dev] surpassent les modèles populaires comme Midjourney v6.0, DALL· E 3 (HD) et SD3-Ultra dans chacun des aspects suivants : qualité visuelle, suivi des invites, variabilité de la taille et de l’aspect, typographie et diversité de sortie. FLUX.1 [schnell] serait le modèle en quelques étapes le plus avancé à ce jour, surpassant non seulement les concurrents de sa catégorie, mais aussi de puissants modèles non distillés comme Midjourney v6.0 et DALL· E 3 (HD).

Les 3 variantes du modèle FLUX.1 prennent en charge une large gamme de rapports d’aspect et de résolutions allant de 0,1 à 2 mégapixels.

Perspectives de BFL : les modèles text-to-video

Black Forest Labs ne compte pas s’arrêter à la génération d’images. En s’appuyant sur les capacités robustes de FLUX.1, l’entreprise travaille au développement d’une suite de modèles génératifs texte-vidéo. La start-up conclut ses annonces par :

“Nos modèles vidéo débloqueront une création et un montage précis en haute définition et à une vitesse sans précédent. Nous nous engageons à continuer à innover dans l’avenir des médias génératifs”.

Black Forest Labs, nouvel acteur européen de l'IA générative, lance FLUX-1, une famille de modèles text-to-image
  • ✇ActuIA
  • Stable Cascade et Stable Diffusion 3, les deux derniers modèles text-to-image de Stability AI
    Stability AI a présenté récemment deux modèles text-to-image : Stable Cascade disponible en prévisualisation de recherche sous une licence non commerciale et la nouvelle génération de son modèle phare Stable Diffusion 3.0. Si le premier est basé sur l’architecture Würstchen pour améliorer les performances et la précision, la dernière itération de Stable Diffusion utilise une nouvelle architecture combinant transformateur de diffusion et appariement de flux. Stable Cascade est un modèle très effi

Stable Cascade et Stable Diffusion 3, les deux derniers modèles text-to-image de Stability AI

26 février 2024 à 10:30

Stability AI a présenté récemment deux modèles text-to-image : Stable Cascade disponible en prévisualisation de recherche sous une licence non commerciale et la nouvelle génération de son modèle phare Stable Diffusion 3.0. Si le premier est basé sur l’architecture Würstchen pour améliorer les performances et la précision, la dernière itération de Stable Diffusion utilise une nouvelle architecture combinant transformateur de diffusion et appariement de flux.

Stable Cascade est un modèle très efficace qui est, selon Stability AI, “exceptionnellement facile à entraîner et à affiner sur du matériel grand public grâce à son approche en trois étapes”, l’architecture Würstchen.

Il est construit sur un pipeline composé de trois modèles distincts : les étapes A, B et C. Cette architecture permet une compression hiérarchique :

  • Le générateur latent (Stage C) transforme les entrées textuelles en latents compacts de 24×24 ;
  • Le décodeur latent (Stages A et B) décompresse les latents en images à haute résolution ;
  • Le réseau de contrôle (ControlNet) permet d’ajuster les caractéristiques des images générées.

Tandis que Stable Diffusion compresse les images de 1024×1024 à 128×128, Stable Cascade le fait à une résolution à 24×24, ce qui se traduit par des vitesses d’inférence plus rapides et des coûts de formation moins élevés. Il produit des images complexes en seulement 30 étapes d’inférence, contre 50 pour les modèles concurrents tels que Playground v2, SDXL, SDXL Turbo ou Würstchen v2.

Le modèle est capable de gérer des descriptions compliquées, de générer des détails fins et de suivre les variations de style et de couleur. Il dépasse largement les autres modèles en termes de qualité perçue, selon une évaluation humaine.

Chaque étape de la cascade peut être ajustée pour des besoins spécifiques, permettant de contrôler le niveau de détail, la résolution, le style et la couleur des images. De plus, le modèle dispose d’un réseau de contrôle (ControlNet), qui permet d’effectuer des modifications fines sur les images générées, telles que le changement de position, de taille, de forme ou de couleur des objets.

Stable Cascade est disponible en prévisualisation de recherche sous une licence non commerciale, le code pour l’inférence, l’entraînement, l’affinage et le ControlNet est publié sur la page GitHub de Stability. On peut l’essayer sur Hugging face ici

Stable Diffusion 3

Stability AI a annoncé le 22 février dernier l’ouverture de la liste d’attente pour un prévisualisation anticipée de son dernier modèle. Selon la start-up, il présenterait une nette amélioration des performances sur les requêtes multi-sujets, de la qualité d’image et des capacités orthographiques.

La suite Stable Diffusion 3 comprend des modèles allant de 800M à 8B de paramètres, offrant aux utilisateurs un éventail d’options adaptées à leurs besoins créatifs spécifiques. Stablity AI précise seulement que le modèle utilise une architecture de transformateur de diffusion et un appariement de flux, un rapport détaillé est prévu.

Voici quelques exemples d’images générées par le modèle partagées par la start-up:

Prompt : Une œuvre d’art épique d’anime d’un sorcier au sommet d’une montagne la nuit lançant un sort cosmique dans le ciel sombre qui dit “Stable Diffusion 3” fait d’énergie colorée .

Prompt : photo de studio en gros plan d’un caméléon sur un fond noir.

Prompt : Un tableau d’un astronaute chevauchant un cochon portant un tutu tenant un parapluie rose, sur le sol à côté du cochon se trouve un oiseau rouge-gorge portant un haut-de-forme, dans le coin sont les mots “stable diffusion”.

Stable Cascade et Stable Diffusion 3, les deux derniers modèles text-to-image de Stability AI
❌
❌