Vue lecture

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.

OpenAI Devday 2024 : Vision Fine-tuning, Model Distillation, Prompt Caching et Realtime API au cœur des annonces

Lors de sa 1ère conférence des développeurs, il y a un peu moins d’un an, les annonces principales d’OpenAI étaient consacrées à GPT-4 turbo, GPT Builder et au GPT Store. Cette année, toujours pas de GPT-5, mais il n’était pas réellement attendu après la présentation d‘OpenAI o1, il y a 3 semaines. Le Devday 2024 a été un événement plus technique, entièrement dédié aux développeurs et à l’exploitation des modèles existants de la start-up, avec de nouveaux ajouts à la plateforme API.

Parmi la série d’outils et fonctionnalités destinés à améliorer l’utilisation et la personnalisation des solutions d’IA d’OpenAI au sein des applications professionnelles, présentés, on retrouve : Realtime API, Vision fine-tuning pour GPT-4o, Model distillation et Prompt caching.

Realtime : Une API conçue pour des expériences vocales instantanées

Realtime a été déployée ce 1er octobre en version bêta publique pour tous les développeurs payants. Ses capacités audio sont alimentées par le nouveau modèle GPT-4o. Elle permet aux développeurs de créer des applications multimodales en temps réel, avec les six voix prédéfinies prises en charge par l’API, distinctes de celles de ChatGPT.

Voici quelques avantages notables de l’API qui prend actuellement en charge le texte et l’audio en entrée et en sortie, (la vision et la vidéo sont déjà prévues), mais également l’appel de fonctions :

  • Parole à parole native : L’absence d’intermédiaire de texte signifie une faible latence et une sortie nuancée ;
  • Voix naturelles et orientables : Les modèles ont une inflexion naturelle et peuvent rire, chuchoter et adhérer à la direction du ton ;
  • Sortie multimodale simultanée : Le texte est utile pour la modération, l’audio plus rapide que le temps réel assure une lecture stable.

OpenAI va également introduire l’audio dans l’API de complétion de chat pour “les cas d’utilisation qui ne nécessitent pas les avantages de faible latence de l’API en temps réel”.
La start-up prévoit également d’augmenter progressivement les limites de débit actuelles (environ 100 sessions simultanées pour les développeurs de niveau 5). L’API Realtime sera intégrée dans les SDK OpenAI pour Python et Node.js et prendra en charge GPT-4o mini dans les futures versions.

Vision Fine-tuning

Cette nouvelle API permet aux développeurs de personnaliser des modèles basés sur GPT-4o en affinant leur compréhension des images. Des applications dans des domaines tels que la détection d’objets pour les véhicules autonomes ou l’analyse d’images médicales sont désormais possibles. OpenAI a cependant précisé que l’utilisation d’images protégées par des droits d’auteur reste interdite.

La start-up a présenté quelques cas d’utilisation pratiques :

  • Amélioration de la cartographie routière : Grab, une entreprise de covoiturage et de livraison alimentaire en Asie du Sud-Est, a utilisé la nouvelle fonctionnalité de vision pour améliorer sa cartographie urbaine. En ajustant GPT-4o avec seulement 100 images, l’entreprise a amélioré de 20 % la précision du comptage des voies et de 13 % la localisation des panneaux de signalisation par rapport à un modèle de base. Cela permet à Grab d’automatiser davantage la création de cartes routières, un processus auparavant manuel ;
  • Automatisation des processus d’affaires : Automat, spécialisé dans l’automatisation des processus métier, a formé GPT-4o pour reconnaître des éléments d’interface utilisateur via des captures d’écran, augmentant le taux de réussite de son système de 272 %. Ce réglage fin a également permis à Automat d’améliorer la précision d’extraction de données à partir de documents non structurés ;
  • Optimisation des sites web : Coframe, une plateforme d’ingénierie de croissance numérique, a affiné GPT-4o pour générer du code à partir d’images existantes d’un site web. Ce réglage fin a permis à GPT-4o de produire des sites web avec une cohérence visuelle accrue de 26 % par rapport au modèle de base.

Vision Fine-Tuning est d’ores et déjà disponible, OpenAI offre gratuitement 1 million de jetons d’entraînement par jour jusqu’au 31 octobre 2024 pour affiner GPT-4o avec des images.

Prompt Caching

La mise en cache des invites, déjà en place chez des concurrents comme Anthropic, permet d’améliorer la latence des réponses et de réduire les coûts d’utilisation des API, en réutilisant les jetons d’entrée récemment utilisés, et ce, sans compromettre la performance.

OpenAI explique : “De nombreux développeurs utilisent le même contexte à plusieurs reprises dans le cadre de plusieurs appels d’API lorsqu’ils créent des applications d’IA, par exemple lorsqu’ils apportent des modifications à une base de code ou qu’ils ont de longues conversations à plusieurs tours avec un chatbot”.

Les appels d’API aux modèles GPT-4o, GPT-4o mini, o1-preview et o1-mini, ainsi qu’aux versions affinées de ces modèles, bénéficieront automatiquement de la mise en cache des invites de plus de 1 024 jetons.

Le système met en cache le préfixe le plus long déjà traité, en commençant à 1 024 jetons et augmente par incréments de 128 jetons. Les développeurs n’ont donc pas besoin de modifier leur intégration API pour bénéficier de cette fonctionnalité. Les caches sont généralement effacés après 5 à 10 minutes d’inactivité et supprimés au plus tard dans l’heure qui suit la dernière utilisation du cache.

Model Distillation

La distillation de modèle consiste à entraîner un modèle plus petit et plus économique en utilisant les résultats d’un modèle plus performant. Cela permet aux développeurs d’obtenir des performances proches de celles du modèle initial (comme GPT-4o) sur des tâches spécifiques, tout en réduisant considérablement les coûts et la latence, en particulier avec des modèles comme GPT-4o mini. OpenAI annonce plusieurs nouveautés pour sa plateforme de distillation de modèles, notamment : Stored completions, Evals et Fine-tuning

  • Achèvements stockés : Capture automatique des paires entrée-sortie générées par des modèles comme GPT-4o, stockées via l’API pour créer des ensembles de données en vue du réglage fin. Cela facilite la création d’ensembles de données issus de la production pour améliorer et évaluer les modèles ;
  • Évaluations (bêta) : Permet de créer et d’exécuter des évaluations sur la plateforme OpenAI pour mesurer la performance des modèles sur des tâches spécifiques. Cela offre un moyen intégré d’évaluer la qualité des modèles sans avoir à créer des scripts manuellement ;
  • Réglage fin : L’intégration complète avec les achèvements stockés et les évaluations permet d’affiner les modèles plus petits avec des ensembles de données réels, tout en mesurant les performances de manière continue.

Model Distillation est disponible pour tous les développeurs sur la plateforme OpenAI. Jusqu’au 31 octobre, OpenAI offre 2 millions de jetons gratuits par jour pour entraîner GPT-4o mini et 1 million de jetons gratuits pour GPT-4o.

En marge du DevDay, OpenAI a également annoncé l’introduction de son nouveau modèle de modération multimodale, omni-modération-latest, qui est intégré dans l’API de modération. Ce modèle, construit sur GPT-4o, améliore considérablement la détection de contenus préjudiciables, notamment dans les langues non-anglophones, avec deux nouvelles catégories de détection.

OpenAI Devday 2024 : Vision Fine-tuning, Model Distillation, Prompt Caching et Realtime API au cœur des annonces

OpenAI lance le fine-tuning de GPT-4o avec une offre gratuite limitée

Après avoir annoncé le fine-tuning de GPT-4o mini fin juillet dernier avec une offre de 2 millions de jetons gratuits par jour jusqu’au 23 septembre prochain, OpenAI propose depuis mardi dernier aux développeurs d’affiner son LLM multimodal phare GPT-4o

GPT-4o, introduit en mai dernier par OpenAI, fusionne le traitement de l’audio, de la vision et du texte en temps réel. Comparé à GPT-4 Turbo, il est deux fois plus rapide, deux fois moins cher et propose des limites de débit cinq fois plus élevées. Les développeurs vont pouvoir l’affiner en utilisant des ensembles de données personnalisés à un coût réduit pour leurs cas d’utilisation spécifiques.

Le fine-tuning, l’une des fonctionnalités les plus demandées par les développeurs, permet d’améliorer la précision, la structure, et le ton des réponses du modèle, ainsi que sa capacité à suivre des instructions complexes propres à certains domaines, même avec de petits ensembles de données. Selon OpenAI, quelques dizaines d’exemples peuvent suffire pour obtenir des améliorations significatives.

La nouvelle fonctionnalité est disponible pour tous les développeurs, quel que soit leur niveau d’utilisation. Le coût de l’entraînement est fixé à 25 par million de jetons, avec des tarifs d'inférence de 3,75 par million de jetons d’entrée et 15 $ par million de jetons de sortie.

Comme pour GPT-4o mini, son lancement est assorti d’une offre de fine-tuning gratuit jusqu’au 23 septembre mais plus restreinte : chaque organisation bénéficie d’un million de jetons d’entraînement gratuits par jour.

De premiers cas d’utilisation convaincants

Depuis deux mois, plusieurs partenaires de confiance d’OpenAI ont pu tester le fine-tuning de GPT-4o avec des résultats impressionnants.

Parmi ceux-ci :

  • Cosine a utilisé GPT-4o pour affiner son assistant d’ingénierie logicielle, Genie. En intégrant des exemples réels d’ingénieurs logiciels, Genie a été en mesure de détecter et corriger des bogues, créer de nouvelles fonctionnalités et refactoriser du code avec une précision accrue. Grâce à ce réglage fin, Genie a atteint un score record de 43,8 % sur le banc d’essai SWE-bench, établissant un nouveau standard de performance ;
  • Distyl : ce partenaire spécialisé dans les solutions d’IA pour les entreprises du Fortune 500 a utilisé GPT-4o pour améliorer ses capacités de traitement SQL. Le modèle affiné a obtenu un score de 71,83 % au benchmark BIRD-SQL, surpassant ses concurrents et démontrant une compétence exceptionnelle dans la reformulation de requêtes et la génération SQL.

Sécurité et contrôle des données

Les modèles affinés via GPT-4o restent entièrement sous le contrôle des développeurs. Les données d’entreprise, y compris les entrées et sorties, sont protégées et ne sont jamais partagées ou utilisées pour entraîner d’autres modèles. De plus, des mesures de sécurité rigoureuses, incluant des évaluations automatisées et une surveillance continue de l’utilisation, sont en place pour prévenir tout usage abusif.

Comment commencer le fine-tuning de GPT-4o ?

Les développeurs intéressés par cette nouvelle fonctionnalité peuvent suivre ces étapes simples :

  • Se connecter à leur tableau de bord de fine-tuning sur la plateforme OpenAI ou s’enregistrer pour ceux qui n’ont pas encore de compte ;
  • Cliquer sur “créer”;
  • Sélectionner gpt-4o-2024-08-06 dans le menu déroulant des modèles de fondation.

OpenAI propose un guide dédié aux étapes du fine-tuning pour les non-initiés ici.

La start-up commente :

“Du codage à l’écriture créative, la mise au point peut avoir un impact important sur les performances du modèle dans divers domaines. Ce n’est qu’un début : nous continuerons d’investir dans l’élargissement de nos options de personnalisation de modèle pour les développeurs”.

OpenAI lance le fine-tuning de GPT-4o avec une offre gratuite limitée

Snowflake annonce l’intégration de Llama 3.1 et l’open source de sa pile d’optimisation d’inférence

Snowflake annonce qu’il héberge et optimise la collection de LLM Llama 3.1 dans sa plateforme Snowflake Cortex AI, offrant aux entreprises un accès sécurisé et sans serveur au modèle open source le plus avancé de Meta, Llama 3.1 405B. Parallèlement, la société rend open source sa pile d’optimisation d’inférence et de fine-tuning pour les grands modèles de langage, démocratisant ainsi l’accès aux IA génératives pour les entreprises et la communauté open source.

Lancée en novembre dernier, Snowflake Cortex AI est une suite de fonctionnalités d’IA entièrement gérées, conçues pour permettre aux entreprises de créer et de déployer des applications d’IA génératives de manière sécurisée et sans serveur. Le service propose une interface de développement sans code, accessible aux utilisateurs de tous niveaux techniques. Il donne accès à des LLM de pointe, notamment ceux de Mistral AI, de Google et AI21 Labs, mais également à Snowflake Arctic, à Llama 3 (8B et 70B), aux LLM Reka-Core et désormais à la famille Llama 3.1.

Une collaboration stratégique pour l’innovation

Développée en collaboration avec des acteurs clés de l’IA, dont DeepSpeed, Hugging Face et vLLM, la pile d’optimisation de Snowflake offre des outils et des technologies pour optimiser l’inférence et le fine-tuning des LLMs de manière efficace et rentable. Cette initiative s’inscrit dans le cadre de l’engagement de Snowflake à fournir des solutions de pointe en matière d’intelligence artificielle tout en favorisant l’innovation ouverte.

Caractéristiques techniques et avantages

Optimisation de l’Inférence

  • Réduction de la latence : La pile permet de réduire la latence d’inférence jusqu’à trois fois par rapport aux solutions open source existantes, offrant ainsi une performance en temps réel indispensable pour les applications critiques ;
  • Augmentation du débit : Avec une amélioration du débit de 1,4 fois, les utilisateurs peuvent traiter un volume plus important de requêtes en moins de temps, optimisant ainsi l’efficacité opérationnelle.

Fine-tuning efficace

  • Utilisation minimale de ressources : Le fine-tuning des modèles massifs peut désormais être réalisé en utilisant un seul nœud GPU, réduisant considérablement les coûts et la complexité.
  • Support de fenêtres de contexte étendu : Avec une prise en charge des fenêtres de contexte allant jusqu’à 128K, les modèles peuvent gérer des contextes plus larges et produire des résultats plus cohérents et pertinents.

Llama 3.1 405B a ainsi été optimisé pour l’inférence en temps réel et à haut débit avec une fenêtre de contexte massive de 128K à l’aide d’un seul nœud GPU au sein de Cortex AI.

Vivek Raghunathan, VP of AI Engineering chez Snowflake, commente :

“Nous ne nous contentons pas de fournir les modèles de pointe de Meta à nos clients via Snowflake Cortex AI. Nous armons les entreprises et la communauté de l’IA avec de nouvelles recherches et un code open source supportant des fenêtres de contexte de 128K, l’inférence multi-nœuds, le parallélisme de pipeline, la quantization en virgule flottante de 8 bits, et bien plus, afin de faire progresser l’intelligence artificielle pour l’écosystème global.”

Engagement en matière de sécurité et de confiance

Snowflake a également intégré des mécanismes de sécurité avancés dans sa pile open source avec Snowflake Cortex Guard. Pour développer cette nouvelle fonctionnalité, l’entreprise a utilisé Llama Guard 2 de Meta, qui recourt à des algorithmes avancés pour détecter et filtrer automatiquement les contenus potentiellement nuisibles, offensants ou inappropriés dans les sorties des modèles de langage. Les applications d’IA construites sur cette pile sont ainsi protégées contre les contenus nuisibles.

Ryan Klapper, leader IA chez Hakkoda, assure :

“La sécurité et la confiance sont des impératifs business lorsqu’il s’agit d’exploiter l’intelligence artificielle générative, et Snowflake nous offre les garanties nécessaires pour innover et utiliser à grande échelle des grands modèles de langage de pointe. La combinaison des modèles Llama de Meta au sein de Snowflake Cortex AI nous ouvre encore plus de possibilités pour des applications internes basées sur les RAG, permettant à nos parties prenantes d’accéder à des informations précises et pertinentes”.

Snowflake annonce l'intégration de Llama 3.1 et l'open source de sa pile d'optimisation d'inférence

OpenAI propose un fine-tuning gratuit pour GPT-4o mini pendant deux mois

La concurrence entre les acteurs de la GenAI semble plus que jamais de mise. Nouveau hasard du calendrier ou non, le jour-même où Meta lançait la famille Llama 3.1 et NVIDIA annonçait de nouveaux microservices NIM Llama 3.1, OpenAI a lancé une offre de fine-tuning gratuit pour son dernier LLM, GPT-4o mini, présenté le 18 juillet dernier.

Pour rappel, GPT-4o mini est présenté par OpenAI comme le plus rentable de ses modèles. Grâce à son faible coût et sa faible latence, il est particulièrement adapté aux scénarios enchaînant ou parallélisant plusieurs appels de modèle, par exemple l’appel de plusieurs API, ou une analyse de grands volumes de données contextuelles, comme l’intégration de bases de code complètes ou d’historiques de conversations. Les chatbots de support client peuvent également bénéficier de ses réponses rapides et précises en temps réel.

Un fine-tuning gratuit jusqu’au 23 septembre

Depuis le 23 juillet, les développeurs et entreprises peuvent entraîner gratuitement GPT-4o mini sur des données supplémentaires pour l’adapter à leurs besoins spécifiques, mais  avec une limite quotidienne de 2 millions de jetons d’entraînement. Pour ceux qui dépassent cette limite, des frais de 3 $ par million de jetons supplémentaires seront appliqués.

L’offre concerne initialement les niveaux 4 et 5 des plans d’utilisation d‘OpenAI. Ces derniers sont généralement destinés à des entreprises et des organisations ayant des besoins importants et un volume élevé de requêtes. La start-up les proposera aux trois premiers niveaux prochainement.

Comment profiter du fine-tuning gratuit ?

Pour profiter de cette offre, les développeurs peuvent suivre ces étapes simples :

  • Se connecter à leur tableau de bord de fine-tuning sur la plateforme OpenAI ou s’enregistrer pour ceux qui n’ont pas encore de compte ;
  • Cliquer sur “créer”;
  • Sélectionner GPT-4o mini dans le menu déroulant des modèles de fondation.

OpenAI propose un guide dédié aux étapes du fine-tuning pour les non-initiés ici.

Cette offre est valable jusqu’au 24 septembre, affiner GPT-4o mini reviendra alors à 3 $, pour chaque million de jetons d’entraînement, une somme bien inférieure au fine-tuning de GPT-3,5 Turbo qui revient à 8 $ pour le même nombre de jetons.

OpenAI propose un fine-tuning gratuit pour GPT-4o mini pendant deux mois
❌