Lancé ce lundi 3 février, OpenEuroLLM est un projet collaboratif réunissant 20 institutions de recherche, entreprises et centres de calcul de premier plan. Cette initiative, qui bénéficie du soutien de la Commission européenne dans le cadre du programme pour une Europe numérique (Digital Europe), vise à développer une famille de modèles de fondation transparents et performants pour les langues européennes et d’autres langues d’intérêt social et économique, adaptés aux besoins des secteurs public
Lancé ce lundi 3 février, OpenEuroLLM est un projet collaboratif réunissant 20 institutions de recherche, entreprises et centres de calcul de premier plan. Cette initiative, qui bénéficie du soutien de la Commission européenne dans le cadre du programme pour une Europe numérique (Digital Europe), vise à développer une famille de modèles de fondation transparents et performants pour les langues européennes et d’autres langues d’intérêt social et économique, adaptés aux besoins des secteurs public et privé.
Soutenir la compétitivité et la souveraineté numérique de l’UE
OpenEuroLLM s’inscrit dans une dynamique de renforcement de la compétitivité européenne en matière d’IA. En garantissant l’accessibilité, la transparence et la conformité réglementaire, le projet entend offrir une alternative robuste aux modèles propriétaires tout en préservant les valeurs et la diversité linguistique européennes.
Il est d’ailleurs le premier projet financé par Digital Europe à recevoir le label d’excellence STEP (Strategic Technologies for Europe Platform, une nouvelle initiative de l’UE visant à renforcer la compétitivité industrielle européenne en soutenant les technologies critiques, notamment l’IA).
OpenEuroLLM bénéficiera d’un budget total de 37,4 millions d’euros, dont 20,6 millions du programme pour une Europe numérique. L’entreprise commune EuroHPC fournira quant à elle un accès à ses services de calcul.
Un consortium d’acteurs clés
Coordonné par Jan Hajič de l’Université Charles en Tchéquie et co-dirigé par Peter Sarlin, le plus grand laboratoire d’IA privé d’Europe, racheté l’an dernier par le fabricant américain de puces AMD, OpenEuroLLM rassemble des partenaires prestigieux issus du monde académique, de l’industrie et des infrastructures de calcul haute performance :
Instituts de recherche et universités : Université d’Helsinki, Université d’Oslo, Fraunhofer IAIS, Institut ELLIS Tübingen, Université de technologie d’Eindhoven, entre autres.
“Au lieu d’efforts fragmentés, il s’agit d’une action coordonnée visant à créer des modèles de langage européens ouverts que les entreprises peuvent posséder, contrôler et intégrer dans leurs produits. “
Transparence et collaboration avec la communauté Open Source
Un des piliers d’OpenEuroLLM repose sur son engagement en faveur d’une intelligence artificielle ouverte et responsable. En partenariat avec des organisations comme LAION, OpenML et open-sci, le projet veillera à ce que les modèles, les logiciels et les ensembles de données soient accessibles à tous, favorisant ainsi l’innovation et l’adaptabilité aux besoins industriels et publics.
Laurent Daudet, Directeur Général Délégué et cofondateur de LightOn, conclut :
“L’Europe dispose des talents et des ressources nécessaires pour prendre une place de choix dans cette compétition internationale autour de l’IA.Pour transformer ces efforts en un véritable levier stratégique, l’Europe doit non seulement capitaliser sur l’IA Act, véritable catalyseur de l’innovation vers une IA de confiance, mais également soutenir une approche coordonnée de ses leaders. C’est aujourd’hui rendu possible grâce au consortium OpenEuroLLM.”
En fin de semaine dernière, alors que tout le monde avait les yeux rivés sur DeepSeek et son modèle R1, Mistral AI, licorne française de la GenAI, a lancé plus discrètement Mistral Small 3. Publié sous la licence Apache 2.0, ce modèle de 24 milliards de paramètres optimisé pour la latence est “une excellente alternative open source aux modèles propriétaires opaques comme GPT4o-mini” selon elle.
Avec Small 3, la licorne, démontre une fois de plus que pour être performant, un LLM ne requiert pas u
En fin de semaine dernière, alors que tout le monde avait les yeux rivés sur DeepSeek et son modèle R1, Mistral AI, licorne française de la GenAI, a lancé plus discrètement Mistral Small 3. Publié sous la licence Apache 2.0, ce modèle de 24 milliards de paramètres optimisé pour la latence est “une excellente alternative open source aux modèles propriétaires opaques comme GPT4o-mini” selon elle.
Avec Small 3, la licorne, démontre une fois de plus que pour être performant, un LLM ne requiert pas un nombre astronomique de paramètres. Le modèle se positionne comme une réponse aux besoins croissants d’efficacité en offrant un taux de traitement de 150 tokens par seconde, tout en affichant une précision de plus de 81 % sur le benchmark MMLU.
Cette prouesse technique est rendue possible grâce à une architecture optimisée qui réduit le nombre de couches traditionnelles, diminuant ainsi le temps de passage avant (forward pass time, ou temps nécessaire à un modèle de réseau de neurones pour traiter une entrée et produise une sortie) sans compromettre la qualité des réponses.
Ce choix architectural, qui en fait “actuellement le modèle le plus efficace de sa catégorie”, permet à la version optimisée, Mistral Small 3 Instruct, de rivaliser avec des modèles bien plus imposants comme Llama 3.3 70B ou Qwen 32B, tout en garantissant une exécution rapide et efficace sur du matériel standard.
Des applications pour divers secteurs
Le Mistral Small 3 ne se contente pas d’afficher des performances techniques remarquables : il s’inscrit également dans une logique d’adaptabilité aux besoins concrets des entreprises. Parmi les cas d’usage envisagés, plusieurs domaines se démarquent :
Assistance conversationnelle et appels de fonction : la faible latence garantit des interactions en temps réel, essentielles pour les chatbots ou assistants virtuels ;
Fine-tuning pour des expertises spécifiques : sa taille modeste facilite l’ajustement fin pour des domaines précis, comme le diagnostic médical ou le conseil juridique ;
Inférence locale : la possibilité de déployer le modèle sur du matériel accessible favorise l’usage dans des secteurs où les données sensibles nécessitent un traitement en local.
Comme les “Ministraux”, Small 3 répond également aux besoins croissants de calcul local et de protection de la vie privée : la possibilité de le déployer sur des configurations matérielles accessibles, comme une RTX 4090 ou un MacBook avec 32 Go de RAM, offre aux organisations le contrôle sur leurs données sensibles sans dépendance à une infrastructure cloud centralisée.
Une stratégie de diffusion ouverte et collaborative
Selon Mistral AI, faisant référence aux derniers modèles de DeepSeek, et au projet Open-R1,”Ce furent des jours passionnants pour la communauté open source ! Mistral Small 3 complète les grands modèles de raisonnement open source comme les récentes versions de DeepSeek, et peut servir de modèle de base solide pour faire émerger des capacités de raisonnement”.
L’entreprise a fait le choix de le publier sous la licence Apache 2.0, faisant le choix d’abandonner peu à peu sa licence plus restrictive MRL pour les modèles à usage général. Elle annonce d’ores et déjà “des modèles Mistral petits et grands avec des capacités de raisonnement améliorées dans les semaines à venir”.
Actuellement disponible sur les plateformes Hugging Face, Ollama, Kaggle, Together AI et Fireworks AI, Mistral Small 3 le sera également bientôt sur NVIDIA NIM, Amazon SageMaker, Groq, Databricks et Snowflake.
L’avancement des LLMs repose souvent sur leur capacité à traiter des volumes croissants de données dans des contextes plus longs et plus complexes. Avec le lancement des modèles open source Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M, l’équipe Qwen d’Alibaba Cloud place la barre très haut.
Pour permettre aux développeurs de déployer plus efficacement les modèles de la série Qwen2.5-1M, ceux-ci sont accompagnés d’un cadre d’inférence innovant, intégrant une méthode d’extrapolation de longu
L’avancement des LLMs repose souvent sur leur capacité à traiter des volumes croissants de données dans des contextes plus longs et plus complexes. Avec le lancement des modèles open source Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M, l’équipe Qwen d’Alibaba Cloud place la barre très haut.
Pour permettre aux développeurs de déployer plus efficacement les modèles de la série Qwen2.5-1M, ceux-ci sont accompagnés d’un cadre d’inférence innovant, intégrant une méthode d’extrapolation de longueur et une méthode d’attention clairsemée, visant à réduire les coûts d’inférence et à améliorer la précision.
Les avancées techniques de Qwen2.5-1M
L’entraînement avec des séquences aussi longues représente un défi monumental en termes de calcul. L’équipe Qwen a adopté une approche progressive :
Augmentation graduelle : les modèles passent de 4K à 256K jetons au pré-entraînement, grâce à l’ajustement de la fréquence de base RoPE ;
Fine-tuning supervisé : une stratégie en deux étapes combine des instructions courtes (32K jetons) et longues (jusqu’à 256K jetons), garantissant une performance équilibrée ;
Extrapolation à 1 M : l’intégration de l’attention à double bloc (DCA) permet de gérer des distances de position relative invisibles pendant l’entraînement classique, tout en évitant une dégradation des performances.
Optimisations de l’inférence
Les besoins matériels pour traiter des contextes longs sont élevés, mais l’attention clairsemée et d’autres améliorations ont permis de réduire ces contraintes :
Chunked Prefill : cette méthode divise les séquences en blocs pour diminuer l’utilisation de la mémoire vive (VRAM) d’activation jusqu’à 96,7 % ;
Optimisation du parallélisme : une meilleure gestion des ressources GPU assure une exécution fluide même sur des dispositifs limités ;
Efficacité accrue : ces optimisations aboutissent à une augmentation de la vitesse de traitement, qui peut être jusqu’à 6,7 fois supérieures à celle des modèles classiques.
Performances de la famille de modèles Qwen2.5-1M
Tâches à contexte long
La série Qwen2.5-1M comprend actuellement les modèles open source Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M, ainsi que le modèle accessible via API Qwen2.5-Turbo, qui alimente désormais Qwen Chat.
Les modèles Qwen2.5-1M excellent sur des benchmarks complexes comme RULER, LV-Eval et LongBenchChat, souvent utilisés pour tester la compréhension de longs contextes, où ils surpassent leurs homologues 128K dans la plupart des tâches à contexte long, en particulier pour les séquences de plus de 64 Ko.
Le modèle 14B-Instruct-1M surpasse non seulement Qwen2.5-Turbo, mais aussi des modèles concurrents comme GPT-4o-mini, offrant une alternative open-source robuste pour les tâches à contexte long.
Évalués sur la tâche Passkey Retrieval, leurs résultats démontrent qu’ils peuvent récupérer avec précision des informations cachées dans des documents contenant jusqu’à 1 million de jetons, avec seulement des erreurs mineures observées dans le modèle 7B.
Tâches à contexte court
L’équipe a comparé les performances des modèles Qwen2.5-1M sur des séquences courtes par rapport à celles de leurs versions 128K et de GPT-4o-mini. Ils ont constaté que les versions 1M sont aussi précises que leurs homologues 128K sur des tâches classiques et qu’avec une longueur de contexte huit fois supérieure à celle de GPT-4o-mini, les modèles Qwen2.5-14B-Instruct-1M et Qwen2.5-Turbo atteignent des performances similaires au modèle d’OpenAI.
Le lancement de Qwen2.5-1M marque un tournant pour les modèles à contexte long, repoussant les limites techniques tout en élargissant le champ des possibles pour les applications qui nécessitent un traitement contextuel étendu telles que l’analyse juridique ou la gestion documentaire.
Pour plus d’informations sur les modèles, cliquer ici.
Alibaba, l'équipe Qwen annonce l'ajout de deux nouveaux modèles open source
Systematic Paris-Region, pôle européen du numérique et des DeepTech, a dévoilé hier la promotion 2024 de ses Champions, son label premium décerné chaque année à des PME en hyper croissance. Probabl, Quandela, Scalinx, Sekoia.io et Uavia rejoignent ainsi le cercle élitiste des Champions du Pôle qui compte désormais 73 entreprises innovantes, incarnant la DeepTech européenne dans toute sa diversité et son ambition.
Le label « Champion du Pôle » : un tremplin pour l’avenir
Ce label premium vise à a
Systematic Paris-Region, pôle européen du numérique et des DeepTech, a dévoilé hier la promotion 2024 de ses Champions, son label premium décerné chaque année à des PME en hyper croissance. Probabl, Quandela, Scalinx, Sekoia.io et Uavia rejoignent ainsi le cercle élitiste des Champions du Pôle qui compte désormais 73 entreprises innovantes, incarnant la DeepTech européenne dans toute sa diversité et son ambition.
Le label « Champion du Pôle » : un tremplin pour l’avenir
Ce label premium vise à accélérer la croissance des membres « pré-ETI » deeptech du pôle. Il offre aux lauréats une visibilité accrue et un accès préférentiel aux ressources stratégiques de l’écosystème DeepTech. Au-delà de l’accompagnement financier, il favorise leur mise en réseau avec des acteurs clé de l’innovation européenne, tout en renforçant leur capacité à attirer des talents.
Les Champions du Pôle illustrent l’avenir de la Deep Tech européenne : pragmatisme, ambition globale, et modèles économiques durables.
Un processus de sélection rigoureux et exigeant
Le label « Champion du Pôle » repose sur une analyse approfondie des candidatures, avec deux axes principaux :
Les enjeux de développement : les défis auxquels ils seront confrontés pour poursuivre leur croissance ;
Les apports attendus : le soutien spécifique qu’ils espèrent obtenir du pôle, de l’écosystème et du jury.
Les cinq Champions du Pôle 2024 se démarquent par leur potentiel d’innovation, leur croissance forte et régulière, leur développement à l’international et l’ambition de leurs dirigeants.
Sous la présidence de Fadwa Sube, vice-présidente de Systematic, le jury a évalué des critères variés : croissance du chiffre d’affaires, qualité des solutions technologiques, stratégies de financement, ambition internationale, et capacité des dirigeants à mobiliser des talents.
Elle affirme :
“C’est avec beaucoup d’enthousiasme que nous dévoilons la 13ème promotion 2024 des champions. Ces PME sont porteuses de technologies de pointe, démontrant l’excellence et la force d’innovation de la Deep Tech française. Ce millésime 2024 est celui de la maturité et de la consolidation. Ces 5 Champions adressent toujours les sujets stratégiques, critiques de la DeepTech européenne : Quantique, Cyber, Semi-conducteurs, Drones, Open Source en s’appuyant évidemment sur les moteurs DATA et IA. Cette année, ils abordent leurs marchés et écosystèmes avec plus de pragmatisme, de sens du réel et de créativité dans la structuration de leurs modèles économiques et leur gouvernance !”
Les lauréats 2024
Probabl : Démocratiser l’IA et la science des données
Spin-off d’Inria, Probabl s’impose comme un acteur majeur de la science des données en s’appuyant sur la renommée de scikit-learn, bibliothèque open source comptabilisant plus de 2,2 milliards de téléchargements. Leur mission : améliorer la productivité dans l’étape précédant la mise en production des modèles de machine learning.
Points forts : son approche open source, son modèle économique SaaS, et sa vision audacieuse soutenue par des investisseurs stratégiques comme Mozilla Ventures.
“Le jury des Champions 2024 a particulièrement apprécié le fait que Probabl soit une Entreprise à Mission dans l’Open Source et l’IA. Probabl propose une refondation totale de l’infrastructure et l’ADN de l’édifice « start-up » innovante. Il a également souligné l’excellence de la recherche de l’Inria et la vocation d’un projet développant un actif majeur pour une « Science des Données Française », mais aussi et surtout la vision, l’audace, le chemin de vie de Yann Lechelle et sa connaissance intime du numérique et de ses chaînes de valeur depuis les années 80.”
Leader dans le calcul quantique, Quandela conçoit des solutions adaptées aux besoins industriels : ordinateurs quantiques prêts à l’emploi, accès cloud aux processeurs et services d’algorithmes quantiques.
Points forts : l’excellence scientifique alliée à une approche pragmatique à étapes, étroitement liée aux besoins client.
“Le jury des Champions 2024 a particulièrement apprécié la parfaite alliance entre l’excellence scientifique au plus haut niveau mondial dans le « quantique » et le pragmatisme et l’humilité de Valérian Giesz et son équipe. Il a aussi souligné l’approche « step by step » très attentive aux besoins des clients et la construction terrain et opérationnelle de l’offre et de la roadmap.”
Scalinx : Optimiser la connectivité physique-numérique
Spécialisée dans les circuits intégrés mixtes et RF, Scalinx propose la technologie SCCORE™, permettant de réduire les coûts et la consommation énergétique dans des secteurs stratégiques comme la défense, l’aérospatial et les communications.
Points forts : un positionnement central répondant aux besoins critiques en performance et décarbonation, avec des partenariats stratégiques comme ceux avec Thales ou Nokia.
“Le jury des Champions 2024 a particulièrement apprécié le combo microprocesseur x data x décarbonation, ainsi que son positionnement central au cœur des besoins colossaux en performance, sécurité et efficacité énergétique pour les acteurs stratégiques de la défense, du spatial, de l’automobile et de la 5G et 6G. Elle a également souligné l’excellence de son équipe « semiconducteurs.”
Sekoia.io : Maîtriser les cybermenaces grâce à l’IA
Sekoia.io, société européenne de technologies de cybersécurité, est leader en détection et réponse s’appuyant sur l’IA et le renseignement cyber (CTI). Sa mission : fournir aux entreprises et organisations publiques les meilleures capacités de protection contre les cyberattaques.
Points forts : une plateforme SOC interopérable et conforme aux standards techniques internationaux, qui permet aux équipes de sécurité de se concentrer sur des missions à haute valeur ajoutée. Leur campagne de désinfection du malware PlugX, saluée par le FBI en 2025, illustre leur impact mondial.
“Le jury des Champions 2023 a particulièrement apprécié la maturité d’une offre cyber complète, en mode SaaS, opérationnelle pour les SI, la très belle croissance en termes de nombre de clients, d’actifs protégés, de partenaires et clients partout dans le monde et son très fort potentiel de passage à l’échelle.”
Uavia : Révolutionner la robotique autonome
Leader européen du logiciel, de la data et de la cybersécurité appliqués à la robotique, Uavia développe des solutions de drones autonomes répondant aux enjeux de protection des populations, de souveraineté et d’environnement.
Points forts : une plateforme indépendante du hardware permettant des opérations temps réel. Son projet SIMEA, primé France 2030, illustre son rôle clé dans la réduction des émissions de gaz à effet de serre.
“Le jury des Champions 2024 a particulièrement apprécié l’offre plateforme complète intégrée clé en main, son équipe chevronnée et des fondateurs et actionnaires engagés pour une souveraineté opérationnelle dans le marché ultra critique et compétitif des drones. Ajoutons à cela un écosystème dense, diversifié et international.“
LightOn, acteur européen majeur dans le domaine de l’IA générative, et Europrop International GmbH (EPI), consortium regroupant quatre leaders européens des moteurs d’avions (MTU Aero Engines, Safran Aircraft Engines, Rolls-Royce, et Industria de Turbo Propulsores), annoncent un partenariat stratégique pour déployer la plateforme d’IA générative Paradigm auprès de toutes les équipes d’EPI.
Fondée en 2016 par Igor Carron, Laurent Daudet, Florent Krzakala et Sylvain Gigan, la start-up parisienne L
LightOn, acteur européen majeur dans le domaine de l’IA générative, et Europrop International GmbH (EPI), consortium regroupant quatre leaders européens des moteurs d’avions (MTU Aero Engines, Safran Aircraft Engines, Rolls-Royce, et Industria de Turbo Propulsores), annoncent un partenariat stratégique pour déployer la plateforme d’IA générative Paradigm auprès de toutes les équipes d’EPI.
Fondée en 2016 par Igor Carron, Laurent Daudet, Florent Krzakala et Sylvain Gigan, la start-up parisienne LightOn, plutôt que de se concentrer sur des applications grand public, cible le secteur professionnel. Première société européenne de la GenAI à être cotée sur Euronext Growth, ses deux produits phares sont Forge lancé en 2022 et Paradigm, lancé l’année suivante, une plateforme d’IA générative à destination des entreprises européennes, qui peut être directement intégrée dans les infrastructures existantes,(on premise, Air Gapped), garantissant ainsi la sécurité des données des organisations utilisatrices.
Paradigm : la technologie au service des données stratégiques
Cette solution, qui repose sur la RAG (Retrieval Augmented Generation), est régulièrement mise à jour avec de nouveaux LLMs, à l’instar de ModernBERT, fruit d’une collaboration avec le laboratoire de R&D Answer.AI. Adoptée par des acteurs de divers secteurs, notamment le SEO, la défense, la santé et l’aéronautique, pour interroger des bases de données complexes et volumineuses, générant des réponses précises et contextuelles, elle vient d’être choisie par Europrop International.
Créé en 2002, issu d’un programme de collaboration entre les quatre motoristes européens ITP Aero, MTU Aero Engines, Rolls-Royce et Safran Aircraft Engines, EPI est responsable de la conception, du développement et de la fabrication du moteur TP400-D6. Ce turbopropulseur, le plus puissant au monde, est destiné à l’Airbus A400M de transport militaire construit par Airbus Defence and Space. Les 2 500 personnes chargées à travers l’Europe de gérer le programme TP400-D6 pourront bénéficier de la technologie avancée de LightOn pour optimiser la gestion des connaissances tout en répondant aux enjeux de confidentialité propres à cette industrie.
GenAI : Europrop International opte pour la solution Paradigm de LightOn
Avec Phi-4, Microsoft démontre une nouvelle fois qu’il est possible de concilier performance et compacité. Ce SLM de 14 milliards de paramètres qui selon l’entreprise “excelle dans le raisonnement complexe dans des domaines tels que les mathématiques, en plus du traitement du langage conventionnel”, a réussi à surpasser sur certains benchmarks des modèles de pointe tels que Gemini Pro 1.5, GPT-4o ou Claude 3.5 Sonnet.
Alors qu’on a pu voir arriver des LLMs affichant un nombre de paramètres de p
Avec Phi-4, Microsoft démontre une nouvelle fois qu’il est possible de concilier performance et compacité. Ce SLM de 14 milliards de paramètres qui selon l’entreprise “excelle dans le raisonnement complexe dans des domaines tels que les mathématiques, en plus du traitement du langage conventionnel”, a réussi à surpasser sur certains benchmarks des modèles de pointe tels que Gemini Pro 1.5, GPT-4o ou Claude 3.5 Sonnet.
Alors qu’on a pu voir arriver des LLMs affichant un nombre de paramètres de plus en plus impressionnant, certains acteurs de l’IA comme Mistral AI ou Google proposent désormais des modèles beaucoup plus compacts. Microsoft, avec ses modèles Phi, s’est intéressé au potentiel des SLMs dès avril 2023. Alors qu’il a dévoilé les modèles Phi-3,5 : Phi-3.5-mini-instruct, Phi-3.5-MoE-instruct, et Phi-3.5-vision-instruct, optimisé chacun pour des tâches spécifiques, en août dernier, il introduit Phi-4.
Selon Microsoft, si Phi-4 surpasse des modèles comparables et plus grands sur le raisonnement lié aux mathématiques, c’est grâce aux progrès réalisés depuis le développement de Phi-3.5. Il explique cette avancée par :
L’usage de données synthétiques de haute qualité, qui enrichissent les capacités du modèle ;
Des processus de post-formation innovants, optimisant ses réponses pour des tâches spécifiques ;
Une conservation rigoureuse des données organiques pour maintenir la pertinence linguistique.
On peut voir dans l’image ci-dessous qu’il surpasse largement LLama-3.1-8B_Instruct et que ses performances sont légèrement en deçà de celles de LLama-3.3-70B-Instruct.
Microsoft a évalué ses performances sur des benchmarks de compétitions mathématiques organisées par la Mathematical Association of America (MAA), notamment les tests AMC 10/12, conçus pour évaluer les compétences en trigonométrie, algèbre, géométrie et probabilité des élèves du secondaire.
Phi-4 a obtenu des résultats impressionnants, surpassant des modèles plus grands comme Gemini Pro 1.5, Claude 3.5 Sonnet et GPT-4o, comme on peut le constater dans ce graphique.
Phi-4 est disponible sous un accord de licence de recherche via Azure AI Foundry. Présentée à Ignite 2024, le mois dernier, cette plateforme fournit des outils robustes pour évaluer, atténuer et gérer les risques liés à l’IA, ce qui garantit une utilisation sûre du modèle. Celui-ci sera également accessible sur Hugging Face dans les prochains jours.
Google a annoncé ce mercredi 11 décembre le lancement de Gemini 2.0 Flash, le premier modèle de la famille Gemini 2, conçue selon lui pour l’ère agentique. Ce modèle est d’ores et déjà disponible en tant que modèle expérimental pour les développeurs et les testeurs de confiance via l’API Gemini dans Google AI Studio et Vertex AI. Sa disponibilité générale est prévue pour janvier 2025.
Google a présenté Gemini il y a tout juste un an, Gemini 1.5 Flash a, quant à lui été dévoilé en mai dernier lor
Google a annoncé ce mercredi 11 décembre le lancement de Gemini 2.0 Flash, le premier modèle de la famille Gemini 2, conçue selon lui pour l’ère agentique. Ce modèle est d’ores et déjà disponible en tant que modèle expérimental pour les développeurs et les testeurs de confiance via l’API Gemini dans Google AI Studio et Vertex AI. Sa disponibilité générale est prévue pour janvier 2025.
Google a présenté Gemini il y a tout juste un an, Gemini 1.5 Flash a, quant à lui été dévoilé en mai dernier lors de la conférence Google I/O 2024. Optimisé pour la vitesse et l’efficacité, il a été entraîné par 1.5 Pro grâce à un processus appelé “distillation”, où les connaissances et les compétences les plus essentielles d’un modèle plus grand sont transférées vers un modèle plus petit et plus efficace.
Les performances du modèle ont été améliorées en matière de multimodalité, de texte, de code, de vidéo, de compréhension spatiale et de raisonnement tandis que la latence a été réduite. Flash 2.0 prend en charge les entrées multimodales comme les images, la vidéo et l’audio ainsi que les sorties multimodales, telles que la génération d’images combinées avec du texte et de l’audio multilingue TTS (Text-to-Speech). Il permet également l’intégration native d’outils tels que Google Search, l’exécution de code et des fonctions tierces définies par l’utilisateur.
L’équipe de recherche Gemini a comparé les performances du nouveau modèle avec celles de Gemini 1.5 Flash et Pro. Il surpasse même 1.5 Pro sur les principaux benchmarks, tout en étant deux fois plus rapide.
Projets de recherche
Google a également partagé plusieurs projets illustrant sa vision d’assistants d’IA universels, utiles au quotidien. Ces prototypes cherchent à transformer l’IA en des agents polyvalents, capables de comprendre le contexte d’une situation, de planifier des actions et d’effectuer des tâches à la place des utilisateurs, tout en interagissant de manière transparente avec d’autres systèmes.
Project Astra, présenté en mai dernier, a ainsi été mis à jour grâce aux capacités multimodales de Gemini 2.0. Ce prototype montre comment un assistant IA peut interagir dans des conversations multilingues, se souvenir de sessions passées et utiliser des outils comme Google Maps ou Lens.
Project Mariner, de son côté, explore la possibilité pour des agents IA d’assister l’utilisateur dans la navigation sur le web en analysant des éléments de page et en effectuant des actions spécifiques dans le navigateur.
Enfin, Jules, un agent de codealimenté par l’IA, assiste les développeurs. Il s’intègre dans leurs flux de travail GitHub pour gérer les corrections de bogues et autres tâches chronophages.
Gemini 2.0 Flash, le modèle qui ouvre la voie aux agents d'IA de Google
Que ce soit dans le cadre de sa stratégie régionale sur l’intelligence artificielle (IA2021) ou dans celui de son plan en faveur de la santé, la Région Île-de-France entend devenir un pôle d’excellence dans le domaine de l’innovation et de la santé. Dans la continuité de ces initiatives, elle s’est associée à l’Hôpital Fondation Rothschild pour lancer le Challenge IA pour la Santé, doté de 500.000 €. Il ne reste plus que quelques jours aux entreprises intéressées pour se manifester puisque les c
Que ce soit dans le cadre de sa stratégie régionale sur l’intelligence artificielle (IA2021) ou dans celui de son plan en faveur de la santé, la Région Île-de-France entend devenir un pôle d’excellence dans le domaine de l’innovation et de la santé. Dans la continuité de ces initiatives, elle s’est associée à l’Hôpital Fondation Rothschild pour lancer le Challenge IA pour la Santé, doté de 500.000 €. Il ne reste plus que quelques jours aux entreprises intéressées pour se manifester puisque les candidatures ne sont ouvertes que jusqu’au 6 décembre prochain.
Le Challenge vise à initier un partenariat de long terme entre l’HFAR (Hôpital Fondation Rothschild) et une entreprise ayant démontré sa capacité à développer, valider et tester un algorithme d’intérêt pour améliorer la prise en charge des patients atteints de sclérose en plaques (SEP).
La SEP est une maladie neurologique auto-immune chronique qui affecte le système nerveux central, impliquant le cerveau et la moelle épinière. Elle résulte d’une attaque anormale du système immunitaire contre la myéline, une substance qui entoure et protège les fibres nerveuses, jouant un rôle essentiel dans la transmission rapide des signaux nerveux. Elle touche environ 2,8 millions de personnes dans le monde, dont 130.000 en France, et est la principale cause de handicap neurologique non traumatique chez les jeunes adultes.
Si on ne peut guérir la SEP, de nouveaux traitements permettent aujourd’hui de ralentir l’évolution de la maladie et en gérer les symptômes, ils sont d’autant plus efficaces que le diagnostic posé est précoce. Celui-ci repose sur une combinaison de méthodes dont l’imagerie par résonance magnétique (IRM).
Le Challenge IA pour la Santé s’articule autour de deux biomarqueurs de la SEP visibles sur une IRM cérébrale : le signe de la veine centrale qui se manifeste par la présence d’une veine au centre des lésions inflammatoires etle signe du halo qui se caractérise par la présence d’un anneau de signal hyper intense autour des lésions.
Les compétiteurs devront développer un algorithme pour :
détecter le signe de la veine centrale, avec un haut degré de fiabilité. Si un diagnostic formel de SEP ne peut être établi, le modèle devra estimer la probabilité que la pathologie soit présente ;
reconnaître le signe du halo, souvent plus subtil et complexe à détecter.
Qui peut candidater ?
Pour être éligible à la subvention, les entreprises candidates devront être :
Soit 1 TPE ou 1 PE (entreprise de moins de 50 salariés dont le chiffre d’affaires annuel ou le total du bilan annuel n’excède pas 10 M€),
Soit 1 ME (entreprise de moins de 250 salariés dont le chiffre d’affaires annuel est inférieur à 50 M€ ou dont le total du bilan annuel n’excède pas 43 M€),
Soit 1 ETI (entreprise de 250 à 4.999 salariés dont le chiffre d’affaires annuel n’excède pas 1,5 Md € ou dont le total de bilan n’excède pas 2 Mds €, et qui n’est pas affiliée à un groupe de dimension supérieure).
Peuvent également candidater les groupements associant :
Soit 1 laboratoire public et 1 (ou plusieurs) entreprise(s) privée(s),
Soit plusieurs entreprises de type TPE, PE, ME ou ETI issues de l’UE ou de Suisse ayant un projet d’implantation dans les 6 mois.
Une seule candidature par groupement est attendue. Pour plus d’informations sur le challenge, cliquer ici.
Via son programme “Build on Trainium”, Amazon fournira des heures de calcul aux chercheurs qui leur permettront de créer de nouvelles architectures d’IA, des bibliothèques d’apprentissage automatique (ML) et des optimisations de performances pour les UltraClusters AWS Trainium distribués à grande échelle.
Le programme cible deux enjeux majeurs de la recherche en IA : le besoin croissant de puissance de calcul et l’accès limité aux infrastructures de pointe pour les institutions académiques qui p
Via son programme “Build on Trainium”, Amazon fournira des heures de calcul aux chercheurs qui leur permettront de créer de nouvelles architectures d’IA, des bibliothèques d’apprentissage automatique (ML) et des optimisations de performances pour les UltraClusters AWS Trainium distribués à grande échelle.
Le programme cible deux enjeux majeurs de la recherche en IA : le besoin croissant de puissance de calcul et l’accès limité aux infrastructures de pointe pour les institutions académiques qui peinent à soutenir des recherches à grande échelle en raison de contraintes budgétaires. Dans le cadre de Build on Trainium, AWS a créé un UltraCluster de recherche Trainium intégrant jusqu’à 40 000 puces Trainium optimisées pour des charges de travail complexes.
Trainium est la puce ML qu’AWS a conçue à des fins d’entraînement et d’inférence de deep learning. Tout comme sa puce Graviton, Trainium2 offre des avancées en matière de rapport qualité-prix et d’efficacité énergétique pour un large éventail de charges de travail, notamment l’entraînement des modèles d’IA et les applications d’IA générative exécutés sur Amazon Elastic Compute Cloud (Amazon EC2).
En intégrant également des interfaces de programmation avancées comme la Neuron Kernel Interface, qui donne un accès direct au jeu d’instructions de la puce, le programme offre aux chercheurs une flexibilité sans précédent pour explorer les capacités des puces Trainium.
Build on Trainium permet aux chercheurs d’accéder à des infrastructures technologiques de pointe, mais favorise aussi l’innovation ouverte puisque les avancées réalisées dans le cadre de cette initiative seront publiées en open source, permettant à la communauté scientifique de continuer à innover.
Former les experts de demain
Au-delà des avancées techniques, Amazon mise sur l’humain. Le programme finance des collaborations avec des institutions renommées telles que Carnegie Mellon et Berkeley, non seulement pour soutenir des recherches de pointe, mais aussi pour éduquer une nouvelle génération d’experts en IA.
En outre, Amazon organisera plusieurs séries d’appels à propositions Amazon Research Awards, les propositions sélectionnées recevant des crédits AWS Trainium et un accès aux grands Trainium UltraClusters pour leurs recherches.
En offrant des crédits cloud, des formations techniques et un accès aux clusters de calcul, Amazon prépare le terrain pour un écosystème où les compétences en IA deviennent plus accessibles tout en renforçant son rôle central dans les solutions cloud pour l’IA.
Amazon annonce un investissement de 110 millions de dollars dans la recherche universitaire en IA générative.
Lors de son évènement annuel Snapdragon Summit, Qualcomm Technologies a annoncé une collaboration stratégique avec Mistral AI, visant à apporter les derniers modèles de pointe présentés il y a deux semaines par la licorne : Ministral 3B et Ministral 8B, directement sur les appareils alimentés par les plateformes Snapdragon.
Exécuter l’IA directement sur l’appareil offre des bénéfices importants : une meilleure confidentialité, une latence réduite, une fiabilité accrue, des économies de coûts, et
Lors de son évènement annuel Snapdragon Summit, Qualcomm Technologies a annoncé une collaboration stratégique avec Mistral AI, visant à apporter les derniers modèles de pointe présentés il y a deux semaines par la licorne : Ministral 3B et Ministral 8B, directement sur les appareils alimentés par les plateformes Snapdragon.
Exécuter l’IA directement sur l’appareil offre des bénéfices importants : une meilleure confidentialité, une latence réduite, une fiabilité accrue, des économies de coûts, et une plus grande efficacité énergétique.
Les Ministraux, conçus pour être exécutés sur des appareils périphériques, tels que les smartphones et les ordinateurs portables, ou les systèmes embarqués des véhicules, offrent des performances inédites dans la catégorie des modèles IA de moins de 10 milliards de paramètres.
Intégration sur les plateformes Snapdragon
Ce partenariat stratégique permettra à Ministral 3B et Ministral 8B d’opérer sur les plateformes présentées par Qualcomm lors de l’évènement : Snapdragon 8 Elite, pour les appareils mobiles, Snapdragon Cockpit Elite, destinée aux systèmes d’infodivertissement embarqués dans les véhicules et Snapdragon Ride Elite, conçue pour les systèmes de conduite autonome et les systèmes avancés d’assistance à la conduite (ADAS). Les deux modèles seront également intégrés à la plateforme de calcul Snapdragon X Elite, destinée aux ordinateurs portables et tablettes, dotée de capacités d’IA avancée.
Durga Malladi, vice-présidente principale et directrice générale de la technologie, de la planification et des solutions de périphérie chez Qualcomm, souligne :
“Les Ministral 3B et Ministral 8B de Mistral AI permettront aux fabricants d’appareils, aux fournisseurs de logiciels et aux fournisseurs de services numériques d’offrir des expériences innovantes, telles que des assistants d’IA et d’autres applications qui comprennent les désirs et les besoins des utilisateurs, grâce à l’immédiateté, à la fiabilité et à la confidentialité accrue de l’IA sur l’appareil”.
Les modèles de Mistral AI seront accessibles via le Qualcomm AI Hub, une plateforme conçue pour centraliser et faciliter l’accès aux outils et modèles d’IA destinés aux développeurs, leur permettant de créer des solutions IA de bout en bout pour des applications mobiles, informatiques, automobiles et IoT.
Deux modèles de Mistral AI, Mistral 7B v0.3 et Mistral 3B, optimisés pour Qualcomm, y sont déjà disponibles. Cette nouvelle collaboration permettra à Ministral 3B et Ministral 8B de les rejoindre prochainement.
Arthur Mensch, cofondateur et PDG de Mistral AI, commente :
“Cette collaboration avec Qualcomm Technologies est une étape importante pour Mistral AI, démontrant la capacité de nos nouveaux modèles à fonctionner localement sur des appareils alimentés par des plates-formes Snapdragon, ce qui se traduit par un traitement local plus rapide qui peut aider à réduire les coûts et les demandes d’énergie”.
Il conclut :
“Ensemble, nous démocratisons l’accès à l’IA avancée, en permettant aux développeurs et aux utilisateurs du monde entier de découvrir le plein potentiel de nos modèles directement sur leurs appareils”.
Lors de l’événement annuel TechXchange d’IBM, la société a annoncé la sortie de Granite 3.0, la dernière version de sa famille de modèles de langage (LLM) open source, adaptés aux besoins des entreprises. Granite 3.0 se distingue par son équilibre entre performance, sécurité et rentabilité, répondant aux défis de l’utilisation de LLMs dans des environnements professionnels.
La suite de modèles Granite 3.0 comprend :
Des LLM à usage général : Granite 3.0 8B-Instruct, Granite 3.0 2B-Instruct, G
Lors de l’événement annuel TechXchange d’IBM, la société a annoncé la sortie de Granite 3.0, la dernière version de sa famille de modèles de langage (LLM) open source, adaptés aux besoins des entreprises. Granite 3.0 se distingue par son équilibre entre performance, sécurité et rentabilité, répondant aux défis de l’utilisation de LLMs dans des environnements professionnels.
La suite de modèles Granite 3.0 comprend :
Des LLM à usage général : Granite 3.0 8B-Instruct, Granite 3.0 2B-Instruct, Granite 3.0 8B Base, Granite 3.0 2B Base
Granite 3.0 : un modèle d’efficacité et de flexibilité
Granite 3.0 8B et 2B ont été entraînés à partir de 12 000 milliards de jetons de données, provenant de 12 langages naturels et de 116 langages de programmation différents. Les entreprises peuvent les personnaliser avec leurs propres données grâce à la méthode d’alignement InstructLab, introduite par IBM et Red Hat en mai dernier. Elle permet aux entreprises de personnaliser les modèles en utilisant des données synthétiques et des protocoles de formation adaptés à leurs besoins, réduisant ainsi les coûts de trois à vingt-trois fois, et les délais de mise en œuvre.
Les modèles de la famille Granite 3.0 sont adaptés à différentes applications d’IA. Les modèles de base Granite 3.0 8B et 2B, qualifiés de “bourreaux de travail” par IBM, sont conçus pour des tâches variées comme la génération augmentée de récupération (RAG), la classification et la synthèse de données. Ils peuvent être facilement personnalisés avec des données d’entreprise, permettant ainsi aux organisations d’optimiser leurs performances à moindre coût.
Le modèle phare de cette version, Granite 3.0 8B Instruct, un modèle dense optimisé pour les instructions, est destiné à servir de bloc de construction principal pour les flux de travail sophistiqués et les cas d’utilisation basés sur des outils.
En matière de benchmarks académiques et professionnels, Granite 3.0 8B Instruct rivalise avec des modèles concurrents open source de taille similaire, comme Llama 3.1-8B de Meta et Mistral-7B de Mistral AI, tout en se distinguant par ses performances sur des tâches spécifiques à l’entreprise, notamment en cybersécurité. Il a ainsi dominé les évaluations sur RAGBench, un benchmark évaluant la génération augmentée par récupération (RAG) dans des contextes industriels tels que les manuels techniques.
Granite Guardian 3.0 : la sécurité au cœur de l’innovation
Outre ses modèles polyvalents, IBM introduit les modèles Granite 3.0 Guardian, spécialement conçus pour répondre aux besoins critiques de sécurité et de conformité des entreprises. Granite Guardian 3.0 8B et 2B sont des modèles renforcés avec des mécanismes de sécurité intégrés pour minimiser les risques liés aux biais et à l’exploitation malveillante des systèmes d’IA. Grâce à une série de mécanismes de contrôle et de supervision, ces modèles assurent une protection contre les fuites de données sensibles et les réponses inappropriées. Ils peuvent être utilisés pour mettre en œuvre des garde-fous avec n’importe quel modèle d’IA ouvert ou propriétaire.
IBM affirme que Granite Guardian excelle dans les environnements réglementés, où la conformité aux normes de sécurité et de confidentialité est primordiale. Ces modèles sont capables de détecter les anomalies dans les interactions utilisateur et les manipulations malveillantes, ce qui les rend particulièrement adaptés à des secteurs comme la finance, la santé et la défense. Selon ses tests internes, Granite Guardian a surpassé des modèles similaires, comme LLamaGuard de Meta, en matière de détection des risques.
Mixture-of-Experts : performances et rentabilité
La version 3.0 introduit les modèles “Mixture-of-Experts” (MoE), tels que Granite 3.0 3B-A800M Instruct et 1B-A400M Instruct, qui adoptent une approche modulable, où seuls certains experts (sous-modèles spécialisés) sont activés en fonction de la tâche demandée, ce qui les rend très intéressants pour les environnements où les ressources de calcul peuvent être limitées ou coûteuses.
Entraînés sur plus de 10 000 milliards de jetons de données, ces nouveaux modèles MoE Granite sont particulièrement adaptés pour des applications sur l’appareil, des serveurs CPU et des situations nécessitant une latence extrêmement faible.
IBM a également annoncé une mise à jour de ses modèles Granite Time Series pré-entraînés, dont les premières versions ont été publiées au début de l’année. Ces nouveaux modèles, entraînés sur 3 fois plus de données, offrent de solides performances selon les 3 principaux benchmarks de type série temporelle (Time Series), surpassant des modèles 10 fois plus grands de Google, Alibaba et d’autres. Ces modèles mis à jour offrent également une plus grande flexibilité de modélisation grâce à la prise en charge de variables externes et de prévisions glissantes.
Granite 3.0 dans l’écosystème d’IBM
L’introduction de Granite 3.0 s’intègre parfaitement à l’écosystème plus large d’IBM, avec des intégrations optimisées pour certaines de ses plateformes. Watsonx.ai, le produit phare d’IBM dédié à l’IA, s’appuie désormais sur Granite 3.0 pour offrir des solutions avancées aux entreprises cherchant à automatiser leurs processus tout en maintenant un haut niveau de sécurité et de transparence.
IBM a également mis en avant la compatibilité de Granite 3.0 avec ses outils de gestion des modèles et des données, permettant aux entreprises de surveiller et d’ajuster en continu leurs modèles pour améliorer la précision et la pertinence. L’intégration avec des outils comme Watsonx.data et Watsonx.governance garantit que les données sont gérées et utilisées de manière responsable tout au long du cycle de vie des modèles.
IBM continue d’améliorer Granite avec des extensions prévues pour la fin 2024, comme l’augmentation de la fenêtre de contexte à 128 000 jetons et l’ajout de capacités multimodales. Tous les modèles Granite 3.0 sont entraînés sur l’infrastructure Blue Vela d’IBM, qui fonctionne à 100 % grâce à des sources d’énergie renouvelable. Ce choix s’inscrit dans l’engagement croissant d’IBM à intégrer des pratiques durables dans ses processus de développement technologique.
Disponibilité des modèles Granite 3.0
Les modèles Granite 3.0 et les modèles Time Series mis à jour sont distribués sous la licence Apache 2.0 et peuvent être téléchargés sur HuggingFace, renforçant l’engagement d’IBM envers l’open source et la transparence.
Les variantes d’instruction des nouveaux modèles de langage Granite 3.0 8B et 2B et les modèles Granite Guardian 3.0 8B et 2B sont disponibles dès aujourd’hui pour une utilisation commerciale sur la plateforme watsonx d’IBM. Une sélection des modèles Granite 3.0 sera également disponible en tant que microservices NVIDIA NIM et via les intégrations Vertex AI Model Garden de Google Cloud avec HuggingFace.
Pour faciliter le choix et l’utilisation des développeurs et soutenir les déploiements locaux et à la périphérie (edge), un ensemble organisé de modèles Granite 3.0 est également disponible sur Ollama et Replicate.
Les modèles sont également disponibles sur les plateformes de partenaires d’IBM, tels qu’AWS, Docker, Domo, Qualcomm Technologies, Salesforce ou SAP.
Open source : IBM dévoile Granite 3.0, sa nouvelle génération de LLMs optimisés pour les entreprises
Microsoft a récemment publié BitNet.cpp, un cadre open-source conçu pour optimiser l’inférence des grands modèles de langage (LLM) quantifiés à 1 bit. Il permet notamment d’exécuter un modèle BitNet b1.58 de 100 milliards de paramètres sur un seul processeur, atteignant des vitesses de traitement comparables à la lecture humaine, à une cadence de 5-7 jetons par seconde, démocratisant ainsi l’accès aux LLM les plus avancés.
La taille croissante des LLM pose des défis pour leur déploiement et soul
Microsoft a récemment publié BitNet.cpp, un cadre open-source conçu pour optimiser l’inférence des grands modèles de langage (LLM) quantifiés à 1 bit. Il permet notamment d’exécuter un modèle BitNet b1.58 de 100 milliards de paramètres sur un seul processeur, atteignant des vitesses de traitement comparables à la lecture humaine, à une cadence de 5-7 jetons par seconde, démocratisant ainsi l’accès aux LLM les plus avancés.
La taille croissante des LLM pose des défis pour leur déploiement et soulève des inquiétudes quant à leur impact environnemental et économique, principalement en raison de leur forte consommation d’énergie.
Les avantages de la quantification
Une des approches pour répondre à ces défis consiste à utiliser la quantification post-entraînement, qui vise à créer des modèles à faible précision pour l’inférence. Cette technique réduit la précision des poids et des activations, diminuant ainsi considérablement les besoins en mémoire et en ressources de calcul des LLMs.
BitNet.cpp s’appuie sur les travaux de Microsoft sur les architectures de modèles quantifiés 1 bit, notamment BitNet, et la variante LLM à 1 bit, BitNet b1.58, introduite en février dernier, dans laquelle chaque paramètre (ou poids) du LLM est ternaire {-1, 0, 1}
Contrairement aux LLMs traditionnels qui utilisent des valeurs en virgule flottante 16 bits (FP16 ou BF16) pour les opérations de multiplication de matrices, BitNet n’utilise que des additions entières, ce qui permet une économie d’énergie significative tout en maintenant les caractéristiques essentielles du modèle.
Outre le calcul, le transfert des paramètres du modèle entre la mémoire DRAM et celle d’un accélérateur sur puce (comme la SRAM) peut être coûteux. Les tentatives d’agrandissement de la SRAM pour améliorer le débit entraînent en effet des coûts élevés. En revanche, les modèles 1 bit comme ceux de BitNet ont une empreinte mémoire beaucoup plus faible, ce qui réduit à la fois le coût et le temps de chargement des poids depuis la DRAM, accélérant ainsi l’inférence.
La précision de 1,58 bits dans le système binaire conserve tous les avantages de BitNet 1 bit tout en ajoutant des capacités de filtrage de caractéristiques, grâce à l’inclusion de la valeur 0 dans les poids du modèle.
Le cadre d’inférence BitNet.cpp
Le cadre, qui gère l’exécution de ce modèle optimisé et des LLM 1 bit, offre une suite de noyaux optimisés qui prennent actuellement en charge l’inférence sans perte sur le CPU, avec des plans pour la prise en charge de NPU et GPU à l’avenir.
Actuellement, bitnet.cpp prend en charge les processeurs ARM et x86. Les vitesses d’inférence sont de 1,37 et 5,07 fois plus rapides sur les processeurs ARM, et de 2,37 à 6,17 fois sur les processeurs x86, selon la taille du modèle.
Les gains énergétiques vont quant à eux de 55,4 % à 82,2 %, selon la configuration : 55,4 % à 70,0 % sur les processeurs ARM, et 71,9 % à 82,2 % sur les processeurs x86.
Les modèles testés ci-dessous sont des configurations factices utilisées pour illustrer les capacités du framework.
BitNet.cpp prend en charge une liste de modèles 1 bit disponibles sur Hugging Face, qui sont entraînés avec des paramètres de recherche.
En réduisant la dépendance à des infrastructures énergivores, BitNet.cpp peut contribuer à diminuer l’empreinte carbone des LLM et à améliorer leur adoption dans des environnements de calcul à faible coût, où la consommation énergétique est un facteur critique. Les développeurs, les petites et moyennes entreprises, qui n’ont pas toujours les moyens d’investir dans des solutions basées sur des GPU ou des serveurs cloud puissants, pourraient ainsi en bénéficier.
Au-delà de l’impact sur la consommation d’énergie, l’exécution locale des modèles via BitNet.cpp présente aussi des avantages sur le plan de la confidentialité des données, en évitant le recours à des infrastructures cloud pour le traitement de l’information.
Des instructions détaillées pour installer et configurer bitnet.cpp sur différents systèmes d’exploitation, y compris Windows et Debian/Ubuntu, sont disponibles sur GitHub.
BitNet.cpp : le cadre open source de Microsoft pour réduire les coûts d'inférence des LLMs quantifiés à 1 bi
On a vu ces dernières années la publication d‘études explorant comment l’IA pourrait accélérer la conception et la construction de réacteurs nucléaires ou réduire les coûts d’exploitation des centrales nucléaires. Paradoxalement, c’est aussi cette technologie, très énergivore, qui incite aujourd’hui les géants de la tech à se tourner vers le nucléaire pour répondre à leurs besoins croissants en énergie. Après Microsoft et Google, Amazon vient d’annoncer son recours à cette électricité verte pour
On a vu ces dernières années la publication d‘études explorant comment l’IA pourrait accélérer la conception et la construction de réacteurs nucléaires ou réduire les coûts d’exploitation des centrales nucléaires. Paradoxalement, c’est aussi cette technologie, très énergivore, qui incite aujourd’hui les géants de la tech à se tourner vers le nucléaire pour répondre à leurs besoins croissants en énergie. Après Microsoft et Google, Amazon vient d’annoncer son recours à cette électricité verte pour répondre à la hausse de ses besoins énergétiques tout en réduisant son empreinte carbone.
L’énergie nucléaire, tout comme les énergies renouvelables, joue un rôle crucial dans la réalisation des objectifs environnementaux face au réchauffement climatique. Contrairement à ces dernières qui dépendent des conditions météorologiques (vent, ensoleillement), elle peut garantir une production stable et continue, quand bien même les problèmes de gestion de déchets radioactifs et les risques d’incidents dans les centrales sont souvent mis en avant.
D’ailleurs, le récent contrat d’achat d’électricité signé par Microsoft avec Constellation Energy, s’il permettra le redémarrage d’une centrale nucléaire de 835 mégawatts (MW) en Pennsylvanie qui a été mise hors service en 2019, rappelle le triste accident survenu en 1979 à l’un de ses réacteurs, l’unité 2, qui reste l’accident nucléaire le plus important de l’histoire des États-Unis.
Après Google, qui a signé un accord avec la start-up américaine Kairos Power, pour l’achat d’énergie nucléaire provenant de SMR ou Small Modular Reactor, l’une des dix technologies retenues par le gouvernement dans le cadre de France 2030, ces petits réacteurs modulaires sont également le choix d’Amazon.
Combiner énergies renouvelables et nucléaire
Amazon a annoncé en juillet dernier avoir compensé 100 % de sa consommation électrique mondiale avec des énergies renouvelables, atteignant cet objectif sept ans avant la date prévue, 2030. Cependant, alors que ses besoins énergétiques continuent de croître, notamment avec l’expansion d’Amazon Web Services (AWS), la société cherche des solutions complémentaires pour garantir une énergie stable et propre et fait le choix du nucléaire.
Matt Garman, PDG d’AWS, affirme:
“Le nucléaire est une source sûre d’énergie sans carbone qui peut nous aider à alimenter nos opérations et à répondre aux demandes croissantes de nos clients, tout en nous rapprochant de notre objectif climatique”.
Des accords pour développer des réacteurs modulaires
Amazon a signé trois accords pour soutenir le développement de SRM aux États-Unis. Ces réacteurs modulaires, en plus d’avoir une empreinte environnementale réduite, peuvent être installés au plus près des infrastructures existantes, facilitant ainsi leur intégration au réseau. L’un des accords les plus significatifs a été signé avec Energy Northwest, un consortium de services publics de l’État de Washington, pour la construction de quatre SRM. Ces réacteurs devraient générer 320 MW dans la première phase du projet, avec une possibilité d’expansion à 960 MW, soit assez pour alimenter plus de 770 000 foyers américains.
Un autre partenariat a été noué avec Dominion Energy en Virginie, pour explorer l’implantation d’un SRM près de la centrale nucléaire existante de North Anna, ce qui devrait apporter 300 MW d’énergie supplémentaire à la région. Amazon annonce également avoir investi dans X-energy, un leader dans le développement de technologies SRM de nouvelle génération.
L’impact économique et environnemental
Selon Amazon, le développement des SRM stimulera l’économie locale. Le projet avec Energy Northwest pourrait créer jusqu’à 1 000 emplois temporaires dans la construction et environ 100 emplois permanents une fois les réacteurs opérationnels. En Pennsylvanie, l’investissement d’Amazon dans Talen Energy, en plus de préserver un réacteur existant, créera de nouveaux emplois dans le cadre de la construction d’un campus de centres de données.
En intégrant les SRM dans sa stratégie énergétique, Amazon espère renforcer la résilience de son infrastructure tout en soutenant les communautés locales. De plus, ces réacteurs devraient fournir une source d’énergie fiable et sans carbone pour des décennies, contribuant ainsi à réduire les émissions mondiales.
Un tournant pour la transition énergétique
Le développement des petits réacteurs modulaires marque une étape importante dans la transition énergétique d’Amazon. Alors que l’entreprise continue de massivement investir dans les énergies renouvelables, notamment avec des projets solaires et éoliens, elle reconnaît la nécessité de compléter ces sources intermittentes avec des technologies plus stables comme le nucléaire.
Avec l’augmentation constante de la demande énergétique mondiale, et la pression croissante pour réduire les émissions de carbone, les SRM pourraient devenir un élément clé dans le mix énergétique de demain. Le soutien d’Amazon à ces technologies illustre bien comment des entreprises privées peuvent contribuer à façonner l’avenir de l’énergie, tout en poursuivant leurs objectifs ambitieux en matière de développement durable.
Matt Garman conclut :
“Nos ententes encourageront la construction de nouvelles technologies nucléaires qui produiront de l’énergie pour les décennies à venir”.
À l’occasion du premier anniversaire du modèle Mistral 7B, Mistral AI a présenté hier une nouvelle famille de modèles, qu’il appelle “Les Ministraux” : Ministral 3B et Ministral 8B. Ces deux modèles conçus pour être exécutés sur des appareils périphériques, tels que les smartphones ou ordinateurs portables, offrent des performances inédites dans la catégorie des modèles IA de moins de 10 milliards de paramètres, répondant aux besoins croissants en matière d’efficacité, de calcul local et de prot
À l’occasion du premier anniversaire du modèle Mistral 7B, Mistral AI a présenté hier une nouvelle famille de modèles, qu’il appelle “Les Ministraux” : Ministral 3B et Ministral 8B. Ces deux modèles conçus pour être exécutés sur des appareils périphériques, tels que les smartphones ou ordinateurs portables, offrent des performances inédites dans la catégorie des modèles IA de moins de 10 milliards de paramètres, répondant aux besoins croissants en matière d’efficacité, de calcul local et de protection de la vie privée.
Les Ministraux disposent tous deux d’une fenêtre contextuelle pouvant aller jusqu’à 128 000 jetons, Ministral 8B bénéficie, quant à lui, d’une architecture d’attention optimisée pour une inférence plus rapide et économe en mémoire. Selon Mistral AI, ils établissent une nouvelle frontière en matière de connaissance, de bon sens, de raisonnement, d’appel de fonction et d’efficacité dans la catégorie.
Dans son communiqué, la licorne déclare :
“Nos clients et partenaires les plus innovants demandent de plus en plus d’inférence locale et respectueuse de la vie privée pour des applications critiques telles que la traduction sur l’appareil, les assistants intelligents sans Internet, l’analyse locale et la robotique autonome. Les Ministraux ont été conçus pour fournir une solution efficace en calcul et à faible latence pour ces scénarios. Qu’il s’agisse d’amateurs indépendants ou d’équipes de fabrication mondiales, les Ministraux répondent à une grande variété de cas d’utilisation”.
Utilisés en combinaison avec des modèles de plus grande envergure comme Mistral Large, les Ministraux jouent le rôle d’intermédiaires efficaces pour l’exécution de tâches complexes, comme les appels de fonction dans les flux de travail en plusieurs étapes.
Comparaisons de performances
Les Ministraux ont été testés sur diverses tâches où ils ont obtenu de meilleurs résultats que leurs pairs : Gemma 2 2B, Llama 3.2 3B, Llama 3.1 8B et Mistral 7B. Mistral AI précise que tous les modèles ont été réévalués à l’aide de son cadre interne à des fins de comparaison équitable.
Modèles pré-entraînés
Les modèles Ministral 3B et 8B Instruct ont également été comparés à Gemma 2 2B, Llama 3.2 3B, Llama 3.1 8B, Gemma 2 9B et Mistral 7B sur différentes catégories d’évaluation.
Disponibilité et tarification
Les deux modèles sont d’ores et déjà disponibles sous la licence commerciale Mistral, Ministral 8B peut être téléchargé mais seulement à des fins de recherche.
Les développeurs peuvent utiliser Ministral 3B et Ministral 8B via la plate-forme cloud de Mistral AI, La Plateforme, et prochainement sur d’autres clouds partenaires.
Ministral 8B est tarifé à 0,1 dollar par million de jetons de sortie/entrée, tandis que le Ministral 3B revient à 0,04 dollar par million de jetons de sortie/entrée.
OpenAI a récemment dévoilé Swarm, un framework expérimental open source conçu pour orchestrer des systèmes multi-agents. Il fournit aux développeurs un schéma pour créer des réseaux d’agents d’IA interconnectés qui peuvent communiquer et collaborer afin de gérer des tâches complexes de manière autonome.
Swarm est une illustration de la façon dont les concepts de “routines”, des séquences d’actions prédéfinies que les agents suivent pour accomplir des tâches spécifiques, et de transferts, qui pe
OpenAI a récemment dévoilé Swarm, un framework expérimental open source conçu pour orchestrer des systèmes multi-agents. Il fournit aux développeurs un schéma pour créer des réseaux d’agents d’IA interconnectés qui peuvent communiquer et collaborer afin de gérer des tâches complexes de manière autonome.
Swarm est une illustration de la façon dont les concepts de “routines”, des séquences d’actions prédéfinies que les agents suivent pour accomplir des tâches spécifiques, et de transferts, qui permettent à un agent de déléguer une tâche à un autre agent, peuvent être utilisés pour orchestrer plusieurs agents de manière simple et contrôlable.
Le framework repose sur l’idée que plusieurs agents, chacun avec des capacités uniques, peuvent améliorer la qualité et la rapidité des réponses ou actions dans un environnement dynamique. Par exemple, un agent peut se spécialiser dans la compréhension des instructions, tandis qu’un autre pourrait exceller dans l’analyse des données…
Swarm est construit autour de deux abstractions primitives :
Agents autonomes : Chaque agent est un module indépendant capable d’exécuter des tâches spécifiques, avec des instructions et des fonctions définies. Un agent peut soit gérer une tâche donnée, soit déléguer ou transférer la responsabilité à un autre agent plus qualifié ;
Transferts dynamiques : Ce concept est central dans Swarm. Lorsqu’un agent atteint ses limites, il peut transférer la conversation ou la tâche à un autre agent. Cela permet de maintenir la fluidité des opérations, sans qu’un agent soit surchargé ou dépassé par des requêtes trop complexes.
Les agents dans Swarm peuvent accéder à un contexte partagé, leur permettant de se tenir informés des actions précédentes ou des données disponibles et ainsi collaborer plus efficacement en ayant une vue d’ensemble des opérations en cours.
Exemples d’utilisation
Swarm propose déjà plusieurs exemples pratiques dans sa documentation, comme un scénario de service client, où un premier agent gère la question initiale d’un utilisateur et, si la requête devient plus technique, transfère la conversation à un autre agent spécialisé dans la vente ou le remboursement.
OpenAI le présente comme une ressource éducative pour les développeurs curieux d’en savoir plus sur l’orchestration multi-agents. Contrairement à l’API Assistants d’OpenAI, davantage conçue pour des flux de travail entièrement hébergés, Swarm s’exécute principalement sur le client, réduisant ainsi les besoins en infrastructure côté serveur et donnant aux développeurs le contrôle et la visibilité sur les interactions des agents. Son interface est similaire à celle de l’API de complétion de chat d’OpenAI, chaque interaction est exécutée individuellement, sans conserver un historique persistant.
OpenAI l’a rendu public sous la licence MIT, qui offre une grande flexibilité aux développeurs tout en offrant une protection minimale à ses concepteurs, rappelant que :
“Swarm est actuellement un framework d’échantillonnage expérimental destiné à explorer les interfaces ergonomiques pour les systèmes multi-agents. Il n’est pas destiné à être utilisé en production et ne bénéficie donc d’aucun soutien officiel. (Cela signifie également que nous n’examinerons pas les RP ou les problèmes !)
L’objectif principal de Swarm est de présenter les modèles de transfert et de routines explorés dans le livre de recettes Agents d’orchestration : transferts et routines. Il ne s’agit pas d’une bibliothèque autonome, mais principalement à des fins éducatives”.
Perspectives futures
Des développeurs utilisent déjà le framework dans le cadre de leur projet “Hierarchical Autonomous Agent Swarms (HAAS) visant à créer un écosystème d’agents d’IA autonomes et éthiquement gouvernés.
Alors que les applications commerciales potentielles de Swarm sont nombreuses (support client, analyses de marché, stratégies marketing…), le niveau d’automatisation introduit par les systèmes multi-agents soulèvent des préoccupations quant à leur impact sur l’emploi et le rôle de l’humain dans la prise de décision.
Le 5 septembre dernier, Matt Shumer, PDG d’Hyperside (OthersideAI), a dévoilé Reflection 70B sur X, le présentant comme le LLM open source le plus performant au monde. Basé sur le modèle de langage Llama 3.1 70B publié par Meta en juillet dernier, ce nouveau LLM utilise un mécanisme innovant d’autocorrection, le reflection-tuning. Si cette annonce a été accueillie avec enthousiasme par la communauté de l’IA, les performances impressionnantes annoncées ont vite été remises en cause par une partie
Le 5 septembre dernier, Matt Shumer, PDG d’Hyperside (OthersideAI), a dévoilé Reflection 70B sur X, le présentant comme le LLM open source le plus performant au monde. Basé sur le modèle de langage Llama 3.1 70B publié par Meta en juillet dernier, ce nouveau LLM utilise un mécanisme innovant d’autocorrection, le reflection-tuning. Si cette annonce a été accueillie avec enthousiasme par la communauté de l’IA, les performances impressionnantes annoncées ont vite été remises en cause par une partie d’entre elle.
Matt Shumer a expliqué que le modèle est capable de s’autocorriger en temps réel grâce à un processus de raisonnement étape par étape, imitant un type de métacognition, c’est-à-dire la capacité à “penser sa propre pensée”. Le reflection-tuning, d’où le nom du modèle désormais présenté comme “Reflection Llama-3.1-70B” sur Hugging Face, permet à celui-ci de repérer et corriger ses propres erreurs logiques avant de produire une réponse finale. Cette approche permet d’obtenir des réponses plus précises et de surmonter un défi majeur rencontré par les LLM : les hallucinations.
Matt Shumer souligne sur X l’importance du rôle de Glaive, une start-up spécialisée dans la génération de données synthétiques personnalisées, qui a permis au modèle de s’entraîner rapidement sur des ensembles de données de haute qualité, augmentant la précision des résultats tout en raccourcissant les cycles de développement.
Les performances annoncées
Lors de son annonce, Matt Shumer a vanté les performances de Reflection 70B sur plusieurs benchmarks, affirmant qu’il surpassait d’autres LLMs, y compris certains des modèles propriétaires les plus performants. Parmi ces tests figure le MMLU (Massive Multitask Language Understanding), où le modèle se serait distingué par sa polyvalence, ainsi que HumanEval, qui mesure la capacité des modèles à résoudre des problèmes de programmation.
Il a partagé les résultats sur Hugging Face .
Le terrain de jeu Reflection qui permet d’essayer le modèle, indique qu’en raison de la forte demande, la démo est temporairement en panne.
La désillusion
Toutefois, cette révolution annoncée n’a pas tardé à être remise en question. Dès le lendemain du lancement de Reflection 70B, des tests indépendants ont révélé que le modèle n’était pas à la hauteur des attentes. Là où Mat Shumer et son équipe avaient promis une capacité de correction automatique exceptionnelle, le modèle a rapidement montré des faiblesses dans des tâches de base telles que le comptage et le raisonnement logique. Les résultats n’étaient ni constants ni fiables, et Reflection 70B échouait là où d’autres modèles LLM comme GPT-4o et Claude 3,5 Sonnet excellent.
Selon l’évaluation d‘Artificial Analysis, une organisation dédiée à l’analyse indépendante des modèles d’IA et des fournisseurs d’hébergement, du score MMLU de Reflection Llama 3.170B publiée sur X, le modèle obtient le même score que Llama 3 70B et un score nettement inférieur à celui du Llama 3.1 70B.
Pour certains, Reflection 70B pourrait en fait être Llama 3 avec un réglage LoRA (Low-Rank Adaptation) appliqué, plutôt qu’un affinage de Llama 3.1, pour d’autres le modèle de Shumer n’est pas un modèle original, mais un simple wrapper de Claude 3,5 Sonnet d’Anthropic. En d’autres termes, Reflection 70B ne serait pas le produit d’une avancée technologique inédite, mais plutôt une façade, un reconditionnement d’une technologie déjà disponible.
HyperWrite a répondu aux critiques, admettant que les poids du modèle avaient été corrompus lors du téléchargement sur Hugging Face, ce qui a pu entraîner des performances de qualité inférieure. Pour Matt Shumer, cette corruption des poids est la cause des résultats incohérents observés par des évaluateurs tiers.
Il a publié sur Hugging Face la mise à jour suivante :
“Il y a eu un problème avec le modèle lorsque nous l’avons téléchargé pour la première fois. Si vous l’avez essayé et que vous n’avez pas obtenu de bons résultats, veuillez réessayer, nous pensons avoir résolu le problème”.
ajoutant :
“De plus, nous savons à l’heure actuelle que le modèle est divisé en une tonne de fichiers. Nous le condenserons bientôt pour rendre le modèle plus facile à télécharger et à utiliser !”
Cependant, malgré cette mise à jour, beaucoup de scepticisme persiste. La communauté s’interroge sur l’ampleur réelle du problème technique initial. La mention explicite de Glaive dans le post Hugging Face, avec la recommandation de “l’utiliser” pour ceux qui souhaitent entraîner un modèle, est perçue par certains comme une tentative de promouvoir la start-up dans laquelle Matt Shumer a investi.
L’ensemble de données et un rapport détaillant l’entraînement du modèle devraient être publiés dans les prochains jours et apporter plus d’éclaircissements. Ces accusations doivent être vérifiées par des experts en IA avant de jeter l’opprobre sur Matt Shumer et Hyperside.
Un modèle beaucoup plus grand, Reflection 405B, censé surclasser les modèles open sources actuels, devrait être présenté très prochainement. Mais après les controverses autour de Reflection 70B, la communauté attend désormais plus de transparence et des preuves concrètes avant d’accorder sa confiance.
Pour les acteurs de l’IA, cette affaire est un rappel que l’innovation doit toujours être accompagnée de transparence et d’éthique, et qu’il vaut mieux patienter quelque temps pour obtenir des résultats fiables et vérifiables plutôt que de se précipiter vers des annonces spectaculaires.
IA open source tout juste dévoilé, Reflection 70B au cœur des controverses
Si l’arrivée de LLMs au nombre de paramètres époustouflants a suscité l’enthousiasme, les entreprises qui désirent intégrer la GenAI dans leurs flux de travail hésitent à le faire en raison des coûts et des ressources nécessaires. Les acteurs de l’IA l’ont bien compris et proposent aujourd’hui des modèles plus légers, adaptés à des tâches spécifiques, à l’instar d’Aleph Alpha, avec sa famille Pharia-1-LLM et ses “seulement” 7 milliards de paramètres.
Basée à Heidelberg en Allemagne, la start-up
Si l’arrivée de LLMs au nombre de paramètres époustouflants a suscité l’enthousiasme, les entreprises qui désirent intégrer la GenAI dans leurs flux de travail hésitent à le faire en raison des coûts et des ressources nécessaires. Les acteurs de l’IA l’ont bien compris et proposent aujourd’hui des modèles plus légers, adaptés à des tâches spécifiques, à l’instar d’Aleph Alpha, avec sa famille Pharia-1-LLM et ses “seulement” 7 milliards de paramètres.
Basée à Heidelberg en Allemagne, la start-up Aleph Alpha a pour ambition de faire de l’UE un des leaders dans le domaine de l’IA et de consolider sa souveraineté numérique.
Elle se positionne comme un acteur clé de l’IA explicable et digne de confiance, ce qui est essentiel pour les agences gouvernementales et les entreprises qui cherchent à construire et à appliquer l’IA dans un environnement souverain, tout en garantissant la protection et la sécurité des données. Cette approche lui a permis de lever l’an passé près de 467 millions d’euros, un montant record pour une start-up d’IA européenne.
Des modèles optimisés pour l’Europe
Les deux modèles Pharia-1-LLM-7B-control et Pharia-1-LLM-7B-control-aligned, disponibles au public sous sa licence “Open Aleph”, autorisant la recherche non commerciale et l’utilisation éducative, ont été entraînés sur un vaste corpus multilingue et optimisés pour les langues européennes.
Le modèle Pharia-1-LLM-7B-control a été conçu pour fournir des réponses concises dont la longueur peut être contrôlée, répondant ainsi aux besoins d’une grande variété d’applications. Optimisé pour exceller dans les secteurs de l’automobile et de l’ingénierie, ce modèle se distingue par son efficacité de jeton améliorée et sa capacité à s’aligner sur les préférences des utilisateurs. Il se révèle particulièrement performant dans les applications spécifiques à un domaine, où des réponses précises et directes sont cruciales.
Le développement de Pharia-1-LLM-7B-control s’est appuyé sur un ensemble de données multilingues (anglais, allemand, Français, espagnol, italien, portugais et néerlandais) soigneusement sélectionné, en conformité avec les réglementations européennes et nationales, notamment en matière de droit d’auteur et de confidentialité des données. Le modèle a été entraîné en utilisant des techniques de pointe, notamment la Grouped Query Attention (QGA) pour améliorer les performances en temps d’inférence et une base rotative plus large pour une meilleure capacité de contexte long.
L’entraînement de Pharia-1-LLM-7B s’est déroulé en deux étapes. Dans un premier temps, le modèle a été pré-entraîné sur un ensemble de données de 4,7 billions de jetons avec une longueur de séquence de 8 192 jetons, à l’aide de 256 GPU A100. Il a ensuite entraîné sur un nouveau mélange de données de 3 billions de jetons supplémentaires, en utilisant 256 GPU H100.
La variante Pharia-1-LLM-7B-control-aligned a été développée avec des garde-fous supplémentaires, grâce à des méthodes d’alignement sophistiquées. Ce modèle est parfaitement adapté aux applications conversationnelles, telles que les chatbots et les assistants virtuels, où la sécurité et la clarté des réponses sont primordiales. Les ajustements apportés via un processus d’alignement minutieux garantissent que ce modèle respecte les intentions de l’utilisateur tout en évitant les comportements indésirables.
Évaluation et performance
Les modèles Pharia-1-LLM-7B-control et Pharia-1-LLM-7B-control-aligned ont été rigoureusement évalués par rapport aux modèles multilingues open source de taille similaire Mistral-7B-Instruct-v0.3 de Mistral AI et Llama-3.1-8b-instruct de Meta. Ils ont démontré des performances comparables, voire supérieures, à ces derniers, notamment en matière de traitement multilingue.
Les modèles et les évaluations sont disponibles sur Hugging Face.
Aleph Alpha dévoile la famille Pharia-1-LLM des modèles d'IA transparents et conformes aux exigences de L'UE
Salesforce a récemment annoncé deux nouveaux agents autonomes basés sur l’IA pour renforcer les équipes de vente : Einstein SDR Agent et Einstein Sales Coach Agent. Ces outils, qui seront disponibles dès octobre 2024, visent à améliorer l’efficacité des équipes de vente en automatisant certaines tâches cruciales et en fournissant un coaching personnalisé. Ils s’appuient sur la plateforme Einstein 1 Agentforce, conçue pour offrir des réponses fiables et sécurisées en intégrant des données interne
Salesforce a récemment annoncé deux nouveaux agents autonomes basés sur l’IA pour renforcer les équipes de vente : Einstein SDR Agent et Einstein Sales Coach Agent. Ces outils, qui seront disponibles dès octobre 2024, visent à améliorer l’efficacité des équipes de vente en automatisant certaines tâches cruciales et en fournissant un coaching personnalisé. Ils s’appuient sur la plateforme Einstein 1 Agentforce, conçue pour offrir des réponses fiables et sécurisées en intégrant des données internes et externes via la génération augmentée de récupération (RAG).
Einstein SDR Agent : automatisation des interactions avec les prospects
L’agent Einstein SDR (Sales Development Representative) est un assistant de vente virtuel capable d’engager de manière autonome les prospects entrants en temps réel. Contrairement aux chatbots traditionnels, cet agent peut répondre à des questions complexes, gérer les objections, et même programmer des rendez-vous avec les représentants commerciaux humains. Les équipes de vente peuvent ainsi se concentrer sur les transactions à haute valeur ajoutée, tandis qu’Einstein SDR gère les tâches chronophages en amont de l’entonnoir de vente. Avec sa capacité à gérer plusieurs prospects simultanément sur divers canaux et en plusieurs langues, Einstein SDR représente une avancée majeure dans l’automatisation des processus de vente.
Einstein Sales Coach Agent : un coach virtuel pour les vendeurs
L’agent Einstein Sales Coach pousse l’entraînement des vendeurs à un niveau supérieur en simulant des jeux de rôle réalistes. Il permet aux vendeurs de pratiquer des scénarios d’appel de découverte, de présentation ou de négociation dans un environnement contrôlé. Grâce à l’IA générative et à la technologie RAG, Einstein Sales Coach reproduit fidèlement les comportements d’un acheteur, en se basant sur les informations de l’entreprise stockées dans Salesforce. Après chaque session, le vendeur reçoit un retour d’information personnalisé et objectif, lui permettant d’améliorer ses compétences en continu. Les managers peuvent également évaluer l’impact du coaching sur les performances de vente en analysant les résultats obtenus.
Adoption stratégique par Accenture
Accenture, un leader mondial en conseil et services professionnels, a déjà prévu d’adopter ces agents dans le cadre de ses opérations de vente. Selon Sara Porter, responsable de l’excellence des ventes mondiales chez Accenture, ces outils permettront à l’entreprise d’améliorer l’efficacité de son équipe de vente tout en augmentant sa capacité à gérer un volume accru de transactions. Elle souligne que cette collaboration avec Salesforce permettra aux employés de se concentrer sur les transactions les plus complexes et à forte valeur ajoutée.
Les nouveaux agents d’IA peuvent être configurés à l’aide d’actions sans code, de flux de travail et de modèles prédéfinis. En utilisant Salesforce Data Cloud, les clients peuvent améliorer les modèles génératifs en intégrant des informations externes pertinentes, comme des documents de vente et de formation existants, afin d’obtenir des résultats plus précis, pertinents et contextuels. Les deux agents utilisent la couche de confiance Einstein pour assurer des réponses sécurisées et fiables.
Perspectives et disponibilité
Les agents Einstein SDR et Einstein Sales Coach seront disponibles dès octobre 2024, avec des fonctionnalités supplémentaires prévues tout au long de l’année.
Optimisation des ventes grâce à l'IA Salesforce introduit Einstein SDR Agent et Einstein Sales Coach Agent
Les modèles de langage de petite taille (SLM) sont une alternative intéressante aux LLMs pour les entreprises qui peuvent les exploiter à moindre coût pour des tâches spécifiques. Microsoft après avoir introduit le SLM Phi-1 en juin 2023 et présenté le 23 avril dernier la famille de modèles open source Phi-3, dévoile à présent les modèles Phi-3,5 : Phi-3.5-mini-instruct, Phi-3.5-MoE-instruct, et Phi-3.5-vision-instruct.
Chacun de ces modèles est optimisé pour des tâches spécifiques, tout en part
Les modèles de langage de petite taille (SLM) sont une alternative intéressante aux LLMs pour les entreprises qui peuvent les exploiter à moindre coût pour des tâches spécifiques. Microsoft après avoir introduit le SLM Phi-1 en juin 2023 et présenté le 23 avril dernier la famille de modèles open source Phi-3, dévoile à présent les modèles Phi-3,5 : Phi-3.5-mini-instruct, Phi-3.5-MoE-instruct, et Phi-3.5-vision-instruct.
Chacun de ces modèles est optimisé pour des tâches spécifiques, tout en partageant une longueur de contexte de 128 000 jetons, permettant une manipulation efficace des données complexes.
Phi-3.5-mini-instruct : un modèle compact et puissant pour environnements restreints
Le Phi-3.5-mini-instructest le plus petit modèle de la série, conçu pour offrir des performances robustes dans des environnements où les ressources informatiques sont limitées. Avec 3,8 milliards de paramètres, ce modèle est parfaitement adapté aux tâches nécessitant un raisonnement logique solide, telles que la génération de code et la résolution de problèmes mathématiques.
Malgré sa taille réduite, ce modèle a été entraîné sur un impressionnant ensemble de 3,4 billions de jetons à l’aide de 512 GPU H100-80G pendant 10 jours. Les performances de Phi-3.5 Mini Instruct dans les tâches conversationnelles multilingues et multi-tours sont remarquables. Le modèle est compétitif avec d’autres modèles ouverts beaucoup plus grands tels que Llama-3.1-8B-instruct, Mistral-7B-instruct-v0.3 et Mistral-Nemo-12B-instruct-2407. Il a notamment surpassé Llama-3.1-8B-instruct et Mistral-7B-instruct-v0.3 dans le benchmark RepoQA (compréhension du code à contexte long).
Phi-3.5-MoE-instruct : une architecture de mélange d’experts
Le modèle Phi-3.5-MoE(Mixture of Experts) représente une avancée significative dans l’architecture de l’IA. Ce modèle utilise une approche sophistiquée qui active différents “experts” en fonction de la tâche à accomplir, optimisant ainsi les performances pour des tâches spécifiques. Avec 42 milliards de paramètres, dont 6,6 milliards activés à chaque utilisation, le Phi-3.5 MoE est conçu pour gérer des tâches de raisonnement complexes, la compréhension de code et le traitement multilingue.
Il prend en charge les langues suivantes : Allemand, Anglais, Arabe, Chinois, Coréen, Danois, Espagnol, Finnois, Français, Hébreu, Hongrois, Italien, Japonais, Norvégien, Néerlandais, Polonais, Portugais, Russe, Suédois, Thaï, Turc et Ukrainien.
Entraîné sur 4,9 billions de jetons, dont 10 % multilingues, en utilisant 512 GPU H100-80G pendant 23 jours, le modèle MoE a montré une supériorité notable dans les tests de performance spécifiques. Il a surpassé les modèles plus grands Llama 3.1-8B-instruct, Gemma 2-9B-It et Gemini 1.5-Flash mais s’est incliné face à GPT-4o-mini d’OpenAI, dans la majorité des cas. Cependant, dans le test MMLU (Massive Multitask Language Understanding) à 5 coups, il a réussi à prendre l’avantage sur ce dernier.
Microsoft commente :
“Il est encore fondamentalement limité par sa taille pour certaines tâches. Le modèle n’a tout simplement pas la capacité de stocker trop de connaissances factuelles, par conséquent, les utilisateurs peuvent rencontrer des inexactitudes factuelles. Cependant, nous pensons qu’une telle faiblesse peut être résolue en augmentant Phi-3.5 avec un moteur de recherche, en particulier lors de l’utilisation du modèle sous les paramètres RAG”.
Le modèle a fait l’objet d’un processus d’amélioration rigoureux, intégrant un réglage fin supervisé, une optimisation des politiques proximales et une optimisation des préférences directes pour garantir une adhésion précise aux instructions et des mesures de sécurité robustes.
Phi-3.5-vision-instruct : pour les tâches multimodales
LePhi-3.5-vision-instructest conçu pour les tâches multimodales, intégrant à la fois des données textuelles et visuelles. Avec 4,15 milliards de paramètres, ce modèle est spécialement adapté pour des applications telles que la reconnaissance optique de caractères (OCR), la compréhension de graphiques et de tableaux, et le résumé vidéo.
Il a été entraîné sur 500 milliards de jetons avec 256 GPU A100-80G sur une période de 6 jours. Son aptitude à traiter et à intégrer des données complexes, combinée à sa capacité à gérer plusieurs images, en fait un outil extrêmement polyvalent pour les tâches nécessitant une analyse détaillée des informations visuelles et textuelles.
Open source pour une adoption généralisée
Les trois modèles de la série Phi-3.5 sont disponibles sous licence MIT, ce qui permet aux développeurs de les utiliser, de les modifier et de les distribuer sans restriction. Ils sont disponibles sur Hugging Face, Phi-3.5 Vision Instruct est également accessible via Azure AI Studio.
Phi-3.5 Microsoft présente la dernière génération de ses SLM, optimisée pour des tâches spécifiques
HubSpot, la plateforme de gestion de la relation client (CRM) dédiée aux entreprises en croissance, a dévoilé hier l’édition 2024 de son rapport sur “Les tendances IA des marketeurs”. Basé sur une enquête réalisée en collaboration avec The Next Wave auprès de plus de 1 000 professionnels du marketing et professionnels de la publicité à travers le monde, il met en lumière l’évolution rapide de l’adoption de l’IA dans le secteur.
Créée en 2006 par Brian Halligan et Dharmesh Shah, deux anciens étud
HubSpot, la plateforme de gestion de la relation client (CRM) dédiée aux entreprises en croissance, a dévoilé hier l’édition 2024 de son rapport sur “Les tendances IA des marketeurs”. Basé sur une enquête réalisée en collaboration avec The Next Wave auprès de plus de 1 000 professionnels du marketing et professionnels de la publicité à travers le monde, il met en lumière l’évolution rapide de l’adoption de l’IA dans le secteur.
Créée en 2006 par Brian Halligan et Dharmesh Shah, deux anciens étudiants du MIT, HubSpot est une plateforme client qui fournit les logiciels, les intégrations et les ressources nécessaires pour connecter les équipes de marketing, de vente, de gestion de contenu et de service client. Elle publie régulièrement des rapports sur les tendances actuelles et futures du marketing. Ce dernier rapport montre qu’en quelques mois, l’utilisation de l’IA par les marketeurs a considérablement augmenté, passant de 35 % l’année dernière à 74 % cette année.
Optimisme autour du potentiel de l’IA
Le rapport révèle que la majorité des marketeurs voient dans l’IA un levier de croissance. En effet, 68 % affirment que l’IA a amélioré la dynamique de leur entreprise, 69 % indiquent qu’elle a permis de personnaliser l’expérience client, et 70 % estiment qu’elle a favorisé la collaboration entre les équipes.
L’IA a permis à plus de 7 marketeurs sur 10 de consacrer moins de temps aux tâches manuelles et plus de temps aux aspects importants de leur rôle : ce qui a permis de stimuler leur évolution professionnelle pour 68 % d’entre eux.
Près de 7 responsables sur 10 ayant investi dans l’IA déclarent avoir bénéficié d’un ROI (retour sur investissement) positif en termes de productivité et d’efficacité des employés. Ils considèrent que l’IA apporte une valeur ajoutée non pas en remplaçant leur équipe, mais en l’améliorant. Ils précisent également que les outils d’IA et d’automatisation permettent aux employés :
d’être plus productifs (45 %) ;
de prendre des décisions éclairées, basées sur la data (39 %) ;
de partager des données plus efficacement (39 %) ;
d’être plus efficaces dans leur travail (34 %).
Adoption croissante et intégration aux outils existants
Près de 3 marketeurs sur 4 intègrent des outils d’IA dans leur travail. Les cas d’utilisation les plus courants partagent un objectif commun : l’unification. En effet, 74 % d’entre eux affirment que l’intégration de capacités d’IA dans les outils existants, notamment les CRM et les outils de productivité, a encouragé l’adoption de cette technologie.
Les cinq principaux cas d’utilisation sont les suivants :
Les chatbots pour des réponses rapides et personnalisées (35 %) ;
Les outils de CRM et de marketing améliorés par l’IA (25 %) ;
Les outils de productivité améliorés par l’IA pour rationaliser les tâches quotidiennes (23 %) ;
Les outils d’IA visuelle pour générer des images (23 %) ;
Les outils de génération de texte pour créer plus rapidement des contenus performants (22 %).
L’IA, moteur de la création de contenu
Les canaux de marketing se multiplient : un précédent rapport de HubSpot souligne d’ailleurs l’omniprésence des réseaux sociaux dans les stratégies marketing des entreprises, leur usage pour le service client et la vente en ligne ainsi qu’une utilisation croissante de l’IA générative pour se démarquer.
En effet, l’IA est principalement utilisée pour la création de contenu (43 %), et ce pour la deuxième année consécutive. Cependant, les marketeurs tiennent à garder un certain contrôle : 86 % apportent des modifications avant publication.
Les principales tâches liées à la création de contenu sont :
la génération d’images (47 %) ;
la rédaction de textes (45 %);
la vérification de la qualité du contenu (44 %).
Les formats les plus courants sont :
les emails et newsletters (47 %) ;
les posts sur les réseaux sociaux (46 %) ;
les articles de blog (38 %).
Nicholas Holland, VP Product et GM, Marketing Hub chez HubSpot, commente :
“L’IA se transforme en un véritable catalyseur de productivité pour les équipes de marketing. Elle leur permet de créer plus de contenu, de naviguer sur un plus grand nombre de canaux et de générer plus de leads, tout en améliorant la qualité et la personnalisation. Les professionnels du marketing qui s’appuient sur l’IA et l’intègrent à leurs processus sont sans aucun doute ceux qui se différencieront”.
Etude HubSpot montée en puissance de l'IA dans les stratégies marketing
Un modèle d’apprentissage profond a démontré une performance équivalente à celle d’un radiologue abdominal dans la détection du cancer de la prostate cliniquement significatif à l’IRM, selon une étude récemment publiée dans Radiology, une revue de la Radiological Society of North America (RSNA). Ce modèle pourrait être utilisé, selon les chercheurs de la Mayo Clinic, en complément des radiologues pour améliorer la détection du cancer de la prostate.
Le cancer de la prostate est le deuxième cance
Un modèle d’apprentissage profond a démontré une performance équivalente à celle d’un radiologue abdominal dans la détection du cancer de la prostate cliniquement significatif à l’IRM, selon une étude récemment publiée dans Radiology, une revue de la Radiological Society of North America (RSNA). Ce modèle pourrait être utilisé, selon les chercheurs de la Mayo Clinic, en complément des radiologues pour améliorer la détection du cancer de la prostate.
Le cancer de la prostate est le deuxième cancer le plus fréquent chez les hommes dans le monde. En France, avec environ 53 000 nouveaux cas par an, il est non seulement le cancer le plus fréquent chez l’homme mais aussi dans l’ensemble de la population française.
L’IRM multiparamétrique, qui fait appel à des méthodes complémentaires d’imagerie, est aujourd’hui l’outil principal utilisé par les radiologues pour diagnostiquer le cancer de la prostate, les résultats étant exprimés via le système PI-RADS (Prostate Imaging-Reporting and Data System) version 2.1. Toutefois, ce système présente certaines limites dans la classification des lésions.
Selon le Dr Naoki Takahashi, principal auteur de l’étude et membre du département de radiologie de la Mayo Clinic à Rochester, au Minnesota :
“L’interprétation de l’IRM de la prostate est complexe. Les radiologues les plus expérimentés obtiennent généralement de meilleures performances diagnostiques”.
Les algorithmes d’IA appliqués à l’IRM de la prostate ont montré un potentiel prometteur pour améliorer la détection du cancer tout en réduisant la variabilité entre les observateurs. Cependant, les approches actuelles d’IA nécessitent souvent que les lésions soient annotées par un radiologue ou un pathologiste, ce qui alourdit le processus de développement et de mise en œuvre clinique.
Pour le Dr Takahashi, ce processus est non seulement chronophage mais aussi difficile à corréler avec les résultats pathologiques. Il explique :
“Les radiologues annotent les lésions suspectes au moment de l’interprétation, mais ces annotations ne sont pas systématiquement disponibles, donc lorsque les chercheurs développent un modèle d’apprentissage profond, ils doivent en redessiner les contours. De plus, les chercheurs doivent corréler les résultats de l’imagerie avec le rapport de pathologie lors de la préparation de l’ensemble de données. Si plusieurs lésions sont présentes, il n’est pas toujours possible de corréler les lésions à l’IRM avec les résultats pathologiques correspondants”.
Pour surmonter ces défis, le Dr Takahashi et son équipe ont développé un nouveau modèle de deep learning capable de prédire la présence d’un cancer de la prostate cliniquement significatif sans nécessiter d’information sur l’emplacement précis des lésions. Ce modèle a été comparé aux performances de radiologues abdominaux sur un grand groupe de patients sans cancer de la prostate cliniquement significatif connu, ayant subi une IRM sur plusieurs sites d’un seul établissement universitaire.
L’étude a utilisé un réseau neuronal convolutif (CNN) pour analyser les IRM multiparamétriques. Parmi 5 735 examens effectués sur 5 215 patients, 1 514 ont révélé un cancer de la prostate cliniquement significatif. Les résultats montrent que le modèle d’IA atteint une performance similaire à celle des radiologues expérimentés tant sur des ensembles de tests internes qu’externes.
La combinaison des prédictions du modèle de deep learning avec les résultats des radiologues a surpassé les performances des radiologues seuls. Pour localiser les tumeurs, les chercheurs ont utilisé une carte d’activation de classe pondérée par gradient (Grad-CAM). Cette méthode a permis de localiser avec précision les lésions cliniquement significatives lors des examens positifs.
Le Dr Takahashi voit ce modèle comme un outil d’assistance, capable d’améliorer la précision des diagnostics tout en réduisant les faux positifs. Il précise :
“Ce modèle ne peut pas être utilisé comme un outil de diagnostic autonome. Il est plutôt destiné à compléter le processus décisionnel des radiologues”.
L’équipe de recherche a également élargi son ensemble de données, doublant le nombre de cas étudiés. La prochaine étape sera une étude prospective pour observer comment les radiologues interagissent avec ce modèle et évaluer si cette collaboration améliore les performances diagnostiques par rapport à l’interprétation traditionnelle.
Références de l’article :
“Modèle d’apprentissage profond entièrement automatisé pour détecter le cancer de la prostate cliniquement significatif à l’IRM”. Radiology, https://doi.org/10.1148/radiol.232635
Auteurs :
Jason C. Cai, Hirotsugu Nakai, Shiba Kuanar, Adam T. Froemming, Candice W. Bolan, Akira Kawashima, Hiroaki Takahashi, Lance A. Mynderse, Chandler D. Dora, Mitchell R. Humphreys, Panagiotis Korfiatis, Pouria Rouzrokh, Alexander K. Bratt, Gian Marco Conte, MD, Ph.D., Bradley J. Erickson, Naoki Takahashi.
Affiliations :
Départements de radiologie (J.C.C., H.N., S.K., A.T.F., H.T., P.K., P.R., A.K.B., G.M.C., B.J.E., N.T.) et d’urologie (L.A.M.), Mayo Clinic, 200 First St SW, Rochester, MN 55905 ; Département de radiologie, Massachusetts General Hospital, Boston, Massachusetts (J.C.C.) ;
Départements de radiologie (C.W.B.) et d’urologie (C.D.D.), Mayo Clinic, Jacksonville, Floride ;
Départements de radiologie (A.K.) et d’urologie (M.R.H.), Mayo Clinic, Scottsdale, Arizona.
IA et santé un modèle de deep learning pour aider les radiologues à détecter le cancer de la prostate
Des chercheurs en ingénierie de l’Université du Minnesota à Twin Cities ont dévoilé une avancée technologique majeure qui pourrait transformer le paysage de l’IA : un nouveau dispositif de mémoire, baptisé CRAM (mémoire vive computationnelle), qui pourrait réduire la consommation d’énergie des systèmes d’IA d’un facteur impressionnant de 1 000, tout en maintenant des performances optimales. Leurs travaux ont été publiés dans npj Unconventional Computing, une revue scientifique à comité de lectur
Des chercheurs en ingénierie de l’Université du Minnesota à Twin Cities ont dévoilé une avancée technologique majeure qui pourrait transformer le paysage de l’IA : un nouveau dispositif de mémoire, baptisé CRAM (mémoire vive computationnelle), qui pourrait réduire la consommation d’énergie des systèmes d’IA d’un facteur impressionnant de 1 000, tout en maintenant des performances optimales. Leurs travaux ont été publiés dans npj Unconventional Computing, une revue scientifique à comité de lecture publiée par Nature.
Cette innovation est le fruit de plus de deux décennies de recherche et s’attaque directement à l’un des plus grands défis des systèmes informatiques actuels : la consommation d’énergie liée au transfert constant de données entre la mémoire et la logique de traitement. En effet, les architectures informatiques traditionnelles, basées sur le modèle de von Neumann, nécessitent de nombreux transferts de données énergivores pour traiter l’information. Le CRAM brise cette barrière en permettant de traiter les données directement dans la mémoire, éliminant ainsi ces transferts coûteux.
Jian-Ping Wang, auteur principal de l’article et professeur distingué McKnight et titulaire de la chaire Robert F. Hartmann au département de génie électrique et informatique de l’Université du Minnesota, commente :
“Notre concept initial d’utiliser directement les cellules de mémoire pour l’informatique il y a 20 ans était considéré comme fou”.
Yang Lv, chercheur postdoctoral à l’Université du Minnesota et premier auteur de l’article ajoute :
“Ce travail est la première démonstration expérimentale de la CRAM, où les données peuvent être entièrement traitées dans le réseau de mémoire sans avoir besoin de quitter la grille où un ordinateur stocke des informations”.
Une technologie de pointe basée sur la spintronique
Le cœur de cette innovation réside dans l’utilisation des jonctions à tunnel magnétique (MTJ), une technologie de spintronique qui exploite le spin des électrons au lieu de leur charge électrique pour stocker des données. Les MTJ sont des dispositifs nanostructurés utilisés pour améliorer les disques durs, les capteurs et d’autres systèmes microélectroniques, y compris la mémoire magnétique à accès aléatoire (MRAM), qui a été utilisée dans des systèmes embarqués tels que les microcontrôleurs et les montres intelligentes. Cette approche non seulement réduit la consommation d’énergie, mais augmente également la vitesse de traitement et la robustesse du système dans des environnements difficiles.
Ulya Karpuzcu, expert en architecture informatique, co-auteur de l’article et professeur agrégé au département de génie électrique et informatique de l’Université du Minnesota, explique :
“En tant que substrat de calcul numérique en mémoire extrêmement économe en énergie, la CRAM est très flexible dans la mesure où le calcul peut être effectué à n’importe quel endroit de la baie de mémoire. En conséquence, nous pouvons reconfigurer la CRAM pour qu’elle corresponde au mieux aux besoins de performance d’un ensemble diversifié d’algorithmes d’IA”.
Il ajoute:
“Il est plus économe en énergie que les blocs de construction traditionnels des systèmes d’IA d’aujourd’hui. La CRAM effectue des calculs directement dans les cellules de mémoire, en utilisant efficacement la structure du réseau, ce qui élimine le besoin de transferts de données lents et énergivores”.
Selon les chercheurs, un accélérateur d’inférence d’apprentissage automatique basé sur la CRAM permet d’obtenir une amélioration de l’ordre de 1 000. Ils ont démontré que la CRAM peut accomplir des tâches essentielles pour l’IA, telles que l’addition scalaire et la multiplication matricielle, en seulement 434 nanosecondes, avec une consommation énergétique de seulement 0,47 microjoule. Ce qui représente une économie d’énergie environ 2 500 fois supérieure par rapport aux systèmes de mémoire conventionnels, qui séparent les composants logiques et de mémoire.
Un effort collaboratif de longue haleine
L’équipe dirigée par le professeur Jian-Ping Wang, un pionnier dans le domaine des dispositifs MTJ, a travaillé sans relâche depuis 2003 pour concrétiser cette vision. Ce projet a réuni une équipe interdisciplinaire composée de spécialistes en physique, en science des matériaux, en informatique et en ingénierie, contribuant à des avancées significatives qui rendent aujourd’hui cette technologie prête à être intégrée dans des applications industrielles.
Implications et perspectives
Avec l’augmentation exponentielle de la demande en applications d’IA, l’impact potentiel de cette technologie est immense. Selon l’Agence internationale de l’énergie (AIE), la consommation d’énergie de l’IA pourrait atteindre 1 000 térawattheures (TWh) d’ici 2026, soit l’équivalent de la consommation annuelle d’électricité du Japon. L’adoption de la CRAM pourrait réduire de manière drastique cette consommation, rendant les systèmes d’IA plus durables et plus économes en énergie.
L’équipe envisage déjà de collaborer avec des leaders de l’industrie des semi-conducteurs pour produire à grande échelle ce nouveau matériel et intégrer cette technologie dans les prochaines générations de systèmes d’IA.
Un soutien solide pour une technologie pionnière
Ce projet a été soutenu par des institutions majeures telles que la Defense Advanced Research Projects Agency (DARPA), le National Institute of Standards and Technology (NIST), la National Science Foundation (NSF), et Cisco Inc. Les travaux ont également bénéficié des infrastructures de pointe du Minnesota Nano Center et du Minnesota Supercomputing Institute.
Références de l’article :
“Démonstration expérimentale de la mémoire à accès aléatoire computationnelle basée sur les jonctions tunnel magnétiques”. npj Unconventional Computing https://doi.org/10.1038/s44335-024-00003-3, publié le 25/07/2024
Auteurs : Yang Lv, Brandon R. Zink, Robert P. Bloom, Hüsrev Cılasun, Pravin Khanal, Salonik Resch, Zamshed Chowdhury, Ali Habiboglu, Weigang Wang, Sachin S. Sapatnekar, Ulya Karpuzcu, Jian-Ping Wang.
La CRAM, une technologie de mémoire innovante pour des applications d'IA moins énergivores
Frédéric Bardolle, à la tête de l’incubateur numérique du ministère des Armées, considère que « la qualité des intervenants est incroyable, et les sujets évoqués sont très variés et toujours passionnants. »
Mehdi Benhabri, haut fonctionnaire spécialiste des questions scientifiques et technologiques, résume sa participation en ces termes : « Le Paris Machine Learning est rapidement devenu l’un des plus grands rassemblements de France sur les thématiques de l’intelligence artificielle en général e
Frédéric Bardolle, à la tête de l’incubateur numérique du ministère des Armées, considère que « la qualité des intervenants est incroyable, et les sujets évoqués sont très variés et toujours passionnants. »
Mehdi Benhabri, haut fonctionnaire spécialiste des questions scientifiques et technologiques, résume sa participation en ces termes : « Le Paris Machine Learning est rapidement devenu l’un des plus grands rassemblements de France sur les thématiques de l’intelligence artificielle en général et du machine learning en particulier. Le dynamisme de ses animateurs a permis de mobiliser des compétences de haut niveau dans un cadre original et peu formel afin d’échanger de manière libre et approfondie, sans les rigidités et les contraintes du monde académique. »
Dans le cadre des jeux olympiques 2024, nous vous offrons chaque jour un article issu du magazine ActuIA n°4, dont le dossier principal est “Le sport à l’ère de l’IA”. Afin de découvrir le magazine ActuIA, nous vous invitons à vous rendre sur notre boutique. Tout nouvel abonnement d’un an vous donne droit à l’ensemble des archives au format numérique.
Une identité et une charte
Au cours des réunions suivantes, nous peaufinons les valeurs de notre groupe et esquissons notre charte. À savoir une structure plate, sans cooptation. Son but est de donner aux membres le point de vue des chercheurs les plus prometteurs du domaine, d’éviter les discours de vendeurs de solutions techniques, de couper les pitchs et les présentations éclair à la mode dans les startups numériques. Mais également de filtrer et de rejeter sans ambiguïté les tentatives d’exploitation douteuses des algorithmes, parmi lesquelles : les algorithmes de détection d’orientation sexuelle, la recherche des traits du visage caractéristiques des criminels, ou encore la façon de dessiner un visage à partir de la voix.
L’Eurovision du machine learning chez Google
Un an plus tard, forts de nos mille premiers membres, Google nous ouvre les portes de son immense salle de conférence parisienne et met toute son infrastructure à disposition pour une soirée. Le défi ? Retransmettre les interventions des spécialistes IA en direct à Paris, Londres, Berlin et Zurich.
Le point d’orgue de la soirée est Andrew Ng, cofondateur de Google Brain, professeur à Stanford et star mondial de l’IA. Son credo ? « L’IA est une nouvelle électricité. Elle s’immisce dans tous les objets comme l’électricité l’a fait au début du siècle. »
Après cette première saison, le ton est donné. S’enchaînent au fil des sept saisons différents formats et déclinaisons, présentations à distance avec des chercheurs à l’autre bout du monde, hackathons, concours de code et hors-série thématiques : data journalism par le responsable data du New York Times, attaques adverses, finance algorithmique, automatic machine learning, robotique et IA, calcul haute performance.
Andrew Ng, professeur à Stanford, cofondateur de Google Brain (division de recherche fondamentale IA de Google) a très largement contribué à populariser les méthodes et les techniques de l’intelligence artificielle, particulièrement à travers son célèbre cours en ligne Coursera, passage obligé pour tous les codeurs d’IA.
Partage d’expertise
Cas d’usage d’entreprises et algorithmes data
En France et dans le monde, des communautés d’experts data et IA se constituent. Toulouse, Marseille, Nantes. Amsterdam, Stockholm, New York, Boston, San Francisco. Aucune ville n’est en reste. Pour quelle raison ? Parce que l’accélération prodigieuse du rythme d’apparition de technologies déstabilisantes provoque un besoin de formation et une soif de compréhension immédiate, peu en adéquation avec le rythme des formations longues.
En effet, ce que désirent les ingénieurs, les programmeurs et les entrepreneurs est de comprendre immédiatement ce qui est en train de se jouer et qui chamboule l’économie. Comment appliquer les algorithmes à leur métier ?
Quant à l’offre d’expertise, elle est tout aussi abondante.
Facteur H, l’humain dans la boucle
Au-delà d’une soif de connaissances techniques, le plaisir des rencontres informelles et du réseautage est un élément important. Gautier Marti, un Français spécialiste des algorithmes machine learning travaillant à Abou Dabi pour un fonds souverain nous confiait que « les rencontres du Paris Machine Learning sont une source de veille technologique. Elles permettent de découvrir de nouveaux outils et de confronter ses idées à la réalité ou à l’expérience d’autres experts. »
Lors de ces rencontres, des fondateurs d’entreprise se sont rencontrés et ont créé leur entreprise. Nicolas Gaude, cofondateur de la startup Prevision.io, fait part de son expérience en ces termes : « Ce fut pour moi un vrai déclic. Avec l’aide de Franck Bardol, d’Igor Carron et les conseils des experts présents, j’ai pu vraiment progresser techniquement et donner corps à mon projet. »
Jacques-Henri Gagnon, directeur adjoint des services culturels et chef des relations universitaires à l’ambassade du Canada à Paris, ajoute : « Le Paris Machine Learning m’a donné accès à ce large réseau et a aussi été le point de départ d’échanges franco-canadiens ce qui, dans mon sec-teur d’activité, est le cœur de métier. » Le groupe a fait office de facilitateur pour nombre de ses membres, des ingénieurs y ont été recrutés, des sociétés ont initié des partenariats et des rachats.
Pour conclure, cette phrase de Théodore Levitt, le père fondateur du marketing s’adressant à ses étudiants, résume bien l’esprit de cette communauté : « Le client ne veut pas une mèche de perceuse. Il veut un trou dans le mur. »
Jürgen Schmidhuber, découvreur des LSTM au début des années 2000, a rendu cet apprentissage possible grâce à des données temporelles, ordonnées et horodatées. Ses réseaux récurrents temporels LSTM analysent désormais les données de capteurs des chaînes de production d’usines et permettent de prédire les valeurs futures. On lui doit le traitement efficace des motifs temporels à l’aide de réseaux de neurones spécialisés. Il était revenu sur la genèse de sa découverte dans une réunion et avait partagé les voies d’amélioration de ses méthodes. L’avenir lui a donné raison. Depuis lors, les architectures transformers ont révolutionné la traduction automatique et tout le traitement du langage par des algorithmes.
Gaël Varoquaux, Alexandre Gramfort et Olivier Grisel : ce trio d’ingénieurs et scientifiques français est la tête pensante de la librairie machine learning la plus utilisée au monde, dont les statistiques sont impressionnantes.
C’est la seconde librairie la plus téléchargée au monde derrière la célèbre TensorFlow de Google, avec 700 000 utilisateurs et 42 millions de visites sur le site internet. Son nom ? Scikit-learn. Tous les codeurs du machine learning ne jurent que par elle. Son mérite est de mettre à disposition de n’importe quel programmeur des millions de lignes de code optimisées, pensées et calibrées par les plus grands spécialistes de l’ingénierie. Son prix ? Inestimable. Elle est gratuite et en open source. Elle représente la plus grande réussite de démocratisation du machine learning.
De nombreuses années en arrière, ces trois chercheurs étaient venus initier les membres du Paris Machine Learning au fonctionnement de leur outil Scikit-learn dès la première réunion.
Alexandre Gramfort nous confiait que « cela a été pour moi une belle opportunité de présenter ma recherche. » Depuis, Alexandre, Gaël et Olivier ont été récompensés par le prix Inria – Académie des sciences.
François Chollet, malgré son jeune âge, est une star de l’IA. Et pour cause, ce Français, chercheur chez Google Brain, a écrit la librairie de deep learning nommée Keras. L’avantage de cette librairie est de simplifier et masquer la complexité du deep learning. Le même esprit que Scikit-learn en somme. La reconnaissance ne s’est pas fait attendre. Désormais, Keras est livrée par Google en même temps que les autres programmes deep learning de cette société. Nous l’avions reçu dans une réunion hors-série qui lui était consacrée. François Chollet est également l’auteur d’un ouvrage de référence sur le deep learning. Jacqueline Forien a traduit cet ouvrage en français¹ et poursuit ainsi la démocratisation des algorithmes IA.
Yoshua Bengio, un des co-découvreurs du deep learning, avait évoqué dans une réunion les difficultés d’apprentissage ainsi que les solutions envisagées.
À cette période, le deep learning était encore balbutiant. Ce n’est désormais plus le cas et nous le devons en grande partie à ses travaux.
Les algorithmes de ces découvreurs fonctionnent au quotidien et inspirent les logiciels IA d’entreprises. Leur passage par le Paris Machine Learning a été une source profonde d’inspiration.
Les algorithmes d’apprentissage ont révolutionné des pans entiers de l’ingénierie et rendu possible ce qui tenait jusqu’alors du domaine du rêve des ingénieurs.
La robotique dans tous ses états
La robotique figure en bonne position dans ce chamboulement. Pierre Sermanet, jeune chercheur français dans le groupe robotique de Google² y avait consacré plusieurs conférences. « Mes recherches explorent l’intersection du langage³ et du jeu et mobilisent de multiples mécanismes pour l’apprentissage robotique ». Interrogé sur l’avenir de sa discipline, il répond : « Les avancées récentes autour de l’apprentissage sur des données massives de langage non labellisées (notamment les modèles GPT d’OpenAI) sont impressionnantes et prometteuses, le même type d’approche appliquée à la vidéo et à la robotique me paraît très prometteur ».
Le coup de force du deep learning
S’il est un domaine qui a connu une véritable révolution, c’est bien l’analyse d’images.
Impossible de ne pas évoquer l’apport du machine learning dans l’analyse et la compréhension des images. Le point de bascule a lieu au moment de la fondation du Paris Machine Learning. Grâce à sa nouvelle méthode de réseaux de convolution, Geoffrey Hinton réalise un tour de force dans la compétition ImageNet. Il écrase les méthodes traditionnelles d’analyse d’images et y impose les techniques de deep learning comme nouveau standard.
Dominique Cardon, directeur du Médialab de Sciences Po et auteur d’un des ouvrages de référence⁴ sur le sujet, était venu nous en faire un récit épique au cours de la centième réunion du groupe tenue dans les locaux inspirants de la startup Scaleway. Voici quelques morceaux choisis de son récit publié depuis dans un article intitulé La revanche des neurones⁵.
« L’épisode est en passe de devenir légendaire dans l’histoire de l’informatique ». Un chercheur interrogé par Dominique Cardon se souvient : « En 2012, Hinton débarque dans la compétition ImageNet et crée un véritable séisme !
Il ne connaît rien au domaine de la vision par ordinateur et il embauche deux petits gars pour tout faire sauter !
À l’époque, les ingénieurs de computer vision s’excitent sur ImageNet depuis deux ou trois ans. Le meilleur d’entre eux était à 27 % d’erreurs. Hinton, lui, marque dix points à tout le monde ! Ce jeune geek arrive et annonce le résultat devant une salle bondée. Un ado qui ne comprend rien à ce domaine, enfermé dans ses algorithmes !
Tous les grands manitous du computer vision essaient de réagir : En fait c’est pas possible, ça va pas marcher… Au final, les mecs étaient tous abasourdis parce que grosso modo cela foutait en l’air dix ans d’intelligence, de tuning et de sophistication. »
Ce récit savoureux nous fait vivre de l’intérieur la révolution initiée par les algorithmes d’apprentissage. Les méthodes d’expertise manuelle fine sont balayées par la science “à la Google” qui allie big data et algorithmes IA.
Du laboratoire à la startup
Depuis, les ingénieurs et docteurs en IA ont transformé ces algorithmes encore balbutiants en produits finis redoutables d’efficacité. Des exemples ? LightOn, startup technologique cofondée par Igor Carron, révolutionne l’informatique grâce à sa puce optique. Le résultat ? Des calculs à la vitesse de la lumière et une empreinte énergétique minime grâce à sa technologie de rupture. Le meilleur des mondes en somme.
Meero, une autre pépite technologique, automatise la retouche photo grâce à ses algorithmes AI entraînés sur des millions de photographies. Jean-François Goudou, son directeur R&D nous avait décrit l’algorithme machine learning de restauration et d’amélioration automatique d’images lors d’une réunion au siège de Samsung. « Les premiers retours clients sont très très positifs. » nous confia-t-il.
Tony Pinville, fondateur, aux côtés de Charles Ollion, de Heuritech, une startup spécialiste de ces mêmes algorithmes IA d’analyse d’images, avait ouvert pour nous le capot de ses algorithmes. Il nous confie : « Le meetup Paris Machine Learning a été un mouvement précurseur de l’IA que Heuritech a eu la chance de rejoindre au tout début. », et ajoute : « Pour notre part, nous utilisons une technologie de reconnaissance visuelle qui analyse chaque jour plusieurs millions d’images de consommateurs et d’influenceurs sur les réseaux sociaux et les traduit en informations riches et pertinentes pour les marques de mode et de luxe.
Pour mieux créer leurs collections, ces marques ont besoin d’informations sur la prévision de tendances et de ventes. Heuritech souhaite combiner ces deux types de prédictions pour mieux les accompagner. » Depuis, la récompense est venue naturellement. Heuritech a reçu le prix LVMH de l’innovation des mains de Bernard Arnault.
Déplacement de l’expertise
Malgré ces succès et avancées spectaculaires, la fabrication des programmes de machine learning demeure artisanale et reste une affaire de spécialistes et d’experts. Les data scientists procèdent le plus souvent par tâtonnements et essais-erreurs lorsqu’ils élaborent un algorithme de machine learning.
C’est à ce déplacement de l’expertise auquel nous assistons depuis dix ans. Auparavant, le cœur de la création de valeur dans les entreprises était la production de règles métiers par les experts. Désormais, ces règles émergent des données grâce aux algorithmes auto-apprenants.
L’expertise des ingénieurs IA qui les conçoivent consiste à choisir l’algorithme le plus approprié pour un jeu de données particulier, puis à l’étalonner et à le dimensionner à la bonne puissance. Pour les entreprises qui mobilisent des technologies IA, la sélection d’algorithmes et d’architectures matérielles et logicielles s’est substituée à la conception des règles métiers traditionnelles.
Les programmes d’IA proposent une mécanisation de l’intuition et de la connaissance métier de l’expert humain. Nous en sommes au premier stade. Un courant de recherche visant à automatiser tout ou partie de la chaîne de fabrication des programmes d’IA s’est mis en place. Il s’agit du second stade, celui qui consiste à « automatiser l’automatisation ». En effet, en induisant la production automatique des règles par un programme d’ordinateur, le machine learning représente une automatisation de la pensée d’experts. Cette voie se nomme AutoML, pour Automatic Machine Learning.
L’AutoML, futur du machine learning ?
Le Paris Machine Learning a participé à l’organisation de concours et de hackathons AutoML. Ce fut le cas du concours RAMP du Paris-Saclay Center for Data dirigé par Balázs Kégl, intervenant lors d’une rencontre consacrée à l’apport du machine learning pour la physique théorique au laboratoire européen du Cern, la data au service des particules atomiques. Ou encore du concours ChaLearn organisé par Isabelle Guyon et du défi européen See.4C assorti d’un prix de deux millions d’euros pour les gagnants. Le laboratoire d’innovation ouverte La Paillasse hébergeait ces rencontres grâce au soutien énergique d’un de ces dirigeants, Sébastien Treguer.
Isabelle Guyon confie que le Paris Machine Learning « a facilité l’organisation de hackathons et la diffusion des challenges en machine learning. »
L’histoire ne s’arrête pas là. « La série de challenges AutoML a permis la création d’Auto-Sklearn⁶ ». En ce qui concerne le deep learning, « la série de challenges AutoDL a abouti à un self-service de deep learning automatisé. »
Pour nous, l’AutoML constitue un axe de développement majeur pour les années à venir. Tous les acteurs importants sont désormais entrés dans la course. Parmi les avancées récentes, citons les méthodes Neural Architecture Search (NAS), en particulier Neural Network Intelligence (NNI) de Microsoft, ou encore Evolved Transformer de Google.
Dans un futur proche, l’expertise technique du data scientist ne sera donc plus nécessaire pour construire des programmes auto-apprenants. Le programme de recherche intitulé Automatic statistician et conduit par Zoubin Ghahramani de l’université de Cambridge, en collaboration avec le MIT, illustre parfaitement cette vision. Ghahramani nous en avait partagé les méthodes et les enjeux.
À terme, seule sera nécessaire une équipe restreinte de data scientists chargés d’améliorer les procédés automatiques de découvertes de règles. Tous les autres redeviendront des programmeurs traditionnels. Ils fourniront des données d’entraînement et obtiendront en retour, sans aucune expertise en la matière, le meilleur programme IA imaginable.
Parmi ceux qui mettent au point ce type de service automatisé de haut niveau, Nicolas Gaude, précédemment cité, nous décrit son activité en ces termes : « Mon métier consiste avant tout à démocratiser l’usage de l’A en apportant aux entreprises à la fois les innovations techniques et la capacité de les mettre en production. Ce qui nous préoccupe, et de loin, est de rendre accessible et opérable le machine learning sur le long terme. »
Quand les algorithmes deviennent un sujet de société
Les algorithmes de machine learning interprètent le monde avec un filtre statistique afin de nous guider dans nos choix.
Ce faisant, ils agissent sur la société et en transforment les pratiques et les usages. Ainsi, lorsqu’un algorithme de GPS suggère aux automobilistes pressés un itinéraire secondaire moins encombré, il peut créer simultanément un problème d’aménagement du territoire, l’itinéraire secondaire n’étant pas dimensionné, par nature, à subir cette augmentation de trafic. De plus, les nuisances sonores et la pollution engendrées par ce dernier touchent les riverains. L’algorithme crée donc également un problème de santé publique.
Dominique Cardon résumait ces points en 2017 lors d’une conférence consacrée aux biais des algorithmes à l’institut Henri Poincaré. Selon lui, « les algorithmes deviennent un sujet de société. » Ajoutons qu’ils deviennent un sujet politique. Un exemple frappant ? Le Zimbabwe a vendu une base de données contenant les visages de ses citoyens à la Chine.
Son but ? Entraîner les algorithmes de reconnaissance faciale sur des visages noirs. En échange de cette masse de données, le Zimbabwe sera bientôt équipé de caméras à reconnaissance faciale dernier cri…
Lors de cette conférence, Cédric Villani proposait une réflexion sur l’apport des algorithmes prédictifs dans l’entreprise. Il notait avec pertinence que les algorithmes devaient au préalable être acceptés avant d’être utilisés. En effet, un algorithme sans accompagnement ne sert à rien, un travail doit être effectué en amont. Cédric Villani nous rapportait une expérience réussie au cours de laquelle des salariés valident les décisions du programme IA et gardent ainsi la main sur la machine. Dans le cas contraire ? Il n’est pas rare de voir les salariés entrer en lutte “souterraine” contre ces programmes en les nourrissant, par exemple, de fausses données.
En somme, c’est l’illustration du fossé qui sépare l’IA capacitante de l’IA substitutive. Pour l’une, il s’agit de remplacer le salarié, pour l’autre il s’agit de le renforcer.
Franck Bardol pour sa part prolongeait cette réflexion autour de l’IA de confiance et précisait les points-clés de transparence et de loyauté des algorithmes. Depuis, ces thèmes émergent dans l’actualité du secteur et sont devenus un sujet d’inquiétude.
Pour Pierre Saurel, professeur associé à la Sorbonne, intervenant dans cette conférence, le domaine de l’éducation est également concerné par cette transformation numérique. De plus, les biais algorithmiques y sont tout aussi présents. Il ajoute que « L’analyse de ces biais est un point particulièrement important. Elle permet d’accompagner les enseignants pour identifier, par exemple, des spécificités dans les documents qu’ils peuvent utiliser en classe. »
Dans les coulisses de la conférence NeurIPS
Les grandes conférences scientifiques internationales sont des opportunités d’échanges intenses pour la communauté, mais aussi de moments, qui comme des œuvres d’art, sont révélateurs de tendances fortes.
Le Paris Machine Learning s’est associé avec la conférence NeurIPS afin de mettre à l’honneur quelques-uns des chercheurs francophones sélectionnés pour cette grand-messe. La forme ? Un panel quotidien de cinq intervenants durant la semaine de conférence. Des présentations éclair dans des visioconférences de dix minutes. Du concentré d’état de l’art. Ce qui émerge de cette sélection de chercheurs ? Beaucoup d’efforts consacrés à l’amélioration des méthodes d’apprentissage mais aussi des tentatives d’explorer des pistes totalement inédites.
Les neurosciences et l’explicabilité des algorithmes figurent aussi en bonne place. En somme, une dense semaine de mathématiques et d’algorithmique de haut niveau par des chercheurs de l’INRIA, l’École normale, Telecom Paris, Criteo, Google Brain et Facebook. Mais aussi venant des startups technologiques les plus avancées en recherche, parmi lesquelles LightOn, Hugging Face et Prophesee.
Des groupes de data scientists de Strasbourg, Timisoara en Roumanie et du Cameroun participaient également à cette semaine de mise en valeur de la recherche francophone. Robert Maria, organisateur du groupe de Strasbourg et de Timisoara, ainsi qu’Alain Nkongweni, organisateur du groupe du Cameroun, ont rejoint Jacqueline Forien et Claude Falguière dans l’organisation. Jacqueline est par ailleurs Meetup Chair à NeurIPS.
L’IA en lutte contre la Covid-19
Dès les premiers signes de la pandémie de Covid-19, la recherche scientifique s’est mobilisée. Le machine learning fait partie de l’arsenal mis en œuvre. C’était pour nous une évidence qui s’est traduite par une série d’interventions exclusives sur ce thème durant l’année 2020.
La recherche d’un remède définitif contre la Covid-19 complète la politique sanitaire du Tester – Alerter – Protéger. Chacun de ces éléments est décliné à base de machine learning, depuis les applications de traçage aux tests en masse, en passant par le suivi personnalisé de centaines de milliers de patients, la prévision du nombre de cas, l’estimation de la dangerosité du virus (le fameux R0) ou encore l’équilibre confinement – détection des cas, sans oublier la conception de molécules médicamenteuses.
Ces différents aspects ont été évoqués par Lenka Zdeborová, professeur à l’EPFL, Maximilien Levesque, fondateur de la startup Aqemia, Alexandre Gramfort de l’INRIA, Dror Baron de l’université de North Carolina et Arthur Charpentier de l’UQAM.
Avant de conclure, rappelons des points fondamentaux. Un algorithme ne remplace pas une infirmière. Un robot désinfectant ne se substitue pas à un accueil des patients à l’hôpital. Une application de traçage ne protège de rien. Aucune technique, méthode ou algorithme ne peut se substituer à l’action politique. Franck Bardol avait insisté sur ce point dans une intervention lors de la sortie de l’application de traçage nommée Stop Covid. Tous les éléments pour un fiasco étaient réunis. On connaît la suite. L’IA n’est pas de la magie qui résout tout. Aucune personne sérieuse n’y croit plus. Evgeny Morozov et son ouvrage de référence sur le techno-solutionnisme est passé par là et a balayé ce mythe.
Quel message retenir du Paris Machine Learning ?
Pour conclure, prêtons-nous à un exercice de synthèse difficile. Tentons de prendre du recul sur plusieurs centaines d’heures de prises de parole.
En premier lieu, ce qui frappe est la vitesse d’adoption des algorithmes IA. Yann LeCun, précurseur du domaine, relevait ce point dans sa leçon inaugurale du Collège de France consacrée aux algorithmes IA. Les ingénieurs ont adopté les méthodes du deep learning à une vitesse stupéfiante. Le décalage du cycle innovation-production n’existe pour ainsi dire plus !
Les avancées spectaculaires du deep learning en ce qui concerne le traitement des images et du langage ont très fortement facilité l’adoption du machine learning dans le tissu économique et dans les entreprises.
Au-delà de l’efficacité pure des algorithmes, d’autres préoccupations émergent. Notamment pour tout ce qui concerne le fonctionnement de ces algorithmes. Quelles sont les ressources nécessaires en données, en énergie, en matériel informatique pour entraîner ces algorithmes ? Hormis ces questions liées à la parcimonie des algorithmes, les mathématiciens s’interrogent toujours : « Pourquoi ces algorithmes fonctionnent-ils aussi bien ? » La recette est désormais connue de tous et a fait ses preuves mais la question de pourquoi elle fonctionne si bien reste entière.
Parallèlement à ces enjeux de recherche pure, le grand public, les ingénieurs, les décideurs politiques s’inquiètent du retentissement considérable de ces algorithmes sur nos sociétés. Les data scientists qui en écrivent le code informatique ne peuvent désormais plus se contenter d’être de purs techniciens, pour reprendre les termes de Cathy O’Neil, célèbre mathématicienne data scientist. Les algorithmes sont devenus un objet politique, l’éthique n’est plus une option mais un devoir.
Cet article est extrait du magazine ActuIA. Afin de ne rien manquer de l’actualité de l’intelligence artificielle, procurez vous ActuIA n°16, actuellement en kiosque et sur abonnement :
Snowflake annonce qu’il héberge et optimise la collection de LLM Llama 3.1 dans sa plateforme Snowflake Cortex AI, offrant aux entreprises un accès sécurisé et sans serveur au modèle open source le plus avancé de Meta, Llama 3.1 405B. Parallèlement, la société rend open source sa pile d’optimisation d’inférence et de fine-tuning pour les grands modèles de langage, démocratisant ainsi l’accès aux IA génératives pour les entreprises et la communauté open source.
Lancée en novembre dernier, Snowfla
Snowflake annonce qu’il héberge et optimise la collection de LLM Llama 3.1 dans sa plateforme Snowflake Cortex AI, offrant aux entreprises un accès sécurisé et sans serveur au modèle open source le plus avancé de Meta, Llama 3.1 405B. Parallèlement, la société rend open source sa pile d’optimisation d’inférence et de fine-tuning pour les grands modèles de langage, démocratisant ainsi l’accès aux IA génératives pour les entreprises et la communauté open source.
Lancée en novembre dernier, Snowflake Cortex AI est une suite de fonctionnalités d’IA entièrement gérées, conçues pour permettre aux entreprises de créer et de déployer des applications d’IA génératives de manière sécurisée et sans serveur. Le service propose une interface de développement sans code, accessible aux utilisateurs de tous niveaux techniques. Il donne accès à des LLM de pointe, notamment ceux de Mistral AI, de Google et AI21 Labs, mais également à Snowflake Arctic, à Llama 3 (8B et 70B), aux LLM Reka-Core et désormais à la famille Llama 3.1.
Une collaboration stratégique pour l’innovation
Développée en collaboration avec des acteurs clés de l’IA, dont DeepSpeed, Hugging Face et vLLM, la pile d’optimisation de Snowflake offre des outils et des technologies pour optimiser l’inférence et le fine-tuning des LLMs de manière efficace et rentable. Cette initiative s’inscrit dans le cadre de l’engagement de Snowflake à fournir des solutions de pointe en matière d’intelligence artificielle tout en favorisant l’innovation ouverte.
Caractéristiques techniques et avantages
Optimisation de l’Inférence
Réduction de la latence : La pile permet de réduire la latence d’inférence jusqu’à trois fois par rapport aux solutions open source existantes, offrant ainsi une performance en temps réel indispensable pour les applications critiques ;
Augmentation du débit : Avec une amélioration du débit de 1,4 fois, les utilisateurs peuvent traiter un volume plus important de requêtes en moins de temps, optimisant ainsi l’efficacité opérationnelle.
Fine-tuning efficace
Utilisation minimale de ressources : Le fine-tuning des modèles massifs peut désormais être réalisé en utilisant un seul nœud GPU, réduisant considérablement les coûts et la complexité.
Support de fenêtres de contexte étendu : Avec une prise en charge des fenêtres de contexte allant jusqu’à 128K, les modèles peuvent gérer des contextes plus larges et produire des résultats plus cohérents et pertinents.
Llama 3.1 405B a ainsi été optimisé pour l’inférence en temps réel et à haut débit avec une fenêtre de contexte massive de 128K à l’aide d’un seul nœud GPU au sein de Cortex AI.
Vivek Raghunathan, VP of AI Engineering chez Snowflake, commente :
“Nous ne nous contentons pas de fournir les modèles de pointe de Meta à nos clients via Snowflake Cortex AI. Nous armons les entreprises et la communauté de l’IA avec de nouvelles recherches et un code open source supportant des fenêtres de contexte de 128K, l’inférence multi-nœuds, le parallélisme de pipeline, la quantization en virgule flottante de 8 bits, et bien plus, afin de faire progresser l’intelligence artificielle pour l’écosystème global.”
Engagement en matière de sécurité et de confiance
Snowflake a également intégré des mécanismes de sécurité avancés dans sa pile open source avec Snowflake Cortex Guard. Pour développer cette nouvelle fonctionnalité, l’entreprise a utilisé Llama Guard 2 de Meta, qui recourt à des algorithmes avancés pour détecter et filtrer automatiquement les contenus potentiellement nuisibles, offensants ou inappropriés dans les sorties des modèles de langage. Les applications d’IA construites sur cette pile sont ainsi protégées contre les contenus nuisibles.
Ryan Klapper, leader IA chez Hakkoda, assure :
“La sécurité et la confiance sont des impératifs business lorsqu’il s’agit d’exploiter l’intelligence artificielle générative, et Snowflake nous offre les garanties nécessaires pour innover et utiliser à grande échelle des grands modèles de langage de pointe. La combinaison des modèles Llama de Meta au sein de Snowflake Cortex AI nous ouvre encore plus de possibilités pour des applications internes basées sur les RAG, permettant à nos parties prenantes d’accéder à des informations précises et pertinentes”.
Snowflake annonce l'intégration de Llama 3.1 et l'open source de sa pile d'optimisation d'inférence
Lors de la conférence SIGGRAPH 2024 qui s’est déroulée du 28 au 30 juillet dernier à Denver, au Colorado, NVIDIA a dévoilé des avancées majeures dans le domaine de la description universelle de scène (OpenUSD), un cadre universel d’échange de données 3D. Ces innovations visent à élargir l’adoption de l’OpenUSD dans la robotique, le design industriel et l’ingénierie, tout en accélérant les capacités des développeurs à créer des mondes virtuels extrêmement précis pour la prochaine génération de l’
Lors de la conférence SIGGRAPH 2024 qui s’est déroulée du 28 au 30 juillet dernier à Denver, au Colorado, NVIDIA a dévoilé des avancées majeures dans le domaine de la description universelle de scène (OpenUSD), un cadre universel d’échange de données 3D. Ces innovations visent à élargir l’adoption de l’OpenUSD dans la robotique, le design industriel et l’ingénierie, tout en accélérant les capacités des développeurs à créer des mondes virtuels extrêmement précis pour la prochaine génération de l’IA.
L’Universal Scene Description (OpenUSD) est un écosystème ouvert et extensible créé par Pixar Animation Studio. Plus qu’un simple format de fichier, l’OpenUSD permet de décrire, composer, simuler et collaborer dans des mondes 3D. Grâce à ses capacités d’extension, de personnalisation et de collaboration non destructives, il accélère les flux de travail et les projets, offrant une interopérabilité inégalée dans la création de contenus 3D. L’Alliance for OpenUSD (AOUSD), cofondée l’an passé par NVIDIA, Pixar, Adobe, Apple et Autodesk, promeut l’interopérabilité et l’innovation dans le contenu 3D via cet écosystème.
DigitalFish, Hunan Mango Innocreative Technology, Microsoft Corp., Shutterstock, Sony Group et Sunvega Information Technology les ont rejoints récemment au sein de l’AOUSD qui vient de lancer OpenUSD v24.08. Cette dernière version, disponible sur GitHub, propose des frameworks d’introspection et d’édition de contenu plus flexibles pour les développeurs, simplifie davantage les dépendances de build et les aligne sur les mises à jour des versions sélectionnées sous la plate-forme de référence VFX pour 2025, continue de moderniser le backend graphique pour le moteur de rendu Storm et ajoute plus de guides d’utilisation à la documentation des concepts clés.
IA Générative basée sur OpenUSD
NVIDIA a présenté une nouvelle IA générative basée sur OpenUSD, propulsée par la plateforme NVIDIA Omniverse, qui permettra à diverses industries de visualiser des projets de design et d’ingénierie, de simuler des environnements et de créer la prochaine vague de robots et d’IA physique. Cette technologie offre une opportunité sans précédent de développer des applications plus rapidement et de manière plus efficace.
Microservices NVIDIA NIM : des outils Innovants pour l’OpenUSD
NVIDIA, qui a développé les premiers modèles d’IA générative pour l’OpenUSD, les rend disponibles sous forme de microservices NVIDIA NIM. Ces modèles permettent aux développeurs d’intégrer des copilotes et des agents d’IA générative dans les flux de travail USD, accélérant ainsi l’adoption de l’USD dans divers secteurs industriels, tels que la fabrication, l’automobile et la robotique.
Les nouveaux microservices NVIDIA NIM disponibles en preview sont les suivants :
Microservice NIM de code USD : Capable de répondre aux requêtes des utilisateurs et de générer automatiquement du code OpenUSD-Python à partir d’invites textuelles. Ce code peut ensuite être utilisé dans des applications de visualisation telles que usdview de Pixar ou des applications basées sur NVIDIA Omniverse Kit ;
Microservice NIM de recherche USD : Permet aux développeurs de rechercher dans des bibliothèques massives de données OpenUSD, 3D et d’images en utilisant le langage naturel ou des entrées d’image ;
Microservice NIM USD Validate : Vérifie la compatibilité des fichiers avec les versions d’OpenUSD et génère des images entièrement rendues et tracées par chemin d’accès via les API NVIDIA Omniverse Cloud.
D’autres microservices, comme NIM USD Layout, un modèle d’IA génératif permettant d’assembler des scènes basées sur OpenUSD à partir d’une série d’invites de texte, et NIM SmartMaterial, permettant d’appliquer des matériaux réalistes à des objets 3D, seront bientôt disponibles, élargissant encore les capacités de développement et de simulation.
Des microservices NIM seront également bientôt disponibles pour fVDB, un framework de deep learning open source développé par NVIDIA. Il construit des opérateurs d’IA accélérés par NVIDIA sur OpenVDB pour générer des environnements virtuels compatibles avec l’IA qui capturent l’échelle spatiale massive et la haute résolution du monde réel.
Rev Lebaredian, vice-président d’Omniverse et de la technologie de simulation chez NVIDIA, affirme :
“Le boom de l’IA générative pour les industries lourdes est là. Jusqu’à récemment, les mondes numériques étaient principalement utilisés par les industries créatives. Aujourd’hui, grâce aux améliorations et à l’accessibilité que les microservices NVIDIA NIM apportent à OpenUSD, les industries de toutes sortes peuvent créer des mondes virtuels physiques et des jumeaux numériques pour stimuler l’innovation tout en se préparant à la prochaine vague d’IA : la robotique”.
Partenariats stratégiques et collaborations
NVIDIA a présenté plusieurs entreprises utilisant déjà ses nouveaux produits :
Foxconn, groupe industriel taïwanais leader dans la fabrication de produits électroniques, utilise la plateforme NVIDIA, notamment les microservices NIM et Omniverse pour créer un jumeau numérique d’une usine en cours de développement ;
WPP, l’un des leaders mondiaux des services de marketing et de communication, a adopté les microservices USD Search et USD Code NIM pour son pipeline de création de contenu généré par l’IA basé sur NVIDIA Omniverse, utilisé par des clients comme Coca-Cola ;
Siemens intègre les pipelines OpenUSD dans ses technologies de simulation Simcenter, facilitant la prise de décision basée sur des données probantes et la collaboration entre les parties prenantes.
Expansion de l’écosystème OpenUSD
NVIDIA a également annoncé de nouveaux outils pour faciliter l’interopérabilité et la création avancée dans divers secteurs :
Connecteurs USD pour les formats de données robotiques et de simulation industrielle.
SDK OpenUSD Exchange, permettant aux développeurs de créer leurs propres connecteurs de données robustes, qui sera disponible plus tard cette année sur GitHub.
Outils de diffusion de scènes OpenUSD vers Apple Vision Pro via le réseau de diffusion graphique NVIDIA.
Avec ces avancées, NVIDIA s’affirme comme un leader de l’innovation technologique, transformant la manière dont les industries créent et interagissent avec le contenu 3D. L’OpenUSD et les nouveaux microservices NVIDIA NIM promettent d’accélérer l’adoption de l’IA et de la simulation dans un large éventail de secteurs, ouvrant la voie à des mondes virtuels plus réalistes et à des innovations sans précédent.
Steve May, directeur de la technologie de Pixar et président de l’Alliance for OpenUSD (AOUSD), conclut :
“OpenUSD révolutionne la façon dont nous créons et interagissons avec le contenu 3D. Avec ces nouveaux services et API conçus par NVIDIA, nous nous attendons à une croissance et à une adoption accélérées de l’USD, ouvrant la voie à de nouveaux utilisateurs et secteurs pour s’engager plus facilement dans notre écosystème”.
Siggraph NVIDIA dévoile de nouveaux outils et microservices NIM pour l'OpenUSD
Mistral AI a annoncé ce 16 juillet dernier deux nouveaux LLM publiés sous licence Apache 2.0 : Codestral Mamba 7B et Mathstral 7B. Le premier utilise la nouvelle architecture Mamba introduite fin 2023 par les chercheurs de renom Albert Gu et Tri Dao, et est destiné à la génération de code comme son prédécesseur Codestral. Mathstral, basé sur Mistral 7B, est un modèle spécialisé dans les tâches mathématiques et scientifiques, développé dans le cadre de la collaboration de Mistral AI avec le Proje
Mistral AI a annoncé ce 16 juillet dernier deux nouveaux LLM publiés sous licence Apache 2.0 : Codestral Mamba 7B et Mathstral 7B. Le premier utilise la nouvelle architecture Mamba introduite fin 2023 par les chercheurs de renom Albert Gu et Tri Dao, et est destiné à la génération de code comme son prédécesseur Codestral. Mathstral, basé sur Mistral 7B, est un modèle spécialisé dans les tâches mathématiques et scientifiques, développé dans le cadre de la collaboration de Mistral AI avec le Projet Numina.
Codestral Mamba 7B : une architecture innovante
Codestral Mamba se distingue par une approche radicalement différente de celle des modèles Transformer traditionnels. Mistral AI explique :
“Contrairement aux modèles Transformer, les modèles Mamba offrent l’avantage de l’inférence temporelle linéaire et la capacité théorique de modéliser des séquences de longueur infinie. Ils permettent aux utilisateurs d’interagir de manière approfondie avec le modèle avec des réponses rapides, quelle que soit la longueur d’entrée. Cette efficacité est particulièrement pertinente pour les cas d’utilisation de la productivité du code. C’est pourquoi nous avons formé ce modèle avec des capacités avancées de code et de raisonnement, lui permettant d’être aussi performant que les modèles basés sur les transformateurs SOTA”.
Performances du modèle
Codestral Mamba a été soumis à des benchmarks détaillés, testant sa capacité de récupération contextuelle jusqu’à 256 000 jetons. Les résultats confirment son potentiel en tant qu’assistant de code local et sa capacité à gérer des tâches complexes.
Le modèle a démontré des performances supérieures aux modèles open source concurrents CodeLlama 7B, CodeGemma-1.17B et DeepSeek dans les tests HumanEval.
Disponibilité
Codestral Mamba a été publié sous la licence Apache 2.0, offrant une liberté complète d’utilisation et de modification. Il est disponible à des fins de tests sur la plateforme de Mistral AI et sur Hugging Face, où il peut être déployé en utilisant le SDK mistral-inférence, qui s’appuie sur les implémentations de référence du dépôt GitHub de Mamba. Il peut également l’être sur TensorRT-LLM pour ceux qui préfèrent cette option de déploiement et bientôt sur llama.cpp pour l’inférence locale.
Mathstral 7B : une avancée dans les problèmes mathématiques complexes
Mathstral est une contribution significative de Mistral AI à la communauté scientifique, destinée à résoudre des problèmes mathématiques avancés nécessitant un raisonnement logique complexe et multi-étapes.
Basé sur Mistral 7B, disposant d’une fenêtre contextuelle de 32 000 jetons, Mathstral excelle dans les matières STEM, atteignant des performances de pointe dans sa catégorie. Il a obtenu 56,6 % sur MATH et 63,47 % sur MMLU.
Avec un calcul plus intensif au moment de l’inférence, le modèle peut atteindre des scores encore plus élevés : MATH avec vote majoritaire: 68,37%, MATH avec un modèle de récompense fort parmi 64 candidats: 74,59%.
Mathstral illustre les excellents compromis performance/vitesse obtenus en construisant des modèles pour des objectifs spécifiques, une philosophie que Mistral AI promeut activement. Les poids de Mathstral sont disponibles sur HuggingFace, et le modèle peut être utilisé tel quel ou affiné avec mistral-inference et mistral-finetune.
Mistral AI annonce deux nouveaux modèles open source Codestral Mamba 7B et Mathstral 7B
LightOn, un des acteurs clés français de l’IA générative, annonce s’être associé à Hewlett Packard Enterprise (HPE) pour développer une solution d’intelligence artificielle générative. Cette offre conjointe, dédiée aux entreprises, intègre la plateforme Paradigm de LightOn avec les serveurs HPE ProLiant DL380a Gen11.
Créée en 2016 par Igor Carron, Laurent Daudet, Florent Krzakala et Sylvain Gigan, LightOn compte parmi ses collaborateurs les meilleurs ingénieurs et chercheurs européens en ML. Apr
LightOn, un des acteurs clés français de l’IA générative, annonce s’être associé à Hewlett Packard Enterprise (HPE) pour développer une solution d’intelligence artificielle générative. Cette offre conjointe, dédiée aux entreprises, intègre la plateforme Paradigm de LightOn avec les serveurs HPE ProLiant DL380a Gen11.
Créée en 2016 par Igor Carron, Laurent Daudet, Florent Krzakala et Sylvain Gigan, LightOn compte parmi ses collaborateurs les meilleurs ingénieurs et chercheurs européens en ML. Après avoir lancé en 2020 son tout premier co-processeur photonique, la start-up s’est attaquée à un nouveau défi dans le domaine émergent de l’IA : créer les premiers grands modèles de langage pour les langues européennes, en particulier le français. Depuis lors, elle a démontré son expertise en développant 12 LLM, dont Alfred, son modèle open source phare.
Alfred-40B-0723, une version affinée de Falcon-40B, le premier LLM open source des Émirats arabes unis et du Moyen-Orient a été annoncé il y a tout juste un an, sa seconde itération, Alfred-40B-1023, lancée en novembre dernier. La start-up a développé ce nouveau modèle optimisé pour la RAG (Retrieval Augmented Generation) afin qu’il réponde spécifiquement aux besoins des entreprises et des services publics.
Alfred alimente Paradigm, la plateforme d’IA générative à destination des entreprises européennes de LightOn, pouvant être directement installée sur les structures existantes, sécurisant ainsi leurs données. La plateforme a été adoptée dans divers secteurs, notamment le SEO, la défense, la santé, l’aéronautique.
Igor Carron, président et cofondateur de LightOn, souligne :
“Notre engagement est de fournir aux entreprises des outils d’IA générative qui révolutionneront leurs opérations, leurs services et leurs produits sans compromettre la sécurité de leurs données. Notre objectif est de proposer des outils faciles à déployer dans leur infrastructure, personnalisables en fonction de leurs besoins et capables de mettre en production des solutions rentables qui génèrent des gains de productivité”.
Une solution complète et intégrée
La plateforme Paradigm permet aux équipes métiers d’incorporer l’IA générative dans leurs cas d’usage sans nécessiter l’intervention des équipes techniques, offrant ainsi une flexibilité maximale. Elle peut se connecter à tous les grands modèles de langages open source, ce qui permet une personnalisation et une adaptabilité accrues.
L’offre conjointe de LightOn et HPE, combinant confidentialité dès la conception, sécurité des données et maîtrise des coûts, s’adresse aux entreprises de toutes tailles souhaitant déployer une solution clé en main. La solution inclut un modèle de langage performant et une interface métier intuitive, facilitant l’utilisation et l’optimisation. Paradigm permet d’intégrer des bases documentaires internes, rendant ces informations accessibles via un agent conversationnel.
Alain Melon, directeur général de HPE France, affirme :
“Cette nouvelle ère de l’IA générative permet aux entreprises de transformer les données, offrant de nouvelles façons de découvrir l’innovation et la valeur. Pour atteindre le plein potentiel des modèles d’IA, les entreprises ont besoin de systèmes puissants. En combinant les serveurs haute densité optimisés pour le
calcul de HPE avec les modèles d’apprentissage et l’interface utilisateur intuitive de LightOn, nous donnons aux entreprises les moyens de libérer la valeur de leurs données, où qu’elles se trouvent”.
Les deux partenaires collaborent également pour offrir des offres personnalisées à leurs clients communs, en affinant des modèles afin de répondre à leurs besoins et objectifs spécifiques.
LightOn et HPE lancent une offre d'IA générative conjointe
Oracle a récemment annoncé la disponibilité générale de HeatWave GenAI. Le service de base de données HeatWave intègre désormais des grands modèles de langage (LLM), un dépôt de vecteurs automatisé et évolutif, ainsi que des capacités de conversation contextuelle en langage naturel. Ces nouvelles fonctionnalités permettent aux entreprises d’exploiter la puissance de l’IA générative avec leurs propres données, sans nécessiter d’expertise en IA ni de transférer leurs données vers des bases de donn
Oracle a récemment annoncé la disponibilité générale de HeatWave GenAI. Le service de base de données HeatWave intègre désormais des grands modèles de langage (LLM), un dépôt de vecteurs automatisé et évolutif, ainsi que des capacités de conversation contextuelle en langage naturel. Ces nouvelles fonctionnalités permettent aux entreprises d’exploiter la puissance de l’IA générative avec leurs propres données, sans nécessiter d’expertise en IA ni de transférer leurs données vers des bases de données vectorielles externes.
Une IA générative directement dans la base de données
HeatWave GenAI marque un tournant dans la manière dont les entreprises peuvent utiliser l’IA. En intégrant des LLM directement dans HeatWave, Oracle simplifie le développement d’applications d’IA génératives.
Ces LLM en base de données ont un ensemble de paramètres plus petit et sont des LLM quantifiés qui fonctionnent sur les mêmes ressources de calcul que les opérations de la base de données. Des versions quantifiées de Mistral-7B-Instruct et Llama3-8B-Instruct, par exemple, offrent un bon compromis entre coût et qualité de réponse et sont disponibles dans toutes les régions où HeatWave est disponible.
Les entreprises peuvent désormais rechercher des données, générer ou synthétiser du contenu, et effectuer des tâches de récupération augmentée par génération (RAG) sans quitter la base de données. Cette intégration permet également de combiner l’IA générative avec d’autres fonctionnalités de HeatWave, telles que AutoML, pour créer des applications encore plus riches.
Automatisation et performance avec le dépôt de vecteurs
Le dépôt de vecteurs de HeatWave GenAI permet aux entreprises d’utiliser l’IA générative avec leurs documents commerciaux sans avoir à déplacer leurs données. Toutes les étapes de création de dépôts de vecteurs et d’intégrations vectorielles sont automatisées et exécutées à l’intérieur de la base de données. Cela inclut le repérage des documents dans le stockage d’objets, leur analyse, la génération d’intégrations et leur insertion dans le dépôt de vecteurs. Cette automatisation rend HeatWave Vector Store efficace et facile à utiliser.
Traitement vectoriel évolutif pour des résultats rapides et précis
Le traitement vectoriel évolutif de HeatWave GenAI offre des résultats de recherche sémantique extrêmement rapides sans compromettre la précision. Grâce à l’implémentation optimisée de la fonction de distance et à la représentation en colonnes hybride en mémoire, les requêtes sémantiques peuvent être effectuées avec du code SQL standard. La capacité d’évoluer jusqu’à 512 nœuds HeatWave permet de maintenir des performances élevées, garantissant des réponses rapides et pertinentes aux utilisateurs.
HeatWave Chat : interaction naturelle avec les données
HeatWave Chat est un module d’extension de code visuel pour MySQL Shell, offrant une interface graphique pour HeatWave GenAI. Ce module permet aux développeurs de poser des questions en langage naturel ou en SQL, facilitant une conversation contextuelle. Le navigateur Lakehouse intégré permet aux utilisateurs de sélectionner des fichiers dans le stockage d’objets et de créer un dépôt de vecteurs. Les utilisateurs peuvent ainsi effectuer des recherches dans l’ensemble de la base de données, tout en tenant compte de l’historique des questions posées et des citations des documents sources.
Performances supérieures et réduction des coûts
Selon Oracle, les tests indépendants réalisés ont démontré des avantages significatifs en termes de performance et de coûts : HeatWave GenAI est jusqu’à 30 fois plus rapide et 25 % moins cher que Snowflake, 15 fois plus rapide et 85 % moins cher que Databricks, et 18 fois plus rapide et 60 % moins cher que Google BigQuery. La création de dépôts de vecteurs est jusqu’à 23 fois plus rapide et représente un quart du coût d’utilisation de la base de connaissances pour Amazon Bedrock.
HeatWave GenAI d’Oracle représente une avancée significative dans le domaine de l’IA générative, offrant aux entreprises des outils puissants pour exploiter leurs données sans complexité supplémentaire. Cette nouvelle solution est disponible immédiatement dans toutes les régions d’Oracle Cloud et sans frais supplémentaires pour les clients HeatWave.
HeatWave GenAI Oracle vers une démocratisation de l'IA générative en entreprise
Le Hub France IA vient de publier un guide essentiel pour les organisations cherchant à intégrer des modèles d’IA générative, en particulier les “Large Language Models” (LLM), dans leurs opérations. Ce document, élaboré par le groupe de travail IA Générative du Hub France IA, offre des recommandations détaillées et une méthodologie éprouvée pour aider les entreprises, collectivités et autres entités à faire des choix éclairés.
Association à but non lucratif créée en 2017, le Hub France IA fédèr
Le Hub France IA vient de publier un guide essentiel pour les organisations cherchant à intégrer des modèles d’IA générative, en particulier les “Large Language Models” (LLM), dans leurs opérations. Ce document, élaboré par le groupe de travail IA Générative du Hub France IA, offre des recommandations détaillées et une méthodologie éprouvée pour aider les entreprises, collectivités et autres entités à faire des choix éclairés.
Association à but non lucratif créée en 2017, le Hub France IA fédère plus de 200 membres et 50 partenaires afin d’accélérer le développement de propositions et de solutions concrètes aux niveaux national et européen. Il agit pour faire émerger une IA de confiance et souveraine, respectueuse des citoyens, au service des entreprises et du secteur public.
Les actions prioritaires de l’association suivent 3 axes :
• Assurer une veille de l’écosystème, des technologies et du réglementaire en interaction étroite avec les autorités compétentes en France et en Europe ;
• Favoriser les synergies entre les différents acteurs de l’écosystème IA français et européen ;
• Accompagner l’adoption de l’IA et la montée en compétences par la production de communs utiles à tous.
Dans ce livrable, il adresse une des problématiques actuellement rencontrées par les entreprises françaises de toute taille et tout secteur : comment faire pour choisir entre les différents LLM ?
Une réponse aux besoins des organisations
Composé d’une quinzaine de membres, le groupe de travail IA Générative s’est réuni chaque semaine pendant plusieurs mois pour préparer ce guide. Leur objectif : fournir aux organisations un outil complet pour naviguer dans le paysage complexe des LLM. Ce travail fait suite à un livrable précédent publié en février 2024, qui portait sur les usages des IA génératives.
Pour élaborer ce guide, le groupe a mené une enquête approfondie auprès des organisations afin de comprendre leurs critères de choix les plus importants. Les résultats de cette enquête constituent la première partie du document.
Comment choisir son LLM ?
Le guide est structuré en cinq parties principales :
Résultats de l’enquête : Cette section présente la méthodologie et les résultats de l’enquête menée auprès des organisations, identifiant les critères cruciaux pour le choix des modèles d’IA.
Cartographie des benchmarks : Le document offre une vue d’ensemble des benchmarks de référence qui peuvent être utilisés pour tester la performance des différents modèles de LLM.
Grille d’évaluation des modèles : Basée sur les critères identifiés par l’enquête, cette grille permet d’évaluer les modèles selon divers aspects tels que la sécurité des données, la conformité légale, les infrastructures, le business model, l’accompagnement des clients et les considérations écologiques.
Échanges avec les fournisseurs : Cette partie restitue les échanges avec les principaux fournisseurs de LLM, structurés selon la grille d’évaluation, offrant ainsi une perspective pratique sur l’application des critères de choix.
Analyse détaillée des résultats : Le guide partage une analyse approfondie des résultats pour chaque fournisseur, aidant les organisations à prendre des décisions éclairées.
Principaux enseignements
Le guide met en lumière plusieurs enseignements clés :
Critères de choix multiples : La performance d’un modèle ne doit pas être le seul critère de sélection. La sécurité des données, le respect des réglementations, l’adaptation aux infrastructures existantes et le coût sont également essentiels ;
Importance des benchmarks : Bien que les benchmarks soient utiles, ils doivent être complétés par des interactions directes avec les fournisseurs de modèles ;
Absence de fournisseur parfait : Aucun fournisseur ne se distingue comme étant le meilleur dans tous les aspects.
Le guide recommande d’adopter une approche méthodologique :
Définir les cas d’usage spécifiques ;
Lister les critères de choix pertinents pour ces cas d’usage ;
Consulter les benchmarks appropriés ;
Affiner l’analyse en se référant aux critères spécifiques.
Ce guide représente un outil précieux pour les organisations souhaitant s’assurer de sélectionner le modèle le plus adapté à leurs besoins spécifiques. Vous pouvez le retrouver ici.
Choisir un modèle d’IA générative pour son entreprise le guide du Hub France IA
Dassault Systèmes et Mistral AI ont annoncé le 1er juillet un partenariat stratégique destiné à offrir des solutions industrielles fiables basées sur l’IA générative. Combinant l’expertise en jumeaux virtuels et l’infrastructure cloud souveraine de Dassault Systèmes avec les grands modèles de langage (LLM) avancés de Mistral AI, il vise à accélérer le déploiement de l’IA générative dans le secteur industriel.
Dassault Systèmes est un éditeur de logiciels spécialisé dans la conception 3D, le maq
Dassault Systèmes et Mistral AI ont annoncé le 1er juillet un partenariat stratégique destiné à offrir des solutions industrielles fiables basées sur l’IA générative. Combinant l’expertise en jumeaux virtuels et l’infrastructure cloud souveraine de Dassault Systèmes avec les grands modèles de langage (LLM) avancés de Mistral AI, il vise à accélérer le déploiement de l’IA générative dans le secteur industriel.
Dassault Systèmes est un éditeur de logiciels spécialisé dans la conception 3D, le maquettisme numérique 3D et les solutions pour la gestion du cycle de vie d’un produit. Depuis 1981, il permet aux particuliers et aux entreprises de proposer des innovations durables dans les domaines de l’industrie manufacturière, des sciences de la vie et de la santé, ainsi que des villes et des territoires. Sa plateforme 3DEXPERIENCE permet aux utilisateurs de collaborer et d’innover dans un environnement virtuel.
Selon l’éditeur, “À l’ère de l’économie générative, l’industrie doit évoluer du produit vers l’expérience et la durabilité en s’appuyant sur les univers virtuels pour élargir et améliorer le monde réel”. Les grands modèles de langage (LLM) tels que ceux de Mistral AI, sont pour lui une opportunité pour accélérer ce processus.
Le partenariat formé par Dassault Systèmes et Mistral AI vise donc à proposer au marché :
Une nouvelle offre OUTSCALE baptisée « Large Language Models as a Service » (LMaaS) : s’appuyant sur l’infrastructure cloud souveraine OUTSCALE de Dassault Systèmes, cette solution permet aux LLM commerciaux de Mistral AI de se conformer aux normes de sécurité et de conformité les plus strictes, dont SecNumCloud, élaborée par l’Agence nationale de la sécurité des systèmes d’information (ANSSI), qui vise à garantir la robustesse et la sécurité des solutions cloud face aux cyberattaques.
Des expériences génératives optimisées par les LLM : ces expériences permettront aux 350 000 clients industriels de Dassault Systèmes d’accéder à de gigantesques bases de données pour transformer leurs opérations vers une approche plus durable.
Arthur Mensch, PDG et cofondateur de Mistral AI, affirme :
“Nous nous réjouissons de nouer ce partenariat avec Dassault Systèmes et de réaffirmer notre engagement mutuel en faveur des performances, de l’efficacité, de la sécurité et de la confidentialité que l’intelligence artificielle générative apporte au plus grand nombre. En nous appuyant sur l’infrastructure souveraine et les solutions industrielles de Dassault Systèmes, nous franchissons une nouvelle étape dans notre mission commune qui consiste à favoriser l’utilisation de l’IA générative de pointe par le plus grand nombre”.
“Nous poursuivons notre démarche en vue de réinventer les industries au niveau mondial grâce à des jumeaux virtuels alimentés par l’IA. Le partenariat avec Mistral AI, nous permettra d’offrir des expériences génératives fiables, en proposant une combinaison unique de modélisation scientifique, de simulation et d’IA — et notamment des grands modèles de langage — au sein d’un environnement souverain avec OUTSCALE. Ce partenariat souligne notre engagement à bâtir un écosystème technologique solide au bénéfice de solutions industrielles basées sur l’IA”.
Les grands modèles de langage (LLM) présentent des capacités impressionnantes dans différents domaines mais les modèles plus petits (SLM) sont une alternative intéressante pour les entreprises qui peuvent les exploiter à moindre coût pour des tâches spécifiques. Microsoft, qui a introduit le SLM Phi-1 en juin 2023, a présenté le 23 avril dernier la famille de modèles ouverts Phi-3. Le plus petit d’entre eux, Phi-3 mini, d’ores et déjà disponible, compte 3,8 milliards de paramètres et, grâce à sa
Les grands modèles de langage (LLM) présentent des capacités impressionnantes dans différents domaines mais les modèles plus petits (SLM) sont une alternative intéressante pour les entreprises qui peuvent les exploiter à moindre coût pour des tâches spécifiques. Microsoft, qui a introduit le SLM Phi-1 en juin 2023, a présenté le 23 avril dernier la famille de modèles ouverts Phi-3. Le plus petit d’entre eux, Phi-3 mini, d’ores et déjà disponible, compte 3,8 milliards de paramètres et, grâce à sa petite taille, peut être déployé en local sur un téléphone ou un ordinateur.
Microsoft présente les modèles Phi-3 comme “les modèles de langage de petite taille les plus performants et les plus rentables disponibles”.
Phi-3 Mini est un modèle de transformateur avec décodeur dense, affiné grâce au fine-tuning supervisé (SFT) et l’optimisation directe des préférences (DPO) pour garantir l’alignement avec les préférences humaines et les directives de sécurité. Il est disponible sur Azure AI Studio, Hugging Face et Ollama.
Il a été entraîné pendant sept jours sur 512 GPU NVIDIA H100 Tensor Core, NVIDIA nous a d’ailleurs précisé qu’il était possible de l’essayer sur ai.nvidia.com où il sera packagé en tant que NVIDIA NIM, “un microservice avec une interface de programmation d’application standard qui peut être déployé n’importe où”.
Dans leur rapport technique, les chercheurs expliquent que “L’innovation réside entièrement dans notre jeu de données pour l’entraînement, une version agrandie de celle utilisée pour PHI-2, composé de données web fortement filtrées et de données synthétiques“.
Le modèle, entraîné sur 3,3 trillions de jetons, a également été aligné pour la robustesse, la sécurité et le format de chat. Sa fenêtre contextuelle, qui peut aller de 4 000 jusqu’à 128 000 jetons, lui permet d’assimiler et de raisonner sur des contenus textuels volumineux (documents, pages Web, code…). Selon Microsoft, Phi-3-mini démontre de solides capacités de raisonnement et de logique, ce qui en fait un bon candidat pour les tâches analytiques.
Des performances solides malgré une petite taille
Microsoft a partagé dans son blog les performances de Phi-3 mini, mais également celles de Phi-3-small (7B) et Phi-3-medium (14B) qui seront prochainement disponibles et ont été entraînés sur 4,8 trillions de tokens.
Les performances des modèles Phi-3 ont été comparées à celles de Phi-2, Mistral-7b, Gemma-7B, Llama-3-instruct-8b, Mixtral-8x7b, GPT-3.5 Turbo et Claude-3 Sonnet. Tous les chiffres déclarés sont produits avec le même pipeline afin qu’ils soient effectivement comparables.
Phi-3-mini surpasse Gemma-7B et Mistral-7B sur certains benchmarks de référence comme MMLU, tandis que Phi-3-small et Phi-3-medium, nettement plus performants, surpassent les modèles beaucoup plus grands, y compris GPT-3.5 Turbo. Cependant, du fait de leur petite taille, les modèles Phi-3 sont moins compétitifs pour les tâches axées sur les connaissances factuelles, telles que celles évaluées dans TriviaQA.
Toutefois, leurs capacités dans de nombreux autres domaines, les rendent particulièrement utiles dans des scénarios où la taille du modèle et les ressources disponibles sont des facteurs critiques, comme dans les environnements à ressources limitées ou les applications nécessitant des temps de réponse rapides.
Les GAFAM ou GAMAM (Google, Apple, Facebook (Meta), Amazon, Microsoft) portés par l’essor de l’IA générative, connaissent une croissance importante de leur capitalisation boursière tout comme NVIDIA. Alphabet, la maison mère de Google, a ce vendredi 12 avril franchi pour la seconde fois de son existence le cap des 2 billions de dollars, se retrouvant ainsi la 4ème entreprise la plus valorisée au monde.
Alors que la valorisation de NVIDIA portée par la demande de puces ne cesse de grimper, les 5
Les GAFAM ou GAMAM (Google, Apple, Facebook (Meta), Amazon, Microsoft) portés par l’essor de l’IA générative, connaissent une croissance importante de leur capitalisation boursière tout comme NVIDIA. Alphabet, la maison mère de Google, a ce vendredi 12 avril franchi pour la seconde fois de son existence le cap des 2 billions de dollars, se retrouvant ainsi la 4ème entreprise la plus valorisée au monde.
Alors que la valorisation de NVIDIA portée par la demande de puces ne cesse de grimper, les 5 GAFAM ont également vu la leur augmenter significativement l’an passé et en ce début 2024.
En mai 2023, Apple était l’entreprise la plus valorisée devant Microsoft, suivie par Saudi Aramco, une société pétrolière saoudienne, Alphabet et Amazon. Alors que l’inflation leur était favorable, l’appétit des investisseurs pour la GenAI et la demande de puces avaient quelque peu modifié ce classement : Microsoft, principal investisseur d’OpenAI, s’est installé en 1ère place et NVIDIA est venu s’immiscer en 3ème position devant Saudi Aramco.
Vendredi dernier, le classement a de nouveau évolué : Saudi Aramco s’est vu relégué à la sixième place par Alphabet et Amazon. Si Microsoft semblait inatteignable avec une valorisation de plus de 3 billions (3000 milliards de dollars), celle d’Apple était de 2,7 billions.
Les perspectives optimistes d’août 2023 pour NVIDIA, boosté par les ventes du H100, son GPU pour datacenters, se sont avérées justes : l’entreprise s’est retrouvée en 3ème place du top 5 avec une valorisation de plus de 2,2 billions. Alphabet, qui, pendant un moment a lui aussi dépassé le seuil des 2 000 milliards de dollars comme il l’avait éphémèrement fait en novembre 2021, est redescendu aux alentours de 1,990 billions tandis qu’Amazon était valorisé à plus de 1,966 billions.
Google (Alphabet) avait quelque peu raté la présentation de son modèle phare Gemini fin décembre dernier et vu ses actions chuter rapidement. La société a cependant su regagner la confiance des investisseurs la semaine dernière lors de Google Cloud Next où elle a notamment dévoilé son CPU Axion.
Si les appareils mobiles ont considérablement évolué depuis le premier iPhone, ils n’ont toujours pas la puissance de calcul nécessaire pour exploiter pleinement les grands modèles de langage (LLM) contemporains. La solution pour maximiser le potentiel de l’IA sur mobile et en périphérie ne réside pas dans la puissance de calcul pure, mais dans une approche stratégique de l’architecture du modèle, de la gestion des données et de l’exploitation des capacités de calcul issues d’un appareil.
Un clo
Si les appareils mobiles ont considérablement évolué depuis le premier iPhone, ils n’ont toujours pas la puissance de calcul nécessaire pour exploiter pleinement les grands modèles de langage (LLM) contemporains. La solution pour maximiser le potentiel de l’IA sur mobile et en périphérie ne réside pas dans la puissance de calcul pure, mais dans une approche stratégique de l’architecture du modèle, de la gestion des données et de l’exploitation des capacités de calcul issues d’un appareil.
Un cloud indépendant pour l’IA mobile
Une véritable IA mobile ne peut pas dépendre uniquement de solutions basées sur le cloud. Il ne s’agit pas seulement d’une question de connectivité, mais aussi d’efficacité, de rapidité et de confidentialité des données. L’IA qui repose sur la transmission de données à un serveur central ne peut pas répondre en temps réel. La latence introduit des lenteurs qui compromettent la fiabilité des informations générées par l’IA, sans compter les coûts de bande passante associés à la transmission constante des données.
Les serveurs cloud sont la solution appropriée pour les applications de calcul puissant, comme l’entraînement des modèles d’apprentissage profond et des LLM. À l’inverse, les opérations nécessitant une interaction immédiate entre l’IA et les utilisateurs, ainsi que d’autres processus de Machine Learning, sont traitées plus efficacement sur l’appareil, à la périphérie du réseau. Cette approche améliore les performances tout en garantissant la confidentialité des utilisateurs grâce à une simplification de la transmission des données.
L’optimisation de la performance sur les appareils mobiles
Réduire la charge de calcul de l’appareil est une autre étape critique. Des techniques comme la quantification des modèles (« quantization » en anglais) qui simplifie les modèles d’IA en optimisant ses paramètres pour réduire l’espace de stockage requis sont essentielles pour maintenir les performances sans compromettre la fonctionnalité. Le GPTQ, qui compresse les modèles après l’entraînement, LoRA, qui affine les matrices plus petites au sein d’un modèle préentraîné, et QLoRA, qui optimise l’utilisation de la mémoire du GPU pour une plus grande efficacité, représentent des options destinées à satisfaire les besoins spécifiques de chaque application.
Confidentialité, sécurité et synchronisation des données
La confidentialité, la sécurité et la synchronisation des données sont d’autres facteurs et éléments clés à prendre en compte pour le développement de l’IA mobile. La mise en place d’un chiffrement des données solide pour la préservation de la vie privée garantit la protection des informations utilisateurs, ce qui conforte l’un des principaux avantages du traitement des données au niveau local. Parallèlement, des mécanismes de synchronisation des données entre les appareils périphériques et le cloud ou les serveurs centraux garantiront l’intégrité et la cohérence des données sur l’ensemble du réseau.
Une plateforme de données unifiée capable de gérer différents types de données et qui permet aux modèles d’IA d’accéder aux données locales et d’interagir avec elles, à la fois en ligne et hors ligne, représente ainsi un avantage significatif. Cette approche améliore non seulement les performances, mais aussi l’expérience utilisateur en garantissant que les applications d’IA sont réactives, fiables et capables de fonctionner dans divers environnements.
La meilleure architecture pour l’IA mobile — et l’IA en général — est celle qui consiste à minimiser sa complexité. Plus l’architecture est simple, plus elle peut consacrer de puissance à l’IA elle-même, ce qui est particulièrement important dans un environnement mobile.
On savait OpenAI en tractations avec plusieurs médias pour entraîner ses LLM sur leurs publications. En France, c’est avec le journal Le Monde que le premier accord a été signé : OpenAI puisera en toute légalité dans le contenu du quotidien pour entraîner ses modèles et enrichir les réponses de ChatGPT. Le Monde, de son côté, s’assure d’une nouvelle source de revenus tout en protégeant ses droits d’auteur.
Si 2023 a été l’année de l’IA générative, elle a été également celle de batailles judiciai
On savait OpenAI en tractations avec plusieurs médias pour entraîner ses LLM sur leurs publications. En France, c’est avec le journal Le Monde que le premier accord a été signé : OpenAI puisera en toute légalité dans le contenu du quotidien pour entraîner ses modèles et enrichir les réponses de ChatGPT. Le Monde, de son côté, s’assure d’une nouvelle source de revenus tout en protégeant ses droits d’auteur.
Si 2023 a été l’année de l’IA générative, elle a été également celle de batailles judiciaires entre les éditeurs, les écrivains, les artistes et les acteurs de l’IA comme OpenAI, Midjourney ou Meta. OpenAI a d’ailleurs été principalement la cible de plaintes comme en témoigne celle du New York Times fin décembre dernier.
Sachant pertinemment que leurs contenus vont aller enrichir les données sur lesquelles sont entraînés les modèles d’IA, leurs auteurs entendent aujourd’hui ne pas laisser les développeurs engranger des bénéfices sur leur dos sans contrepartie. Ce que ces derniers ont compris : Google a ainsi signé en février un accord de licence avec Reddit d’un montant de 60 millions de dollars annuels pour exploiter son contenu.
OpenAI s’est dit prêt à collaborer avec les éditeurs et les créateurs “afin qu’ils tirent profit d’une technologie IA avancée et d’un nouveau modèle de revenus”.
La start-up a signé un accord avec le groupe de presse allemand Axel Springer après avoir conclu un partenariat avec l’Associated Press en juillet dernier, pour partager certains contenus et technologies d’information et examiner des cas d’utilisation potentiels de l’IA générative dans les produits et services d’actualité. Mercredi, elle a annoncé cet accord avec Le Monde mais également un partenariat avec le groupe espagnol Prisa Media.
L’accord de partenariat Le Monde-OpenAI
Les équipes du Monde vont pouvoir exploiter les technologies d’OpenAI pour développer des projets et des fonctionnalités basées sur l’IA tandis que la start-up utilisera son corpus éditorial.
Louis Dreyfus, Directeur général du Monde, et Jérôme Fenoglio, Directeur du Monde, écrivent :
“L’accord prévoit que les références aux articles du Monde soient mises en évidence et systématiquement accompagnées d’un logo, d’un lien hypertexte et des titres des articles utilisés comme références. Les contenus qui nous sont fournis par les agences de presse et les photographies publiées par Le Monde sont expressément exclus”.
Tous deux rappellent qu’ils ont été parmi les premiers en France à signer des accords de droits voisins avec Facebook puis Google. Le droit voisin permet, depuis 2019, aux éditeurs de presse de recevoir une rémunération des plateformes du Web utilisant leurs publications datant de moins de deux ans. Le montant de celle-ci est déterminé à la suite de négociations entre éditeur et plateforme, comme dans le cadre de ce partenariat.
Ils ajoutent :
“Nous espérons que cet accord créera un précédent pour notre industrie. Avec cette première signature, il sera plus difficile pour les autres plateformes d’IA de se soustraire ou de refuser de négocier. De ce point de vue, nous sommes convaincus que l’accord est bénéfique pour l’ensemble de la profession”.
Précisant :
“Il va sans dire que ce nouvel accord, comme les précédents que nous avons signés, n’entravera en rien la liberté de nos journalistes d’enquêter sur le secteur de l’intelligence artificielle en général, et sur OpenAI en particulier”.
Une charte sur l’IA
Comme de nombreuses entreprises et éditeurs, Le Monde utilise des outils d’IA au quotidien, notamment l’outil de traduction de DeepL pour son site web et son application en anglais. Le quotidien teste également la transcription orale de ses articles français dans le cadre d’un accord avec Microsoft.
L’éditeur met l’accent sur la nécessité d’une supervision humaine dans l’utilisation de l’IA. Une fois les articles traduits par DeepL, ils sont ainsi relus par des traducteurs professionnels avant de l’être par des journalistes anglophones, ce qui a d’ailleurs permis de créer des emplois.
Sa charte sur l’IA, récemment adoptée, complète sa charte éthique et déontologique et stipule en autres :
“L’intelligence artificielle générative (…) ne peut en aucun cas remplacer les équipes éditoriales”
mais également :
“L’utilisation de l’IA générative n’est autorisée, que dans des conditions strictement définies, comme outil d’aide à la production éditoriale”.
Lundi dernier, Anthropic annonçait la dernière itération de sa famille de modèles d’IA générative : Claude 3. Le modèle se décline sous trois versions à l’instar du modèle Gemini de Google : Claude 3 Haiku, Claude 3 Sonnet et Claude 3 Opus, par ordre de performances. Les deux derniers modèles sont d’ores et déjà disponibles dans 159 pays, dont la France, via l’API Claude, Haiku, le plus léger, les y rejoindra prochainement.
Selon Anthropic, les utilisateurs des modèles Claude 3 pourront désormai
Lundi dernier, Anthropic annonçait la dernière itération de sa famille de modèles d’IA générative : Claude 3. Le modèle se décline sous trois versions à l’instar du modèle Gemini de Google : Claude 3 Haiku, Claude 3 Sonnet et Claude 3 Opus, par ordre de performances. Les deux derniers modèles sont d’ores et déjà disponibles dans 159 pays, dont la France, via l’API Claude, Haiku, le plus léger, les y rejoindra prochainement.
Selon Anthropic, les utilisateurs des modèles Claude 3 pourront désormais sélectionner l’équilibre optimal entre intelligence, vitesse et coût pour leur application spécifique.
Claude 3 Haiku est le modèle le plus rapide et le plus économique : 0,25$ par million de tokens (jetons) en entrée et 1,25$ par million de tokens générés, et, selon la société, le plus rentable du marché “pour sa catégorie intelligence”. Il peut lire un article de recherche dense en informations et en données sur arXiv (environ 10 000 jetons) avec des tableaux et des graphiques en moins de trois secondes.
Claude 3 Sonnet, 2 fois plus rapide que Claude 2 et Claude 2.1 avec des niveaux d’intelligence plus élevés, combine performances et vitesse pour des tâches efficaces et à haut débit. Il excellerait dans les tâches exigeant des réponses rapides, comme la récupération de connaissances ou l’automatisation des ventes. Son coût est de 3$ par million de tokens en entrée et 15$ par million de tokens générés.
Claude 3 Opus est le modèle le plus puissant des trois mais également le plus onéreux : 15$ par million de tokens en entrée, 75$ par million de tokens générés. Il peut gérer des analyses complexes, des tâches plus longues comportant plusieurs étapes, des tâches mathématiques et de codage d’ordre supérieur.
Selon Anthropic :
“Il peut naviguer dans des invites ouvertes et des scénarios invisibles avec une fluidité remarquable et une compréhension humaine. Opus nous montre les limites extérieures de ce qui est possible avec l’IA générative”.
Les trois modèles ont une fenêtre contextuelle de 200 000 jetons d’entrée, pouvant aller jusqu’à 1 million pour des cas d’utilisation spécifiques.
Evaluations des performances des modèles Claude 3
Les modèles Claude 3 présentent des capacités accrues en matière d’analyse et de prévision, de création de contenu nuancé, de génération de code et de conversation dans des langues autres que l’anglais comme l’espagnol, le japonais et le français.
Selon les comparaisons d’Anthropic que l’on retrouve dans le tableau ci-dessous, Opus surpasse ses concurrents GPT-4 et Gemini Ultra sur la plupart des benchmarks d’évaluation courants des systèmes d’IA, notamment les connaissances expertes de premier cycle ( MMLU ou Massive Multitask Language Understanding), le raisonnement expert de niveau supérieur (GPQA) et les mathématiques de base (GSM8K).
Pour la start-up, il se rapproche de l’AGI :
“Il présente des niveaux de compréhension et d’aisance quasi-humains sur des tâches complexes, à la pointe de l’intelligence générale”.
Anthropic a tenu à préciser que des scores plus élevés pour un modèle GPT-4T plus récent avaient été rapportés.
Les trois modèles peuvent traiter un large éventail de formats visuels, notamment des photos, des tableaux, des graphiques et des diagrammes techniques. Cependant, ils ne peuvent pas générer d’images, ni traiter d’audio ou de vidéo.
Par rapport aux versions précédentes, ils font preuve d’une compréhension plus nuancée des demandes, et refusent beaucoup moins souvent de répondre à des invites inoffensives. Selon Anthropic, ils sont également beaucoup plus précis et leurs réponses plus fiables. Prochainement, il suffira de pointer sur les citations pour les retrouver dans le document traité par Claude 3.
Outre l’API Claude, Sonnet est également disponible via Amazon Bedrock et en avant-première privée sur Vertex AI Model Garden de Google Cloud, Opus et Haiku le seront également.
Anthropic conclut :
“Nous ne pensons pas que l’intelligence des modèles soit proche de ses limites et nous prévoyons de publier des mises à jour fréquentes de la famille de modèles Claude 3 au cours des prochains mois. Nous sommes également ravis de publier une série de fonctionnalités visant à améliorer les capacités de nos modèles, en particulier pour les cas d’utilisation en entreprise et les déploiements à grande échelle. Ces nouvelles fonctionnalités incluront l’utilisation d’outils (alias appel de fonction), le codage interactif (alias REPL) et des capacités agentiques plus avancées”.
Google, Anthropic et Mistral AI talonnent aujourd’hui OpenAI qui a amélioré les capacités de GPT-4 avec GPT-4 Turbo avec Vision et pourrait prochainement creuser de nouveau l’écart avec GPT-5.
IA générative Anthropic dévoile la 3ème génération de sa famille de modèles Claude
La génération de texte basée sur la récupération de connaissances (RAG) permet aux LLM de produire des textes informatifs et cohérents à partir de sources externes. Cependant, la qualité des textes générés dépend fortement de la pertinence des documents récupérés. Pour pallier à ce problème, des chercheurs proposent une méthode nommée “Corrective Retrieval Augmented Generation” (CRAG), qui améliore considérablement les performances des approches basées sur la RAG, donc la précision et la fiabili
La génération de texte basée sur la récupération de connaissances (RAG) permet aux LLM de produire des textes informatifs et cohérents à partir de sources externes. Cependant, la qualité des textes générés dépend fortement de la pertinence des documents récupérés. Pour pallier à ce problème, des chercheurs proposent une méthode nommée “Corrective Retrieval Augmented Generation” (CRAG), qui améliore considérablement les performances des approches basées sur la RAG, donc la précision et la fiabilité des LLM.
Les avancées récentes dans le domaine des modèles de langage ont permis des progrès significatifs dans la génération automatique de texte. Cependant, ces modèles ne sont pas exempts de défis, notamment en ce qui concerne l’exactitude des informations générées. Lorsque les modèles se basent uniquement sur leurs connaissances internes, acquises au cours de l’entraînement, ils peuvent générer des résultats inexacts ou incohérents.
La Génération Augmentée par Récupération (RAG) a été introduite en 2020 pour améliorer la pertinence des informations produites par les LLM. Elle permet au modèle d’utiliser des sources de données externes pour générer des réponses plus précises et à jour, réduisant ainsi le phénomène d’hallucinations.
Pour l’équipe, composée de chercheurs de l’Université de Science et Technologie de Chine, de l’Université de Californie et de Google Research, “Bien que la génération augmentée de récupération (RAG) soit un complément pratique aux LLM, elle repose fortement sur la pertinence des documents récupérés, ce qui soulève des inquiétudes quant à la façon dont le modèle se comporte si la récupération tourne mal”.
Ils proposent donc la CRAG, ou génération de récupération corrective augmentée, pour améliorer la robustesse de la génération basée sur la RAG en affinant les documents pertinents récupérés et en corrigeant ceux qui sont inexacts avec la recherche sur le Web.
La CRAG combine la RAG avec un mécanisme de correction automatique. Tout d’abord, un évaluateur de récupération léger est utilisé pour estimer la pertinence des documents récupérés par rapport à la requête d’entrée, et déclencher différentes actions de récupération de connaissances selon le degré de confiance : Correct, Ambigu, Incorrect.
Si les réponses sont ambigües ou incorrectes, des recherches sur le web à grande échelle permettent d’enrichir ou corriger les résultats de la RAG.
Les chercheurs ont également conçu un algorithme de décomposition-recomposition pour affiner les informations pertinentes dans les documents récupérés. La méthode est plug-and-play et peut être couplée avec diverses approches basées sur RAG.
Evaluations de la méthode
CRAG a été testé sur quatre jeux de données couvrant diverses tâches de génération :
PopQA : un ensemble de données utilisé pour évaluer les modèles de génération de texte sur des tâches de réponse à des questions de format court. Il comprend une collection de questions variées auxquelles les modèles doivent répondre en utilisant des connaissances factuelles ;
Bio (Biography) : Le jeu de données Bio est destiné à évaluer les modèles de génération de texte sur des tâches de génération de biographies détaillées. Il contient des informations sur différentes entités, et les modèles doivent générer des biographies précises et informatives sur ces entité ;
Pub : un jeu de données utilisé dans le domaine de la santé pour évaluer les modèles de génération de texte sur des tâches de vérification de faits et de réponse à des questions vrai ou faux. Il contient des affirmations sur des sujets liés à la santé, et les modèles doivent déterminer si ces affirmations sont vraies ou fausses ;
ARC (Arc-Challenge) : ARC est un ensemble de données composé de questions à choix multiples sur des phénomènes scientifiques de bon sens quotidiens. Les modèles doivent sélectionner la réponse correcte parmi plusieurs choix pour chaque question, en se basant sur leur compréhension du contexte scientifique.
Les expériences couplant CRAG avec RAG standard et Self-RAG démontrent largement sa capacité d’adaptation aux approches basées sur RAG, et celles menées sur les quatre ensembles de données démontrent son applicabilité à travers des tâches de génération de forme courte et longue.
CRAG représente une avancée significative dans le domaine de la génération de texte, permettant d’améliorer la robustesse des modèles de langage et de produire des textes plus précis et plus pertinents. Son adaptabilité à différentes tâches de génération de texte en fait une solution prometteuse pour de nombreuses applications du traitement du langage naturel dans divers domaines.
Auteurs: Shi-Qi Yan1, Jia-Chen Gu2, Yun Zhu3, Zhen-Hua Ling1 1 : National Engineering Research Center of Speech and Language Information Processing,
University of Science and Technology of China, Hefei, China
2 : Department of Computer Science, University of California, Los Angeles
3 : Google Research
Apple semble combler son retard par rapport à Microsoft, Google ou Meta en matière de GenAI. Après le LLM multimodal Ferret open source présenté en octobre dernier, ses chercheurs ont collaboré avec ceux l’Université de Californie à Santa Barbara pour développer le modèle MGIE (MLLM-Guided Image Editing), qui permet de modifier des images à partir d’instructions textuelles. L’équipe a présenté ses travaux dans un article sur arXiv qui a été sélectionné pour la Conférence internationale sur les r
Apple semble combler son retard par rapport à Microsoft, Google ou Meta en matière de GenAI. Après le LLM multimodal Ferret open source présenté en octobre dernier, ses chercheurs ont collaboré avec ceux l’Université de Californie à Santa Barbara pour développer le modèle MGIE (MLLM-Guided Image Editing), qui permet de modifier des images à partir d’instructions textuelles. L’équipe a présenté ses travaux dans un article sur arXiv qui a été sélectionné pour la Conférence internationale sur les représentations de l’apprentissage 2024 (ICLR).
Les modèles de langage multimodaux de grande taille (MLLMs) peuvent comprendre naturellement les images en entrée et fournir des réponses qui tiennent compte de la visualisation, agissant ainsi comme des assistants multimodaux.
Pour trouver une solution au défi rencontré lorsque les instructions données aux modèles d’édition d’image ne sont pas assez détaillées ou précises pour produire les résultats souhaités, MGIE utilise un MLLM et un modèle de diffusion pour dériver des instructions précises et fournir un guidage visuel explicite. En s’appuyant sur l’imagination visuelle, MGIE interprète l’intention derrière les invites ambiguës pour produire rapidement des modifications d’image cohérentes et pertinentes.
Par exemple, il peut comprendre une invite telle que “sain” en se basant sur le contexte pour effectuer des éditions appropriées, comme ajouter des garnitures de légumes à une pizza.
Il est également possible d’ajuster le contraste d’une image, d’en supprimer des éléments ou d’y en ajouter, et d’effectuer des modifications plus courantes telles que le recadrage, le redimensionnement, la rotation, le retournement et l’ajout de filtres.
Le MLLM est initialisé à partir de LLaVA-7B , tandis que le modèle de diffusion est initialisé à partir de StableDiffusion-v1.5. Les chercheurs mettent ensuite à jour conjointement ces deux modèles pour la tâche spécifique de l’édition d’image.
Vue d’ensemble de l’Édition d’Image Guidée par MLLM (MGIE), qui exploite les MLLMs pour améliorer la modification d’image basée sur les instructions. MGIE apprend à dériver des instructions expressives concises et fournit un guidage explicite lié à la visualisation pour l’objectif visé. Le modèle de diffusion est entraîné conjointement et réalise la modification d’image avec l’imagination latente à travers la tête de modification de manière bout à bout. et montre que le module est entraînable et figé, respectivement.
Evalué sur différents aspects de l’édition d’images, tels que la modification de style Photoshop, l’optimisation globale de la photo et l’altération locale des objets, sur plusieurs jeux de données, MGIE montre des améliorations significatives par rapport aux méthodes de base en termes de métriques automatiques et d’évaluation humaine.
Pour les chercheurs, il permet une retouche d’image raisonnable et peut contribuer à de futures recherche sur la vision et le langage.
OpenAI a récemment partagé sur son blog plusieurs améliorations concernant ses modèles d’incrustation et de modération de texte, ainsi que des mises à jour de ses modèles phares GPT-4 turbo et GPT-3,5 turbo. Ces innovations visent à offrir aux développeurs plus de performance, d’efficacité, de personnalisation et de sécurité dans leurs applications basées sur le langage naturel ou le code.
OpenAI avait publié la première version de GPT-4 en mars 2023, mise à la disposition de tous les développeu
OpenAI a récemment partagé sur son blog plusieurs améliorations concernant ses modèles d’incrustation et de modération de texte, ainsi que des mises à jour de ses modèles phares GPT-4 turbo et GPT-3,5 turbo. Ces innovations visent à offrir aux développeurs plus de performance, d’efficacité, de personnalisation et de sécurité dans leurs applications basées sur le langage naturel ou le code.
OpenAI avait publié la première version de GPT-4 en mars 2023, mise à la disposition de tous les développeurs au mois de juillet suivant. Lors de sa première conférence des développeurs, OpenAI DevDay, le 6 novembre dernier, la société lançait un aperçu de la prochaine génération de ce modèle : GPT-4 Turbo.
Différents utilisateurs se sont plaints du fait que ChatGPT refusait de répondre à leurs requêtes ou ne le faisait que partiellement, les invitant à compléter les réponses.
OpenAI postait sur X le 8 décembre dernier :
“Nous avons entendu tous vos commentaires sur le fait que GPT4 devient plus paresseux ! nous n’avons pas mis à jour le modèle depuis le 11 novembre, et ce n’est certainement pas intentionnel. Le comportement du modèle peut être imprévisible, et nous cherchons à y remédier”.
OpenAI a donc publié le 25 janvier dernier un modèle d’aperçu GPT-4 Turbo mis à jour, “gpt-4-0125-preview”, indiquant que “ce modèle effectue des tâches telles que la génération de code de manière plus approfondie que le modèle d’aperçu précédent et est destiné à réduire les cas de « paresse » lorsque le modèle n’effectue pas une tâche”.
Les bugs dus aux difficultés rencontrées par le précédent modèle d’aperçu lors de la génération de texte dans des langues autres que l’anglais sont également corrigés.
Mise à jour du modèle GPT-3.5 turbo
OpenAI a également annoncé la sortie cette semaine d’un nouveau modèle GPT-3.5 Turbo, avec des prix réduits (coût des requêtes divisé par 2) et des améliorations de performance. Cette mise à jour vise à fournir une précision accrue des réponses et à corriger les problèmes de codage rencontrés dans la version antérieure, offrant ainsi une expérience améliorée aux utilisateurs.
Deux nouveaux modèles d’embedding à des prix inférieurs
Un embedding est une séquence de chiffres qui représente les concepts d’un contenu tel que le langage naturel ou le code. Les intégrations permettent aux modèles d’apprentissage automatique et à d’autres algorithmes de comprendre facilement les relations entre le contenu et d’effectuer des tâches telles que le regroupement ou la recherche. Ils alimentent des applications telles que la récupération de connaissances dans ChatGPT et l’API Assistants, ainsi que de nombreux outils de développement de génération augmentée de récupération (RAG).
OpenAI lance deux nouveaux modèles d’incrustation de texte : un modèle plus petit et très efficace, embedding-3-small, et un modèle plus grand et plus puissant, embedding-3-large. Ces modèles, plus performants et moins coûteux que leur prédécesseur, embedding-ada-002, offrent aux développeurs la possibilité de choisir la taille des incrustations en fonction des besoins spécifiques de leurs applications. Cette flexibilité accrue permet aux développeurs d’optimiser les performances tout en maîtrisant les coûts associés à l’utilisation des modèles d’IA.
Une meilleure gestion des clés API
Les développeurs bénéficient désormais de nouvelles fonctionnalités de gestion des clés API, leur permettant d’attribuer des autorisations spécifiques et de suivre l’utilisation des API de manière plus détaillée. Ces améliorations offrent un meilleur contrôle et une meilleure visibilité sur l’utilisation des ressources d’IA, facilitant ainsi la gestion des projets et des budgets.
OpenAI précise qu’il prévoit les mois prochains d’améliorer encore la capacité des développeurs à afficher leur utilisation des API et à gérer les clés d’API, en particulier dans les grandes entreprises.
Mise à jour du modèle de modération
OpenAI a introduit un nouveau modèle de modération plus robuste, permettant d’identifier les textes potentiellement dangereux avec une plus grande précision. Selon OpenAI, cette mise à jour témoigne de son engagement envers la sécurité et la fiabilité de ses produits, assurant ainsi une expérience utilisateur sûre et positive.