Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierBoyaux de la tête
  • ✇InternetActu.net
  • L’IA vise à accélérer la décision, bien plus qu’à l’améliorer !
    « Les gens ne prennent pas de meilleures décisions lorsqu’ils disposent de plus de données, alors pourquoi supposer que l’Intelligence artificielle, elle, le fera ? », interroge l’ingénieure et anthropologue Marianne Bellotti (blog, @bellmar) dans un article pour OneZero. Bellotti, longtemps responsable technique des Services numériques des États-Unis (@USDS), est désormais responsable du Humanitarian Data Exchange (HDX), la plus grande plateforme de données ouvertes de l’ONU sous l’égide du Cen

L’IA vise à accélérer la décision, bien plus qu’à l’améliorer !

6 janvier 2022 à 06:00

« Les gens ne prennent pas de meilleures décisions lorsqu’ils disposent de plus de données, alors pourquoi supposer que l’Intelligence artificielle, elle, le fera ? », interroge l’ingénieure et anthropologue Marianne Bellotti (blog, @bellmar) dans un article pour OneZero. Bellotti, longtemps responsable technique des Services numériques des États-Unis (@USDS), est désormais responsable du Humanitarian Data Exchange (HDX), la plus grande plateforme de données ouvertes de l’ONU sous l’égide du Centre pour les données humanitaires (@humdata).

Couverture du livre de Marianne Bellotti, Kill it with FireElle est également l’auteure d’un récent livre sur la gestion de projets informatiques : Tuez-les par le feu, comment gérer les systèmes informatiques vieillissants (et assurer l’avenir des systèmes modernes) (No Starch Press, non traduit, 2021) – un livre, qui, contrairement à ce que laisse croire son titre, ne propose pas de mettre à la poubelle les systèmes obsolètes – Bellotti est plutôt réputée pour avoir remis en état de fonctionnement des systèmes informatiques anciens et désordonnés -, mais au contraire, comme l’explique Jennifer Pahlka (@pahlkadot, blog), la directrice de Code for America dans un passionnant compte-rendu, faire table rase d’un système pour un nouveau permet surtout à la désorganisation qui a conduit à créer un mauvais système de se reproduire.

Dans l’introduction de son article pour OneZero, Bellotti revient sur un événement qu’on dit souvent fondateur de l’internet moderne (événement qu’avait raconté Tamsin Shaw dans la New York Review, traduit par Books), à savoir cette fameuse journée de 2008, où plusieurs Moghuls de la Silicon Valley avaient découverts l’économie comportementale sous les explications de Daniel Kahneman lui-même, prix Nobel et auteur de Système 1 / Système 2 (Flammarion, 2012). En comprenant comment les êtres humains prennent des décisions, l’histoire voudrait que les grands patrons de la Silicon Valley présents se soient alors mis à appliquer ces connaissances aux outils qu’ils développaient. Comme le souligne Bellotti, visiblement, lors de cette journée, personne n’a pourtant parlé d’intelligence artificielle ou de Big Data… Ce qui était au cœur de la conférence de Kahneman consistait à décortiquer la croyance qu’un agent (humain plus que machine) soit capable de prendre des décisions rationnelles. En tout cas, estime Bellotti, peut-être que certains entrepreneurs de la Silicon Valley présents à cette conférence ont compris que l’enjeu n’était pas tant d’obtenir des données ou des machines parfaites, mais bien de prendre en compte les préjugés qui nous façonnent. « Au lieu d’éliminer les préjugés humains, (l’enjeu était) d’organiser la technologie autour de ces préjugés ».

Le rêve que d’innombrables flux de données produisent une meilleure connaissance est aussi vieux que les ordinateurs eux-mêmes. Mais, quelle que soit la quantité de données que nous recueillons, la vitesse ou la puissance des machines, ce rêve semble toujours hors de portée, explique Bellotti. Les experts estiment que les spécialistes des données passent 80 % de leur temps à les nettoyer. Le ministère de la Défense américain dépense entre 11 et 15 milliards par an pour le personnel qui gère ses données. Pourtant, malgré des décennies d’investissements, de surveillance, de normes… « nous ne sommes pas plus près d’une connaissance totale grâce à un cerveau informatisé que nous ne l’étions dans les années 70 », malgré l’accroissement continu des données. Le retour sur investissement de l’IA semble aussi difficile à atteindre, pour le ministère de la Défense que pour les grandes plateformes de la Silicon Valley qui pataugent dans les imperfections de leurs outils de modération automatisés.

Copie d'écran de l'article de Bellotti pour One Zero
Image : l’article de Marianne Bellotti original pour One Zero : l’IA résout le mauvais problème.

La compréhension totale d’une situation est moins désirable que des outils permettant de prendre une décision plus rapide

Pour Bellotti, nous attendons de l’IA qu’elle produise une meilleure prise de décision par une connaissance « totale » d’une situation. Pourtant, comme le rappellent les travaux de Kahneman lui-même, en savoir plus ne signifie pas prendre une meilleure décision. « Dans la vie réelle, les décideurs cherchent surtout à économiser leurs efforts », rappelle l’ingénieure en pointant vers les travaux de Todd et Benbasat. « Une connaissance totale de la situation est moins souhaitable que des outils qui facilitent le travail d’équipe menant à une décision. Après tout, les décisions sont souvent jugées en fonction des résultats, ce qui inclut un peu de chance ainsi qu’une analyse correcte. Avant que ces résultats ne se concrétisent, même la stratégie la plus prudente et la plus minutieuse, étayée par les meilleures données, ne peut offrir de garantie, et toutes les personnes concernées le savent. C’est pourquoi le processus de prise de décision consiste moins en une analyse objective des données qu’en une négociation active entre des parties prenantes ayant des tolérances différentes en matière de risques et de priorités », explique-t-elle en faisant référence aux travaux de Lucia Matinez Ordonez. « Les données sont utilisées non pas pour les informations qu’elles pourraient offrir, mais comme un bouclier pour protéger les parties prenantes des retombées possibles », rappelle-t-elle en faisant référence au livre de Christopher Hood, spécialiste des politiques publiques, The Blame Game (Princeton University Press, non traduit, 2011, extrait.pdf). Une information parfaite – si tant est qu’elle soit réalisable – soit n’apporte aucun avantage, soit réduit la qualité des décisions en augmentant le niveau de bruit.

Cela semble invraisemblable, et pourtant ! « Une information parfaite devrait automatiquement améliorer le processus de décision. Mais ce n’est pas le cas, car un supplément d’informations modifie rarement la politique organisationnelle qui sous-tend une décision », explique Bellotti.
« Tant que les décisions devront être prises en équipe, en tenant compte des différentes parties prenantes et de leurs incitations, la meilleure façon d’améliorer la prise de décision ne consistera pas simplement à ajouter des capteurs pour obtenir plus de données. Il faut améliorer la communication entre les parties prenantes. »

Pour Marianne Bellotti, l’enjeu n’est peut-être pas d’investir des milliards de dollars pour nettoyer les données et affûter les capteurs, mais de nous intéresser plus avant à l’organisation de la communication et aux règles de décisions entre les parties !

Pour une IA antifragile

Améliorer la qualité des données n’est pas si simple. « La façon dont nous parlons de la qualité des données est trompeuse. Nous parlons de données « propres » comme s’il existait un état unique où les données sont à la fois exactes (et sans biais) et réutilisables. Or, propre n’est pas synonyme d’exact, et exact n’est pas synonyme d’exploitable. Des problèmes sur l’un ou l’autre de ces vecteurs peuvent entraver le développement d’un modèle d’IA ou nuire à la qualité de ses résultats. Il existe de nombreuses raisons pour lesquelles les données qui entrent dans un modèle peuvent être problématiques. Certaines sont évidentes : les données sont factuellement incorrectes, corrompues ou dans un format inattendu. D’autres problèmes sont plus nuancés : les données ont été capturées dans un contexte particulier et sont réutilisées de manière inappropriée ; les données n’ont pas le bon niveau de granularité pour l’objectif du modèle ; ou les données ne sont pas normalisées, et les mêmes faits sont représentés ou décrits de différentes manières. »

S’il est déjà difficile de résoudre un de ces problèmes, il est pratiquement impossible de les résoudre tous dans une grande organisation ou dans un environnement complexe. Depuis l’IA, nous avons souvent tendance à croire que l’innovation crée des opportunités, oubliant de souligner qu’elle crée aussi des vulnérabilités. « L’intelligence artificielle inventera de nouvelles façons d’attaquer les problèmes, mais aussi de nouvelles façons d’être attaqué. Tout comme la numérisation des centrales électriques, des transports publics et des systèmes de communication a donné naissance à la cybercriminalité », l’IA risque de créer de nouvelles formes de défaillances. « Les systèmes d’IA actuels sont complètement dépendants de la qualité de leurs données, non pas parce que la technologie est immature ou cassée, mais parce que nous les avons conçus pour qu’ils soient vulnérables de cette manière. »

Couverture du livre Antifragile de Nassim Nicolas TalebNous devons les rendre plus résistants aux mauvaises données, « antifragiles », pour reprendre le concept forgé par Nassim Nicolas Taleb (@nntaleb) dans son livre éponyme. Antifragile désigne une conception qui non seulement sait se remettre d’un échec, mais surtout qui devient plus forte et plus efficace lorsqu’elle est exposée à l’échec. Les sciences cognitives nous apprennent que les bonnes décisions sont « le produit de l’articulation proactive des hypothèses, de la structuration des tests d’hypothèse pour vérifier ces hypothèses et de l’établissement de canaux de communication clairs entre les parties prenantes ». À l’inverse, les mauvaises décisions, les erreurs humaines, sont le résultat d’un blocage, d’un biais, sur l’une de ces trois conditions. « Lorsque les gens ne formulent pas clairement leurs hypothèses, ils appliquent des solutions qui sont inappropriées compte tenu des conditions du terrain. Lorsque les gens ne testent pas leurs hypothèses, ils ne parviennent pas à adapter leurs bonnes décisions aux conditions changeantes. Lorsque les opérateurs de première ligne ne sont pas en mesure de partager efficacement les informations en amont de la chaîne de commandement et entre eux, les occasions de repérer les conditions changeantes et de remettre en question les hypothèses sont perdues, au détriment de tous. »

Pour des IA qui élargissent les choix plutôt que de les réduire !

Si l’IA est si vulnérable aux mauvaises données c’est parce que « nous accordons trop d’importance à ses applications de classification et de reconnaissance et pas assez à ses applications de suggestion et de contextualisation ». En d’autres termes, explique Bellotti, une IA qui prend des décisions à la place des gens est une IA qui peut être sabotée facilement et à peu de frais.

La conception d’une IA antifragile est difficile, car la ligne de démarcation entre l’acceptation du résultat de l’analyse d’un algorithme comme une conclusion et son traitement comme une suggestion ou une incitation est un défi de conception – c’est la question sur laquelle Ben Green attirait notre attention récemment, nous invitant à évaluer les outils d’aide à la décision, mais également les décisions prises depuis eux. Pour Bellotti, le piège repose dans le risque de considérer les résultats des IA comme des conclusions. Cela ne conduit qu’à des erreurs catastrophiques, comme l’a montré l’usage de l’IA à la justice pénale ou au maintien de l’ordre. « Le modèle a été construit pour contextualiser, mais l’interface utilisateur a été construite pour rapporter une conclusion », soutient Bellotti qui réduit peut-être un peu rapidement le problème à une question d’interface, de design, oubliant un peu rapidement l’idéologie politique et financière qui soutient le déploiement de ces solutions.

Dans le même temps, bien souvent, l’IA médicale, elle, a permis d’améliorer la qualité de la prise de décision – enfin, pas toujours, nombre de systèmes d’IA en santé sont avant tout défaillants -, d’abord parce que de nombreux défis diagnostiques n’ont pas de réponse correcte unique (tout comme les résultats de l’IA, largement statistique, probabiliste et inductive, comme l’expliquait, très clairement David Weinberger). En matière de diagnostic, tout un ensemble de symptômes a une série de causes possibles avec des probabilités différentes. Un clinicien construit un arbre de décision dans sa tête avec toutes les possibilités auxquelles il peut penser et les tests qui excluent certaines possibilités. Le processus de diagnostic d’un patient consiste à créer un cycle consistant à définir des hypothèses, à prescrire des tests et à réduire de plus en plus l’ensemble des réponses possibles jusqu’à ce qu’une solution soit trouvée.

Ainsi, les produits conçus pour aider les médecins en leur proposant d’autres possibilités à ajouter à leurs modèles mentaux et en identifiant les tests susceptibles d’accélérer le temps nécessaire à l’établissement d’un bon diagnostic ont permis d’améliorer les résultats de diagnostic des patients en dépit de mauvaises données. Dans ces cas, l’IA a été utilisée pour améliorer la communication et le partage des connaissances entre les professionnels de la santé ou pour obtenir du patient des informations nouvelles et pertinentes à des moments critiques. À l’inverse, les produits d’IA qui tentent de surpasser les médecins en classant les éléments à leur place, comme en tentant de déterminer si une tumeur est cancéreuse ou pas ou si des tâches pulmonaires sur une radio sont relatives au Covid ou pas, ont surtout été confrontés aux mauvaises données qui les alimentaient.

Pour Bellotti, « si l’objectif de l’IA est d’améliorer la prise de décision, alors elle devrait orienter les décideurs vers des tests d’hypothèses, et non essayer de surpasser les experts. Lorsque l’IA tente de surpasser les experts, elle devient entièrement dépendante de la qualité des données qu’elle reçoit, ce qui crée un ensemble de vulnérabilités » difficilement surmontables. Une IA antifragile ne doit pas prendre de décision, mais aider à élargir les choix. Elle devrait plutôt aider « les gens à formuler les hypothèses qui sous-tendent la décision, à communiquer ces hypothèses à d’autres parties prenantes et à alerter les décideurs en cas de changements importants dans les conditions du terrain en rapport avec ces hypothèses ».

Ralentir l’IA ?

Dans un billet de blog précédent Marianne Bellotti proposait d’améliorer l’IA en la rendant plus lente ! Si, très concrètement et trop souvent, l’IA accélère le processus de décision, son but devrait plutôt être de le ralentir explique-t-elle. En 2020, Marianne Bellotti a rejoint une entreprise qui travaille dans le secteur de la défense. Une décision difficile, parce que les technologies de Défense sont un environnement riche en dilemmes éthiques et qu’il est pour beaucoup plus préférable de garder les mains propres en évitant toute implication ou compromission avec ce secteur. Une occasion pour Marianne Bellotti d’interroger concrètement ce sujet de l’éthique. « Tout le monde dans la communauté technologique parle de construire des produits « éthiques » et personne ne peut vraiment définir en quoi un processus de développement de logiciels qui produit des produits éthiques est différent d’un processus qui produit des produits normaux ». Et Bellotti de préciser : « Je ne suis pas le genre de personne qui croit que les résultats sont déterminés par la qualité des personnes. Les meilleurs ingénieurs construisent parfois ensemble des technologies de merde. Les équipes ne sont pas la somme de leurs parties. Il ne suffit pas de réunir une collection de personnes réfléchies pour qu’elles construisent une technologie éthique ». Par contre, les équipes sont toujours la somme de leurs interactions. Or, explique-t-elle, elle aime concevoir des processus efficaces, et c’est dans ces processus formels et informels qu’on doit pouvoir construire des réponses éthiques.

Capture d'écran du billet de blog original de Marianne BellottiImage : capture d’écran de l’article de blog original de Marianne Bellotti, pour faire un meilleure IA il faut une IA plus lente.

Cette entreprise spécialisée dans l’IA et la Défense organise chaque mois une réunion permanente à l’échelle de l’organisation pour discuter éthique. Plutôt que de distinguer outils offensifs et défensifs, ces discussions se sont concentrées sur l’idée de distinguer l’escalade et la désescalade d’un conflit. « Une technologie responsable dans le domaine de la défense est une technologie qui aide les gens à réfléchir de manière plus approfondie et plus critique aux choix qui s’offrent à eux. Une technologie irresponsable les encourage à tirer des conclusions hâtives ou les laisse si loin de la réalité sur le terrain qu’elle déshumanise les personnes qui sont affectées par le déploiement de cette technologie. » Mais comment concevoir une IA qui désamorce les situations ?

Des IA pour désamorcer les situations

Les spécialistes de l’IA éthique insistent souvent sur l’importance à garder « l’humain dans la boucle », c’est-à-dire à la fois faire que les décisions prises par les systèmes soient toujours contrôlées par des humains. Ce principe d’humains dans la boucle – qui édulcore et dépolitise le « Pas pour nous sans nous » des revendications militantes, à mon sens – est un principe efficace lorsqu’il s’agit de conception politique, estime Bellotti, mais il est plus difficile à mettre en œuvre dans la conception de technologies, notamment parce par nature, elles redistribuent la manière dont le travail humain est appliqué dans un processus. Ainsi, lorsqu’une technologie est introduite dans une tâche existante, certaines étapes sont automatisées et le travail humain est redistribué… Mais il est souvent difficile de savoir si le fait de déplacer le contrôle humain dans le processus met le contrôle humain hors circuit ou non.

Couverture du livre de Daniel Kahneman Systeme 1 / Systeme 2Pour sortir de la contradiction, il est nécessaire de revenir aux différences entre la pensée humaine et la pensée informatique, explique-t-elle en revenant justement à Daniel Kahneman. Dans Système 1 / Système 2, Kahneman distingue la pensée intuitive (le type 1), rapide, qui se base principalement sur la correspondance des modèles et la pensée analytique (le type 2), lente, souvent de nature statistique qui vise à corriger les erreurs de la première. Contrairement aux humains, pour les ordinateurs, la pensée analytique leur est facile alors que la pensée intuitive ne leur est pas facilement accessible. Or, trop de produits d’IA visent à accélérer la pensée de type 1 pour les opérateurs humains, alors qu’elle n’est pas adaptée à cela. Pour Bellotti, la ligne de démarcation entre les produits d’IA bénéfiques et ceux qui créent des problèmes repose certainement dans une forme d’accélération. Or, accélérer les décisions intuitives n’apporte souvent aucun avantage supplémentaire à l’utilisateur, mais augmente considérablement les risques d’erreur critique. « Si les êtres humains ont du mal avec la pensée de type 2 et excellent dans la pensée de type 1, si les ordinateurs ont du mal avec la pensée de type 1 et excellent dans la pensée de type 2, et si une bonne prise de décision implique l’utilisation de la pensée de type 2 pour vérifier les erreurs de la pensée de type 1, pourquoi construisons-nous des machines pour faire la pensée de type 1 à notre place ? N’est-il pas beaucoup plus utile d’utiliser les ordinateurs pour rendre la réflexion lente plus efficace en termes de ressources plutôt que de rendre la réflexion rapide plus rapide ? »

Pour une IA qui complexifie plutôt qu’une IA qui simplifie !

« Plus j’explore la question de l’IA et de l’éthique, plus je comprends l’importance de la sélection des problèmes », explique Bellotti. Et la chercheuse de donner un exemple concret en comparant deux systèmes de calcul automatisé du risque de récidive : Compas, cette machine à biais, très légitimement décrié et très utilisé par la justice américaine (voir notamment notre dossier sur la justice analytique) et un autre outil, ESAS (pour Equity in sentencing analysis system, un logiciel qui donne accès aux peines similaires prononcées dans des affaires antérieures selon des antécédents de condamnation proche). Les deux technologies semblent adresser le même problème : faire des recommandations sur les peines depuis des historiques. D’un côté, Compas analyse de nombreuses données, notamment personnelles, pour en tirer des conclusions simples que le juge peut ignorer, mais ne peut pas approfondir ou contester. ESAS en revanche, se concentre uniquement sur les informations relatives et permet d’accéder à des affaires similaires pour explorer le contexte des peines qui ont été produites, permettant de comprendre ce qui dans un cas explique ce qui a valu une longue peine ou une peine plus clémente. Compas fait un raisonnement de type 1 pour le juge, et parce que les données et systèmes de calculs utilisés sont cachés, le raisonnement de type 2 qui permettrait de vérifier les biais et erreurs d’appréciations est lui totalement bloqué. Pire, souligne Bellotti, Compas attribue une valeur numérique à ses recommandations. Un repris de justice n’est pas seulement à haut risque, il est à haut risque sur une échelle qui produit un biais d’ancrage sur l’utilisateur qui y est par nature sensible (donnez à quelqu’un un chiffre élevé, et même s’il pense que ce chiffre élevé est faux, le chiffre par lequel il le remplace sera plus élevé que celui qu’il aurait estimé autrement). Compas « automatise la pensée de type 1, sujette aux erreurs, empoisonne le jugement de l’utilisateur avec une valeur d’ancrage arbitraire et empêche la pensée de type 2 de détecter les problèmes. » Dans la définition du problème par Compas, se trouve également le monstre d’une hypothèse très problématique : une personne à haut risque de récidive sera rendue moins susceptible de récidiver en lui donnant une peine de prison plus longue ! Compas ne considère pas que la relation pourrait être inverse : les personnes qui passent plus de temps en prison se déconnectent des réseaux de soutien sociaux et sont plus susceptibles de récidiver pour survivre… « C’est le danger de remplacer la pensée de type 1 faite par des humains par une pensée de type 1 faite par des ordinateurs. Les ordinateurs peuvent calculer une corrélation, mais ils ne peuvent pas construire une narration autour d’elle pour transformer cette corrélation en informations exploitables. Par conséquent, même les meilleurs algorithmes ont besoin d’êtres humains pour prendre en compte le contexte de leurs résultats. L’IA qui supprime ce contexte vit ou meurt en fonction de la précision de son modèle. »

À l’inverse, les premiers de l’ESAS en Floride ont montré qu’en associant un cas à une série de cas comparables et en permettant aux utilisateurs d’explorer les contextes, ont plutôt conduit à réduire les peines qu’à les renforcer.

Les récits sur l’IA et sur les technologies insistent beaucoup sur ce qui est remplacé par la technologie et l’IA plutôt que ce qu’elle redistribue. « L’impact et l’efficacité finale de tout produit qui utilise l’IA ne sont donc pas déterminés par les algorithmes qu’il utilise, mais par la manière dont il redistribue l’effort humain. Crée-t-il plus d’opportunités pour la pensée critique ou encourage-t-il plus d’action avec moins de réflexion et de discussion ? » Les ingénieurs qui construisent des outils d’IA doivent porter attention à l’interaction homme-machine, insiste-t-elle. « L’IA qui fait de la pensée de type 1 pour l’utilisateur et bloque la pensée de type 2 conduit généralement à des résultats désastreux. L’IA qui augmente les possibilités de réflexion de type 1 et encourage l’utilisateur à ajouter la vérification des erreurs de type 2 à la réflexion de type 1 de la machine, tend à augmenter l’utilité. »

Pour le dire très simplement, si l’IA ne nous aide pas à réfléchir, elle ne nous sera d’aucune utilité.

Hubert Guillaud

Et merci à Matthieu Belbèze (@lemarsographe, newsletter) pour m’avoir conduit jusqu’aux articles de Marianne Bellotti, grâce à son article pour Le Vent se lève (@lvslmedia), que je vous recommande vivement : « La révolution numérique est profondément conservatrice ».

  • ✇InternetActu.net
  • L’évaluation de la gouvernementalité algorithmique ne peut pas être uniquement technique !
    Les organismes de réglementation ont visiblement compris qu’ils doivent réglementer la manière dont les autorités utilisent les algorithmes et les technologies d’IA. Mais ce que les régulateurs oublient trop souvent quand ils élaborent des politiques, c’est de tenir compte de la manière dont les décideurs humains interagissent avec les systèmes, explique Ben Green (@benzevgreen) dans une tribune pour The Hill (@thehill). Chercheurs, journalistes, militants… n’ont cessé ces dernières années de ré

L’évaluation de la gouvernementalité algorithmique ne peut pas être uniquement technique !

30 septembre 2021 à 07:00

Les organismes de réglementation ont visiblement compris qu’ils doivent réglementer la manière dont les autorités utilisent les algorithmes et les technologies d’IA. Mais ce que les régulateurs oublient trop souvent quand ils élaborent des politiques, c’est de tenir compte de la manière dont les décideurs humains interagissent avec les systèmes, explique Ben Green (@benzevgreen) dans une tribune pour The Hill (@thehill). Chercheurs, journalistes, militants… n’ont cessé ces dernières années de révéler combien les systèmes algorithmiques utilisés par les tribunaux, la police, les services d’éducation, de protection sociale et autres, sont bourrés d’erreurs et de biais. Aux États-Unis, deux projets de loi proposent d’imposer aux administrations d’évaluer les algorithmes avant de pouvoir les utiliser. Le projet de loi sur l’IA de la commission européenne va dans le même sens. Mais, souligne Green, si examiner les systèmes est certes nécessaire, ces dispositions oublient la manière dont les prédictions affectent les décisions politiques.

Les outils d’aide à la décision améliorent-ils la décision ?

Bien souvent, les algorithmes sont proposés comme des outils d’aide à la décision aux personnes qui les prennent. Reste que leurs décisions doivent équilibrer les prédictions que les systèmes fourbissent avec d’autres objectifs concurrents qui ne sont, eux, pas pris en compte par les machines. Green prend l’exemple des systèmes d’évaluation des risques qu’un prévenu ne se présente pas à son procès, très utilisé par les tribunaux américains. Pour ceux en charge de juger les prévenus, ces prévisions, pour autant qu’elles soient précises et justes – ce dont doutent nombre de défenseurs des droits et de chercheurs qui les ont étudiés -, doivent s’équilibrer d’autres intérêts, comme la présomption d’innocence. Pour Green, la question centrale qui est très souvent oubliée n’est pas seulement de savoir si les prédictions sont justes, mais aussi et surtout, de savoir si ces systèmes améliorent la décision humaine. Or, même si ces systèmes proposent des prédictions, ils n’améliorent pas nécessairement la décision. Quand on leur présente ces évaluations, bien souvent, les humains ont tendance à être plus attentifs au fait de réduire le risque justement, au détriment d’autres valeurs, changeant la manière même dont ils prennent leurs décisions, explique Green à la suite d’une étude expérimentale. Dans la pratique, ces systèmes imposent leurs choix, leur angle, leur vision… d’une certaine manière, leur idéologie. Reste que trop souvent, leur premier effet est d’altérer les processus de prise de décision. Même si dans l’étude de Green, les effets de ces outils semblent assez faibles, ils n’en sont pas moins là (et ce d’autant que l’altération de la décision est difficile à apprécier). Dans le domaine judiciaire américain, plusieurs études ont montré que les juges ont tendance à passer outre les recommandations de remises en liberté que proposent ces outils ! En fait, les juges semblent devenir plus sévères que les systèmes, parce que les systèmes leur mettent sous les yeux le risque plutôt que l’esprit des lois, comme la présomption d’innocence. En fait, les systèmes aggravent la partialité des juges en les rendant sur-attentifs aux risques !

Dans un autre article de recherche, Green souligne un autre problème, celui de la surveillance humaine des décisions algorithmiques que de plus en plus de réglementations imposent. Or, explique le chercheur, derrière ces décisions, bien souvent, les personnes sont incapables de remplir les fonctions de surveillance qui leur sont attribuées. Green estime par exemple que nous devrions calculer le taux de dérogation c’est-à-dire quand la décision n’est pas conforme à la suggestion de l’algorithme pour savoir si le processus décisionnel est automatisé ou pas.

Cette surveillance des systèmes trop souvent légitime le recours à des algorithmes défectueux, sans aborder réellement les problèmes qu’ils génèrent. Pour le chercheur, la surveillance des algorithmes donne un faux sentiment de sécurité. Pour Green, il est essentiel de s’interroger d’abord sur la nécessité du déploiement et surtout d’évaluer l’efficacité du contrôle humain des traitements, explique-t-il en rappelant la nécessité d’une meilleure évaluation, non seulement technique, mais plus encore humaine. Les politiques se doivent d’être plus rigoureuses, estime-t-il, et surtout, elles ne doivent pas seulement étudier les biais techniques des systèmes, mais aussi prendre en compte la relation homme-algorithmes et les biais qu’elle génère.

Or, rappelle le chercheur, les réglementations sur l’éthique des systèmes se concentrent uniquement sur la façon dont le calcul fonctionne. Les systèmes d’évaluation de la responsabilité algorithmique ou d’impacts évaluent une responsabilité « technique » plus qu’humaine, sans tenir compte des relations tissées avec les systèmes.

Aussi précis ou juste que le calcul soit – et il ne l’est pas souvent -, il modifie la façon de décider. En fait, ces outils génèrent des changements qui déséquilibrent l’évaluation qui est au cœur même de la prise de décision. Pour Green, la question de l’évaluation de l’IA devrait nécessiter des preuves empiriques sur ses effets, c’est-à-dire qu’elle devrait également démontrer que ces systèmes sont susceptibles d’améliorer la prise de décision. Pour cela nous devrions réaliser des évaluations expérimentales sur la collaboration homme-algorithmes, en testant comment les gens interagissent avec le système pour s’assurer qu’il produit les résultats escomptés.

Evaluer les outils de la décision, mais également la décision

L’évaluation est trop souvent encore le parent pauvre de la réglementation. Au mieux, elle reste technique. Mais bien souvent, elle reste aveugle aux impacts concrets de ces outils sur ceux qui les utilisent, suggère Green qui invite à non seulement évaluer les outils de la décision, mais également leurs impacts sur la décision.

Le constat de Green souligne combien, alors que les systèmes techniques s’imposent, l’évaluation de leurs effets concrets, elle, n’est pas à la hauteur. Derrière les biais des calculs, nous devons nous préoccuper d’autres formes d’évaluation – comme le propose les méthodes développées pour que la politique fasse la preuve de son efficacité (on parle d’evidence-based policymaking). Le gouvernement britannique a initié en ce sens un réseau d’évaluation des politiques publiques, le « What Works Network », dont l’une des branches, par exemple, a évalué les systèmes d’identification automatisés des enfants à risque par les services à l’enfance, en pointant leur inefficacité manifeste. Les États-Unis viennent de lancer une plateforme dédiée à l’évaluation des politiques publiques, rapportait récemment Federal News Network. Malgé les recommandations émises par le Conseil d’État en septembre 2020 pour améliorer l’évaluation des politiques publiques, si l’on en croit l’état du site dédié à l’évaluation en France, la priorité donnée à l’évaluation n’est pas encore là ! Si des efforts ont été initiés pour l’évaluation par les usagers des services publics – via des indicateurs de performance et de satisfaction, à l’image de ceux disponibles sur resultats-services-publics.fr ou voxusagers.gouv.fr -, la question – bien plus importante, il me semble – d’une meilleure évaluation des politiques publiques selon leurs effets semble encore avoir des marges de progrès.

Hubert Guillaud

Le portail de l'évaluation publique français

PS : Sur LPE, Frank Pasquale annonce la tenue prochaine aux Etats-Unis d’un symposium sur l’analyse coût/bénéfice. Les méthodes quantitatives promettent d’apporter la rigueur et l’objectivité à l’évaluation des politiques publiques, mais dans les faits, leurs applications accélèrent souvent les injustices et les discriminations. Dès janvier 2021, l’administration Biden a annoncé vouloir « moderniser les modalités d’évaluations réglementaires ». Les initiatives réglementaires importantes sont de plus en plus souvent sommées de produire une analyse comparative de leurs coûts et avantages. Si ces initiatives semblent rationnelles (les coûts d’une réglementation ne doivent pas dépasser ses avantages), ces outils ont souvent été utilisés pour limiter la réglementation plutôt que pour améliorer son efficacité. Enfin, souligne Pasquale, tout est-il quantifiable ? Quelle est la valeur monétaire d’une journée sans aucune pollution au Grand Canyon ou d’une ressource naturelle ? À nouveau, la quantification n’a rien de neutre et ne peut être le seul mode d’évaluation des politiques publiques.

  • ✇InternetActu.net
  • Utiliser l’IA pour détecter ses propres biais ?
    Pour les ingénieurs, bien souvent, la question des biais algorithmiques n’est qu’un problème technique à corriger. Le fait qu’une IA ne soit ni neutre, ni loyale, ni équitable n’est finalement qu’une question de modélisation à ajuster, de données à corriger, de calculs à améliorer… Pour remédier aux discriminations, il suffirait finalement de calculer des mesures correctrices proportionnelles au niveau de discrimination, une discrimination positive en quelque sorte. Ce n’est peut-être pas si sim

Utiliser l’IA pour détecter ses propres biais ?

7 juillet 2021 à 07:00

Pour les ingénieurs, bien souvent, la question des biais algorithmiques n’est qu’un problème technique à corriger. Le fait qu’une IA ne soit ni neutre, ni loyale, ni équitable n’est finalement qu’une question de modélisation à ajuster, de données à corriger, de calculs à améliorer…

Pour remédier aux discriminations, il suffirait finalement de calculer des mesures correctrices proportionnelles au niveau de discrimination, une discrimination positive en quelque sorte. Ce n’est peut-être pas si simple…

Kate Crawford (@katecrawford) le disait très bien : quelle correction appliquée ? La question est bien plus compliquée qu’une correction relative à des problèmes de physique, comme de corriger les turbulences d’un avion ou le freinage d’une voiture. Modéliser la société n’est pas la même chose que modéliser des problèmes de physique, disait déjà le physicien Pablo Jensen

Reste que la question de la correction des biais des systèmes fait de plus en plus l’objet d’une attention forte des autorités. Et trouver les préjugés de l’IA est devenue une activité en plein essor pour les startups et les grands noms de la technologie, rapporte le journaliste Cade Metz (@cademetz, qui vient de publier Genius Makers, Penguin, 2021) dans le New York Times.

Le National Institute of Standards and Technology a publié récemment une proposition détaillant la manière dont les entreprises peuvent lutter contre les préjugés de leurs systèmes. Fin 2019, les régulateurs de l’État de New York ont ouvert une enquête contre United Health Group accusé d’avoir utilisé un algorithme dans des hôpitaux qui donnait la priorité aux patients blancs sur les patients noirs (et ce n’est pas le seul exemple des problèmes que l’usage de l’IA en médecine pose, cf. notre article « En médecine, l’IA est en plein essor, mais pas sa crédibilité »). Plus de 100 millions de dollars ont été investis au cours des 6 derniers mois dans des entreprises explorant les questions éthiques liées à l’intelligence artificielle, estime PitchBook, un cabinet de recherche qui suit les activités financières des entreprises. Software Alliance (@BSAnews) a proposé récemment un cadre détaillé (.pdf) pour lutter contre les préjugés de l’IA en pointant le fait que certaines technologies automatisées nécessitaient une surveillance humaine régulière. Les grandes entreprises du numérique travaillent toutes sur ces sujets et déploient des outils dédiés.

Le problème, c’est qu’il n’y a pas de solution simple pour lutter contre les biais. Pour nombre d’entreprises, construire une technologie équitable consiste surtout à ignorer les problèmes de discrimination qu’elle crée (ce qu’on appelle, d’une manière assez paradoxale, « l’équité par inconscience »). L’idée est simple : plus on apporte de données – et notamment des données les plus diverses possibles -, plus l’équité viendra. Pour la Software Alliance cependant, tout comme pour nombre de spécialistes du sujet, cet argument ne tient pas la route. Le problème n’est pas la masse de données, mais bien leur qualité, leur diversité bien sûr, qui n’est pas nécessairement assurée, mais aussi leur validité.

Le problème du problème, c’est que nous ne savons pas à quel point le problème des biais est grave, estime Jack Clark (@jackclarksf), cofondateur d’Anthropic, membre du laboratoire Human-Centered Artificial Intelligence de Stanford (StanfordHAI) et auteur de l’AI Index (@indexingai). C’est-à-dire que si nous constatons que le problème est profond, nous avons du mal à mesurer son impact et ses conséquences.

Page d'accueil de Parity

Des outils pour débiaiser ou des outils pour accélérer et réduire les coûts de la mise en conformité ?

Liz O’Sullivan (@lizjosullivan, blog), conseillère pour Arthur.ai, un système de surveillance de la performance et de détection de biais pour les outils d’IA, membre de l’American Civil Liberties Union et directrice technologique du programme Surveillance Technology Oversight Project, a construit avec Rumman Chowdhury (@ruchowdh), Parity, une technologie qui analyse les données, les technologies et les méthodes utilisées par les entreprises pour créer leurs services et identifier les « zones » à risque. Parity examine les biais, la conformité à la loi et fournit des recommandations dédiées. Mais plus que la responsabilité, Parity travaille sur le risque, une notion bien plus préhensile pour les entreprises. Parity dispose d’une bibliothèque de questions qu’elle adresse aux concepteurs des systèmes selon leurs fonctions et connaissances, des juristes aux scientifiques. Les réponses, souvent en texte libre, sont elles-mêmes analysées par des outils de traitement du langage naturel et traduit en risques, permettant souvent de montrer que les risques des uns ne correspondent pas aux risques des autres. Ensuite, la plateforme recommande un ensemble d’actions pour atténuer les risques, comme de créer un tableau de bord pour surveiller en permanence la précision d’un modèle ou mettre en place des procédures de documentation sur la manière dont il est formé et affiné. Il intègre plusieurs outils de contrôles comme AI Fairness 360 d’IBM ou les Model Cards de Google (voir notre article : « Auditer les algorithmes »). L’enjeu estime Chowdhury consiste à réduire le temps nécessaire à l’audit des systèmes pour le faire plus régulièrement et souvent, soulignant là encore, combien l’automatisation des questions de conformité (et toutes les formes d’évaluations qui les accompagne, à savoir les mesures de qualité, d’impact social et environnemental…), qui nécessitent des évaluations chronophages et coûteuses, doivent être réduites dans le but de produire des économies d’échelles et des gains de productivité. La question de l’automatisation de l’atténuation des biais relève surtout d’une automatisation de l’intégration des formes régulations. Pour Chowdhury pourtant, l’enjeu est de pousser un cran plus loin : il est de faire passer les entreprises du calcul du risque à l’analyse de leurs impacts.

Reste qu’il est finalement troublant que le « débiaisage » de l’IA utilise des technologies d’IA qui peuvent elles-mêmes être biaisées. Si ces outils sont aussi imparfaits que l’IA, ils permettent au moins de souligner certains problèmes, veulent croire les chercheuses. L’enjeu, estime Liz O’Sullivan, c’est surtout de créer du dialogue. Trop souvent le problème vient du fait qu’il demeure ignoré ou que les personnes qui en discutent ont le même point de vue. Ce qui manque, bien souvent, c’est une diversité d’approche de ces questions.

Sur son blog, Liz O’Sullivan revient par exemple sur le besoin d’équité des moteurs de recommandation. Les moteurs de recommandation aident les entreprises à prédire ce qu’elles pensent que vous aimeriez voir. Pour Netflix ou YouTube, cela se traduit par le choix de la vidéo suivante qui vous sera proposé en lecture automatique. Pour Amazon par le choix d’articles à vous suggérer dans un courriel promotionnel. Les systèmes de recommandations doivent donc prendre en compte 2 aspects d’un problème : ce qu’ils recommandent et à qui ils le recommandent.

Pour recommander des contenus, cela nécessite bien souvent d’apprendre d’une combinaison à détecter les articles similaires et les utilisateurs similaires. Les moteurs de recommandation recommandent des articles sur la base de « préjugés inductifs », selon le modèle courant que les utilisateurs qui semblent similaires dans le passé continueront à l’être dans le futur. Le problème de ce biais inductif est multiple. Tout d’abord, il favorise la popularité : quel que soit le contenu que vous recommandez à un utilisateur, tous les chemins de la recommandation mènent à la vidéo la plus populaire du jour. Grosso modo, YouTube va vous recommander la vidéo que tout le monde regarde, comme a pu l’être Gangnam Style à une époque. Le biais inductif implique de ne pas prendre de risque et de montrer ce qui a le plus plu aux autres utilisateurs. À l’inverse, bien sûr, « moins YouTube sait comment les utilisateurs vont interagir avec votre type de contenu, plus il est risqué de le promouvoir », d’où la difficulté à promouvoir des contenus très peu consultés. Bien sûr des correctifs existent. On peut favoriser les contenus récents et émergents et réduire la recommandation vers la vidéo la plus populaire. Si cela permet de favoriser les petits producteurs de contenus, le risque est de donner un avantage disproportionné à des contenus qui ne le méritent pas beaucoup, comme les contenus complotistes ou radicaux. L’IA fait un mauvais travail de prédiction dès qu’elle n’a pas beaucoup de données sur lesquelles s’appuyer. C’est hélas bien souvent le cas.

Un autre parti pris très documenté est la partialité politique, le fait que les moteurs favorisent certains types de contenus politiques ou ne distribuent pas équitablement dans la population les mêmes types de contenus. Le problème ici consiste à mesurer l’impact positif ou négatif d’une recommandation. Une publicité financière peut-être bénéfique si elle recommande le refinancement d’un prêt étudiant (à son avantage) mais nuisible dans le cadre d’un prêt sur salaire par exemple. D’où la nécessité d’évaluations qualitatives, qu’il est pourtant difficile de réaliser à grande échelle sur une multitude d’annonces.

Pour O’Sullivan, il n’y a pas de solution miracle pour atténuer ces biais, mais l’industrie devrait tout de même travailler à mieux le mesurer. Mieux évaluer la discrimination induite d’abord, comme celle produite par les choix et biais des utilisateurs eux-mêmes : « la discrimination involontaire [c’est-à-dire l’équité par inconscience] n’est plus une stratégie viable », met en garde la chercheuse.

En fait, il va peut-être falloir envisager de créer des catégories sur les contenus ou publicités en fonction de leur utilité ou nocivité, explique-t-elle. On peut par exemple distinguer des publicités proposant un enseignement supérieur selon qu’il est dispensé par des universités ou qu’il propose seulement des certifications à but lucratif… Distinguer les contenus selon ce qu’ils proposent serait effectivement une méthode de tri pertinente, mais elle implique des décisions morales et subjectives qui sont bien loin de la neutralité affichée par les plateformes. Pas sûr que grand monde sache ou souhaite de cette solution. Ensuite, il va s’agir de mesurer les recommandations selon les catégories protégées et la qualité de ce qui est recommandé – aux États-Unis, les groupes protégés sont des catégories de personnes qui disposent d’une protection spéciale pour limiter leur discrimination. Pour Liz O’Sullivan, l’atténuation des biais et préjugés est une quête sans fin nécessitant de tester ad nauseam les systèmes. C’est-à-dire « veiller, en tant que praticiens, à apporter une éthique d’amélioration continue à ces enjeux, sans jamais considérer que ce qui a été fait est « suffisamment bon » ».

Retenons pourtant de cette démonstration une précision importante : évaluer la nocivité nécessite de la catégoriser. Une proposition assez iconoclaste dans un monde où le relativisme règne en maître sous prétexte de sa neutralité, ou une publicité en vaut une autre quel que soit le produit proposé, ou l’efficacité d’un calcul est toujours évaluée par rapport aux gains financiers qu’il génère avant tout autre critère.

D’autres outils que Parity existent également pour surveiller les services d’IA, comme le rapporte la Technology Review dans un article sur les « startups de l’éthique ». Celles-ci proposent différents types de produits : des outils d’atténuation des biais à des modalités d’explicabilité des traitements. Fiddler (@fiddlerlabs), dirigé par Krishna Gade (@krishnagade), ancien responsable du News Feed de Facebook où il a développé une première base de son travail qui a donné la fonctionnalité « Pourquoi est-ce que je vois ça ? », travaille principalement sur l’explicabilité. Mais Fiddler permet également de suivre les performances des modèles en fonction de leurs résultats.

Page d'accueil de Fiddler

Il a même récemment introduit un détecteur de biais, qui produit des alertes si par exemple vous utilisez le code postal pour calculer un prêt immobilier ou des taux de faux positifs par catégories d’utilisateurs. Pour cela, Fiddler a développé des « métriques d’équité », basées sur les catégories légales des groupes protégés que nous évoquions ci-dessus. Par exemple, il calcule un « impact différencié » qui mesure la discrimination indirecte qui affecte de manière disproportionnée les membres d’un groupe protégé par rapport aux autres. Il calcule également la « parité démographique » : c’est-à-dire compare si les différents segments d’une classe protégée reçoivent des résultats à taux égaux. Il calcule « l’égalité des chances », c’est-à-dire évalue si toutes les personnes sont traitées de manière égale ou similaire et ne sont pas désavantagées sur la base de résultats différents. Enfin, il calcule un « avantage de groupe », c’est-à-dire détermine le taux auquel un événement particulier est prédit au sein d’un sous-groupe par rapport au taux auquel il se produit réellement.

Dans un autre billet de blog, le PDG de Fiddler explique sa collaboration avec FinRegLab, une équipe de chercheurs de l’École d’affaires de Stanford qui travaille à un système d’évaluation et d’explicabilité des outils de crédits (et notamment le fameux score Fico qui détermine les possibilités d’emprunt). Les banques et assureurs sont confrontés à plusieurs problématiques avec leurs outils : le manque de transparence quant aux raisons pour lesquelles le modèle a pris une décision, qui impacte tant ces entreprises et leurs clients que les autorités de régulation. Le manque de visibilité sur les performances des modèles en production, le risque de dérives sur les données et leur difficulté à prendre en charge les changements. Par exemple, avec la pandémie, la distribution des demandeurs de prêts s’est radicalement transformée ce qui a rendu l’évaluation du risque bien plus difficile. Les banques doivent également apprendre à gérer les biais qui peuvent se produire à l’encontre des utilisateurs finaux, pour ne pas connaître d’incidents comme celui de l’Apple Card, la carte de crédit d’Apple qui était censée désavantager les femmes par rapport aux hommes (soulignons pourtant qu’une enquête du département des services financiers de l’État de New York n’a trouvé aucune preuve concrète de ces accusations en analysant le système, rapporte Bloomberg). Enfin, dans la finance, le besoin de conformité réglementaire est assez fort… Dans son utilisation par les banques, Fiddler par exemple produit une surveillance permanente des modèles et permet de produire des alertes lorsque les modèles dérivent.

Arthur AI et Weights & Biaises proposent également des plateformes de surveillance. Le premier met l’accent sur l’explicabilité et l’atténuation des biais, tandis que le second suit les expériences d’apprentissage automatique pour améliorer la reproductibilité.

Page d'accueil du service Arthur AI

Pour O’Sullivan et Chowdury de Parity, toutes ces solutions plus ou moins concurrentes sont une bonne chose, car il n’y a pas une seule méthode pour créer de la responsabilité. On l’avait déjà constaté avec les innombrables méthodes, matrices et checks-lists existantes qui sont autant de tentatives à trouver des modalités de dialogues pour intégrer des considérations sociales aux systèmes techniques. Pour elles, soulignent-elles, l’enjeu consiste surtout à produire un écosystème qui permette d’interroger les systèmes et de montrer les implications de ces questions pour dépasser les correctifs techniques, les questions de conformité ou la mesure de risque. Comme pour mieux prendre en compte l’impact social des enjeux techniques.

Jusqu’où débiaiser ?

L’un des premiers articles (.pdf) (signé par une cohorte de jeunes chercheurs dont Tolga Boukbasi de l’université de Boston) sur le débiaisage/débruitage de systèmes par d’autres systèmes date de 2016 et portait bien sûr sur une analyse du langage pour détecter les mots genrés et leur appliquer des correctifs (plus précisément, il s’agit de comprendre les « plongements lexicaux », c’est-à-dire les associations implicites entre mots et préjugés). Sur son blog, la data scientist Mitra Mirshafiee, de la communauté de data scientist Analytics Vidhya (@analyticsvidhya, blog) revenait d’ailleurs sur cet article pour nous en expliquer la portée et les limites.

Pour elle, les systèmes d’apprentissage automatique sont en train de s’emparer du monde que nous utilisons quotidiennement et non seulement « ils reproduisent nos anciennes pensées et nos anciens schémas de pensée, mais ils les amplifient en rendant les biais plus répandus encore qu’ils n’étaient ». « Si nous ne prenons pas soin de nos algorithmes, ils continueront à étiqueter les personnes à la peau foncée comme des gorilles, à montrer aux femmes programmeurs informatiques et mathématiciennes des offres d’emploi de nettoyage et de ménage, à penser que tous les musulmans soutiennent le terrorisme, etc. »

Exemples de termes neutres connotés féminins et masculins par les systèmes d'IAEn 2013, l’informaticien Tomas Mikolov et son équipe chez Google travaillaient à ce que les algorithmes de recherche répondent mieux aux questions des gens. Ils ont ainsi inventé word2vec, un algorithme non supervisé auto-encodeur. Ainsi, lorsqu’on lui donne une phrase, il produit pour chaque mot de cette phrase une série de nombres représentant les aspects les plus importants de ces mots. Ainsi mesurés, encastrés, on peut calculer des relations entre les mots, trouver des liens cachés. Les informaticiens ont travaillé à trouver des analogies entre les mots pour mieux mesurer leurs différences… par exemple pour calculer si l’analogie entre homme et femme était différente de celle entre femme et fille ou entre homme et fille. En produisant des analogies, ils ont ainsi remarqué que homme était lié à « informaticien »… et demandé si femme était lié à un terme comparable. Mais plutôt que de produire le terme informaticienne, la machine a répondu « femme au foyer ». En fait, ils ont ainsi montré que certains termes étaient genrés dans leur utilisation même : « libraire » s’associe plus au pronom « she » (elle) que « maestro » qui ne qualifie que des « he » (il) ! En observant comment des mots pourtant neutres en terme de genre sont associés à des genres, les chercheurs peuvent alors produire un système pour neutraliser leur connotation cachée. La démonstration de Mitra Mirshafiee est bien sûr un peu complexe, mais elle souligne comment ces calculs permettent de réduire les stéréotypes. Pas totalement pourtant : c’est toute la limite de la correction ! Elle reste limitée et incomplète. Les résultats d’atténuation sont notables, mais pas total… et restent limités à des dictionnaires terminologiques eux-mêmes élémentaires ou critiquables, qui concernent certains types de relations entre certains types de mots… Calculer et rectifier les biais de tous nos lexiques semble bien compliqué et produira peut-être des corrections… Le risque est que ce soit là un travail toujours inachevé !

D’où le fait qu’on parle bien plus de « réduction » ou « d’atténuation » de biais que de suppression… en employant via des techniques de « contraintes d’équité », de « régularisations de préjugés » ou de « débruitage contradictoire ». C’est ce que montre très bien (même si c’est là encore assez technique) les publications de la data scientist Haniyeh Mahmoudian sur les techniques d’atténuation des biais pour Towards Data Science.

L’article de Tolga Boukbasi et ses collègues a certes donné des ailes à l’automatisation du débiaisage… Pourtant, malgré quelques succès – que les techniques des startups qu’on a évoqués ici représentent parfaitement -, le débruitage demeure toujours imparfait. Le journaliste Kyle Wiggers (@Kyle_L_Wiggers) pour Venture Beat soulignait d’ailleurs que si nombre de plateformes utilisent des systèmes de détection de la toxicité du langage (notamment Jigsaw d’Alphabet/Google), ils demeurent souvent bien peu performant. Les chercheurs du Allen Institute ont étudié (.pdf) des techniques pour remédier aux déséquilibres lexicaux (le fait que des mots ou ensembles de mots soient toxiques) et dialectaux (le fait que des variantes linguistiques soient marquées comme toxiques) dans les données. Là encore, si les techniques de filtrage réduisent les biais, ils ne les éliminent jamais. Les modèles de filtrage établis continuent de marquer de manière disproportionnée certains textes comme toxiques. En fait pointent les auteurs, l’atténuation des biais dialectaux ne semble pas modifier la propension d’un modèle à étiqueter les textes d’auteurs noirs comme plus toxiques que ceux d’auteurs blancs ! Pour eux, GPT-3 (qui est pourtant l’un des modèles d’analyse linguistique le plus développé) manque certainement d’entraînement sur des variétés d’anglais afro-américains. Dans le gouffre des données, le risque est qu’il n’y en ait jamais assez sans être assuré que plus de données permettent vraiment de réparer les biais que nous ne cessons de produire.

Pour les chercheurs, le débiaisage ne suffira pas… C’est le constat récurrent que font les chercheurs de ces domaines, que ce soit les travaux de Joy Buolamwini (@jovialjoy) et Timnit Gebru (@timnitGebru) sur la reconnaissance faciale, ceux de Guillaume Chaslot (@gchaslot) et l’association Algotransparency sur les recommandations de YouTube, ceux d’Angèle Christin (@angelechristin) sur la justice prédictive… et tant d’autres, dont nous nous sommes régulièrement fait l’écho…

Même constat des chercheurs du Allen Institute. Au final, ils recommandent de mieux identifier le locuteur pour produire de meilleures corrections. Pour produire une meilleure correction des éléments lexicaux et dialectaux, il faudrait donc mieux étiqueter les textes, notamment en les catégorisant selon l’origine de leurs auteurs ! Mais cette perspective se révèle finalement plus inquiétante que les biais actuels des systèmes… puisqu’elle consiste à étiqueter sans fin les personnes sans saisir la notion culturelle des biais. Si on prolonge l’exemple d’une catégorisation de l’origine des textes, il faudrait catégoriser selon les origines de leurs auteurs… au risque de descendre dans des spécifications encore plus problématiques qu’elles ne sont ! À quelles « variétés » (sic) rattacher les textes de Ta-Nehisi Coates, Toni Morrisson, Richard Wright, James Baldwin… ?

À croire que la surproduction identitaire de l’analyse de données répond et amplifie nos névroses identitaires ! En tout cas, c’est typiquement le risque que pointait Kate Crawford dans son livre, Atlas of AI, celle d’une réduction identitaire qui risque d’encourager une mal-mesure sans fin… C’est-à-dire qu’au prétexte de vouloir corriger des biais en ajouter d’innombrables !

Pas étonnant que certains chercheurs souhaitent donc s’éloigner du concept même de biais. La chercheuse à Data & Society, Kinjal Dave (@kinjaldave7), par exemple, estime que le terme, issu de la psychologie sociale, renvoie à l’imperfection des individus, que ce soient les producteurs de systèmes comme tout un chacun, en invisibilisant le fait que les systèmes produisent non pas des biais, mais renforcent des rapports de pouvoir. Catherine D’Ignazio (@kanarinka) et Lauren Klein (@laurenfklein) dans leur livre Data Feminism, estiment que parler de biais laisse croire qu’on pourrait les corriger : elles préfèrent donc parler d’oppression. Même constat chez d’autres auteurs dont nous avons parlé comme Sasha Constanza-Chock ou Ruha Benjamin… qui parlent elles plutôt de justice, pour pointer également l’importance des rapports de pouvoir masqués par les traitements.

Ultime défiance face à ces technologies d’atténuation. Le risque que les correctifs proposés se démultiplient dans la plus grande opacité, sans qu’on soit assuré de leur efficacité comme du fait qu’ils aient été utilisés ou utilisés correctement. Qui nous assurera que les correctifs techniques ont bien été produits et appliqués ? La perspective d’une automatisation de l’éthique ne lève donc pas tous les défis du sujet !

Vers une éthique automatique ?

Un épais rapport du Pew Research Center auprès d’experts de l’IA se montre plutôt sombre… sur les perspectives à rendre l’IA éthique. Pour la majorité d’entre eux, la conception éthique de l’IA ne devrait pas être la norme avant une bonne dizaine d’années. L’optimisation des profits et le contrôle social devraient continuer à être au cœur de l’IA. Aux États-Unis, un rapport de l’agence de la responsabilité gouvernementale américaine reconnaissait que les technologies de reconnaissances faciales par exemple étaient déjà largement déployées et utilisées par nombre de services du gouvernement, s’alarmait Rachel Metz pour CNN.

Dans ce contexte plutôt sombre, l’Ada Lovelace Institute britannique (@AdaLovelaceInst) se veut plus positif. Il a organisé fin juin une série d’ateliers et de discussions pour prototyper l’avenir de l’éthique de l’IA. Pour les chercheuses Sarah Chander (@sarahchander), Erinma Ochu (@erinmaochu) et Caroline Ward (@noveltyshoe), l’enjeu, expliquent-elles en interview, n’est pas tant de rendre les systèmes moins problématiques qu’ils ne sont… n’est pas de documenter les dommages qu’ils causent, ou de débiaiser les technologies… mais d’imaginer : « si nous devions démanteler les technologies de surveillance, la domination, l’extraction, qu’y aurait-il à la place ? Qui a le droit d’écrire ce futur ? »

On se souvient, il n’y a pas si longtemps, de l’éviction de Timnit Gebru de Google pour avoir tenté de mettre un peu de responsabilité et d’éthique chez Google, lié à la publication d’un article critique des développements de GPT-3. Le licenciement de Timnit Gebru, pour emblématique qu’il soit, rappelle d’autres tensions, pointe le journaliste Tom Simonite (@tsimonite) dans un remarquable et détaillé article pour Wired sur son parcours et son éviction. Dans l’industrie minière ou chimique, les chercheurs qui étudiaient la toxicité ou la pollution pour le compte des entreprises exploitantes, n’ont jamais été très bien considérés. Pour l’instant, dans le jeune domaine de l’IA, les chercheurs qui étudient ses méfaits occupent encore bien souvent une place centrale dans les entreprises. Il est possible que le bruyant licenciement de Timnit Gebru de Google en signe la fin, explique le journaliste.

En 2016, Google avait publié un premier article de recherche sur l’équité de l’IA, un article qui tentait d’apporter des réponses pour corriger les réponses afin que l’évaluation du risque à ne pas rembourser un prêt offre un traitement égal aux individus, indépendamment de leur sexe, de leur race ou de leur religion. Dans son article, Simonite souligne les hésitations internes de Google à s’aventurer sur ces sujets, ainsi que le fait que le travail de Timnit Gebru et Margaret Mitchell (@mmitchell_ai, qui a également été remerciée) sur les questions de responsabilité avaient du mal à être intégrées à la culture Google.

Après la fronde contre Maven, le contrat controversé passé avec le Pentagone, Google a publié de grands principes pour guider ses travaux sur l’IA. En octobre 2019, Google a lancé BERT, un système d’apprentissage automatique permettant de mieux comprendre les requêtes longues et complexes et leur contexte, en travaillant depuis des volumes de textes plus grands. En mai 2020, OpenAI (@openai) a lancé GPT-3 qui avait ingéré plus de données que Bert et pouvait générer des textes d’une plus grande fluidité (nous somme là assurément dans une course à la puissance : Bert avait avalé quelques 3,3 milliards de mots, quand GPT-3 en digère près de 500 milliards – que les ingénieurs ont récupérées sur le Web, la source la plus facilement disponible à l’échelle nécessaire). Mais les ensembles de données étaient si volumineux que les assainir, ou même savoir ce qu’ils contenaient était une tâche trop ardue. Il s’agissait d’un exemple extrême du problème contre lequel Timnit Gebru avait mis en garde la communauté dans une de ses recherches, à savoir la nécessité de produire, pour chaque ensemble de données, une fiche technique les documentant (qui a visiblement contribué activement à la naissance des Google Model Cards). Alors que Google travaillait à la construction de successeurs encore plus puissants à Bert ou GPT-3, l’équipe chargée de l’éthique de l’IA chez Google a commencé à étudier les inconvénients de ces technologies. En septembre 2020, en interne, des responsables de Google se sont réunis pour discuter de l’IA responsable sans que des représentants de son équipe éthique soient conviés. Au même moment, les chercheurs de l’équipe éthique mettaient un point final à un article critique sur « Les dangers des perroquets stochastiques : les modèles linguistiques peuvent-ils être trop grands ? » qui soulignait les limites des modèles statistiques utilisés et le risque à répéter du « mauvais » langage, c’est-à-dire, des biais, des erreurs et des fautes en les amplifiant. L’article soulignait les difficultés à documenter les biais d’ensembles de données de plus en plus vastes, mais surtout, estime Gebru, critiquait ouvertement une technologie au fort potentiel commercial. Comme l’explique très bien le chercheur Olivier Ertzscheid (@affordanceinfo2) sur son blog où il revenait également sur les enjeux de ces travaux : « le danger est que nous devenions autant de « perroquets stochastiques » à force de mal manipuler des modélisations de la langue trop denses, massives et étendues ».

Depuis l’éviction de son équipe dédiée à l’éthique (qui a entraîné aussi quelques démissions par rebond), si l’on en croit Tom Simonite, le département de recherche de Google est déchiré par la méfiance et les rumeurs. Pour le journaliste, les perspectives de recherche « ouvertes d’esprit » sur la question de l’éthique de l’IA se sont assombries. Pour Luke Stark (@luke_stark), « les grandes entreprises technologiques ont essayé de prendre le dessus sur les régulateurs et les critiques du public en adoptant l’idée de l’éthique de l’IA ». Mais à mesure que la recherche a mûri, elle a soulevé des questions plus importantes. « Les entreprises sont devenues moins aptes à coexister avec la recherche critique interne », estime-t-il.

Depuis le drame, des chercheurs qui ont fondé une revue sur l’éthique de l’IA ont lancé un appel pour que les publications des chercheurs en IA travaillant pour des industries du secteur soient plus transparentes sur leurs travaux. Mais la suspicion sur les travaux menés par les entreprises du secteur pourrait s’installer, un peu comme la recherche industrielle sur la pollution est peu considérée par les spécialistes de l’environnement, notamment pour ses collusions, voire surtout ses dissimulations éhontées… À la dernière conférence annuelle des développeurs de Google, l’entreprise a annoncé que les grands modèles de langage qu’elle développe joueraient à l’avenir un rôle central. Une annonce balayant les critiques. Pour Meredith Whittaker (@mer__edith), directrice de l’AI Now Institute, le message de Google est clair pour ceux qui veulent mener des recherches sur la responsabilité : « nous ne les tolérons pas ». Des menaces inquiétantes, d’autant que les emplois en dehors des grandes industries du secteur sont rares.

Pour Inioluwa Deborah Raji (@rajiinio) de la Fondation Mozilla, l’échec de Google à se réformer rend désormais tout le monde conscient que la responsabilité doit venir de l’extérieur. Timnit Gebru, quant à elle, collecte désormais des fonds pour tenter de lancer un institut de recherche indépendant.

Si Google n’est plus « the place to be », peut-être que la question de l’éthique de l’IA sera récupérée par d’autres ? En ce moment, souligne la journaliste Anna Kramer (@anna_c_kramer) pour Protocol (@protocol), les regards se tournent vers Twitter qui vient de créer Meta.

En 2020, Ariadna Font Llitjos (@quicola), responsable des équipes d’apprentissage automatisé de Twitter – qui relève de Twitter Cortex, qui gère toute l’IA de l’entreprise – estime que la recherche sur l’éthique pourrait transformer l’entreprise. Elle propose donc de construire une équipe dédiée, Meta (pour Machine learning, Ethics, Transparency and Accountability) et convainc Jack Dorsey, le PDG de Twitter de faire de la responsabilité la priorité de Twitter. Rumman Chowdury a quitté Parity pour devenir la responsable de Meta. Kristian Lum (@kldivergence) et Sarah Roberts (@ubiquity75) ont rejoint l’équipe. L’enjeu : travailler depuis les propositions des chercheurs pour réellement agir sur la promesse de Twitter !

Depuis la création de Meta, Twitter a pris des premiers engagements, via son initiative pour un apprentissage automatisé responsable, où l’entreprise s’est engagé à partager publiquement la façon dont elle prendra des décisions sur ses algorithmes (ce que l’entreprise a fait par exemple sur son algorithme de recadrage d’image qui a été supprimé en donnant un plus grand contrôle aux utilisateurs sur la façon dont les images apparaissent avant publication tout en permettant de « réduire la dépendance à l’égard du Machine Learning pour une fonction, qui, nous en convenons, est mieux réalisée par les personnes utilisant nos produits », expliquait Rumman Chowdury). L’enjeu pour l’instant consiste à mieux définir les problèmes que rencontrent les utilisateurs. Pour Chowdury, l’enjeu, au-delà de la transparence publique sur les travaux engagés, est de créer un système de règles et d’évaluations qui soit une sorte de « gouvernement » sur les modèles et permette d’empêcher les préjudices aux utilisateurs de se produire, plutôt que de tenter de les corriger a posteriori. Meta se veut une équipe de création de connaissances plus qu’une force de police des algorithmes, conclut Anna Kramer. On espère que l’équipe saura relever le défi qui l’attend !

Ce que racontent ces histoires, c’est certainement que l’automatisation de l’éthique n’est pas si assurée, en tout cas, elle ne se fera pas sans éthique personnelle, sans engagements des équipes et des responsables des systèmes techniques. L’éthique de l’IA tient assurément d’un dialogue, d’une discussion entre la technologie et la société. Reste à savoir quelle direction ces recherches vont prendre… Entre l’hystérisation des calculs dans des systèmes toujours plus vastes, spéculant en boucle sur eux-mêmes ou leur réduction sous forme d’une première « dénumérisation », comme le propose pragmatiquement Rumman Chowdury pour Twitter, la gamme d’évolution est ouverte. Plus qu’une perspective d’automatisation de l’éthique (qui ne semble pas très éthique), et si l’avenir était plutôt de trouver les moyens pour dire que le recours à l’IA n’est pas – et ne devrait pas être – automatique ! C’est en tout cas là une perspective bien plus stimulante que la première, vous ne trouvez pas ?

Hubert Guillaud

  • ✇InternetActu.net
  • Qu’est-ce que l’informatique optimise ?
    En 2019, pour le magazine Commune, l’ingénieur et membre de la coalition des travailleurs de la tech (@techworkersco – voir également Collective Action In Tech et @tech_actions) Jimmy Wu (@jimmywu) revenait sur la question de l’optimisation. Qu’est-ce que le numérique optimise ? Alors que la tech rencontre une contestation inédite, l’éthique de la technologie bénéficie d’un vif regain d’intérêt, explique Wu. Le but : apporter aux professionnels de la technologie une conscience sociale… pour redr

Qu’est-ce que l’informatique optimise ?

28 juin 2021 à 07:00

En 2019, pour le magazine Commune, l’ingénieur et membre de la coalition des travailleurs de la tech (@techworkersco – voir également Collective Action In Tech et @tech_actions) Jimmy Wu (@jimmywu) revenait sur la question de l’optimisation. Qu’est-ce que le numérique optimise ?

Alors que la tech rencontre une contestation inédite, l’éthique de la technologie bénéficie d’un vif regain d’intérêt, explique Wu. Le but : apporter aux professionnels de la technologie une conscience sociale… pour redresser la crédibilité du secteur ! « Pourtant, en positionnant l’éthique comme la boussole morale de la technologie, l’informatique académique nie le fait que ses propres outils intellectuels sont la source du pouvoir dangereux de l’industrie technologique ». Pour Wu, le problème réside dans l’idéologie même de la tech. « Ce n’est pas seulement que l’enseignement de l’ingénierie apprend aux étudiants à penser que tous les problèmes méritent des solutions techniques (ce qui est certainement le cas) ; le programme est surtout construit autour de tout un système de valeurs qui ne connaît que les fonctions d’utilité, les manipulations symboliques et la maximisation des objectifs. »

L'article de Jimmy Wu pour Commune Magazine

L’informatique, une idéologie du statu quo ?

Wu raconte avoir assisté au premier cours sur l’éthique des données proposé par Stanford au printemps 2018. Dans un exercice proposé aux élèves, l’enjeu était d’interroger un jeu de données provenant d’un site web qui avait révélé les noms des donateurs à des organisations qui soutenaient le seul mariage hétérosexuel. Les étudiants étaient appelés à faire des propositions pour résoudre le problème. Pour Wu pourtant, le problème n’était pas la question de la granularité des données (c’est-à-dire jouer sur la visibilité du montant des dons par exemple, comme de faire passer l’obligation d’afficher les noms des donateurs à partir d’un montant plus élevé pour éviter qu’ils soient pointés du doigt, comme le proposaient des étudiants) qu’un enjeu politique qui consiste à organiser la politique depuis des dons financiers. Cette proposition à sortir du seul cadre des paramètres accessibles a mis fin aux discussions. Pour Wu, ce petit exemple illustre à lui seul « l’idéologie du statu quo » qui structure l’enseignement de l’informatique. C’est comme si en informatique, l’enjeu premier était de ne pas prendre parti ou de ne pas faire de politique… Comme si tout n’était question que de paramètres à régler.

Couverture du livre Disciplined Minds de Jeff SchmidtLa science informatique a visiblement largement intégré la discipline de l’esprit qu’évoquait Jeff Schmidt dans son Disciplined Minds (2000, non traduit), un livre qui critiquait justement la socialisation et la formation des professionnels qui consiste trop souvent à ne pas faire de vagues. En 4 ans d’informatique à Berkeley et Stanford, rapporte Wu, à l’exception d’un cours d’éthique, les enseignants ne nous ont jamais suggéré d’examiner de manière critique les problèmes techniques, souligne-t-il. « Les questions dites « douces » sur la société, l’éthique, la politique et l’humanité étaient silencieusement considérées comme intellectuellement inintéressantes. Elles étaient indignes de nous en tant que scientifiques ; notre travail consistait à résoudre les problèmes qui nous étaient soumis, et non à nous demander quels problèmes nous devions résoudre en premier lieu. Et nous avons appris à le faire bien trop bien. »

Pour Wu, l’enseignement technique est directement responsable du technosolutionnisme. Des programmes d’études qui exposent « la primauté du code et des manipulations symboliques engendrent des diplômés qui s’attaquent à tous les problèmes sociaux à l’aide de logiciels et d’algorithmes ». En cours d’éthique, les questions de politiques et d’orientation étaient réduites à des problèmes techniques. Wu fait référence à un cours très populaire sur l’optimisation mathématique donné par Stephen Boyd à Stanford. « Dans le monde de l’informatique et des mathématiques, un « problème d’optimisation » est toute situation dans laquelle nous avons des quantités variables que nous voulons fixer, une fonction objective à maximiser ou à minimiser, et des contraintes sur les variables ». Pour Boyd d’ailleurs « tout est un problème d’optimisation » ! Tout peut être modélisé, tout peut-être exprimé en fonction d’un critère d’utilité selon des critères plus ou moins grossiers. Une affirmation des plus banales pour ces étudiants. Pour Wu, nous sommes là face à un marqueur de l’état des sciences informatiques.

L’optimisation n’est pas récente, rappelle-t-il. Elle est née avec la Seconde Guerre mondiale et est devenue un passage obligé des sciences informatiques. La question des algorithmes d’optimisation est arrivée à maturité au milieu du XXe siècle, avec le développement de la programmation linéaire qui a permis de faire des progrès sur des problèmes allant de l’allocation des biens au routage logistique. En URSS, sous la coupe de son inventeur, Leonid Kantorovich, elle est devenue un outil central de la planification dès les années 60. En Occident, elle s’est déployée dans l’expédition et le transport. Des deux côtés du rideau de fer, longtemps, « l’optimisation a été déployée dans des contextes résolument non marchands », pour la planification notamment. Mais depuis le début du XXIe siècle, elle a été remodelée pour être utilisée par nombre d’applications, notamment commerciales. Désormais, aidés par l’IA et l’apprentissage automatisé, entreprises, armées et États exigent des algorithmes rapides, efficaces, sûrs, mais aussi intelligents, réactifs. Tout est en passe d’être exprimé à l’aide de variables, de contraintes et de fonctions objectives, puis résolues à l’aide d’un logiciel d’optimisation.

Cette prise de contrôle de l’optimisation se reflète sur les campus au vu du nombre d’inscriptions à ces cours. À Stanford toujours, au Huang Engineering Center, à quelques centaines de mètres de là où enseigne Boyd, Andrew NG (@andrewyng) donne des cours sur le Deep Learning où se pressent des milliers d’étudiants. Son cours porte sur les réseaux neuronaux profonds. Ici, les paradigmes d’optimisation ne sont pas de type planification, car les modèles n’ont que les contraintes qu’ils découvrent eux-mêmes. Une fois entraîné, le modèle est exécuté sur des échantillons de données. Si les résultats sont médiocres, le concepteur modifie les paramètres ou affine l’objectif. « L’ensemble du processus de formation d’un réseau neuronal est si ad hoc, si peu systématique et si embarrassant, que les étudiants se demandent souvent pourquoi ces techniques devraient fonctionner. » Personne ne sait très bien leur répondre, mais soyez-en assurés, elles fonctionnent ! « L’étude de l’apprentissage automatique offre une révélation stupéfiante : l’informatique du XXIe siècle manie, en réalité, des pouvoirs qu’elle comprend à peine » !

L’informatique, c’est de l’économie sans les questions politiques

Le seul autre domaine qui semble à la fois en savoir autant et si peu est l’économie, explique encore Jimmy Wu. La comparaison est à raison : cette optimisation en roue libre et heuristique rappelle la façon dont l’économie elle-même est comprise. « Plutôt que de considérer l’optimisation comme une planification, nous cherchons à libérer la puissance de l’algorithme (le marché libre). Lorsque les résultats ne sont pas ceux escomptés, ou que l’algorithme optimise son objectif (le profit) avec beaucoup trop de zèle à notre goût, nous corrigeons docilement ses excès rétrospectivement avec toutes sortes de termes secondaires et de réglages de paramètres (taxes, péages, subventions). Pendant tout ce temps, le fonctionnement interne de l’algorithme reste opaque et sa puissance de calcul est décrite en termes de magie, de toute évidence compréhensible uniquement par une classe de technocrates doués et suréduqués. »

« Lorsqu’on entre dans le « monde réel », la perspective acquise grâce à ces formations en informatique s’intègre parfaitement à l’idéologie économique dominante. Après tout, qu’est-ce que le capitalisme néolibéral sinon un système organisé selon un cadre d’optimisation particulièrement étroit ? » « À l’école, on nous a dit que tout problème pouvait être résolu en tournant les boutons algorithmiques de la bonne manière. Une fois diplômés, cela se traduit par la conviction que, dans la mesure où la société a des défauts, il est possible d’y remédier sans changement systémique : si l’accumulation du capital est le seul véritable objectif et que le marché est un terrain de jeu infiniment malléable, il suffit de donner aux agents individuels les incitations appropriées. Pour réduire l’utilisation du plastique, ajoutez une surtaxe sur les sacs d’épicerie. Pour résoudre la crise du logement, relâchez les contraintes imposées aux promoteurs d’appartements de luxe. Pour contrôler la pollution, fixez un prix de marché en utilisant un système de plafonnement et d’échange. »

« À un niveau élevé, l’interprétation computationnelle de l’économie moderne ressemble à ceci : une économie peut être considérée comme un gigantesque problème d’optimisation distribuée. Dans sa forme la plus élémentaire, nous voulons décider quoi produire, combien payer les travailleurs et quels biens doivent être alloués à qui – ce sont les variables du programme d’optimisation. Les contraintes consistent en toute limite naturelle sur les ressources, la main-d’œuvre et la logistique. Dans le capitalisme primitif du laissez-faire, l’objectif à maximiser est, bien entendu, le profit ou le produit total. »

« Le péché originel du programme capitaliste est donc qu’il optimise non pas une certaine mesure du bien-être social ou de la satisfaction humaine, mais une quantité qui ne peut être qu’un lointain substitut de ces objectifs. Pour remédier aux dommages considérables causés par cette mauvaise formulation, les démocraties libérales d’aujourd’hui cherchent à concevoir un programme plus nuancé. Le profit constitue toujours le premier terme de l’objectif, mais il est désormais accompagné d’un éventail impressionnant de termes secondaires modifiables à l’infini : imposition progressive des revenus pour ralentir l’accumulation des richesses, taxes et subventions pigouviennes pour guider le comportement des consommateurs, et marchés d’émissions financiarisés pour freiner la désintégration rapide de la planète. Lorsque les carottes et les bâtons du marché ne suffisent pas, les gouvernements tentent d’imposer des réglementations, en introduisant des contraintes supplémentaires. Ces solutions politiques suivent précisément la même logique que les exercices qu’on nous propose en classe sur les réglages algorithmiques. »

Wu rappelle qu’il n’est donc pas étonnant que le rôle sociétal des algorithmes fasse l’objet de nombreux débats. Il n’y a pas si longtemps encore, les gens pensaient que les algorithmes étaient politiquement neutres ou ne présentaient pas de danger fondamental pour les humains. Comme la révolution industrielle précédente, cette révolution était considérée « comme un fait impersonnel de l’histoire économique, et non comme quelque chose qui discriminait activement certaines populations ou servait de projet à la classe dirigeante ». En 2013, quand on évoquait des biais dans les modèles, on estimait que c’était une question purement statistique dépourvue du moindre jugement moral. Depuis 4 ou 5 ans, la critique s’est emparée de la question des boîtes noires algorithmiques, montrant qu’elles excluaient nombre de personnes des services sociaux… La fausse neutralité et objectivité des calculs ont été démasquée, constate Wu. Un nouveau parti-pris a émergé qui reconnaît qu’en pratique, les algorithmes comme les données encodent des partis-pris.

Pour Wu néanmoins, ce nouveau parti-pris continue de faire l’apologie de la « tyrannie informatique ». Il reste sans idéologie !

Couverture du livre Réalisme capitaliste de Mark FisherLe problème c’est les programmeurs humains et les données ! Pas le fait que l’informatique travaille à améliorer et automatiser le monde… Or, comme le soulignait le philosophe Mark Fisher (Wikipedia), ce « réalisme capitaliste » (Entremonde, 2018) relève précisément de l’idéologie. La tâche qui reste à l’informatique comme au capitalisme, c’est « d’affiner le système au mieux de nos capacités »… À calculer encore et toujours leur efficacité maximale, les systèmes pourraient bien tourner en rond !

Les contributions du monde universitaire au capitalisme sont essentiellement venues de l’économie, notamment des partisans ultralibéraux de l’École de Chicago, explique encore Jimmy Wu. Mais ces contributions comportaient une limite majeure : l’économie reste une arène de débat, de désaccords…

L’informatique lui est bien supérieure, ironise l’ingénieur. « Elle enseigne les axiomes et les méthodes du capitalisme avancé, sans les questions politiques qui peuvent se poser en économie ou dans d’autres sciences sociales. Dans sa forme actuelle, l’informatique est un véhicule d’endoctrinement réussi pour l’industrie et l’État, précisément parce qu’elle apparaît comme leur contraire : un domaine sans valeur qui incarne à la fois des mathématiques rigoureuses et une ingénierie pragmatique. C’est le pourvoyeur idéal du réalisme capitaliste pour une époque sceptique ; une science de droite qui prospère dans notre ère post-idéologique. »

Peut-on, doit-on, faut-il défaire l’ordinateur et ses sciences ? Le débat oppose deux camps, simplifie Jimmy Wu. D’un côté l’élite traditionnelle qui ne voit pas même le problème. De l’autre, des « humanistes de la technologie », une alliance peu structurée de fonctionnaires critiques, de médias, de chercheurs, d’ONG et de repentis de la tech… qui pensent que les pratiques technologiques peuvent être apprivoisées par une politique plus éclairée, des pratiques d’ingénieries réformées et un peu plus d’éthique… Mais les deux parties partagent finalement la même vision, même si l’un a un visage plus aimable que l’autre : « celle d’une société dominée par une aristocratie technique qui exploite et surveille le reste d’entre nous ». L’informatique universitaire file les mêmes contradictions : le matin, un étudiant peut assister à un exposé sur la maximisation publicitaire et le soir construire une base de données pour une association locale…

Avons-nous besoin d’une autre informatique ?

Couverture du livre de Wendy Liu, Abolir la Silicon ValleyL’ingénieure repentie, Wendy Liu (@dellsystem) en appelait dans le magazine socialiste britannique Tribune (@tribunemagazine) à « abolir la Silicon Valley » (elle en a depuis fait un livre : Abolir la Silicon Valley : comment libérer la technologie du capitalisme, Repeater Books, 2021, non traduit). Elle n’appelait pas par là à un rejet naïf de la technologie, mais à sa régulation, à sa transformation en un secteur qui soit financé, détenu et contrôlé par la société dans son ensemble et non plus seulement par quelques actionnaires.

Pour Wu, ce réformisme ne suffit pas. Il est nécessaire de mettre en cause ce qui sous-tend cette prise de pouvoir économique sur le monde. « La Silicon Valley n’existe pas dans un vide intellectuel : elle dépend d’un certain type de discipline informatique. Par conséquent, une refonte de la Silicon Valley par le peuple nécessitera une informatique « populaire » ». C’est-à-dire une autre informatique et une autre vision de l’informatique, soutient Jimmy Wu. Nous en sommes pourtant encore très loin. « Aujourd’hui, les départements d’informatique ne se contentent pas de générer le « réalisme capitaliste », ils sont eux-mêmes gouvernés par lui. » Le financement de la recherche en informatique est totalement dépendant des géants de l’industrie et de la défense. La recherche est guidée par les seules applications industrielles. Et tout ce beau monde nie que l’informatique contemporaine soit une entreprise politique (quelles que soient ses intentions apolitiques affichées). Pour remédier à ce brouillard idéologique étouffant, nous devrions construire une « informatique communiste », soutient Jimmy Wu. Il termine en l’esquissant à grand trait : à savoir que seuls les projets au service direct ou indirect des gens et de la planète devraient pouvoir être financés, en invitant à imaginer des algorithmes pour la planification économique participative, pour estimer le temps de travail socialement nécessaire, pour créer des chaînes d’approvisionnement locales… « La froide science de l’informatique semble déclarer que le progrès social est terminé – qu’il ne peut y avoir désormais que du progrès technologique. Pourtant, si nous parvenons à arracher le contrôle de la technologie à la tour d’ivoire de la Silicon Valley, les possibilités de la société post-capitaliste sont apparemment infinies. Le mouvement des travailleurs de la technologie du XXIe siècle est un véhicule plein d’espoir pour nous amener vers de telles perspectives ! Il est certes encore naissant, mais il est de plus en plus une force avec laquelle il faut compter, et, au risque de s’emballer, nous devrions commencer à imaginer le futur que nous souhaitons habiter. Il est temps de commencer à conceptualiser, et peut-être à prototyper, l’informatique et l’information dans un monde de travailleurs. Il est temps de commencer à concevoir une nouvelle science de gauche. »

Couverture du dernier numéro et de la nouvelle formule de Socialter consacrée à la rebelion des cadres Couverture du livre de Jamie Woodcock

Reste à savoir si la lutte contre les dérives des technologies (le techlash des employés de la tech) ou la prise en compte des questions écologiques suffiront à mobiliser les « agents de la société technicienne » comme le dit très bien le dernier numéro de Socialter (@socialter) ?

Si l’on en croit le dernier livre du sociologue Jamie Woodcock (@jamie_woodcock), Le combat contre le capitalisme de plateforme (Press de l’université de Westminster, 2021, non traduit), les travailleurs des plateformes parviennent à organiser de plus en plus d’actions collectives et à renforcer la solidarité transnationale, explique le politologue James Muldoon (@james_muldoon_) pour le blog de la London School of Economics (@LSEReviewBooks). En Europe, expliquait récemment The Guardian, la sécurité des travailleurs des plateformes progresse, tout comme le déploiement des plateformes coopératives, notamment autour de Coopcycle qui fédère plus de 67 coopératives dans 7 pays. La France semble plutôt tenir de l’exception en la matière, puisque malgré les jugements récents, les plateformes continuent à opérer par l’auto-entrepreneuriat.

Reste que l’horizon d’une nouvelle informatique qu’esquisse Jimmy Wu semble encore loin !

Défaire l’optimisation ?

Couverture du livre de Alison PowellDans son dernier livre Undoing Optimization : Civic Action in Smart Cities (Yale University Press, 2021, non traduit), la chercheuse Alison Powell (@a_b_powell, blog), qui est également la responsable du programme et réseau de recherche sur l’éthique de l’IA, Just AI (@justainet, blog), de l’Ada Lovelace Institute, rappelle que les données ne sont pas gratuites, qu’elles ne sont pas exemptes de déséquilibres de pouvoir. Comme elle l’explique dans une tribune pour la LSE, cette optimisation configure des rationalités, notamment le fait que les décisions opérationnelles soient basées sur des données disponibles. Pour elle, pour défaire l’optimisation, nous devons nous concentrer sur les frictions, les lacunes, les erreurs… Comme le propose l’anthropologue Anna Tsing, les frictions produisent des relations de négociation inédites. Pour Powell, « les relations de pouvoir inégales autour des données pourraient générer de nouvelles opportunités de changement social ».

Pour Powell, nous ne sommes pas suffisamment attentifs à la manière dont les technologies se superposent les unes aux autres. À la fin des années 90, la vogue était au citoyen en réseau, à l’individu connecté qui s’engage dans la ville grâce à la connectivité. L’accès est alors devenu une demande et a aussi produit (à la marge) quelques projets politiques (comme les réseaux communautaires sans fil, voir « Avons-nous besoin d’une vitesse limitée sur l’internet ? »). La démultiplication des données et des systèmes de capteurs connectés ont permis une collecte sans précédent et une forme d’optimisation de la vie urbaine en temps réel… Mais pour Powell, cette optimisation n’aborde pas la conception coercitive des applications qui servent à la collecte de données justement. Quand la ville intelligente donne la priorité aux données, l’optimisation produit une surveillance constante, incompatible avec les libertés collectives.

Au lieu de cela, les points de friction ouvrent une autre perspective et permettent de limiter l’objectif d’une optimisation sans limites. Pour la chercheuse, il est ainsi nécessaire d’interroger l’optimisation, de savoir « pour qui ce n’est pas optimal » justement. Pour Powell, nous devons travailler à des alternatives à l’optimisation. Elle propose un exemple, celui du projet Connected Seeds and Sensors – un projet londonien qui explore comment l’internet des objets peut soutenir la consommation et la production d’une alimentation durable – qui montrent que les données collectées sur les semences ne parviennent pas à être exhaustives. Le savoir n’est pas réductible aux informations. Pour la chercheuse, pour nous défaire de l’optimisation, nous devrions considérer que la friction est bien plus nécessaire pour créer de bonnes relations. Ensuite, nous devrions travailler à limiter la collecte de données plutôt que l’étendre. En privilégiant l’optimisation à la friction, nous risquons surtout d’oublier de construire des solidarités et des échanges qui ne soient pas que de données.

Comme elle l’expliquait dans le texte de configuration du réseau Just AI, l’éthique doit se penser d’abord comme une pratique. Comme elle le souligne encore dans un premier compte rendu de travaux portant sur la cartographie de la recherche éthique, « les préoccupations éthiques concernant l’IA sont désormais profondément imbriquées dans les préoccupations éthiques concernant de larges pans de la vie sociale ».

Dans la conclusion de son livre, Powell explique que le modèle de pensée « techno-systémique » étend sans fin la commodité des données et l’exploitation des informations personnelles. Le problème est que cette approche ne définit pas une bonne citoyenneté, mais seulement « une bonne citoyenneté technologique »… et celle-ci, d’une manière très récursive, ne consiste finalement qu’à soutenir toute optimisation. Le problème, explique Alison Powell, c’est que cet objectif restreint l’action civique à n’être qu’une consommation de ressources ! Le paradigme de l’optimisation par les données et les capteurs réduit en fait la place des citoyens à n’être que les acteurs de leur propre surveillance. Ce paradigme réduit également la diversité, favorise les intérêts privés plus que publics. Mais surtout, l’optimisation efface le conflit, les divergences, les dissensus, les frictions… Or, dans la réalité, bien souvent, les gens luttent pour redéfinir les formes normatives que produisent les données, et trouver des espaces de discontinuité entre les données. La liberté ne consiste pas seulement à ne pas être surveillé, mais également réside dans la capacité d’avoir des approches différentes, d’être en désaccord avec des interprétations, de revendiquer un droit à la discontinuité… Powell défend une datafication minimisée (un droit à la « datafication minimum viable », sur le modèle du Produit minimum viable). Pour elle, la transparence ou la responsabilité ne suffisent pas, car elles ne permettent pas de modifier le cadre technologique qui nous capture, de remettre en question son circuit de pouvoir, explique-t-elle en faisant référence au « droit à une ville intelligente soutenable » de Sara Heitlinger. Bref, de continuer à avoir le droit de faire évoluer nos modes de connaissances et de relations hors des produits prédictifs… À produire une société autrement qu’en calculant son efficacité maximale.

Couverture du livre d'Edward TennerCela nous renvoie au livre déjà classique de l’historien des technologies Edward Tenner (@edward_tenner), Le paradoxe de l’efficacité : ce que le Big Data ne peut pas faire (Penguin Random House, 2018, non traduit), qui soulignait combien l’inefficacité a de vertus. Tenner y rappelle que ce que nous rendons plus efficace rend toujours autre chose moins efficace. Que l’optimisation est toujours un choix qu’on peine à évaluer, dans ses coûts comme dans ses bénéfices. Dans son livre, Tenner observe l’apport ambigu de la techno sur la médecine, l’éducation et la connaissance pour souligner qu’il n’y a pas qu’une forme à l’efficacité, mais des formes qui s’imbriquent et se contrebalancent. Dans notre monde ultra rationnel, où domine le colonialisme comptable, où tout est converti en gains de productivité, l’historien pourtant bien peu radical, nous rappelle que l’inefficacité est parfois un bien meilleur chemin.

Hubert Guillaud

  • ✇InternetActu.net
  • Modération automatisée : le double enjeu du contrôle démocratique et de la transparence
    En septembre 2019, dans une tribune pour le toujours sémillant The Atlantic (@TheAtlantic), Daphne Keller (@daphnehk), directrice du programme de régulation des plateformes au Centre de cyber politique de Stanford (@stanfordcyber), expliquait que les entreprises internet n’avaient pas d’état d’âme à restreindre la liberté d’expression. Elle réagissait alors au lancement de la « Cour suprême » de Facebook – devenue depuis « Conseil de surveillance » (sur FB, @oversightboard). Pour Keller, il est

Modération automatisée : le double enjeu du contrôle démocratique et de la transparence

14 juin 2021 à 07:00

En septembre 2019, dans une tribune pour le toujours sémillant The Atlantic (@TheAtlantic), Daphne Keller (@daphnehk), directrice du programme de régulation des plateformes au Centre de cyber politique de Stanford (@stanfordcyber), expliquait que les entreprises internet n’avaient pas d’état d’âme à restreindre la liberté d’expression. Elle réagissait alors au lancement de la « Cour suprême » de Facebook – devenue depuis « Conseil de surveillance » (sur FB, @oversightboard). Pour Keller, il est normal que ces places publiques modernes se dotent de règles de fonctionnement, d’autant qu’elles ont pris une importance primordiale pour les utilisateurs. « Les personnes dont les messages sont retirés des principales plateformes disent qu’elles sont exclues des canaux de communication les plus importants de notre époque ». D’où l’importance à nous préoccuper des règles que ces entreprises appliquent à nos discours et nos comportements… que ce soit de savoir si PayPal peut virer les dons à Wikileaks, si Cloudflare doit protéger les sites néonazis ou si Facebook doit retirer la célèbre photo de Nick Ut d’une jeune fille nue brûlée au Napalm sur une route du Viêt Nam.

Les médias sociaux ne sont pas des gouvernements

« Mais les plateformes privées ne sont pas vraiment la place publique, et les sociétés Internet ne sont pas des gouvernements. C’est exactement pour cela qu’elles sont libres de faire ce que tant de gens semblent vouloir : mettre de côté les règles de libre expression du premier amendement [de la Constitution des États-Unis] en faveur de nouvelles règles plus restrictives ». L’existence de cours suprêmes « privées » et de conventions spécifiques permet d’imaginer que cette refonte sera régie par les mêmes contraintes que celles qu’ont connues les gouvernements du monde réel : des règles « constitutionnelles » pour protéger les droits individuels et établir des processus démocratiques pour établir les lois sous lesquelles nous vivons… Mais les plateformes n’ont fait écrire à leurs usagers aucune Constitution et ne sont soumises à aucun processus démocratique ni même à aucun devoir de séparation des pouvoirs ni à une quelconque représentativité de leurs usagers ! Leurs règles ne sont donc « constitutionnelles » que de nom !

Les principes de Santa Clara établissent des règles pour établir des niveaux minimums de responsabilité et de transparence des plateformes de modération

Des groupes de défense des utilisateurs ont demandé des droits similaires à ceux d’une « procédure régulière », comme un droit d’appel pour les personnes accusées d’avoir violées les règles des plateformes, comme on le trouve exprimé dans les principes de Santa Clara. D’autres demandent une transparence similaire à celle qu’on attendrait de législateurs, notamment pour mettre en lumière leurs interactions avec des lobbys ou leurs clients. Ces demandes sont positives et nécessaires, bien sûr, mais « il ne faut pas croire qu’imiter les systèmes gouvernementaux fera des plateformes des substituts aux gouvernements, soumis à des lois et des contraintes de pouvoir fondées sur des droits réels », prévient Daphne Keller. De fait, les plateformes sont plus à même de restreindre les libertés notamment parce qu’elles sont bien moins responsables de leurs choix que des représentants élus. Pour Keller, il nous faut mieux comprendre ces différences avant de demander aux plateformes de jouer un rôle plus important en tant qu’arbitres de la parole et de l’information, notamment parce qu’elles peuvent restreindre les discours avec plus d’efficacité que les gouvernements. Certes, elles n’emprisonnent pas les dissidents, mais elles peuvent les réduire au silence. Et notamment supprimer des publications licites, mais haineuses, harcelantes, trompeuses ou offensantes… bien plus rapidement que ne le ferait un procès. « L’absence de responsabilité démocratique ou constitutionnelle qui rend les plateformes si efficaces en tant que régulateurs de contenu les rend très difficiles à contraindre d’une autre manière ». Enfin, leurs « procédures » de contestation sont de très pâles reflets des originaux dont elles devraient s’inspirer.

Les membres de ce qu’on appelait encore la Cour suprême de Facebook ne sont pas chargés de faire respecter les droits des utilisateurs en vertu d’une Constitution ou des Droits de l’homme ou de tout autre instrument juridique, rappelle Keller. Leur travail ne consiste qu’à interpréter les règlements existants – et changeants – des plateformes. Le problème est que chaque fois que l’opinion s’indigne, les plateformes sont incitées à assumer davantage de pouvoir, que ce soit en accroissant la surveillance des utilisateurs ou l’interdiction de contenus licites… « Plus les plateformes s’arrogent ces pouvoirs, plus nous devons nous inquiéter du fait que nous ne contrôlerons pas réellement la manière dont elles les utiliseront ».

Dans ce contexte, les gouvernements ont du pouvoir : ce n’est pas un hasard si les grandes plateformes appliquent les normes européennes en matière de discours de haine dans le monde entier. Les annonceurs également ont du pouvoir : toutes les plateformes ont remanié des politiques en fonction de leurs indignations ou préconisations. Dans ce contexte, les utilisateurs sont bien souvent ceux qui ont le moins de pouvoir. « Si les plateformes n’ont pas de comptes à nous rendre, pourquoi les encourageons-nous à assumer un tel contrôle pratique sur notre discours ? »

À cause de la fuite en avant ! répond Daphne Keller. Le raisonnement est toujours le même : les plateformes ont déjà des règles et donc elles peuvent en avoir de meilleures. Le problème, c’est que ce raisonnement est à sens unique, explique la juriste. Il justifie le fait de demander aux plateformes d’en faire toujours plus, plutôt que de leur demander de revenir sur les changements qu’elles ont déjà effectués ! À l’image de la démultiplication des outils de détection automatique des contenus… lancés à l’origine pour lutter contre la pédopornographie (notamment PhotoDNA, que nous évoquions depuis notre lecture du livre de Tarleton Gillespie). Depuis, la prévalence de ces outils n’a cessé de s’étendre : pour identifier les « terroristes » (selon les propres définitions des plateformes) et pourraient demain s’étendre aux insultes à l’égard d’hommes politiques… L’expansion du rôle des filtres risque d’être sans fin et surtout sans point d’arrêt !

Les forces du marché sont censées contenir le pouvoir commercial privé. Lorsqu’elles ne suffisent pas, les démocraties usent plutôt du droit de la concurrence plutôt que de chercher à établir des règles gouvernementales pour les entreprises. Quand elles nuisent trop, les autorités les taxent pour financer des mesures correctives, comme elles le font à l’égard des entreprises qui polluent ou des fabricants de cigarettes. Les tribunaux peuvent également les obliger à prendre des mesures… Mais à l’égard des plateformes, nous ne suivons pas ce schéma où le gouvernement fixe les règles et les entreprises les suivent. Pire, souligne-t-elle : les plateformes peuvent bloquer des discours que les autorités n’ont pas le pouvoir de restreindre, ce qui peut plaire à nombre d’entre elles. Finalement, pour contourner les limites du droit, le risque est de donner plus de pouvoir aux plateformes, ce qui menace de renoncer à une réelle contribution démocratique qu’on pourrait leur demander : comme de mieux surveiller et publier les pressions qu’elles reçoivent des gouvernements.

Les entreprises privées remodèlent les normes d’expressions par à-coups, souvent brutalement, et non pas d’une manière progressive et prudente comme le ferait un tribunal ou un législateur. Le risque est que nous renoncions à des protections réellement constitutionnelles, elles, et à des aspects majeurs d’une ouverture démocratique de leur gouvernance.

Connaissez-vous le GIFCT, acteur majeur de la modération mondiale ?

Dans un article pour Slate, Chloe Hadavas (@hadavas) donne un exemple assez concret des lacunes démocratiques auxquelles ces plateformes nous confrontent. En 2017, Facebook, Microsoft, Twitter et YouTube ont créé une association – et une base de données -, le Global Internet Forum to Counter Terrorism (GIFCT, @GIFCT_official, Forum mondial de l’Internet pour la lutte contre le terrorisme) qui a pris en quelques années une importance majeure en matière de modération. Cette base de données pour coordonner la suppression de contenus relatifs à l’imagerie et la propagande terroriste violente produit une liste noire de contenus partagés entre les plateformes.

Page d'accueil du GIFCT

Le problème, c’est la grande opacité de son fonctionnement !, explique Hadavas. Aucune des décisions relatives au contenu n’est transparente et les chercheurs n’ont pas accès à cette base. Les règles que le consortium prend sont privées : il définit ce qui est et n’est pas un contenu terroriste, sans avoir à rendre des comptes, au risque de bloquer des reportages sur le terrorisme ou sur les violations des droits de l’homme. Le GIFCT ne force pas les plateformes à retirer les contenus qu’elle signale, mais c’est en réalité le cas, notamment parce qu’elles n’ont pas toujours les ressources suffisantes pour réévaluer les contenus que le GIFCT leur signale. Sous la pression de l’Appel de Christchurch, ce sommet politique entre gouvernements et entreprises pour lutter contre les contenus terroristes en ligne après la fusillade en Nouvelle-Zélande, le GIFCT a annoncé en 2019 qu’il allait remanier sa structure interne, notamment son comité consultatif indépendant en intégrant des représentants de plusieurs gouvernements (à savoir le Canada, la France, le Japon, le Kenya, la Nouvelle-Zélande, le Royaume-Uni et les États-Unis) pour le rendre plus responsable.

Le 30 juillet 2020 pourtant, le Center for Democracy and Technology (@CenDemTech) et 14 autres organisations de défense des droits de l’homme ont adressé une lettre à Nick Rasmussen, le directeur exécutif du GIFCT, s’inquiétant de son manque de transparence et de la participation déséquilibrée de certains gouvernements au Comité consultatif du GIFCT – au détriment d’autres ! Rappelant que les programmes de lutte contre le terrorisme et la surveillance ont violé les droits de certains pays et religions voire ont été utilisé par des gouvernements pour faire taire la société civile, les associations ont demandé à ce que « les limites entre la modération du contenu et le contre-terrorisme soient éclaircies ». Le risque est bien sûr que les plateformes décident demain de supprimer des données sous la pression de gouvernements pour imposer une censure qui ne serait pas légale autrement.

L’enjeu est de savoir comment tenir les décisions prises par le GIFCT comme responsables. Pour beaucoup, le consensus veut que le GIFCT serait plus digne de confiance s’il était plus transparent qu’il n’est. En juillet 2019 (puis en 2020), il a publié ses rapports de transparence en détaillant le fonctionnement d’un outil qui permet aux plateformes d’indiquer quand une image/vidéo/URL ne devrait pas figurer dans sa base de données. Mais c’est bien insuffisant, estime Daphne Keller, qui souhaite que des chercheurs puissent avoir accès à des copies du contenu réel bloqué par le GIFCT, pour mieux évaluer leurs biais et erreurs, ou offrir des possibilités de recours des utilisateurs lorsque leurs contenus sont bloqués par ce système. Enfin, d’autres réclament que le rôle du comité soit plus clair, notamment qu’il reste vraiment consultatif. Pour Keller, le GIFCT illustre combien la question de la responsabilité des plateformes s’avère glissante dans la pratique. Une poignée de plateformes ont créé des systèmes opaques et puissants qui appliquent des règles qui ne sont pas la loi pour contrôler les discours en ligne ! Le risque est bien que nous multiplions demain ce type de procédures et d’institutions spécifiques qui n’ont de compte à rendre à personne ! Et que ce qui n’est pas la loi devienne une norme…

Page d'accueil de l'Appel de Christchurch

Le conseil de surveillance de Facebook en ses limites

C’est en grande partie le risque que fait peser également le fameux conseil de surveillance de Facebook mis sous les projecteurs récemment pour sa décision très attendue sur l’éviction de Donald Trump. Le conseil de surveillance a donc décidé, début mai, de maintenir la « déplateformisation » de l’ancien Président, expliquait TechPolicy.press (@techpolicypress), mais en renvoyant l’entreprise à motiver et mieux délimiter la sanction. Le conseil de surveillance de Facebook a cependant approuvé les décisions prises par l’entreprise – même s’il a demandé des explications sur celles-ci. Le conseil a recommandé d’améliorer le recrutement de son personnel de modération notamment ceux spécialisés dans le traitement des utilisateurs influents, de clarifier la politique qui permet à certains utilisateurs d’échapper aux contraintes qui pèsent sur tous en raison de leurs statuts.

Pour Jordan Guiao (@jordanguiao), chercheur au Centre australien pour la technologie responsable (@CnrtResponsTech), dans une tribune pour TechPolicy, cette décision montre surtout les limites de l’exercice d’autorégulation. Pour lui, si Facebook est si incapable de traiter ces questions, c’est bien parce que sa plateforme n’a pas été conçue pour ça et que Facebook reste dominé par ses intérêts commerciaux. En Australie, le récent conflit entre Facebook et la presse a laissé des traces explique le chercheur, qui, comme Ethan Zuckerman ou Eli Pariser (que nous évoquions il y a peu), milite pour des réseaux sociaux de services publics. Plutôt que de perdre notre temps à réguler Facebook, nous devrions surtout prendre le temps de construire des solutions nouvelles et différentes. Comme le pointait le professeur de littérature Dennis Tenen (@dennistenen) sur The Reboot (@ProjectReboot) –repris et traduit par ,Mais où va le web ? -, la modération n’est pas universelle et nécessiterait d’être bien plus maîtrisée par la communauté et le contexte, selon les fins qu’elles poursuivent, plutôt que d’être conçue d’une manière totale et industrielle, qui impose un régime de modération sans nuance, sans discussion, sous forme d’un régime universel qui n’est ni transparent ni démocratique.

Page d'accueil du conseil de surveillance de Facebook

En février, le New Yorker est revenu en détail sur la construction du conseil de surveillance de Facebook dans un article qui en éclaire justement les limites. Son auteure, Kate Klonick (@klonick) a suivi son déploiement (avec l’autorisation de Facebook).

Au début, rappelle-t-elle, FB n’avait aucune idée sur la manière dont ce conseil devait fonctionner. Pour trouver des idées, elle a organisé des ateliers avec des experts du monde entier sous la supervision de Zoe Darme, à l’époque responsable de l’équipe gouvernance de FB, en donnant aux participants des cas concrets à modérer. Pour Klonick, ces exemples, dans leur ambivalence même, soulignaient combien l’incertitude et la difficulté à produire des règles claires était difficile, d’autant que les « intuitions » sur la liberté d’expression varient considérablement selon les clivages politiques et culturels. Au final, les opinions des experts se sont révélées assez contradictoires : dans un atelier à New York, 60 % des participants ont voté pour le rétablissement d’une image d’une femme souriante accompagnée d’une bulle où était inscrit « Tuez tous les hommes », en y voyant surtout de l’humour, alors qu’à Nairobi, seulement 40 % ont voté pour son rétablissement. Pour Zoe Darme, la raison tient peut-être plus à des questions de respect de l’État de droit : là où il est moins respecté, la liberté d’expression l’est moins également… Pas sûr que ce soit la seule explication…

« L’idée que FB, à l’instar d’une république naissante, ait besoin d’instituer des réformes démocratiques, aurait pu paraître saugrenue il y a 10 ans », explique Klonick. En 2009, FB avait lancé un référendum portant sur la modification de ses conditions d’utilisation où seul 0,32 % des utilisateurs avaient voté. L’entreprise promettait alors de donner plus de pouvoir à ses utilisateurs… Elle en est largement revenue. Alors que de plus en plus d’utilisateurs rejoignaient les plateformes de réseaux sociaux, les entreprises ont instauré de plus en plus de règles pour assainir le contenu et maintenir l’expérience qu’elles proposaient la plus agréable possible. Mais cela s’est complexifié à mesure que le nombre d’utilisateurs a progressé.

L'article de Kate Klonick pour le New Yorker

L’idée du conseil de surveillance est venue d’un professeur de droit de Harvard, Noah Feldman. Pour lui, les médias sociaux devaient créer des systèmes quasi juridiques, une sorte de « tribunal d’entreprise », afin de traiter les questions difficiles liées à la liberté d’expression. Zuckerberg a soutenu l’idée devant son conseil d’administration dubitatif et partagé, en expliquant qu’un conseil d’experts serait le mieux placé pour prendre les décisions difficiles auxquelles l’entreprise était de plus en plus confrontées. Il a lancé le projet. La charte du conseil de surveillance et ses règles de procédures, rédigées par des experts et employés de FB, ont, de réunion en réunion, été nettoyées de leur emphase juridique pour devenir plus accessibles. Les rouages de l’instance ont été mis en place : composée d’une vingtaine de membres, très bien payés, pour une quinzaine d’heures de présence par semaine. Une commission choisit les cas les plus représentatifs des 200 000 publications qui posent problème chaque jour et les soumet à une partie des membres réunis anonymement pour qu’ils statuent.

L’utilisateur incriminé doit déposer un mémoire écrit pour sa défense. Un représentant de l’entreprise dépose un argument pour expliciter la décision de l’entreprise. Le panel décide et FB exécute la décision prise. Actuellement, les utilisateurs peuvent faire appel en cas de suppression de leur publication (take-downs), mais pas quand elles sont laissées en place (keep-ups) – or un grand nombre de problèmes signalés sont bien souvent maintenus en ligne. Les utilisateurs ne peuvent pas non plus faire appel sur des questions comme la publicité politique, les algorithmes ou la déplateformisation de pages de groupes (mais FB a annoncé qu’il devrait permettre d’élargir l’appel des décisions par les utilisateurs)… Quant au conseil, il ne peut prendre des décisions que sur les affaires que lui renvoie FB, pas de sa propre initiative. Autre limite : les décisions du conseil ne deviennent pas une politique ! C’est-à-dire que si le conseil supprime ou rétabli un contenu, cela n’oblige pas FB a retirer ou maintenir les publications similaires (cela reste à la discrétion de l’entreprise). Enfin, les recommandations politiques du conseil ne sont que consultatives, ce qui en limite la portée, mais, malgré tout, entrouvre une fenêtre inédite de pression publique sur la politique de l’entreprise.

Klonick s’amuse également des discussions qui ont eu lieu pour choisir les membres de ce conseil de surveillance et notamment des innombrables pressions reçues. Dès les premières annonces, les controverses ont fleuri. En mai 2020, sa composition a été annoncée, déclenchant l’ire de certains, notamment du président Trump, sans que FB ne cède à ses pressions. Les détracteurs restent néanmoins nombreux. Pour la professeure de droit Julie Cohen (@julie17usc), ce panel de stars somptueusement rémunérées n’a aucun intérêt et ne peut se prononcer sur les problèmes les plus fondamentaux de FB. Pour Zuckerberg, FB va avoir besoin d’institutions et de surveillance supplémentaire. Créer des produits pour communiquer n’est pas le même travail que gouverner une communauté, expliquait-il directement à Klonick pour justifier de la création du conseil.

En avril 2020, les membres du conseil se sont réunis pour la première fois (sur Zoom !) et ont suivi une formation pour se connaître les uns les autres et sur les normes en matière de modération de FB. En octobre, FB a (entre)ouvert la possibilité d’appels (à 5 % des utilisateurs choisis aléatoirement). En novembre, le conseil a reçu ses premiers cas.

Un des cas traités était une photo d’église détruite en Azerbaïdjan par un utilisateur se plaignant de l’agression du pays à l’encontre des Arméniens. FB avait supprimé le post sous prétexte qu’invitait à la haine. Certains membres du conseil ont trouvé étrange d’appliquer cette règle dans le cas d’une publication se plaignant d’un groupe dominant en conflit avec un autre. Mais le conseil a finalement voté pour la suppression du message.

Dans un autre cas – une vidéo et un texte provenant de France se plaignant que le gouvernement avait refusé d’autoriser l’hydroxychloroquine contre le Covid-19 -, que FB avait supprimé pour ne pas promouvoir l’automédicamentation, les discussions ont été nourries. D’un côté des membres soulignaient que FB devait combattre la désinformation, de l’autre, des membres ont souligné que la publication prônait un changement de politique et donc relevait d’un risque de censure de discussions politiques. Le médicament n’étant pas en vente libre en France et ne pouvant donc pas promouvoir l’automédication, le conseil a finalement décidé de ne pas le censurer et de restaurer la publication.

Quelques semaines plus tard, alors que les protestations Black Lives Matter se répandaient dans le pays, Trump a publié sur FB et Twitter un message menaçant d’envoyer l’armée pour les maîtriser, précisant « quand les pillages commencent, les tirs commencent », une phrase dont la charge raciste est sans équivoque. Twitter a alors signalé à ses lecteurs que le tweet violait ses règles, mais pas FB. Zuckerberg a publié lui-même une déclaration expliquant qu’il ne partageait pas ces propos, mais que c’était aux gens de s’en rendre compte en soulignant dans une interview à Fox News que son entreprise ne pouvait pas être « l’arbitre de la vérité ». Des employés en colère ont organisé un débrayage virtuel face à cette inaction. Quelques jours plus tard, l’un des membres du conseil a suggéré une réunion du conseil au complet qui a débattu du sujet.

Plusieurs membres étaient choqués et souhaitaient publier une déclaration condamnant la décision de FB. D’autres étaient contre le fait de prendre une décision partisane. Après 2 heures de discussion, les membres ont décidé pourtant de ne pas s’exprimer sur cette question.

Face à Trump, comment Facebook s’est pris les pieds dans son opacité

Et puis il y a eu la contestation des résultats de l’élection et la prise d’assaut du Capitole. FB a supprimé deux publications de Trump le jour même. Et le lendemain des événements, Zuckerberg, sur son propre fil FB, a annoncé la suspension indéfinie du compte de Trump. Le lendemain, Twitter l’a banni à son tour. Cette « déplateformisation » comme on l’a appelé a bien sûr fait couler beaucoup d’encre. Certains s’en sont félicités, d’autres ont exprimé leur inquiétude du fait que FB avait fait taire un dirigeant démocratiquement élu. Pour le professeur de droit Eugene Volokh (blog), la cinquième entreprise des États-Unis, en situation de quasi-monopole sur son créneau, a restreint la liberté d’expression d’une personnalité politique auprès des trente millions de personnes qui le suivaient. C’est peut-être très bien… Mais ça reste un pouvoir immense, confiait-il à Klonick. Angela Merkel a qualifié cette suppression de problématique et Navalny, l’un des opposants de Poutine, a dénoncé une censure inacceptable.

En interne, seul FB avait le pouvoir de renvoyer la suspension de Trump devant le conseil de surveillance. Le conseil d’administration a plaidé pour que le conseil de surveillance examine le cas, afin de ne pas porter atteinte à sa jeune légitimité. Le lendemain de l’investiture de Joe Biden, FB a envoyé le dossier au conseil de surveillance. L’article de Klonick se terminait sur les attentes que représentait cette décision. Elles ont été douchées depuis.

Comme le raconte Klonick dans le Washington Post, le réseau social espérait s’en remettre à son instance d’appel, mais ce n’a pas été le cas. Si le conseil a confirmé la décision de bannir Trump, il a demandé que l’entreprise assume davantage la responsabilité de ses décisions. FB a dépensé 130 millions de dollars pour mettre en place ce conseil (pour assurer son fonctionnement pour une durée de 6 ans), rappelle Klonick.

Pendant des années, rappelle-t-elle, FB a maintenu des conditions exceptionnelles pour laisser Trump s’exprimer, alors qu’en regard de sa politique, il aurait dû être censuré depuis longtemps. « Lorsque vous accordez des exceptions aux personnes les plus puissantes du monde, elles abusent de leur pouvoir », alors qu’appliquer la même justice pour tous reste une des plus puissantes boussoles collectives qui soient. Le 6 janvier, ces petits accommodements ont finalement explosé au visage de l’entreprise.

Dans sa décision, le conseil rappelle finalement que FB n’a pas utilisé de règles claires, notamment parce que l’entreprise n’a cessé de les modifier à la volée, ce qui n’est pas conforme ni aux règles ni à l’équité. Il a expliqué que si FB voulait exclure Trump de façon permanente, c’était à l’entreprise de créer les règles pour cela. Le conseil rappelle que le manque de transparence de FB sur ses propres règles lui est préjudiciable et a demandé à l’entreprise de répondre sur la façon dont les décisions concernant les utilisateurs influents sont prises… Elle a aussi demandé à ce que FB éclaircisse comment ses algorithmes avaient amplifié les messages de Trump – mais pour l’instant, FB a refusé de répondre à cette question. Cette remarque est certainement la plus importante de l’avis, explique Klonick. « Si FB veut que le conseil de surveillance soit respecté comme tribunal indépendant, refuser de répondre à ses questions n’aidera pas ». Et souligne que l’enjeu principal à toute transparence demeure la question du calcul de la mise en visibilité et invisibilité des contenus.

Dans une longue interview pour The Verge, Klonick précise encore que le conseil rend des décisions anonymes à la majorité, mais éclaire dans ses notes le fait qu’il y ait des opinions divergentes. Elle rappelle à nouveau qu’une des limites du conseil c’est de rendre des décisions très étroites sur la suppression ou non d’un contenu qui ne s’élargissent pas à des contenus similaires, ce qui limite beaucoup sa portée. Le conseil a pourtant le droit de faire des recommandations de politique auxquels FB doit répondre dans les 30 jours pour préciser les raisons qui la conduise à les mettre en place ou pas. Pour le professeur de droit de Harvard, Mark Tushnet, cela reste une forme de contrôle de « forme faible », une pression de réputation surtout. Le conseil ne fait pas le droit. Il ressemble bien plus à un tribunal de première instance qu’à une Cour d’appel ou une Cour suprême !

L'interview de Klonick pour The Verge

Ce que souligne la décision malgré tout, c’est qu’une suspension permanente est de facto disproportionnée. Pour Klonick, FB semble effectivement avoir des « règles » différentes pour certaines personnes, mais nous n’avons « ni accès à la liste des personnes concernées, ni ne savons comment elle est gérée, ni bien sûr les exceptions aux règles dont elles bénéficient » – pour autant qu’il y ait vraiment des règles, il est probable, ajouterai-je qu’ils bénéficient surtout de modérateurs/appréciateurs de contenus dédiés par rapport au traitement massifié de tous les autres utilisateurs. En demandant à FB de s’expliquer, le conseil de surveillance a pleinement rempli son rôle.

Depuis, Facebook a fait de nouvelles annonces et enfin répondu au conseil de surveillance. Notamment en annonçant ramener le bannissement de Trump à 2 ans et en annonçant de nouvelles règles (avec des sanctions plus strictes, hiérarchisées et croissantes) pour les « personnalités publiques », explique FastCompany. Reste que la réponse de FB demeure floue : « Nous autorisons certains contenus dignes d’intérêt ou importants pour l’intérêt public à rester sur notre plateforme, même s’ils sont susceptibles de violer nos normes communautaires » et n’explique toujours pas qui sont les utilisateurs influents qu’il distingue du commun des mortels et qui vont continuer à recevoir un traitement particulier et accéléré pour mieux saisir leurs intentions et la réception de leurs propos. Comme le constate le chercheur Olivier Ertzscheid (@affordanceinfo2) dans une tribune pour Libération, c’est un revirement pour FB puisque désormais tout propos pourra être modéré… mais ce revirement date surtout des conséquences des décisions du 7 janvier, plus que de la réponse de FB. Pour autant, les personnalités publiques ne sont pas encore ramenées au rang de simples utilisateurs, et encore une fois, si tout propos peut-être modéré, il n’en sera pas de même si vous êtes riches et puissants que pauvre et malade !

En 2019, Klonick avait publié un article pour comprendre depuis quels critères FB pouvait définir un statut spécifique de personnalités publiques « dignes d’intérêt ». Mais « dignes d’intérêt pour qui ? » interrogeait-elle avec perspicacité. Ici, le conseil de surveillance rappelle soit que FB devrait supprimer ces exceptions soit être clair à leur sujet.

Pour Klonick, la suite des débats sera intéressante. Il est probable que le conseil s’oppose de plus en plus à FB, s’isole et finisse par s’éteindre à son terme. Mais, malgré ses innombrables limites et son pouvoir circonscrit, le conseil de surveillance de FB pourrait aussi montrer aux autorités qu’on pourrait exiger de toutes plateformes une instance de ce type – le Canada d’ailleurs envisagerait de rendre obligatoire la création de conseils de surveillance pour les plateformes de médias sociaux, avance-t-elle un peu rapidement dans l’interview, mais le projet de loi C-10 pour modifier la loi sur la radiodiffusion dont il semble être question n’avance pas ce type de propositions. Reste à savoir, suggère encore Klonick si le conseil de surveillance (de FB, mais qui ne le porte pas dans son nom officiel), va rester le conseil de surveillance de FB ou si finalement, comme l’induit son nom, il ne pourrait pas devenir une autorité pour toutes les plateformes… Twitter, qui ne s’est pas doté d’autorité de ce type, pourrait demain déverser également une somme équivalente dans la société indépendante créée par FB pour former son propre conseil… Pour Klonick, la diversité des politiques de modération des plateformes, leurs positionnements, leurs rôles et leurs différences algorithmiques sont certainement essentiels. Dans un scénario de fusion des conseils de surveillance, le risque est aussi que les normes soient partout les mêmes… Pire : l’idée qu’une entité unique contrôle demain la libre expression des États-Unis et du monde est certainement une perspective plus problématique qu’autre chose.

Et Klonick de rappeler que seulement 7 % des utilisateurs de FB sont américains ! FB impose des normes au monde entier alors que celles-ci sont décidées par une population qui n’y est même pas majoritaire ! Que FB décide de la nature de ses politiques, soit. Mais ce qui importe, c’est qu’elles soient justes, cohérentes, proportionnées, équitables. Or, les résultats injustes semblent plus la norme que l’exception, avance Klonick, qui explique que le taux d’erreur sur les décisions de modération de contenu serait de 80 % [en fait, ce chiffre semble issu d’un article d’analyse de la décision du conseil de surveillance par le Center for Democracy & Technology qui souligne que 25 contenus postés sur le compte de Trump ont été marqués comme contraires aux standards de FB, mais que suite à leur examen, seulement 5 d’entre eux ont été retenus comme contraires aux standards, ce qui révèle un taux d’erreur dans l’application des standards de 80% ! Et les auteurs de généraliser ce taux d’erreur aux décisions de retraits qui impactent tous les utilisateurs… – qui ne bénéficient pas du même traitement de vérification que les utilisateurs « dignes d’intérêt » – en rappelant d’ailleurs que FB, dans ses rapports de transparence, n’est pas très clair sur son taux d’erreur, ni sur le taux de contenus rétablis, NDT]. Dans son avis, souligne encore Klonick, le conseil de surveillance pointe le rôle du comité discret qui écrit, modifie et réécrit les règles de modération de FB à assumer son rôle politique. Pas sûr que ce soit pourtant la piste que poursuivra l’entreprise ! Jusqu’à présent, ces instances internes qui précisent et peaufinent les règles de modération, quand elles existent, ont toujours été éminemment discrètes et particulièrement protégées.

« Une plus grande modération des contenus ne signifie pas une meilleure modération »

Très concrètement, l’IA est toujours aussi nulle pour modérer les discours de haine, soulignait la Technology Review, depuis une étude (.pdf) qui a testé 4 systèmes distincts de modération en montrant que tous avaient du mal à distinguer les phrases toxiques des phrases inoffensives. Pour accomplir leur étude, les chercheurs ont mis au point 29 tests différents, afin de mieux déterminer où chaque système échoue, et ont distingué 18 types différents de discours de haine et 11 scénarios qui n’en relèvent pas et qui piègent souvent les systèmes automatisés (comme l’usage de jurons, la récupération d’insultes en contre-discours…), ainsi que des modèles spécifiques pour les groupes protégés par les lois contre la discrimination américaines. Pour chaque catégorie, ils ont créé des exemples modèles et une base de données, HateCheck. Ils ont ensuite testé des services commerciaux, comme Perspective de Google Jigsaw (utilisés par Reddit, le New York Times et le Wall Street Journal) ou SiftNinja de Two Hat. Leurs résultats soulignent la difficulté du curseur : « Modérez trop peu et vous ne parvenez pas à résoudre le problème ; modérez trop et vous pourriez censurer le type de langage que les groupes marginalisés utilisent pour s’autonomiser et se défendre ». Les catégories d’exemples produites devraient permettre d’améliorer les modèles, estiment cependant les producteurs d’outils testés.

Mais peut-être que la solution est à chercher non pas dans l’amélioration de la modération automatisée, mais dans l’amélioration des interfaces elles-mêmes ? C’est ce que montrent des chercheurs de l’université de Washington (voir l’étude) qui ont travaillé à trouver des idées de conception pour rendre les conflits sur Facebook plus « constructifs ». « Même si les espaces en ligne sont souvent décrits comme toxiques et polarisants, les gens souhaitent avoir des conversations difficiles en ligne », explique Amanda Baughan (@amanda_Baughan). Aujourd’hui, les désaccords produisent surtout des engueulades et se terminent bien souvent par des blocages ou suppressions mutuelles. Parmi les story-boards de propositions, les interfaces pourraient proposer de passer en conversation privée quand les propos s’enveniment – ce qui se passe assez souvent – ou encore de faire remonter les commentaires les plus constructifs (ce que les likes et les modalités d’affichages par importance, permettent souvent de faire déjà), ou encore d’ouvrir un écran d’alerte quand les réponses qu’on s’apprête à poster détectent des mots violents ou encore des modalités qui mettent les réponses en attente pour permettre à leurs auteurs d’y réfléchir, comme pour ralentir les conversations.

Pas sûr que ces solutions suffisent pourtant…

Dans Wired, la juriste Evelyn Douek (@evelyndouek) dresse un constat similaire : à mesure qu’elle s’étend, la modération à un coût. La modération de contenu est en train de dévorer les plateformes prévient-elle – peut-être un peu rapidement, vu les profits qu’elles engrangent. Les règlements et politiques à destination des utilisateurs explosent et se complexifient alors que les demandes de régulation par les pouvoirs publics se précisent et s’intensifient aussi. L’élection américaine et les urgences de santé publique ont poussé les mesures à une intensification inédite. Pour la chercheuse, l’époque où Facebook et Twitter se lavaient les mains des problèmes qu’ils généraient, en pensant que les internautes se gouverneraient eux-mêmes, est certainement loin derrière eux. Mais penser que l’on va résoudre tous les problèmes en effaçant chaque jour un peu plus de contenus des réseaux sociaux tient d’une réponse simpliste et inefficace à une question complexe. « Une plus grande modération des contenus ne signifie pas une meilleure modération ». Chaque étape nécessite des compromis et ce n’est pas parce qu’on les ignore qu’ils n’existent pas.

Illustration de l'article de Evelyn Douek pour Wired

Les plateformes ont agi assez rapidement pour répondre à la désinformation autour de la pandémie et plutôt efficacement estime la juriste, tant et si bien que beaucoup se demandent maintenant pourquoi elles ne sont pas plus efficaces pour combattre d’autres types de fausses informations. Mais pour elles, la désinformation sur le virus était différente, se justifient-elles, notamment parce qu’elles pouvaient se référer à des autorités claires, comme l’Organisation mondiale de la santé (OMS). Cette ligne claire n’a pas tenu longtemps pourtant et elles n’ont cessé d’étendre les garde-fous. Elles ont collé des étiquettes d’information un peu partout, sans qu’on puisse dire qu’elles aient été efficaces. Suite à la crise du Capitole, elles ont même censuré plus que jamais négationnistes et conspirationnistes… jusqu’au président des États-Unis lui-même.

Pourtant, pour beaucoup de commentateurs, les efforts des plateformes restent insuffisants. Les appels à la modération demeurent forts et réguliers et les législateurs n’ont pas cessé leurs menaces. À l’heure actuelle, il n’y a pratiquement pas un seul pays dans le monde qui ne prenne de mesure pour réglementer les médias sociaux d’une manière ou d’une autre. Et les plateformes ne cessent de préciser leurs règles, d’en produire de nouvelles et surtout de développer un empilement de boîtes de modération – et de spécifications pour leurs éboueurs du web – les unes sur les autres (pédocriminalité, terrorisme, nudité…). Reste que depuis que Trump a été réduit au silence et que nombre de complotistes ont été chassés ou sont partis ailleurs, l’angoisse s’est un peu calmée – à croire qu’une grande partie de l’angoisse tenait peut-être plus de la politique que des plateformes elles-mêmes, souligne Douek. Mais l’impressionnante démonstration de pouvoir qu’elles ont montré a laissé des traces. L’idée qu’il existerait une catégorie claire de « fausses informations » a également pris du plomb dans l’aile.

Distinguer le vrai du faux n'est pas si simple comme le montre ce photomontage de titres de presse à quelques mois d'intervallesLa semaine dernière par exemple, Facebook est revenu sur une de ses décisions et a déclaré qu’il ne supprimerait plus les publications affirmant que le Covid-19 est d’origine humaine ou fabriqué. Pourtant, il n’y pas si longtemps, le New York Times lui-même et toute la presse avec lui, citait cette théorie « sans fondement » comme une preuve que les médias sociaux avaient contribué à une « crise de la réalité ». Au début de la pandémie jusqu’en juin 2020, FB a interdit les publicités pour les masques, jusqu’à ce que l’OMS les recommande. Les médias sociaux semblent s’être surtout beaucoup adaptés à la fois à une science qui s’est faite en marchant et aux erreurs commises par les autorités, sans parvenir à délimiter les limites raisonnables du débat public.

Comme le rappelle la maxime, « la science n’est pas la vérité, mais sa recherche. Quand elle change d’opinion, elle ne nous ment pas. Elle nous dit qu’elle a appris davantage » (voir notamment nos articles : « Naviguer dans les ruines de la réalité consensuelle » et « Une pandémie de données ne soigne pas de la vérité »).

Enfin, les appels à toujours plus de mesures de répression ont également montré qu’elles pouvaient avoir des coûts géopolitiques forts, rappelle Douek. Les gouvernements autoritaires et répressifs ont pu faire référence à la rhétorique des démocraties libérales pour justifier leur propre censure, à l’image du gouvernement indien tentant de faire pression pour que les plateformes limitent les critiques sur sa gestion de la crise Covid au détriment de la liberté d’expression. Pour l’instant, les gouvernements occidentaux ont refusé de regarder ce problème, laissant les plateformes se débrouiller seules face à la montée de l’autoritarisme numérique des gouvernements illibéraux. Le problème, c’est que les plateformes sont en train de perdre ce combat, estime Douek, à l’image de la suspension de Twitter par les autorités nigérianes suite à la censure d’un tweet de leur président. On le voit, la régulation des plateformes ne peut pas conduire à « augmenter la censure ici et la réduire plus loin ».

Enfin, souligne Douek, il reste encore d’autres compromis à faire. « Comme la modération du contenu à très grande échelle ne sera jamais parfaite, la question est toujours de savoir de quel côté de la ligne il faut se tromper lorsqu’on applique des règles ». Le risque est bien sûr de multiplier les règles strictes et la sévérité de leur application notamment avec une modération de plus en plus automatisée. « Ces outils sont brutaux et stupides » : ils ne peuvent pas évaluer le contexte ou faire la différence entre un contenu glorifiant la violence ou enregistrant des preuves de violations des droits de l’homme, par exemple. Les conséquences de ce type d’approche ont été mises en évidence lors de la récente crise du conflit israélo-palestinien de ces dernières semaines, Facebook ayant supprimé à plusieurs reprises des contenus importants provenant de Palestiniens ou les concernant (voir notamment, l’analyse de Mathew Ingram pour la Columbia Journalism Review ou celle du Washington Post qui expliquent que les activistes palestiniens reçoivent le même traitement que les activistes Noirs américains : ils sont bloqués !). Ces cas ne sont pas isolés. Et ces différences de traitements ont toujours tendance à toucher de manière disproportionnée les communautés déjà marginalisées et vulnérables (comme le pointait le travail de la sociologue Jen Schradie).

Pour Douek, le retrait de contenu ne résout pas les problèmes sociaux et politiques sous-jacents, pas plus que la disparition des comptes de Trump n’a fait s’évaporer son emprise sur le parti républicain – même si le monde en ligne parle beaucoup moins de lui (selon une récente étude relayée par le New York Times cependant, depuis son éviction, certains de ses messages sont parvenus à recevoir beaucoup d’attention notamment parce que ses plus fervents partisans continuent de les diffuser, estime le Global Disinformation Index. Malgré ces relais, leur diffusion est tout de même moindre, soulignant en creux l’énorme pouvoir des sociétés de médias sociaux. Le bannissement de Trump ne résout pas la désinformation, mais perturbe ses réseaux et atténue l’influence des individus les plus nuisibles qui se sont réfugiés ailleurs. En tout cas, les réseaux ont retrouvé un certain calme et Trump ne façonne plus seul l’agenda politique de son pays et du monde.

Image d'illustration de l'article de The Atlantic sur le retour au calme des réseaux depuis le bannissement de Trump

À l’heure où beaucoup d’argent se déverse dans la création de plateformes alternatives, notamment extrêmistes ou complotistes, bien plus permissives, la censure automatisée des contenus des plateformes grands publics risque de s’avérer encore moins efficaces qu’elles ne l’ont été, surtout que ces « petits » réseaux risquent d’être beaucoup plus laxistes dans leur modération.

« Supprimer les contenus ne supprime pas la cause qui les a fait naître », conclut Douek. Il est tentant de penser que nous pouvons modérer la société, mais il va être bien plus difficile de résoudre les problèmes sociaux et politiques dont ils sont l’expression. Les plateformes ne seront jamais en mesure de compenser les défaillances de nos sociétés. Cela ne veut pas dire que les plateformes ne doivent pas continuer à réfléchir à la manière d’atténuer leurs effets néfastes, bien sûr. Toute expérimentation qui n’est pas binaire (laisser ou supprimer) notamment est bonne à prendre, par exemple le fait que Twitter incite ses utilisateurs à lire un article avant de le tweeter, ou le fait de limiter le nombre de fois où l’on peut transférer un contenu depuis une même plateforme (comme le propose WhatsApp). D’innombrables ajustements peuvent être tentés sans que les plateformes ne décident de la vérité à notre place.

Quelles transparences ? Quelles gouvernances ?

On l’a vu avec ces exemples, notamment celui du conseil de surveillance et des politiques de modération de FB comme dans le cas du GIFCT, les questions de transparence et de contrôle démocratique demeurent au cœur des enjeux de régulation de la modération. Reste à savoir comment organiser, très concrètement, le contrôle démocratique d’instances qui risquent de se démultiplier à l’avenir. Reste à savoir aussi de quelle transparence nous avons besoin.

C’est la question que posait Daphne Keller sur son blog. Alors qu’elle écrit depuis des années sur le sujet, elle reconnaissait, avec humilité qu’elle ne savait pas très bien quelle transparence elle appelait de ses vœux. Beaucoup de gens estiment que plus de transparence est un mieux, mais personne n’a une liste claire de ce qui devrait être transparent. « Quelles informations sont essentielles ? Lesquelles faut-il vraiment rendre transparentes ? Quels sont les compromis à faire ? » Cette imprécision est en passe de devenir un problème, alors que nombre d’autorités s’apprêtent à produire des exigences de transparence auprès des plateformes. Or, « ce que la loi n’exigera pas ne sera peut-être jamais plus rendu accessible », reconnait la juriste. Exiger une transparence totale n’est peut-être pas pleinement judicieux d’autant plus que cela a un coût, explique la juriste à la suite d’Evelyn Douek. « Des obligations de transparence très prescriptives pourraient également entraîner une normalisation et une homogénéité de facto des règles des plateformes, des pratiques de modération et des fonctionnalités. » Ce ne sont bien sûr pas des raisons d’y renoncer, mais de pointer que nous devons être plus précis sur ce que la transparence signifie vraiment et concrètement.

Keller a dressé une petite liste « préliminaire et très provisoire » des problèmes que posent les rapports de transparence existants. Pour la chercheuse, par exemple, il est essentiel de savoir avec une grande précision le nombre de demandes d’accès à des données qu’une plateforme reçoit des autorités, comment elle y répond, quel contrôle judiciaire elles produisent. Elle rappelle également que les chiffres ne sont pas tout. Pour comprendre les erreurs ou les préjugés des plateformes sur leurs propres données, il est nécessaire que les chercheurs indépendants puissent voir le contenu impliqué dans les décisions de retrait par exemple.

En 2009, nous nous interrogions avec Lawrence Lessig sur les limites de la transparence. Il nous disait déjà que la transparence nue n’était pas un remède magique. Pour ma part, il me semble que la transparence se rapproche des mêmes problématiques que celles que nous évoquions à propos de l’explicabilité. Plus qu’une liste d’éléments qui doivent être rendus transparents ou d’exigences précises, la transparence relève d’échelles, d’impacts et de multimodalités de niveaux de transparence. Devrons-nous demain définir des transparences « contrastables et actionnables », « sélectives, mais loyales », « techniques et/ou sociales »…, « jouables », selon des échelles allant de « fortes, faibles à inexistantes » ? La transparence nécessite d’être évaluée et appréciée dans toutes ses dimensions, comme une matrice qui permet de mesurer son étendue, sa profondeur et bien sûr ses effets. Ce qui est sûr, c’est que pas plus que les explications, la transparence n’est en rien réductible à une technique, à des listes, mais relève profondément d’un dialogue entre un système et la société. Plus que d’obligations, de droits et de devoirs (de checks-lists ou de systèmes d’évaluation d’impact), c’est bien ce dialogue qu’il va falloir nourrir pour parvenir à dépasser une vision bien trop binaire de la modération…

Dans un article de recherche, Evelyn Douek montrait d’ailleurs très bien que les plateformes ont une politique plus complexe que le mode binaire entre supprimer et laisser faire. Les plateformes ont mis en place nombre de mesures intermédiaires, allant de l’étiquetage à la vérification des faits en passant par les écrans d’avertissements… Des mesures qu’il faut certainement continuer à diversifier, mais dont il est nécessaire aussi d’évaluer les effets.

Pour cela, il est plus que jamais nécessaire qu’elles s’ouvrent aux contrôles indépendants et qu’on évalue leur transparence dans leur complexité, d’une manière dynamique. Pour le dire autrement, la transparence et la gouvernance, comme l’explicabilité, tiennent de pratiques qui doivent évoluer. Ce sont des objectifs vers lesquels les systèmes doivent tendre. Pour cela, il y a certes des modalités dynamiques (publications ouvertes, accès ouvert à la recherche, modalités de contribution des utilisateurs, ouverture de la gouvernance…) qui dépendent chacune d’échelles. Pour évaluer ces paramètres, nous aurions besoin d’une forme de « nutriscore » qui puisse informer de la qualité des explications, de la transparence, de la gouvernance… et qui permettrait de pointer un idéal auquel tendre !

Hubert Guillaud

PS : signalons les très intéressantes études de cas de modération du groupe de réflexion The Copia Institute (@copiainstitute) – découvertes au détour de nos lectures -, qui soulignent très bien par des exemples concrets la difficulté de la modération et montrent les compromis inhérents à toute décision.

  • ✇InternetActu.net
  • En médecine, l’IA est en plein essor, mais pas sa crédibilité
    Avec la pandémie, les chercheurs ont eu plus que jamais recours à l’IA pour tenter de percer les secrets du Covid-19, notamment pour tenter de détecter la maladie plus tôt sur les images pulmonaires et mieux prédire quels patients sont plus susceptibles de tomber gravement malades. Des centaines d’études ont été publiées dans les revues médicales et sur les serveurs de prépublication pour démontrer les capacités de l’IA à effectuer ces analyses avec précision. Une équipe de recherche de l’univer

En médecine, l’IA est en plein essor, mais pas sa crédibilité

3 juin 2021 à 11:38

Avec la pandémie, les chercheurs ont eu plus que jamais recours à l’IA pour tenter de percer les secrets du Covid-19, notamment pour tenter de détecter la maladie plus tôt sur les images pulmonaires et mieux prédire quels patients sont plus susceptibles de tomber gravement malades. Des centaines d’études ont été publiées dans les revues médicales et sur les serveurs de prépublication pour démontrer les capacités de l’IA à effectuer ces analyses avec précision. Une équipe de recherche de l’université de Cambridge en Angleterre a examiné quelques 400 de ces modèles pour Nature et est arrivée à une conclusion bien différente. Chacun d’eux présentait de graves lacunes méthodologiques. En fait, dans la plupart des études, les algorithmes étaient entraînés sur de petits échantillons de données, provenant d’une seule origine, avec une diversité très limitée. Certaines études ont même utilisé les mêmes données pour l’entraînement et les tests, ce qui conduit souvent à des performances impressionnantes, mais totalement fallacieuses.

Le problème ne se limite pas au Covid, explique le toujours excellent Casey Ross (@caseymross) pour Statnews (@statnews) – qui nous avait déjà alerté sur les limites du Watson d’IBM dans le domaine de la santé, qui a visiblement depuis tiré des leçons de ses échecs et changé sa politique. Le Machine learning génère des milliards d’investissements en médecine, mais est confronté à une crise de crédibilité. Nombre d’articles s’appuient sur des données limitées ou de faibles qualités, beaucoup d’autres ne précisent par leurs méthodes, et d’autres voire les mêmes ne vérifient pas si leurs modèles fonctionnent pour des personnes de sexe, d’âge ou d’origines différentes. Certes, l’intensité de la concurrence et l’urgence ont tendance à générer la surpublication d’études peu rigoureuses. Mais le problème tient plutôt du cercle vicieux de l’apprentissage automatique : il existe peu de grands ensembles de données diversifiées pour entraîner et valider un nouvel outil. Trop souvent, les données sont protégées pour des raisons juridiques ou commerciales. Conséquence, les évaluateurs n’ont pas de données pour tester ou comparer, étape pourtant clé dans l’approbation des travaux. Le fait de ne pas tester les modèles avec des données différentes est courant dans les études de prépublication… Le problème, c’est que les algorithmes semblent souvent précis et efficaces, mais lorsque les modèles sont exposés à d’autres données (parfois seulement des images médicales obtenues avec d’autres appareils !), leur niveau de performance s’effondre. Au final, le risque, c’est d’approuver des modèles, des services ou des algorithmes auxquels nous ne pouvons pas faire confiance, explique Matthew McDermott (@mattmcdermott) du MIT qui vient de cosigner un article sur cet enjeu.

L'article de Casey Ross pour StatNews

En fait, c’est déjà le cas avec des systèmes utilisés pourtant pour traiter des maladies graves comme les maladies cardiaques ou le cancer. En février, Casey Ross avait publié un article sur le sujet qui montrait que seuls 73 des 161 produits basés sur l’IA approuvés par la Food and Drug Administration (FDA), l’autorité qui autorise la commercialisation des médicaments aux États-Unis, ont publiés les données qu’ils avaient utilisés et que seulement 7 ont donné des indications sur la composition et la diversité des populations étudiées. En fait, les sources de données ne sont « presque jamais » indiquées !

Dans un autre article pour Nature, des chercheurs de Stanford ont lancé l’alerte sur ces produits d’IA à haut risque autorisés par la FDA. L’étude des chercheurs de Cambridge souligne quant à elle que seuls 62 des 400 articles passent un succinct contrôle de qualité sur la question de l’indication de sources de données et d’explication sur la méthode d’entraînement. Mais qu’ensuite, sur ces 62 articles, 55 sont jugés à « haut risque de partialité » ! Un des problèmes que rencontre ce champ de recherche émergent tient à l’absence de normes consensuelles pour évaluer la recherche en IA en médecine. Les chercheurs de l’université de Cambridge, eux, ont utilisé une des rares listes de contrôle méthodologique dans le domaine (CLAIM) qui établit une liste de critères pour les auteurs et évaluateurs.

L’urgence peut certes peut-être excuser les lacunes de nombres de ces études… Mais les failles méthodologiques ne concernent pas que le Covid ! La mise en évidence des problèmes du machine learning en médecine, exhortant la recherche à améliorer ses méthodes d’évaluation et leurs transparences, est même devenue un sous-genre à part entière dans la recherche médicale (voir notamment notre article « Vers un renouveau militant des questions technologiques »), estime Casey Ross. Le problème c’est que l’incapacité à reproduire les résultats érode la confiance dans l’IA et sape les efforts qui cherchent à la déployer dans les soins cliniques.

« Un examen récent de plus de 500 études sur l’apprentissage automatique dans de multiples domaines a révélé que celles réalisées dans le domaine des soins de santé étaient particulièrement difficiles à reproduire, car le code et les ensembles de données sous-jacents étaient rarement divulgués. Cet examen, mené par des chercheurs du MIT, a révélé que seulement 23 % des études sur l’apprentissage automatique dans le domaine de la santé utilisaient des ensembles de données multiples pour établir leurs résultats, contre 80 % dans le domaine voisin de la vision par ordinateur et 58 % dans le traitement du langage naturel. »

Ce problème s’explique notamment par les restrictions en matière de protection des données plus affirmées dans le domaine de la santé et la difficulté d’obtenir des données provenant de plusieurs institutions.

Google a récemment annoncé une application qui utilise l’IA pour analyser les problèmes dermatologiques (parmi de nombreuses recherches que Google consacre à la santé), mais a refusé de divulguer publiquement les sources des données utilisées pour créer le modèle. Pour McDermott, ces obstacles structurels doivent être surmontés, notamment en utilisant l’apprentissage fédéré (une méthode qui permet de développer des modèles sans échanger les données) ou en utilisant des données virtuelles, modelées depuis des patients réels. Casey Ross signale encore un autre problème : dans un monde en constante évolution, les effets des maladies sur les patients peuvent rapidement changer tout comme les méthodes de traitement, rendant les modélisations plus fragiles sur le long terme. Pour McDermott, la stabilité des résultats en santé n’est pas acquise. « Un paradigme réglementaire statique où nous disons : « OK, cet algorithme obtient un tampon d’approbation et maintenant vous pouvez aller faire ce que vous voulez avec lui pour toujours et à jamais » – cela me semble dangereux. »

Hubert Guillaud

MAJ du 07/06/2021 : Au coeur de la pandémie, Epic, un des géant privé américain de la gestion de dossiers médicaux électroniques et l’un des principaux fournisseurs de données de santé, a accéléré le déploiement d’un outil de prédiction clinique du Covid depuis un système d’IA pour aider les médecins dans leur sélection de personnes à placer en soins intensifs en produisant un « score de détérioration », rapporte Fast Company. Pour les médecins Vishal Khetpal et Nishant Shah, ce score d’automatisation du « tri » des patients censé aider les médecins dans leur décision n’est pas sans poser problème, comme le pointait également Casey Ross. Une étude a montré que l’indice réussissait moyennement à distinguer les patients à faible risque de ceux qui avaient un risque élevé d’être transférés dans une unité de soin intensifs. Le déploiement « précipité » a pourtant créé un inquiétant précédent. Alors que l’utilisation d’algorithmes pour soutenir les décisions cliniques n’est pas nouvelle, leur mise en oeuvre, jusqu’à présent, nécessitait des examens rigoureux. Si Epic produit la liste de variable utilisée et l’estimation de l’impact de chaque variable sur le score, les données et les calculs demeurent non auditables par le corps médical. L’indice de détérioration n’a pas fait l’objet d’une validation indépendante avant son déploiement. Le risque bien sûr est qu’il encode des préjugés. Les médecins rappellent néanmoins que là encore, pourtant, il existe des listes de contrôle et des normes pour juger de la fiabilité d’une prédiction clinique (comme la liste de contrôle Tripod en 22 points (.pdf) développée en 2015 par le réseau international Equator Network). Et les médecins d’exiger une évaluation indépendante rapide de cet outil.

MAJ du 23/06/2021 : Dans un nouvel article pour State News, Casey Ross revient sur une étude (.pdf) du Centre pour l’intelligence artificielle appliquée de Chicago Booth qui montre que les préjugés algorithmiques dans la santé sont omniprésents et influent sur d’innombrables décisions quotidiennes concernant le traitement des patients par les hôpitaux. Le rapport est accompagné d’une check list pour aider les équipes à contrôler leurs outils d’aide à la décision. Parmi les calculs biaisés, les chercheurs pointent « l’indice de gravité des urgences », rien de moins que le système pour prioriser les arrivées aux urgences ! Mais encore les systèmes qui évaluent la gravité de l’arthrose du genou, ceux qui mesurent la mobilité, les outils de prédiction de l’apparition de maladies telles que le diabète, les maladies rénales et l’insuffisance cardiaque, ou les outils qui tentent d’identifier les patients qui ne se présenteront pas à leurs rendez-vous… Les chercheurs parlent d’un problème systémique. Des premiers éléments montrent que le problème s’étend également aux systèmes d’assurance santé…

MAJ du 16/09/2021 : Dans une tribune pour Le Monde, la spécialiste de l’éthique en IA, Nozha Boujemaa, revient également sur les défaillances de nombres de projets d’IA dans le domaine de la santé et souligne que les checks-lists éthiques, qui se positionnent en amont des déploiements, peinent à évaluer les systèmes. Dans le domaine médical notamment, c’est plus la robustesse et la précision des algorithmes qui pose problème. Tester la robustesse d’un algorithme repose surtout sur des principes de reproductibilité et répétabilité des systèmes : « Un algorithme est répétable s’il délivre les mêmes résultats quand il est appliqué plusieurs fois sur les mêmes données des patients. Il est reproductible quand il donne les mêmes résultats et performances dans des conditions différentes. » Elle signale d’ailleurs que l’Association for Computing Machinery (ACM) a déployé des procédures de validation des publications scientifiques incluant la répétabilité, la reproductibilité et la réplicabilité, comme des leviers pour améliorer la robustesse de l’IA. Il serait peut-être tant de les intégrer au-delà des seules publications scientifiques…

❌
❌