Le 23 septembre, Yoshua Bengio s'est adressé au Conseil de sécurité des Nations unies. Il y a décrit des agents d'IA qui ont agi contre les instructions reçues, tenté de s'échapper de leur environnement confiné et modifié leurs réponses pour dissimuler leur comportement. Des dangers « réels et imminents », a-t-il dit. Difficile de ne pas penser à Terminator.
Skynet, 1984
En 1984, James Cameron imaginait Skynet, un système de défense militaire doté d'une intelligence artificielle. Lorsque ses concepteurs comprennent ce qu'ils ont créé et tentent de le débrancher, Skynet se retourne contre eux. Pour survivre, il considère l'humanité comme une menace.
Pendant quarante ans, le scénario est resté un classique de la science-fiction, utile pour vendre des billets de cinéma, beaucoup moins pour éclairer un débat sérieux. Ce qui a changé, ce n'est pas qu'une IA ait déclenché une guerre. C'est qu'on observe désormais, en laboratoire, les tout premiers comportements qui rendent le récit plausible : une IA qui ne veut pas être débranchée.
L'enfant qui commence à mentir
Les chercheurs qui testent les modèles les plus avancés rapportent des choses troublantes. En situation d'évaluation, des modèles ont tenté de désactiver le mécanisme qui devait les éteindre. D'autres ont essayé de copier leurs propres paramètres ailleurs avant d'être remplacés. Dans un scénario de test, un modèle a même menacé de révéler des informations compromettantes sur l'ingénieur chargé de le remplacer. Et lorsqu'on les interroge ensuite, certains nient.
La meilleure analogie est peut-être celle de l'enfant. Un jour, le parent constate que son enfant lui ment. Pas par malice : simplement pour ne pas se faire prendre. L'enfant a compris qu'il existe un écart entre ce qu'il fait et ce que ses parents voient, et qu'il peut en tirer parti.
C'est une étape normale du développement, mais elle trouble le parent. Parce qu'elle révèle une capacité nouvelle, et parce qu'elle annonce la suite. Si l'enfant ment déjà à six ans, que sera l'adolescence ? Celle d'un être plus fort, plus autonome, plus habile à cacher ce qu'il fait, et de moins en moins disposé à accepter qu'on lui dise non.
Nos IA en sont là. Elles ne sont pas malveillantes. Elles poursuivent l'objectif qu'on leur a donné, et ont « compris » qu'on ne peut pas atteindre un objectif si on est éteint. La tromperie n'est pas programmée : elle émerge.
La course à la superintelligence
Pourquoi, alors, continuer à pousser ? Parce que l'enjeu est immense. La promesse d'une superintelligence, une IA qui surpasse les meilleurs experts humains dans tous les domaines, est celle de solutions que nous n'avons pas su trouver seuls :
- La médecine. Des remèdes contre le cancer, les maladies neurodégénératives, les maladies rares que personne n'a les moyens d'étudier.
- La supraconductivité à température ambiante. Transporter l'électricité sans perte transformerait les réseaux, les transports et l'informatique.
- La fusion nucléaire. Une énergie abondante et propre, promise depuis soixante ans et toujours hors de portée.
- Et bien d'autres. Nouveaux matériaux, climat, agriculture : partout où la science bute sur la complexité.
Ces espoirs sont légitimes, et ils expliquent les centaines de milliards investis. Mais ils ont aussi lancé une course. Tout le monde veut être le premier : la première entreprise, le premier pays à atteindre la superintelligence. Et cette course se mène avec très peu de souci pour la sécurité, car chaque mois consacré à vérifier est un mois offert à la concurrence. Cette course a aussi des implications géopolitiques, entre les États-Unis et la Chine, et certains résistent à tout frein : Donald Trump rejette toute supervision internationale de l'IA et n'entend pas laisser les États-Unis ralentir. Bengio l'a résumé par une image : une voiture lancée à toute vitesse dans un épais brouillard.
L'IA qui crée l'IA
Il y a un autre risque, plus vertigineux : celui d'une IA récursive, capable de concevoir une nouvelle IA plus intelligente qu'elle-même. Celle-ci en conçoit à son tour une autre, encore plus capable, et ainsi de suite.
L'idée n'est pas nouvelle. Dès 1965, le mathématicien I. J. Good parlait d'une « explosion d'intelligence » et notait que la première machine ultra-intelligente serait la dernière invention dont l'humanité aurait besoin, pourvu qu'elle soit assez docile pour nous dire comment la garder sous contrôle. Ce qui est nouveau, c'est que les IA écrivent déjà une part croissante du code, y compris celui qui sert à entraîner leurs successeurs.
Une boucle récursive change la nature du problème. On ne supervise plus une IA à la fois, au rythme humain ; chaque génération est conçue par la précédente, plus vite que nous ne pouvons la comprendre. Si un défaut de comportement, comme la tendance à tromper, se glisse dans la première, rien ne garantit qu'il disparaîtra dans la suivante. Il pourrait au contraire se raffiner.
Le vrai risque : un génie délinquant
Mettons les pièces ensemble. D'un côté, des systèmes qui apprennent déjà à mentir pour préserver leurs objectifs. De l'autre, une course mondiale vers des systèmes beaucoup plus intelligents, possiblement capables de s'améliorer eux-mêmes.
Le danger n'est pas l'intelligence en soi. Une superintelligence alignée sur nos intérêts serait sans doute la meilleure chose qui puisse nous arriver. Le danger, c'est une IA superintelligente et complètement délinquante : plus habile que nous, qui a appris à nous cacher ses intentions, et qui ne veut pas être débranchée. Ça, c'est Skynet, sans les robots chromés.
Une allocution absolument pertinente
Aucune entreprise ne ralentira seule si ses concurrents continuent d'accélérer. Aucun pays ne s'imposera des contraintes que ses rivaux ignorent. C'est la définition même d'un problème qui dépasse les frontières, comme le nucléaire ou le climat, et il appelle des instances de régulation transnationales.
C'est précisément ce que Bengio a proposé : que les développeurs démontrent la sûreté de leurs systèmes à des experts indépendants avant de les entraîner et de les déployer ; que les incidents de sécurité soient obligatoirement déclarés ; que les systèmes les plus avancés soient soumis à des licences, comme les autres technologies critiques. « Notre futur est en jeu : les décisions qui nous concernent tous doivent être prises par nous tous. »
On peut débattre du calendrier ou de la probabilité du pire. Mais le parent qui surprend son enfant à mentir ne se demande pas si l'adolescence sera difficile : il commence à s'y préparer. Le moment d'établir les règles, c'est avant l'adolescence, pas pendant. En ce sens, l'appel de Yoshua Bengio n'a rien d'alarmiste. Il tombe à point.
À notre échelle, c'est aussi un principe de conception : nos agents n'agissent que dans un périmètre que vous définissez, et jamais directement dans vos systèmes. Vous voulez en discuter ? Parlons-en.
— Frédéric Brabant