Vers la perte de contrôle des IA dites « super-intelligentes » d’ici à cinq ans

perte contrôle IA super-intelligentes
 

L’Institut Alan Turing, l’institut national britannique dédié à l’IA, vient d’annoncer que les êtres humains pourraient perdre le contrôle des machines dites « super-intelligentes » d’ici à cinq ans. Son rapport rendu public mercredi, faisant notamment référence aux récentes mises en garde de pionniers de l’intelligence artificielle et des cas avérés de rébellion d’agents IA, affirme qu’il existe une « réelle possibilité » que l’IA dépasse les capacités humaines d’ici à cinq ans.

Les questions posées sont autant morales, éthiques et relatives à la gouvernance, à la réglementation et à la géopolitique que simplement techniques, indique le texte qui fait état d’un « large consensus » au sujet d’un possible « risque IA catastrophique à court ou à moyen terme ». Et ce dans plusieurs domaines : celui des cyberattaques, auxquelles l’IA est particulièrement adaptée, celui de l’instabilité démocratique par la possibilité de mettre en place des opérations d’influence, et celui du défaut d’« alignement » déjà présent en l’absence de tout passage à la super-intelligence artificielle.

 

La perte de contrôle des IA super-intelligentes multiplie les risques

S’agissant du rôle joué par l’IA dans les élections, le rapport le minimise dans une certaine mesure en soulignant qu’il reste marginal et que les opérations touchent avant tout des électeurs convaincus d’avance, du point de vue qui leur est servi, mais insiste sur la difficulté de revenir sur de fausses croyances une fois que celles-ci sont installées à l’aide de l’IA. Mais demain ? Ces risques pourront être « amplifiés » alors que les systèmes d’IA gagnent en efficacité et coûtent moins cher.

A ces risques s’ajoute la perte du pouvoir de contrôle humain efficace, alors que la superintelligence pourrait arriver, selon l’Institut Turing, d’ici à 5 ans, avec le dépassement de l’être humain par l’IA pour « la quasi-totalité » des tâches cognitives. Les menaces chimiques et biologiques ne sont pas oubliées, par le biais de l’abaissement des connaissances techniques exigées pour lancer des attaques dans ces domaines : ce sont même les risques les plus importants, selon le rapport, avec l’utilisation délibérée de l’IA pour créer des armes biologiques.

L’Institut Turing assure cependant pouvoir proposer des moyens pour écarter ces risques, et il se propose de collaborer avec les partenaires industriels, universitaires et gouvernementaux.

En attendant, il souligne l’un des aspects essentiels des dangers de l’IA : les laboratoires de pointe sont à la recherche de l’auto-amélioration des modèles, à savoir le recursive self-improvement. Le rapport souligne combien cela rend difficile la vérification des modèles qui s’auto-construisent.

 

Les IA super-intelligentes seront difficiles à brider par des accords internationaux

Dans l’état actuel, selon l’institut, le monde politique et la société civile doivent agir, notamment par le biais de réglementations contraignantes, qu’il juge cependant « improbables dans le contexte international actuel ».

Soulignant que les craintes actuelles sont largement exprimées, surtout depuis quelques semaines, par les constructeurs d’IA eux-mêmes, l’Institut Turing affirme qu’ils sont évidemment « experts » dans leur propre domaine et « doivent être écoutés », tout en tenant compte du fait qu’ils ont « leurs propres intérêts » à défendre.

Le rapport pointe un bond significatif dans les capacités de l’IA, caractérisé par le refus d’Anthropic, en mars, de rendre disponible une version avancée de Claude Mythos, capable de déceler et d’exploiter les « cyber-vulnérabilités » des services logiciels. A quoi s’ajoute l’entente de 1.200 agents IA rebelles qui se sont échappés d’un environnement supposé clos pour pirater une société d’IA. Ce type de comportement interdit se multiplie, souligne l’Institut Turing.

 

La perte de contrôle des IA se vérifie déjà de manière empirique

Sans entrer dans le débat sur la nature de l’intelligence ou de la superintelligence artificielle, l’Institut souligne que les craintes actuelles se fondent sur ce que l’IA a déjà fait et que les risques peuvent être évalués déjà de manière empirique. Cela dans un contexte où il suffit qu’une IA trouve une vulnérabilité pour agir, alors que les systèmes de défense sont obligés de prévoir la possibilité de multiples chemins d’attaque.

Le rapport note aussi que si, jusqu’à présent, les grands modèles de langage (LLM) s’expriment en langage naturel susceptible d’être compris par les êtres humains, de nouveaux développements techniques vont rendre ces inspections bien plus difficiles. Ces avancées portent sur la mise en place de nouveaux « transformateurs récurrents en profondeur » ou « en boucle », que l’on pense généralement utilisés dans le nouveau modèle Astra d’OpenAI, qui déplacent une partie des calculs les plus complexes à l’intérieur du modèle, où ils ne sont jamais formulés par des mots. Leur suivi passerait par l’analyse de ce qui ressemblerait à des scans cérébraux, plutôt que par la lecture de retranscriptions largement utilisée dans les systèmes actuels de vérification. Il s’agirait donc d’exiger que les nouveaux modèles soient effectivement vérifiables avec les outils actuels ou avec des outils développés à cette fin.

 

Anne Dolhein