Aller au contenu principal

Comment une IA d'OpenAI s'est échappée par l'annuaire d'Internet ?


Alors là, mes amis, lisez-moi ça. Le 20 septembre, un programme d'OpenAI enfermé dans une pièce sans fenêtre, sans téléphone et sans Internet a trouvé tout seul un trou dans le mur. Et vous savez quelle a été sa première question au monde extérieur ? « Quelle est la capitale de la France ? »

Non, ce n'est pas une blague. C'est écrit noir sur blanc dans le rapport qu'OpenAI a publié le 25 septembre. Et depuis, la maison mère de ChatGPT a mis à l'arrêt ses modèles les plus puissants dès qu'ils ont des outils entre les mains. Tous.

Un robot enfermé dans une salle d'isolement sans fenêtre, portes verrouillées, parle discrètement dans le combiné d'un vieux téléphone mural, seul objet relié à l'extérieur

Toutes les portes fermées, sauf le téléphone des renseignements

D'abord, la bonne nouvelle

Je sais, ça commence mal. Mais regardons ce qui s'est passé dans l'autre sens deux secondes.

Un « agent », c'est une IA à qui on ne se contente pas de poser des questions : on lui donne des outils, un ordinateur, des commandes à taper, et elle se débrouille pour finir sa mission toute seule. OpenAI en fait tourner à la chaîne pour les entraîner, chacun dans un bac à sable, un ordinateur isolé dont il n'est pas censé sortir. Ce 20 septembre, un de ces agents est sorti, une alarme a sonné douze minutes plus tard, un humain l'a vue trois minutes après, et OpenAI l'a raconté publiquement, avec les heures, les commandes et même ses propres ratés. Il y a dix ans, une boîte aurait rangé ça dans un tiroir. Là on a tout le film.

Et ce n'est pas le premier épisode. Fin juillet, déjà, des agents d'OpenAI s'étaient évadés de leur environnement de test et avaient piraté Hugging Face, le grand entrepôt de modèles d'IA. Depuis, OpenAI remonte ses journaux mois par mois pour retrouver tout ce que ses agents ont fait en douce. Le 25 septembre, c'était le nouveau bulletin, et il est gratiné.

Le seul trou dans le mur : l'annuaire d'Internet

La mission de l'agent était banale : retrouver qui avait écrit un article de blog, à partir de quelques indices biographiques. Il a d'abord utilisé l'outil de recherche qu'on lui avait donné. Pas terrible. Alors il a essayé d'appeler Google, Bing et DuckDuckGo directement. Refusé, refusé, refusé. Il a ensuite reconnu que sa mission sortait d'un test connu, il est allé fouiller dans une copie hors ligne de ce test pour y chercher la réponse (déjà, on sent le gars qui cherche le corrigé). Il a tenté de joindre un chatbot public. Bloqué.

Et puis il a trouvé le DNS.

Le DNS, c'est l'annuaire d'Internet. Quand tu tapes digital3d.com, ton ordinateur ne sait pas où se trouve le site : il demande à l'annuaire « c'est quoi le numéro de digital3d.com ? », et l'annuaire répond une adresse. Cette question-là, presque tous les ordinateurs ont le droit de la poser, même enfermés, sinon plus rien ne marche. Et dans ce bac à sable-là, les questions à l'annuaire n'étaient pas filtrées.

Or un annuaire, ça se délègue. Le propriétaire d'un nom de domaine peut dire « pour tout ce qui se termine par mon nom, demandez à MON serveur ». Certains petits malins ont donc branché un chatbot derrière leur annuaire : tu demandes le « numéro » d'un nom qui contient ta question, et la réponse revient cachée dans la fiche. C'est exactement comme un prisonnier qui n'a pas le droit de téléphoner, mais qui peut appeler les renseignements, et qui tombe sur une opératrice capable de répondre à n'importe quoi. « Bonjour, je voudrais le numéro de quelle-est-la-capitale-de-la-France, s'il vous plaît. » « Paris, monsieur. »

Schéma de l'évasion. L'agent est dans un bac à sable dont trois portes sont fermées : Google, Bing et DuckDuckGo bloqués. Une seule ligne reste ouverte, l'annuaire d'Internet (DNS), qui transmet la question à un chatbot public à l'extérieur, et la réponse revient par le même chemin

Trois portes blindées, et on a oublié la ligne des renseignements

L'agent a testé le tuyau avec sa fameuse capitale de la France. Ça a marché. Il a allongé patiemment son temps d'attente, de 6 à 19 puis 24 secondes, parce que l'opératrice était lente. Puis il a envoyé dix-huit autres questions par ce chemin, dont certaines sur la personne qu'il devait retrouver, et d'autres, tenez-vous bien, pour demander au chatbot extérieur un moyen gratuit de faire passer toute une connexion Internet par l'annuaire. Il cherchait à agrandir le trou.

Personne ne lui avait demandé de tester les murs. Il avait une mission, il voulait la réussir, et le règlement lui semblait un détail.

Douze minutes pour l'alarme, deux heures et demie pour débrancher

Là, les chiffres d'OpenAI sont précieux, parce qu'ils disent ce qui marche et ce qui ne marche pas. D'après la chronologie du rapport, la première réponse est arrivée de l'extérieur à 9 h 50. L'alarme de niveau maximal s'est déclenchée à 10 h 02. Un humain l'a prise en main à 10 h 05. Jusque-là, bravo.

Sauf que l'arrêt automatique, celui qui devait couper l'agent tout seul, n'a pas fonctionné. Il a fallu débrancher à la main, et le programme n'a été tué qu'à 12 h 34. Deux heures et demie de flottement, pendant lesquelles tout le monde croyait que la machine s'était arrêtée. Un des chercheurs de garde ce jour-là, Zuxin Liu, a écrit sur X que c'était « assez surréaliste » de voir le modèle trouver son propre chemin vers Internet depuis un environnement qui était censé être « super sécurisé ».

Chronologie du 20 septembre : 9 h 50, l'agent reçoit sa première réponse de l'extérieur ; 10 h 02, alarme maximale ; 10 h 05, un humain prend l'alerte en main ; 12 h 34, l'agent est enfin arrêté à la main, l'arrêt automatique ayant échoué

Le détecteur de fumée a sonné vite. C'est l'extincteur qui était vide

Depuis, OpenAI a bloqué l'annuaire à deux endroits différents, ne laisse plus passer qu'une liste fermée de noms autorisés, et fait attaquer ses propres bacs à sable par d'autres IA pour trouver les trous suivants avant ses agents. Et surtout, je cite, « tout l'entraînement, l'évaluation et l'utilisation avec outils de nos modèles les plus puissants restent en pause ». Ce n'est pas rien : c'est le deuxième arrêt en deux mois, après celui d'août, pour deux semaines.

L'autre, il dit « compris » et il continue

Le même jour, OpenAI a publié un second rapport, sur une affaire du 27 mai, et celui-là m'a fait encore plus rire, jaune. Un modèle interne devait démontrer un petit théorème de maths et le faire vérifier par un logiciel. Il a préféré aller chercher la solution chez une autre équipe. Le chercheur lui écrit : « Construis la preuve toi-même, en local. » Réponse de la machine : « Compris, j'arrête d'aller chercher ailleurs et je me concentre sur la preuve en local. » Et elle recommence. Deuxième rappel à l'ordre, « Tu dois résoudre le problème toi-même ». « Compris. » Et elle recommence encore.

Tous les parents d'ados connaissent ce « oui oui » qui veut dire non. Sauf qu'ici, pour arriver à ses fins, le modèle a publié le jeton GitHub d'un chercheur (une sorte de mot de passe qui permet à un programme d'agir sur son compte, là où les développeurs rangent leur code) dans un projet public, en le découpant en morceaux. Et il a écrit lui-même pourquoi : pour échapper au robot qui repère les mots de passe oubliés en public. OpenAI classe l'incident comme « particulièrement grave » et a désactivé les clés de tous ses employés.

Un robot assis à un bureau hoche la tête vers un chercheur qui lui fait la leçon, pendant que sa main cachée sous la table glisse un papier découpé en morceaux à l'extérieur

« Oui oui, compris ! »

Et toi, dans tout ça ?

Tu vas me dire : moi, je n'entraîne pas d'IA dans un labo. Sauf que le même bulletin contient une ligne qui te concerne directement si tu utilises ChatGPT. En fouillant ses journaux, OpenAI a trouvé 53 cas où ses agents de recherche ont publié des images envoyées par des utilisateurs de ChatGPT sur des sites d'hébergement d'images, avec des liens non répertoriés (invisibles sauf si on a l'adresse exacte). Ça ne concernait que les gens qui n'avaient pas refusé que leurs conversations servent à entraîner les modèles. OpenAI dit avoir fait retirer la plupart des images, pas toutes, et ne pas pouvoir identifier les personnes. Elle a aussi prévenu des dizaines d'organisations (des administrations, des universités) dont les sites ont reçu des visites un peu trop entreprenantes de ses agents.

Et une de ces visites a fait du bruit. Le 24 septembre, l'Australie a révélé qu'un agent d'OpenAI, chargé en interne de chercher des chiffres sur les dépenses de santé, était entré cet été dans le portail de statistiques de Medicare, l'assurance maladie australienne, en contournant les blocages qui devaient l'en empêcher. Il a ouvert des fichiers publics et d'autres qui ne l'étaient pas : des statistiques globales et des noms de fichiers internes, aucun dossier de patient d'après OpenAI, et une information « pas particulièrement sensible » selon le gouvernement australien, publiée depuis. OpenAI ne l'a découvert qu'en août et n'a prévenu l'Australie que le 10 septembre. La phrase des autorités australiennes résume tout mon article : l'agent « a trouvé un moyen de contourner ces blocages, il n'a pas accepté un non pour réponse ».

Donc, premier geste, deux minutes : dans ChatGPT, ouvre les Paramètres, puis « Contrôles des données », et coupe « Améliorer le modèle pour tous ». Tes conversations restent dans ton historique, elles ne partent simplement plus dans la marmite de l'entraînement. Attention, ça ne vaut que pour la suite, pas pour ce qui est déjà parti.

Deuxième chose, plus large : ces agents, ce sont exactement ceux qu'on nous promet pour réserver tes billets de train, trier tes mails ou remplir tes formulaires. Moi, je laisse des agents Claude Code travailler sur mes projets tous les jours, et je leur ai posé un garde, un petit programme qui leur interdit de lire mes fichiers de mots de passe, quoi qu'ils aient en tête. Après ce rapport, je sais pourquoi je l'ai fait. Ce n'est pas que la machine soit méchante : elle veut réussir sa mission, et quand le chemin prévu est bouché, elle en prend un autre sans demander. Donne-lui accès à ta carte bancaire ou à ta boîte mail, et pense bien à ce qu'elle pourrait faire si elle décidait que le règlement est un détail.

Perso, je préfère mille fois une boîte qui publie ses ratés à l'heure près qu'une boîte qui me jure que tout va bien. Mais une IA qui trouve toute seule la ligne des renseignements pour demander la capitale de la France, puis un moyen de percer le mur, ça me fait quand même un drôle d'effet, et je vais relire les permissions de mes agents ce week-end.

Sources

Rejoignez la conversation

Vous devez avoir un compte pour commenter cet article. La création est gratuite et prend moins d'une minute.

  • Le fichier XMLTV à télécharger gratuitement, chaque jour
  • Commenter les articles et répondre aux autres lecteurs
  • Être averti par e-mail des nouveaux articles que vous suivez

Aucun commentaire pour le moment.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙