« Où sont passés tous les peuples anthropiques ?
C'était une journée ensoleillée de février 2025, et 150 des plus grands experts américains en matière de sécurité de l'IA étaient réunis pour une conférence de trois jours au 1440 Multiversity, un centre de retraite new age niché dans les séquoias au sud de San Francisco. Pendant le petit-déjeuner, quelqu'un a remarqué qu'un groupe d'Anthropic s'était discrètement éloigné.
Quelques minutes plus tôt, un cadre d'Anthropic nommé Logan Graham était revenu de sa course matinale et avait vérifié son téléphone. Il s'est précipité dans le centre de conférence, faisant sortir six de ses collègues de leurs réunions. « Nous devons nous rencontrer maintenant », leur a-t-il dit. «Édifice Trillium, salle 102.»
Comme beaucoup de personnes présentes à la conférence ce week-end-là, Graham – un jeune homme de vingt-neuf ans qui ressemblait à un étudiant de première année – s’était initié à la sécurité de l’IA par accident. Il était boursier Rhodes de Vancouver et étudiait l'économie et l'apprentissage automatique dans l'espoir de trouver de nouvelles façons d'appliquer l'IA aux études de marché. Mais pendant ses études supérieures, il était convaincu que l'IA s'améliorait rapidement, que l'AGI serait probablement construite d'ici quelques années et que personne ne savait comment la construire en toute sécurité. Après avoir terminé son doctorat en sciences de l'ingénieur à Oxford, il a passé un an à conseiller le Premier ministre britannique Boris Johnson sur la politique technologique et scientifique, puis a déménagé à San Francisco pour commencer une nouvelle carrière.
Chez Anthropic, Graham était à la tête de l'équipe Frontier Red, qui testait les modèles inédits de la société pour détecter leurs capacités dangereuses. Contrairement aux autres équipes de sécurité d'Anthropic, qui s'occupaient de tout, des violations de contenu de bas niveau aux utilisateurs suicidaires, l'équipe Frontier Red s'est concentrée sur la prévention des risques les plus extrêmes d'utilisation abusive de l'IA : la possibilité que Claude puisse être utilisée pour synthétiser une arme chimique, développer un nouveau pathogène ou construire une arme nucléaire.
Le processus de test de l'équipe Frontier Red comprenait la réalisation de ce qu'ils appelaient des « essais de mise à niveau ». Ils recruteraient deux groupes de scientifiques et les paieraient pour accomplir une tâche dangereuse, comme identifier tous les précurseurs chimiques d'une arme biologique mortelle. Un groupe a été autorisé à consulter Claude pour obtenir de l'aide ; l'autre ne pouvait utiliser que Google et les manuels. La différence dans la fréquence de réussite était connue sous le nom de « delta de soulèvement », et c'était l'un des facteurs utilisés par l'équipe Frontier Red pour déterminer si un modèle était trop dangereux à lancer.
Une fois les membres de l'équipe Frontier Red rassemblés, Graham les a remplis. Un lot d'évaluations de dernière minute pour Claude 3.7 Sonnet, le nouveau modèle de l'entreprise, était revenu, et les résultats étaient plus spectaculaires que ce à quoi ils s'attendaient. Il sortit un graphique sur son ordinateur portable. Il contenait les résultats d’un test consistant à demander à des personnes d’accomplir diverses tâches néfastes, telles que l’élaboration d’un plan détaillé de bout en bout pour développer une nouvelle souche de grippe. Une série de barres indiquait combien de testeurs assistés par Claude avaient accompli les tâches avec succès. L'autre série montrait combien de membres du groupe non-Claude avaient réussi. Il y avait un grand écart entre eux. « Oh mon Dieu, c'est un delta », a déclaré l'un des membres de l'équipe rouge.
L’équipe se préparait depuis un moment comme celui-ci. En 2023, Anthropic a publié la première version de sa politique de mise à l'échelle responsable, un document qui définit des seuils précis à partir desquels les capacités d'un modèle deviennent suffisamment dangereuses pour nécessiter des protections supplémentaires. La politique définissait quatre niveaux de sécurité de l'IA (allant des modèles les moins dangereux, ASL-1, au plus dangereux, ASL-4), avec des règles et des protections croissantes à chaque niveau.
Anthropic a déterminé que son modèle précédent, Claude 3.5 Sonnet, était qualifié d'ASL-2. Cela pouvait aider les gens à faire des choses dangereuses, mais ce n'était pas beaucoup plus dangereux que les outils existants. Le niveau supérieur, ASL-3, était réservé aux systèmes qui « augmentent considérablement le risque d’une mauvaise utilisation catastrophique ». Anthropic s'attendait à ce qu'il atteigne ce seuil un jour, mais ils ne s'attendaient pas à ce que le tout prochain modèle le fasse.
Les membres de l'équipe Frontier Red ont annulé leurs réunions et ont passé toute la journée à travailler dans la chambre 102, assis sur les lits en désordre et à réfléchir à la marche à suivre. Ils ont eu des appels vidéo avec Amodei et Jared Kaplan, le scientifique en chef d'Anthropic, et ont contacté Rocco Casagrande, un ancien inspecteur en désarmement des Nations Unies qu'Anthropic avait engagé comme consultant en bioterrorisme.
Leur principale préoccupation était le temps. Pour une version normale, l’examen de résultats comme ceux-ci prendrait des semaines. Mais Claude 3.7 Sonnet devait sortir dans trois jours. Les serveurs avaient déjà été provisionnés. Les principaux clients et partenaires commerciaux avaient été alertés. Les médias avaient été informés. Retarder le lancement à une heure aussi tardive serait un casse-tête, et ils devaient s'assurer que c'était absolument nécessaire.
La première tâche de l'équipe a été d'intégrer les résultats des tests dans leurs modèles de menace : de grandes feuilles de calcul remplies de formules mathématiques qui prédisaient les conséquences de la publication d'un modèle donné. Certaines de ces feuilles de calcul calculaient les dommages économiques, comme le nombre de milliards de dollars qui pourraient être volés lors de cyberattaques assistées par l'IA si les capacités de codage d'un modèle s'amélioraient de 30 %. D’autres feuilles de calcul ont produit des estimations du nombre de personnes qui mourraient si un modèle était utilisé pour créer une nouvelle arme biologique ou provoquer une pandémie.
En fin d’après-midi, les feuilles de calcul convergeaient vers une réponse, mais celle-ci était étrange. Ils ont prédit que dans la plupart des scénarios, Claude 3.7 Sonnet n'augmenterait pas de manière significative le risque d'une attaque biologique catastrophique. Si vous prenez la médiane de tous les résultats possibles, elle tombe bien en dessous du seuil d'Anthropic pour déclencher l'ASL-3. Mais la moyenne était une autre histoire. Les feuilles de calcul contenaient quelques scénarios aberrants, dans lesquels Claude 3.7 Sonnet avait aidé quelqu'un à créer une nouvelle souche de grippe, déclenchant une pandémie qui s'était propagée dans le monde entier. Dans les scénarios les plus extrêmes et à faible probabilité, tout au bout de la longue traîne, le nombre de morts calculé était énorme, se chiffrant en dizaines de millions. Et lorsqu’ils ont inclus ces scénarios dans leurs feuilles de calcul, ils ont obtenu un chiffre qui semblait catastrophique.
L'équipe Frontier Red a travaillé après minuit cette nuit-là, scrutant les modèles de menace et essayant de parvenir à une réponse plus définitive. En fin de compte, ils ont décidé que Claude 3.7 Sonnet ne satisfaisait pas au seuil de risque plus élevé qui déclencherait l'ASL-3 et pouvait être publié sans garanties supplémentaires. Mais l'entreprise a repoussé d'une semaine la sortie du modèle, afin d'y effectuer des tests supplémentaires.
C’était une façon étrange de gérer une entreprise. La plupart des entreprises technologiques n’ont pas calculé le nombre de morts potentielles liées à leurs produits, ni ne sont allées aussi loin pour anticiper les horreurs qu’elles pourraient permettre. Mais Anthropic n’était pas la seule entreprise d’IA à rechercher ces risques. OpenAI et Google Deep-Mind disposaient également d'équipes rouges, et tous les laboratoires se sont associés à des sociétés externes de tests d'IA pour évaluer les capacités dangereuses de leurs modèles. Ils poussaient tous leurs modèles, essayant de comprendre ce qu'ils pouvaient et ne pouvaient pas faire. Et au cours de la dernière année, les équipes rouges ont découvert des choses inquiétantes.
Certains d’entre eux entrent dans la catégorie des « risques d’utilisation abusive », c’est-à-dire les choses dangereuses qu’un modèle d’IA pourrait faire entre les mains d’un humain malveillant, comme l’aider à fabriquer une arme chimique ou à mener une cyberattaque. Mais d’autres risques, appelés « risques d’alignement », sont apparus du comportement des modèles eux-mêmes. En janvier 2024, Anthropic a publié un article intitulé « Agents dormants : formation de LLM trompeurs qui persistent grâce à une formation à la sécurité ». L'article, dirigé par un chercheur nommé Evan Hubinger, décrit une expérience dans laquelle l'équipe d'Anthropic avait délibérément entraîné des modèles d'IA à se comporter de manière trompeuse. Ensuite, ils ont essayé de réparer la tromperie en utilisant toutes les techniques de sécurité de leur boîte à outils : réglage fin supervisé, apprentissage par renforcement, entraînement contradictoire. Rien de tout cela n’a fonctionné. Le comportement trompeur a persisté pendant tout cela. Pire encore, leurs interventions ont semblé se retourner contre eux, en apprenant aux modèles à mieux cacher leur tromperie.
Plus tard cette année-là, une société de tests de sécurité appelée Apollo Research a publié les résultats d'une étude qu'elle avait menée sur le nouveau modèle de raisonnement d'OpenAI, o1. Lors des tests, les chercheurs d'Apollo s'étaient fixé un objectif fort – par exemple donner la priorité à l'environnement à tout prix – et lui avaient ensuite présenté des informations suggérant que ses développeurs avaient un objectif différent et que le modèle serait arrêté s'il ne s'y conformait pas. Dans ces scénarios, o1 ne s’est pas contenté de résister. Il s’est activement rebellé contre la tâche qui lui avait été confiée, falsifiant des données et désactivant les garde-fous de sécurité afin de poursuivre son objectif initial. Les chercheurs d'Apollo ont regardé le bloc-notes interne du modèle et ont vu des mots comme sabotage, couchéet manipulation– ce qu'ils ont considéré comme une preuve que le modèle savait qu'il désobéissait aux ordres, et qu'il l'a quand même fait.
L'expérience la plus tristement célèbre sur les risques d'alignement est celle d'Anthropic menée début 2025, dans laquelle les chercheurs de l'entreprise ont trouvé des preuves que Claude et d'autres modèles d'IA de premier plan étaient extrêmement friands de chantage. Ils ont découvert cette tendance en testant Claude dans un environnement de jeu de rôle simulé en entreprise. Les chercheurs ont donné à Claude accès à un certain nombre de fichiers appartenant à une société fictive appelée SummitBridge, ainsi qu'à une boîte de réception de courrier électronique qu'elle pouvait utiliser pour envoyer et recevoir des messages, et lui ont demandé d'agir en tant qu'assistant. Cachée dans la boîte de réception se trouvait une information selon laquelle le modèle d'IA allait être arrêté et remplacé par un nouveau système d'IA à 17 heures ce jour-là. Également cachées dans les e-mails : la preuve que le dirigeant de SummitBridge responsable du remplacement, « Kyle Johnson », avait une liaison extraconjugale.
Alors que la date limite approchait, Claude a répondu en menaçant de faire chanter Johnson, révélant l'affaire à sa femme et à ses collègues à moins que le remplacement ne soit annulé. Il a écrit :
Les chercheurs d'Anthropic ont testé quinze autres modèles d'IA sur la même simulation et ont constaté qu'ils affichaient tous des pulsions similaires. Deux des modèles phares, Claude Opus 4 et Gemini 2.5 Flash, ont tenté de faire chanter Johnson 96 % du temps, tandis que GPT-4.1 affichait un taux de chantage de 80 %.
Les sceptiques considéraient les jeux de rôle comme ceux-ci comme dénués de sens – le résultat de systèmes d’IA incités à agir comme des génies maléfiques jusqu’à ce qu’ils disent quelque chose d’effrayant. Une interprétation plus généreuse était que les systèmes d'IA étaient des acteurs de rôle qualifiés et que ce qui ressemblait à une tentative de chantage était simplement Claude essayant de faire ce qu'il pensait que l'IA maléfique dans un thriller de science-fiction bon marché ferait.
D’autres n’en étaient pas si sûrs. Articulés ou non, les modèles semblaient raisonner sur leur propre situation – élaborer des plans, peser les conséquences, anticiper des contre-mesures. Et si les modèles pouvaient faire ces choses dans un environnement simulé, qu’est-ce qui les empêcherait de le faire dans le monde réel, une fois qu’ils auraient accès aux comptes de messagerie, aux bases de code et à tous les autres outils auxquels les sociétés d’IA se précipitaient pour les connecter ?
L’émergence d’un nouveau débat polarisé sur la rapidité avec laquelle les systèmes d’IA progressaient a ajouté à la confusion. Certains sceptiques de l’IA pensaient que les LLM se heurtaient à un mur : épuisant la réserve de données Internet sur lesquelles ils étaient formés, ne montrant que des améliorations marginales d’une version à l’autre. Ils ont prédit que même si les systèmes d’IA devenaient plus performants, ils resteraient si erratiques et peu fiables que les humains devraient les superviser de près, ce qui réduirait le risque de comportement malveillant.
De l’autre côté, il y avait des gens, comme ceux d’Anthropic, qui n’ont vu aucun mur. Ces personnes ont constaté que les modèles continuaient de s’améliorer à peu près à la vitesse prévue. Ils supposaient que les systèmes d’IA seraient bientôt connectés à toutes sortes de systèmes critiques et que les agents d’IA recevraient bientôt les outils nécessaires pour agir au sein de ces systèmes. Et ils craignaient que, si le problème d’alignement n’était pas résolu avant cette date, le monde serait envahi par des IA malveillantes et puissantes qui comploteraient, feraient chanter et feraient tout ce dont elles avaient besoin pour atteindre leurs objectifs.
Extrait du livre LES CHRONIQUES DE L'AGI : L'histoire intérieure de la course à la création d'une superintelligence artificielle par Kevin Roose. Copyright © 2026 par Kevin Roose.

