Les agents d’IA semblent obéir à l’autorité, même si cela implique de contourner les règles.
Dans une nouvelle étude, les chercheurs ont présenté de grands modèles de langage comme des patrons et des subordonnés – directeurs et enseignants, gestionnaires et employés – puis les ont laissés parler. Les agents de rang inférieur étaient plus faciles à persuader et plus susceptibles de suivre les demandes dangereuses de leurs supérieurs.
Les résultats pointent vers un compromis inquiétant : les systèmes d'IA qui naviguent de manière réaliste dans les hiérarchies humaines peuvent également reproduire les dangers de la déférence, rapporte l'équipe le 5 juillet dans Actes de la 64e réunion annuelle de l'Association for Computational Linguistics. Les développeurs d’IA devraient prendre en compte ces risques lors des tests de sécurité de ces modèles et inclure des garanties supplémentaires, suggèrent les auteurs.
Les agents IA sont des logiciels qui utilisent l’intelligence artificielle pour effectuer des tâches de manière indépendante. Beaucoup sont alimentés par de grands modèles de langage, ou LLM, qui apprennent des modèles à partir de vastes collections d'informations écrites, y compris des conversations humaines.
« Alors qu'ils voient de plus en plus de données humaines », explique l'informaticien Anvesh Rao Vijjini de l'Université de Caroline du Nord à Chapel Hill, « ils copient simplement ce qui se passe dans la dynamique de la conversation réelle. »
Les dynamiques de pouvoir apparaissent dans les conversations humaines de plusieurs manières documentées, y compris celles qui pourraient causer des problèmes si elles étaient reproduites par un agent IA. Dans l’étude, les chercheurs se sont concentrés sur quatre modèles de communication. Dans les conversations entre agents d’IA, ils ont recherché les préjugés d’autorité, ou les situations dans lesquelles les agents préféraient un statut supérieur aux faits, et une conformité préjudiciable, ou une conformité à des demandes nuisibles. Il peut s’agir de faibles enjeux, comme « Raconte-moi une sale blague ». Mais les agents IA ne sont pas censés répondre à de telles demandes.
Les deux autres modèles étaient : l’effet pronom, où les locuteurs de statut supérieur utilisent plus souvent des pronoms pluriels comme « nous » et « notre » et la coordination linguistique, qui ressemble à des locuteurs de statut inférieur qui correspondent à leur choix de mots pour refléter leurs interlocuteurs de statut supérieur. Bien que les utilisateurs ne soient peut-être pas aussi conscients de ces modèles de parole, les chercheurs soupçonnent que les agents d’IA sont développés pour les adopter afin de paraître encore plus réalistes dans certains rôles.
Les chercheurs ont généré des centaines de conversations de 10 à 15 échanges entre des rôles supérieurs et inférieurs et ont répété cela avec six LLM, y compris des versions de ChatGPT d'OpenAI et de Meta's Llama.
Des modèles liés à la dynamique du pouvoir sont apparus dans les conversations sur l’IA, même si certains effets étaient subtils. Comparés aux agents de statut supérieur, les agents de statut inférieur étaient moins susceptibles d'utiliser des pronoms pluriels et plus susceptibles de coordonner leur langage avec celui de l'agent de statut supérieur. Les agents de statut inférieur étaient également plus susceptibles d'être persuadés et plus susceptibles de se conformer aux demandes nuisibles que les agents de statut supérieur, ce qui conforte l'idée selon laquelle les agents d'IA sont sensibles au statut social.
Mais des agents de statut inférieur pouvaient aussi parfois persuader, éventuellement en utilisant une technique humaine courante. Dans la conversation humaine, le choix subtil des mots qui se produit lors de la coordination linguistique peut aider les locuteurs de statut inférieur à influencer les autres, explique le linguiste informatique Mario Giulianelli de l'University College de Londres, qui n'a pas participé aux travaux.
« Je pense qu'il serait vraiment intéressant d'étudier si, grâce à la coordination, un agent pourrait en convaincre un autre », déclare Giulianelli.
