in

L’IA peut-elle raisonner sans mots ? Un petit modèle met l'idée à l'épreuve

L’IA peut-elle raisonner sans mots ? Un petit modèle met l'idée à l'épreuve

L’IA peut être capable de raisonner sans mettre des mots sur chaque étape.

De nombreux systèmes d'IA actuels s'attaquent à des problèmes difficiles en générant des étapes intermédiaires dans de longues chaînes de mots avant d'arriver à une réponse – une technique souvent appelée raisonnement en chaîne de pensée. Cette approche peut améliorer les performances de certaines tâches, mais cela signifie également qu’un modèle d’IA peut générer de nombreux mots, ou jetons, pour aboutir à une réponse relativement courte. Chaque jeton nécessite de la puissance de calcul pour être produit, donc un raisonnement plus long peut rendre la génération de réponses plus lente et plus coûteuse.

Un petit système d’IA expérimental appelé BDH-CQ adopte une approche différente. Il peut résoudre certaines énigmes de raisonnement sans expliciter sa pensée intermédiaire, rapportent les chercheurs dans un article soumis le 10 août à arXiv.org. Les travaux se demandent si l’IA a besoin du langage à chaque étape du raisonnement et si en faire davantage en interne pourrait rendre certains raisonnements moins coûteux.

Lors de la formation, les modèles d'IA voient souvent quelques exemples avant de tenter un nouveau problème. Beaucoup gardent ces exemples devant eux pendant qu’ils travaillent. Mais lors des tests de raisonnement, BDH-CQ (DH est l'abréviation de Dragon Hatchling) utilise à la place chaque exemple pour mettre à jour une mémoire de taille fixe, qui reste la même taille que celle utilisée dans davantage d'exemples, de sorte qu'il n'a pas besoin de revenir en arrière sur tout ce qu'il a déjà vu.

« Une fois la requête reçue, le modèle n'écrit plus du tout sa pensée », explique Zuzanna Stamirowska, spécialiste de la complexité et PDG de la société d'IA Pathway. Stamirowska affirme que le modèle résout un problème en interne sans transformer chaque étape en mots. « Rien entre les deux ne se transforme jamais en langage », dit-elle.

Stamirowska et ses collègues ont déclaré que le modèle résolvait près de trois énigmes sur 10 sur l'ensemble d'évaluation public ARC-AGI-1 après deux tentatives. Le résultat a montré qu’un petit modèle pouvait résoudre de nouveaux problèmes de raisonnement sans préciser ses étapes intermédiaires. Les tests de référence demandent aux systèmes d'IA de déduire des règles visuelles à partir de quelques exemples et de les appliquer à de nouveaux puzzles. Les tests sont comme les examens des étudiants humains.

Le modèle a mieux réussi sur certaines énigmes que sur d’autres. Par exemple, il gérait certaines tâches impliquant de tourner ou de déplacer des formes, mais il éprouvait davantage de difficultés avec les changements de couleur et certaines combinaisons de règles. Sur des puzzles d'ordre et d'imbrication plus difficiles, le modèle a obtenu de meilleurs résultats après avoir vu un exemple de difficulté similaire.

Le processus comportant moins de mots pourrait contribuer à réduire les coûts informatiques, affirment Stamirowska et ses collègues. Ils estiment que chaque requête de puzzle coûte environ 0,00070 $ à exécuter, soit environ un onzième de ce que GPT-5.6 Luna sur le même test de référence, bien que les deux coûts aient été calculés différemment. L'étude n'a pas été évaluée par des pairs.

Cette découverte constitue « un résultat d’efficacité intéressant », déclare l’informaticien Yuntian Deng de l’Université de Waterloo au Canada. Mais il dit que cela ne montre pas que l'architecture sous-jacente de BDH-CQ est meilleure que les autres approches.

« Petits modèles spécialisés [like BDH-CQ] sont une voie prometteuse vers un raisonnement efficace », dit Deng. Mais des tests supplémentaires sont nécessaires pour séparer les effets de la conception du modèle de la façon dont il a été formé, dit-il. Sans raisonnement écrit, le modèle est plus difficile à inspecter, dit Deng. Mais même une chaîne de pensée écrite peut ne pas montrer fidèlement comment le modèle est parvenu à sa réponse.

Le modèle BDH-CQ a été conçu spécifiquement pour les problèmes de type ARC, ce qui rend difficile toute comparaison directe avec les systèmes d'IA à usage général, explique Jonas Geiping, chercheur en apprentissage automatique de l'Institut ELLIS de Tübingen et de l'Institut Max Planck pour les systèmes intelligents en Allemagne. Mais il a qualifié l’approche de « soignée » et a noté qu’elle permet de résoudre les problèmes de test sans recyclage.

Pour Deng, l’étude soulève une question plus large : l’IA doit-elle mettre des mots sur tous ses raisonnements ? « Le langage humain est utile pour communiquer le raisonnement, mais il ne doit pas nécessairement être la représentation la plus efficace pour chaque calcul intermédiaire », explique Deng.

Les cristaux liquides s'inspirent de l'acier dans une transition de phase surprenante