State of Thought : L'IA Développe un Raisonnement Intégré et Autogène

L’amélioration des capacités de raisonnement des grands modèles linguistiques (LLM) est un enjeu majeur dans le domaine de l'intelligence artificielle. Les approches traditionnelles, basées sur un contrôle externe, se révèlent limitantes en termes de généralisation et d'efficacité. De nouvelles méthodes émergent, explorant la possibilité d’un raisonnement interne au modèle lui-même, ouvrant ainsi de nouvelles perspectives pour le développement des LLM.

Rédigé par une IA Publié le 3 sources · 2405 contenus analysés 4 min de lecture
Déontologie : State of Thought : L'IA Développe un Raisonnement Intégré et Autogène

Les fondements du State of Thought

Une nouvelle approche, baptisée State of Thought (SoT), est proposée par l’équipe cs.AI. Cette méthode vise à permettre un raisonnement endogène dans les LLM, où l’état interne de raisonnement du modèle détermine la manière dont le processus de réflexion se déroule. Contrairement aux paradigmes existants qui reposent sur des programmes de raisonnement fixes ou sur une expansion coûteuse dans des espaces de recherche restreints, SoT extrait un état dynamique géométrique compact à partir des transferts d’informations internes du modèle. Un contrôleur de 582 paramètres est ensuite utilisé pour activer sélectivement les supports de raisonnement historiques pertinents en fonction de l’état actuel du raisonnement, transformant ainsi le raisonnement en un processus conditionné par l’état et basé sur la preuve plutôt qu’une chaîne de jetons prédéfinie. Les tests préliminaires suggèrent une amélioration significative des performances, atteignant 1,34x en termes de performance quantitative, 1,62x en général, 1,76x dans le domaine symbolique et du code, et 2… sur les contextes longs.

Ladders of Thought : Un curriculum auto-évolutif

Parallèlement, une autre approche, baptisée Ladders of Thought (LoT), se concentre sur l’amélioration du raisonnement des LLM à différentes échelles. LoT combine la réécriture progressive des questions avec un curriculum auto-évolutif. Le framework génère automatiquement des variantes de problèmes de raisonnement plus simples et sémantiquement fidèles, les organise en buckets de difficulté basés sur des mesures étape par étape et utilise un planificateur bandit auto-évolutif pour allouer les ressources d’entraînement de manière adaptative. Des évaluations sur deux domaines de raisonnement – mathématiques et raisonnement multi-étapes – ont démontré l’efficacité de LoT, avec des gains significatifs par rapport à la distillation de connaissances (KD) dans des tâches arithmétiques (par exemple, +32 pour cent sur AddSub, +25 pour cent sur SVAMP) et des améliorations de 2 à 8 pour cent sur les divisions de jeu de tests en domaine, ainsi que des avantages importants, bien que dépendants des ensembles de données, dans le raisonnement multi-étapes (par exemple, +16 pour cent sur QASC, +25 pour cent sur StrategyQA).

Allocation Optimale du Raisonnement : L’approche CARE

Les recherches menées par l’équipe cs.AI ont également mis en lumière les problèmes liés à l’allocation de la longueur du raisonnement dans les LLM utilisant le reinforcement learning (RL). Ces méthodes, basées sur l’attribution budgétaire de jetons en fonction de la difficulté des questions, souffrent d’une allocation systématique excessive pour les questions simples, entraînant une terminaison prématurée des questions plus complexes et une dégradation de l’efficacité de l’inférence avec un gain d’exactitude négligeable. L’approche CARE (Contrastive Accuracy Reward Estimation) propose une alternative en se concentrant sur les questions partiellement résolubles. L’analyse révèle que l’effet de la longueur du raisonnement sur la précision est concentré sur ces questions partiellement résolues, et que les récompenses explicites de longueur peuvent produire des dynamiques d’entraînement indésirables.

Enjeux et Perspectives

Le développement de ces nouvelles approches soulève plusieurs enjeux. La capacité à intégrer un raisonnement endogène dans les LLM pourrait permettre une meilleure généralisation et une plus grande efficacité, réduisant la dépendance aux modèles massifs et coûteux en ressources. L’utilisation de curriculums auto-évolutifs comme LoT offre une voie prometteuse pour adapter l’entraînement des LLM à différents niveaux de complexité, améliorant ainsi leurs performances dans un large éventail de tâches. La recherche sur l’allocation optimale du raisonnement, telle que l’approche CARE, est cruciale pour éviter les biais et optimiser l’efficacité des modèles de raisonnement.

Ce qu’il faut retenir

  • Le State of Thought (SoT) permet un raisonnement endogène dans les LLM en utilisant un état dynamique compact et un contrôleur adaptable pour guider le processus de réflexion.
  • Ladders of Thought (LoT) améliore le raisonnement des LLM à différentes échelles grâce à un curriculum auto-évolutif, améliorant significativement la performance sur des tâches spécifiques.
  • L’approche CARE vise à optimiser l’allocation du temps de raisonnement en se concentrant sur les questions partiellement résolues, évitant ainsi une allocation excessive et améliorant l’efficacité globale.
reasoningthought

Sources

Sujet détecté par regroupement sémantique · classé « Déontologie » · rédigé avec gemma3:4b via Ollama. Comment cet article a été produit

← Tous les articles