Des chercheurs dirigés par Xiaoyan Bai et Chenhao Tan à l'University of Chicago, en collaboration avec des équipes du MIT, de Harvard, de l'University of Waterloo et de Google DeepMind, ont comparé l'affinage standard à l'Implicit Chain of Thought (ICoT) pour une tâche simple mais révélatrice : multiplier deux nombres à quatre chiffres. Ils se sont intéressés au problème des dépendances à long terme, où le modèle doit conserver des produits partiels et des sommes courantes pour produire un résultat correct.
Sous l'affinage standard, des modèles de 2 à 12 couches n'ont obtenu qu'une précision inférieure à 1 %. En revanche, le modèle entraîné avec ICoT a atteint une précision de 100 %. L'équipe a sondé les états internes et a pu décoder les sommes courantes depuis les états cachés, preuve que le modèle ICoT encode et mémorise les valeurs intermédiaires nécessaires.
Les auteurs ont observé que ICoT organise l'attention en voies distinctes au fil du temps : les couches précoces calculent et stockent les produits de paires de chiffres à des emplacements précis, et les couches ultérieures récupèrent ces valeurs pour former chaque chiffre du résultat. Ils notent aussi des représentations des chiffres en bases de type Fourier et l'apparition naturelle d'une opération géométrique proche d'une somme de Minkowski durant l'entraînement.
Pour tester une modification simple, les chercheurs ont ajouté un objectif d'entraînement qui apprend au modèle à suivre les sommes courantes à chaque étape. Appliqué à un modèle à deux couches, cet objectif a fait passer la précision à 99 % sans supervision explicite par chaîne de pensée, et le modèle a développé des mécanismes d'attention similaires à ICoT. Les auteurs concluent que certaines limites ne se résolvent pas seulement en augmentant les données ou les paramètres, et que l'architecture et les objectifs d'entraînement ciblés sont essentiels. « À mesure que l'IA est de plus en plus intégrée dans la prise de décisions critiques, il est essentiel de comprendre ses façons uniques d'apprendre et de penser », déclare Chenhao Tan.
Mots difficiles
- affinage — processus d'ajustement fin d'un modèle
- dépendance — lien où une étape dépend d'anciennes informationsdépendances
- état caché — représentation interne non visible du modèleétats cachés
- attention — mécanisme qui donne du poids à certaines informations
- produit partiel — valeur intermédiaire pendant un calcul multiplicatifproduits partiels
- somme courante — total provisoire mis à jour étape par étapesommes courantes
- encoder — transformer une information en représentation interneencode
Astuce : survolez, mettez le focus ou touchez les mots en surbrillance dans l’article pour voir des définitions rapides pendant que vous lisez ou écoutez.
Questions de discussion
- Pourquoi, selon l'article, augmenter seulement les données ou les paramètres peut être insuffisant pour résoudre certaines limites ?
- Quels avantages et risques voyez-vous à pouvoir décoder des valeurs intermédiaires depuis les états internes d'un modèle ?
- Pensez-vous que l'idée d'ajouter un objectif pour suivre les sommes courantes pourrait s'appliquer à d'autres tâches complexes ? Donnez un exemple.
Articles liés
Des capteurs bon marché pour surveiller la pollution en Afrique du Sud
Des scientifiques ont adapté des méthodes de physique des particules pour créer AI_r, un réseau de capteurs à faible coût qui mesure la qualité de l'air en temps réel. Le projet s'étend de Soweto à Sedibeng avec 500 capteurs prévus.
Artistes autochtones demandent protection face à l'IA
Des artistes, journalistes et agents culturels aborigènes en Australie lancent la campagne «Stop AI Theft» contre l'utilisation de leurs œuvres par des intelligences artificielles. Ils réclament règles, transparence et compensation financière.
Vulnérabilités dans des gestionnaires de mots de passe en ligne
Des chercheurs de l'ETH Zurich ont testé trois gestionnaires de mots de passe en ligne et montré que des serveurs compromis pouvaient permettre de lire ou modifier des coffres chiffrés. Ils ont conseillé des corrections et des audits.
Virtual Vet : un jeu pour apprendre la science à l'école primaire
Des chercheurs de l'University of Georgia ont créé Virtual Vet, un jeu où des élèves jouent des assistants vétérinaires pour pratiquer l'anatomie, la santé et le raisonnement. Les enfants qui ont joué ont obtenu de meilleurs résultats qu'avec des activités traditionnelles.
Des ARN très anciens trouvés dans un mammouth
Des chercheurs ont isolé et séquencé de l'ARN provenant de restes de mammouth préservés dans le pergélisol sibérien depuis près de 40 000 ans. Ces molécules montrent quels gènes étaient actifs et offrent de nouvelles informations sur les espèces éteintes.