Une équipe dirigée par Xiaoyan Bai et Chenhao Tan, avec des collaborateurs d'autres universités, a étudié pourquoi des modèles de langage ont du mal à multiplier deux nombres à quatre chiffres. Les chercheurs ont comparé l'affinage standard à une méthode appelée Implicit Chain of Thought (ICoT). Sous l'affinage standard, des modèles de 2 à 12 couches ont obtenu une précision inférieure à 1 % pour cette tâche.
En revanche, le modèle entraîné avec ICoT a atteint 100 %. Les chercheurs ont sondé les états internes et montré que ICoT encode les valeurs intermédiaires : on peut décoder les sommes courantes à partir des états cachés, ce qui prouve que le modèle mémorise l'information utile.
Ils ont aussi ajouté un objectif d'entraînement simple pour suivre les sommes courantes. Appliqué à un modèle à deux couches, cet objectif a porté la précision à 99 % sans supervision explicite par chaîne de pensée. Les auteurs soulignent que l'orientation architecturale et les objectifs d'entraînement ciblés peuvent permettre d'acquérir un raisonnement en plusieurs étapes.
Mots difficiles
- affinage — action d'ajuster un modèle par entraînementl'affinage
- encoder — transformer une information en représentation interneencode
- état — condition interne d'un modèle à un moment donnéétats internes, états cachés
- précision — mesure du pourcentage de réponses correctes
- supervision — contrôle humain ou donnée correcte pour l'entraînementsupervision explicite
- objectif — but fixé pendant l'entraînement d'un modèleobjectif d'entraînement, objectifs d'entraînement
- raisonnement — processus de pensée pour résoudre des étapes
Astuce : survolez, mettez le focus ou touchez les mots en surbrillance dans l’article pour voir des définitions rapides pendant que vous lisez ou écoutez.
Questions de discussion
- Pensez-vous que rendre visibles les étapes intermédiaires aiderait les humains à comprendre les modèles ? Pourquoi ?
- Comment l'orientation architecturale peut-elle, selon vous, favoriser un raisonnement en plusieurs étapes ? Donnez une raison simple.
- Donnez un exemple d'une autre tâche où ajouter un objectif d'entraînement simple pourrait améliorer la précision.
Articles liés
Traiter la dépression en ciblant l'inflammation
Une revue et une méta‑analyse montrent que, chez des personnes dépressives avec une inflammation élevée, des traitements anti‑inflammatoires ont réduit les symptômes et l'anhédonie. Les médicaments ne sont toutefois pas approuvés pour la dépression.
Indonésie : renforcement du contrôle des plateformes numériques
Le gouvernement indonésien augmente la régulation des grandes plateformes. La ministre Meutya Hafid a visité le bureau de Meta et les règles comprennent des enregistrements, des retraits rapides et des sanctions, mais elles suscitent des critiques.
Plus de contrôle régional pour la recherche en santé en Afrique
La baisse de l'aide et les défis sanitaires poussent des responsables africains à réclamer un renforcement du contrôle régional de la recherche, de la production de vaccins et des politiques pour garantir l'accès aux médicaments.
Un outil pour accélérer le diagnostic de l’autisme dans le Missouri
Des chercheurs du Missouri ont testé CanvasDx, un dispositif approuvé par la FDA qui utilise l’IA pour aider au diagnostic de l’autisme. L’étude reporte des diagnostics plus précoces et des résultats déterminés pour 52 % des patients.
Des algorithmes pour comprendre la transformation du propane en propylène
Des chercheurs de l'Université de Rochester ont développé des algorithmes qui montrent, au niveau atomique, comment le propane devient propylène. Les résultats, publiés dans le Journal of the American Chemical Society, peuvent aider d'autres réactions industrielles.