Marchés
Microsoft et l'Université Cornell présentent les Free Pause Tokens pour un entraînement efficace des LLM
Des chercheurs de Microsoft et de l'Université Cornell ont publié une technique d'entraînement révolutionnaire visant à améliorer les grands modèles de langage (LLM) dans la prédiction du prochain token tout en maintenant la vitesse d'inférence. La méthode, connue sous le nom de Free Pause Tokens, a été détaillée dans un article soumis à arXiv le 3 septembre.
Cette approche innovante introduit un flux de prédiction parallèle qui partage les poids avec le flux d'état principal du modèle. Cela permet d'effectuer des calculs supplémentaires près de la fin de l'entraînement sans les inconvénients typiques associés aux modifications architecturales.
Fonctionnement des Free Pause Tokens
Les tentatives précédentes d'amélioration des modèles de transformateurs consistaient à insérer des "pause tokens" explicites dans la séquence d'entrée, ce qui offrait au modèle un temps de réflexion supplémentaire mais entraînait des longueurs de contexte plus longues et une inférence plus lente. La méthode Free Pause Tokens contourne ces problèmes en créant un flux de prédiction parallèle léger pendant l'entraînement. Ce flux partage les poids avec le modèle principal via des réseaux de neurones feedforward (FFN) à portes partagées, minimisant ainsi les paramètres supplémentaires et les exigences computationnelles.
Lors de l'inférence, le flux de prédiction peut être efficacement ignoré, permettant au modèle de fonctionner à des vitesses comparables à celles des transformateurs standards. L'amélioration des performances pour un modèle de 1 milliard de paramètres est estimée à environ 2 à 3 centinats en précision de prédiction du prochain token.
Innovations techniques
Trois choix techniques clés contribuent à la faible surcharge d'entraînement des Free Pause Tokens :
- Utilisation d'un découpage en deux passes pour maintenir la compatibilité avec FlashAttention, un algorithme d'attention populaire et économe en mémoire.
- Mise en œuvre d'une fenêtre de prédiction de w=0, ce qui simplifie l'architecture en ne nécessitant pas que le flux de prédiction regarde en avant.
- Exploitation de FFN à portes partagées, permettant au flux de prédiction d'utiliser les paramètres existants du modèle principal sans nécessiter de couches dédiées.
Les chercheurs rapportent que l'entraînement avec les Free Pause Tokens prend seulement environ 1,09 à 1,14 fois plus de temps qu'un pipeline optimisé standard. Cette méthode a montré des améliorations à travers divers indicateurs, y compris isoflop, isoparameter et isotoken, indiquant que les Free Pause Tokens produisent de meilleurs modèles tout en maintenant constants les budgets de calcul, le nombre de paramètres et la taille des données d'entraînement.
Implications pour le déploiement
La signification pratique des Free Pause Tokens réside dans leurs exigences minimales. Il n'est pas nécessaire d'augmenter les longueurs de contexte, ce qui permet aux infrastructures de déploiement existantes de rester intactes. De plus, l'absence de surcharge supplémentaire de cache clé-valeur permet aux environnements à mémoire limitée d'adopter cette technique sans mises à niveau matérielles. Enfin, la méthode n'introduit pas d'étapes de décodage supplémentaires, garantissant que les applications sensibles à la latence maintiennent leurs temps de réponse.
FAQ
Qu'est-ce que les Free Pause Tokens ?
Les Free Pause Tokens sont une technique d'entraînement introduite par des chercheurs de Microsoft et de l'Université Cornell qui améliore l'efficacité des modèles de langage de grande taille (LLMs) dans la prédiction du prochain token tout en maintenant la vitesse d'inférence.
Comment les Free Pause Tokens améliorent-ils l'entraînement des LLM ?
Ils créent un flux de prédiction parallèle léger qui partage les poids avec le modèle principal, permettant un calcul supplémentaire sans les inconvénients typiques des modifications architecturales, ce qui se traduit par une précision de prédiction améliorée.
Quels sont les avantages de l'utilisation des Free Pause Tokens ?
La méthode améliore la précision de la prédiction du prochain token d'environ 2 à 3 centinats pour un modèle de 1 milliard de paramètres, tout en maintenant des temps d'entraînement légèrement plus longs que les méthodes standard et en préservant les infrastructures de déploiement existantes.
Quelles innovations techniques sont impliquées dans les Free Pause Tokens ?
Les innovations clés incluent le découpage en deux passes pour la compatibilité avec FlashAttention, une fenêtre de prédiction de w=0 pour la simplicité architecturale, et des réseaux feedforward à portes partagées pour minimiser les paramètres supplémentaires.
Y a-t-il des exigences supplémentaires pour déployer des modèles avec des Free Pause Tokens ?
Non, il n'y a pas de longueurs de contexte supplémentaires requises, pas de surcharge de cache clé-valeur supplémentaire, et pas d'étapes de décodage supplémentaires, ce qui le rend adapté aux environnements à mémoire limitée et aux applications sensibles à la latence.