Cryptelio

Märkte

Microsoft und die Cornell University führen kostenlose Pause-Token für effizientes LLM-Training ein

Cryptelio Editorial Veröffentlicht 6 Sep 2026 · 20:45 UTC

Forscher von Microsoft und der Cornell University haben eine bahnbrechende Trainingsmethode veröffentlicht, die darauf abzielt, große Sprachmodelle (LLMs) bei der Vorhersage des nächsten Tokens zu verbessern und gleichzeitig die Inferenzgeschwindigkeit aufrechtzuerhalten. Die Methode, bekannt als Free Pause Tokens, wurde in einem am 3. September eingereichten Papier auf arXiv detailliert beschrieben.

Dieser innovative Ansatz führt einen parallelen Vorhersagestrom ein, der die Gewichte mit dem Hauptzustandsstrom des Modells teilt. Dies ermöglicht zusätzliche Berechnungen gegen Ende des Trainings, ohne die typischen Nachteile, die mit architektonischen Änderungen verbunden sind.

Wie Free Pause Tokens funktionieren

Frühere Versuche, Transformermodelle zu verbessern, beinhalteten das Einfügen expliziter „Pause-Token“ in die Eingabesequenz, was dem Modell zusätzliche Denkzeit gab, jedoch zu längeren Kontextlängen und langsamerer Inferenz führte. Die Methode der Free Pause Tokens umgeht diese Probleme, indem sie während des Trainings einen leichten parallelen Vorhersagestrom erstellt. Dieser Strom teilt sich die Gewichte mit dem Hauptmodell über gemeinsame gated Feedforward-Netzwerke (FFNs), wodurch zusätzliche Parameter und Rechenanforderungen minimiert werden.

Während der Inferenz kann der Vorhersagestrom effektiv ignoriert werden, sodass das Modell mit Geschwindigkeiten arbeitet, die mit denen standardmäßiger Transformer vergleichbar sind. Der Leistungszuwachs für ein Modell mit 1 Milliarde Parametern wird mit etwa 2 bis 3 Centinats in der Genauigkeit der Vorhersage des nächsten Tokens angegeben.

Technische Innovationen

Drei wesentliche technische Entscheidungen tragen zur geringen Trainingsüberlastung der Free Pause Tokens bei:

  • Die Nutzung von Zwei-Pass-Splitting, um die Kompatibilität mit FlashAttention, einem beliebten speichereffizienten Aufmerksamkeitsalgorithmus, aufrechtzuerhalten.
  • Die Implementierung eines Vorhersagefensters von w=0, was die Architektur vereinfacht, da der Vorhersagestrom nicht vorausschauen muss.
  • Die Nutzung gemeinsamer gated FFNs, die es dem Vorhersagestrom ermöglichen, die bestehenden Parameter des Hauptmodells zu verwenden, ohne dedizierte Schichten zu benötigen.

Die Forscher berichten, dass das Training mit Free Pause Tokens nur etwa 1,09 bis 1,14 Mal länger dauert als eine standardisierte optimierte Pipeline. Diese Methode hat in verschiedenen Metriken Verbesserungen gezeigt, einschließlich Isoflop, Isoparameter und Isotoken, was darauf hindeutet, dass Free Pause Tokens bessere Modelle liefern, während die Rechenbudgets, Parameterzahlen und Trainingsdatengrößen konstant bleiben.

Implikationen für die Bereitstellung

Die praktische Bedeutung der Free Pause Tokens liegt in ihren minimalen Anforderungen. Es sind keine zusätzlichen Kontextlängen erforderlich, was bedeutet, dass bestehende Bereitstellungsinfrastrukturen intakt bleiben. Darüber hinaus ermöglicht das Fehlen zusätzlicher Key-Value-Cache-Überlastungen, dass speicherbeschränkte Umgebungen diese Technik ohne Hardware-Upgrades übernehmen können. Schließlich führt die Methode nicht zu zusätzlichen Dekodierschritten, sodass latenzempfindliche Anwendungen ihre Reaktionszeiten beibehalten können.

FAQ

Was sind Free Pause Tokens?

Free Pause Tokens sind eine Trainingstechnik, die von Forschern von Microsoft und der Cornell University eingeführt wurde, um die Effizienz von großen Sprachmodellen (LLMs) bei der Vorhersage des nächsten Tokens zu verbessern, während die Inferenzgeschwindigkeit beibehalten wird.

Wie verbessern Free Pause Tokens das LLM-Training?

Sie schaffen einen leichten parallelen Vorhersagestrom, der Gewichte mit dem Hauptmodell teilt, was zusätzliche Berechnungen ermöglicht, ohne die typischen Nachteile architektonischer Änderungen, was zu einer verbesserten Vorhersagegenauigkeit führt.

Welche Vorteile bietet die Verwendung von Free Pause Tokens?

Die Methode verbessert die Vorhersagegenauigkeit des nächsten Tokens um etwa 2 bis 3 Centinats für ein Modell mit 1 Milliarde Parametern, während die Trainingszeiten nur geringfügig länger sind als bei Standardmethoden und die bestehenden Bereitstellungsinfrastrukturen beibehalten werden.

Welche technischen Innovationen sind mit Free Pause Tokens verbunden?

Wichtige Innovationen umfassen das Zweipass-Splitting zur Kompatibilität mit FlashAttention, ein Vorhersagefenster von w=0 für architektonische Einfachheit und gemeinsame gated Feedforward-Netzwerke zur Minimierung zusätzlicher Parameter.

Gibt es zusätzliche Anforderungen für die Bereitstellung von Modellen mit Free Pause Tokens?

Nein, es sind keine zusätzlichen Kontextlängen erforderlich, keine zusätzlichen Schlüssel-Wert-Cache-Überhead und keine zusätzlichen Dekodierschritte, was es für speicherkritische Umgebungen und latenzempfindliche Anwendungen geeignet macht.

Beitrag lesen →