Cryptelio

Microsoft и Корнеллский университет представили бесплатные токены паузы для эффективного обучения LLM

Cryptelio Editorial Опубликовано 6 сен 2026 · 20:45 UTC
Microsoft и Корнеллский университет представили бесплатные токены паузы для эффективного обучения LLM

Исследователи из Microsoft и Корнеллского университета опубликовали революционную технику обучения, направленную на улучшение больших языковых моделей (LLM) в предсказании следующего токена при сохранении скорости вывода. Метод, известный как бесплатные токены паузы, был подробно описан в статье, поданной на arXiv 3 сентября.

Этот инновационный подход вводит параллельный поток предсказания, который делит веса с основным состоянием модели. Это позволяет проводить дополнительные вычисления ближе к концу обучения без типичных недостатков, связанных с архитектурными изменениями.

Как работают бесплатные токены паузы

Предыдущие попытки улучшить трансформерные модели заключались в добавлении явных "токенов паузы" в входную последовательность, что предоставляло модели дополнительное время для размышлений, но приводило к увеличению длины контекста и замедлению вывода. Метод бесплатных токенов паузы обходит эти проблемы, создавая легкий параллельный поток предсказания во время обучения. Этот поток делит веса с основной моделью через общие управляемые сети прямого распространения (FFN), минимизируя дополнительные параметры и вычислительные затраты.

Во время вывода поток предсказания можно эффективно игнорировать, что позволяет модели работать на скоростях, сопоставимых со стандартными трансформерами. Улучшение производительности для модели с 1 миллиардом параметров оценивается примерно в 2-3 центинанта в точности предсказания следующего токена.

Технические инновации

Три ключевых технических выбора способствуют низким затратам на обучение бесплатных токенов паузы:

  • Использование двухпроходного разбиения для поддержания совместимости с FlashAttention, популярным алгоритмом внимания, эффективным по памяти.
  • Реализация окна предсказания w=0, что упрощает архитектуру, не требуя от потока предсказания заглядывать вперед.
  • Использование общих управляемых FFN, позволяя потоку предсказания использовать существующие параметры основной модели без необходимости в выделенных слоях.

Исследователи сообщают, что обучение с бесплатными токенами паузы занимает всего около 1.09-1.14 раз больше времени, чем стандартный оптимизированный процесс. Этот метод показал улучшения по различным метрикам, включая isoflop, isoparameter и isotoken, что указывает на то, что бесплатные токены паузы обеспечивают лучшие модели, сохраняя при этом постоянными бюджеты вычислений, количество параметров и размеры обучающих данных.

Последствия для развертывания

Практическое значение бесплатных токенов паузы заключается в их минимальных требованиях. Нет необходимости в дополнительных длинах контекста, что позволяет существующим инфраструктурам развертывания оставаться нетронутыми. Более того, отсутствие дополнительных затрат на кэш ключей и значений позволяет средам с ограниченной памятью использовать эту технику без обновления оборудования. Наконец, метод не вводит дополнительных шагов декодирования, что гарантирует, что приложения, чувствительные к задержкам, сохраняют свои времена отклика.

FAQ

Что такое токены свободной паузы?

Токены свободной паузы — это техника обучения, представленная исследователями из Microsoft и Корнеллского университета, которая улучшает эффективность больших языковых моделей (LLM) в предсказании следующего токена, сохраняя скорость вывода.

Как токены свободной паузы улучшают обучение LLM?

Они создают легкий параллельный поток предсказаний, который делит веса с основной моделью, позволяя выполнять дополнительные вычисления без типичных недостатков архитектурных модификаций, что приводит к улучшению точности предсказаний.

Каковы преимущества использования токенов свободной паузы?

Метод повышает точность предсказания следующего токена примерно на 2-3 сентинанта для модели с 1 миллиардом параметров, при этом время обучения лишь немного дольше, чем у стандартных методов, и сохраняет существующую инфраструктуру развертывания.

Какие технические инновации связаны с токенами свободной паузы?

Ключевые инновации включают двухпроходное разделение для совместимости с FlashAttention, окно предсказания w=0 для упрощения архитектуры и совместные запираемые сети прямого распространения для минимизации дополнительных параметров.

Есть ли дополнительные требования для развертывания моделей с токенами свободной паузы?

Нет, дополнительных требований к длине контекста нет, нет дополнительных накладных расходов на кэш ключей и значений, и нет дополнительных шагов декодирования, что делает это решение подходящим для сред с ограниченной памятью и приложений, чувствительных к задержкам.

Похожее

Комментарии

Комментарии публикуются после модерации.

Пока нет комментариев — напишите первым.

Комментарий как гость

Капча