Описание
Funnel-Transformer — это новая модель самовнимания, разработанная для повышения эффективности обработки языка путем постепенного сжатия последовательности скрытых состояний. Это сжатие значительно снижает вычислительные затраты, одновременно позволяя создавать модели с более высокой пропускной способностью, либо более глубокие, либо более широкие, при заданном вычислительном бюджете. Основное новшество заключается в способности перераспределять сэкономленные FLOPs на сложность модели.
Кроме того, Funnel-Transformer включает декодирующий механизм, который восстанавливает глубокие представления на уровне токенов из сжатой скрытой последовательности. Эта возможность имеет решающее значение для обеспечения стандартных методологий предварительного обучения, делая модель более универсальной и применимой к более широкому спектру задач обработки естественного языка. Технические детали модели и экспериментальная проверка представлены в исследовательской статье.
Проект предоставляет реализации как на TensorFlow, так и на PyTorch. Версия TensorFlow специально разработана для предварительного обучения и дообучения на TPU, поддерживая такие задачи, как дообучение бенчмарка GLUE, классификация текстов, SQuAD и RACE. Реализация PyTorch служит примером, в основном поддерживая дообучение на GPU для бенчмарка GLUE и классификации текстов.
Предварительно обученные модели доступны в различных размерах и конфигурациях, включая разную глубину слоев и количество скрытых единиц. Каждый пакет модели включает чекпойнт TensorFlow или PyTorch, файл словаря Word Piece для токенизации и файл конфигурации с подробным описанием гиперпараметров модели. Также предоставляется скрипт для загрузки всех доступных чекпойнтов. Инструкции по использованию предварительно обученных моделей и дообучению подробно описаны в соответствующих файлах README в каталогах TensorFlow и PyTorch.
Главное о Funnel-Transformer
Постепенное сжатие скрытых состояний
Снижение вычислительных затрат
Увеличение пропускной способности модели (глубина/ширина)
Восстановление представлений на уровне токенов
Обеспечивает стандартное предварительное обучение
Реализация на TensorFlow для TPU
Реализация на PyTorch для GPU
Поддержка бенчмарка GLUE, классификации текстов, SQuAD, RACE
Доступны модели различных размеров с предварительным обучением
Включает чекпойнты моделей, словарь и файлы конфигурации
Начало работы с Funnel-Transformer
Доступ к модели: Получите код Funnel-Transformer и предварительно обученные модели из репозитория GitHub.
Настройка среды: Установите необходимые зависимости для TensorFlow или PyTorch.
Интеграция через код: Загрузите чекпойнты модели и файлы конфигурации в выбранный вами фреймворк.
Дообучение модели: Адаптируйте модель к конкретным нижестоящим задачам, используя предоставленные скрипты дообучения.
Использование предварительно обученных весов: Применяйте загруженные чекпойнты для инференса или дальнейшего обучения.
Токенизация данных: Используйте предоставленный словарь Word Piece для предварительной обработки текста.
Варианты использования Funnel-Transformer
- Эффективное языковое моделирование
- Классификация текстов
- Ответы на вопросы
- Сжатие последовательностей
- Стандартное предварительное обучение
- Исследования и разработки







