Описание
SpanBERT — это передовая ИИ-модель, разработанная Facebook Research, предназначенная для улучшения методов предварительного обучения путем фокусировки на представлении и предсказании фрагментов текста. Этот репозиторий предоставляет необходимый код и модели для исследователей и разработчиков для использования и оценки возможностей SpanBERT.
Проект предлагает предварительно обученные модели как в базовой, так и в большой версии с учетом регистра. Эти модели имеют ту же конфигурацию, что и BERT, но включают отличительные схемы маскирования и цели обучения, как подробно описано в сопутствующей статье. Модель SpanBERT (базовая и с учетом регистра) имеет 12-слойную архитектуру с 768 скрытыми единицами и 12 головами, что составляет в общей сложности 110 миллионов параметров. Более крупная модель SpanBERT (большая и с учетом регистра) может похвастаться 24-слойной архитектурой, 1024 скрытыми единицами, 16 головами и 340 миллионами параметров. Эти модели разработаны для бесшовной интеграции, принимая формат моделей HuggingFace BERT, что позволяет легко заменять их.
Этот репозиторий включает комплексный код для дообучения SpanBERT на различных задачах обработки естественного языка (NLP). Предоставлены специальные скрипты для дообучения на наборах данных для ответов на вопросы SQuAD 1.1 и SQuAD 2.0, TACRED для извлечения отношений и бенчмарках MRQA, которые включают такие наборы данных, как NewsQA, TriviaQA, SearchQA, HotpotQA и NaturalQuestions. Кроме того, доступен код для дообучения на задачах GLUE, таких как RTE. Для задач разрешения кореференции связана отдельная реализация TensorFlow.
Представлены сравнительные тесты производительности, демонстрирующие превосходные результаты SpanBERT по сравнению с BERT на наборах данных SQuAD 1.1, SQuAD 2.0, Coref и TACRED. Например, SpanBERT (large) достигает показателя F1 94,6 на SQuAD 1.1 и 88,7 на SQuAD 2.0, превосходя BERT (large). Проект также облегчает загрузку дообученных моделей для последующих задач, упрощая процесс внедрения для пользователей.
SpanBERT выпущен под лицензией CC-BY-NC 4.0, которая распространяется как на код, так и на предварительно обученные модели. Это делает его доступным для некоммерческих исследований и разработок. Репозиторий приветствует вклад и предоставляет контактную информацию для запросов и поддержки.
Главное о SpanBERT
Предварительно обученные модели SpanBERT (базовые и большие, с учетом регистра)
Код для использования и оценки SpanBERT
Скрипты для дообучения SQuAD 1.1 и SQuAD 2.0
Скрипты для дообучения извлечения отношений TACRED
Скрипты для дообучения на наборах данных MRQA (NewsQA, TriviaQA и др.)
Скрипты для дообучения на задачах GLUE (RTE)
Совместимость с форматами моделей HuggingFace BERT
Доступен код для дообучения разрешения кореференции
Сравнительные тесты производительности с BERT
Загружаемые дообученные модели для последующих задач
Реализация статьи SpanBERT: Улучшение предварительного обучения путем представления и предсказания фрагментов
Начало работы с SpanBERT
Доступ к коду: Клонируйте репозиторий SpanBERT на GitHub.
Настройка среды: Установите необходимые зависимости, включая Apex (рекомендуется определенный коммит).
Загрузка предварительно обученных моделей: Используйте предоставленные скрипты для загрузки базовых или больших моделей SpanBERT с учетом регистра.
Дообучение моделей: Запустите предоставленные скрипты Python для таких задач, как SQuAD, TACRED, MRQA или GLUE.
Интеграция через API: Адаптируйте использование модели для пользовательских приложений, используя совместимость с HuggingFace.
Оценка производительности: Запустите скрипты оценки для оценки производительности модели на конкретных задачах NLP.
Загрузка дообученных моделей: Используйте предоставленные скрипты для получения предварительно обученных моделей для последующих задач.
Варианты использования SpanBERT
- Ответы на вопросы
- Извлечение отношений
- Разрешение кореференции
- Понимание естественного языка
- Предсказание фрагментов текста
- Исследования и разработки
- Оценка по бенчмаркам







