Перейти к основному содержимому
ToolPotion

SpanBERT

SpanBERT — это ИИ-модель, ориентированная на улучшение предварительного обучения путем представления и предсказания фрагментов текста. Она предлагает предварительно обученные базовые и большие модели с учетом регистра, совместимые с форматами HuggingFace BERT. Репозиторий содержит код для использования и оценки SpanBERT в различных задачах обработки естественного языка, включая ответы на вопросы и извлечение отношений.

Посетить URL

Описание

SpanBERT — это передовая ИИ-модель, разработанная Facebook Research, предназначенная для улучшения методов предварительного обучения путем фокусировки на представлении и предсказании фрагментов текста. Этот репозиторий предоставляет необходимый код и модели для исследователей и разработчиков для использования и оценки возможностей SpanBERT.

Проект предлагает предварительно обученные модели как в базовой, так и в большой версии с учетом регистра. Эти модели имеют ту же конфигурацию, что и BERT, но включают отличительные схемы маскирования и цели обучения, как подробно описано в сопутствующей статье. Модель SpanBERT (базовая и с учетом регистра) имеет 12-слойную архитектуру с 768 скрытыми единицами и 12 головами, что составляет в общей сложности 110 миллионов параметров. Более крупная модель SpanBERT (большая и с учетом регистра) может похвастаться 24-слойной архитектурой, 1024 скрытыми единицами, 16 головами и 340 миллионами параметров. Эти модели разработаны для бесшовной интеграции, принимая формат моделей HuggingFace BERT, что позволяет легко заменять их.

Этот репозиторий включает комплексный код для дообучения SpanBERT на различных задачах обработки естественного языка (NLP). Предоставлены специальные скрипты для дообучения на наборах данных для ответов на вопросы SQuAD 1.1 и SQuAD 2.0, TACRED для извлечения отношений и бенчмарках MRQA, которые включают такие наборы данных, как NewsQA, TriviaQA, SearchQA, HotpotQA и NaturalQuestions. Кроме того, доступен код для дообучения на задачах GLUE, таких как RTE. Для задач разрешения кореференции связана отдельная реализация TensorFlow.

Представлены сравнительные тесты производительности, демонстрирующие превосходные результаты SpanBERT по сравнению с BERT на наборах данных SQuAD 1.1, SQuAD 2.0, Coref и TACRED. Например, SpanBERT (large) достигает показателя F1 94,6 на SQuAD 1.1 и 88,7 на SQuAD 2.0, превосходя BERT (large). Проект также облегчает загрузку дообученных моделей для последующих задач, упрощая процесс внедрения для пользователей.

SpanBERT выпущен под лицензией CC-BY-NC 4.0, которая распространяется как на код, так и на предварительно обученные модели. Это делает его доступным для некоммерческих исследований и разработок. Репозиторий приветствует вклад и предоставляет контактную информацию для запросов и поддержки.

Главное о SpanBERT

  • Предварительно обученные модели SpanBERT (базовые и большие, с учетом регистра)

  • Код для использования и оценки SpanBERT

  • Скрипты для дообучения SQuAD 1.1 и SQuAD 2.0

  • Скрипты для дообучения извлечения отношений TACRED

  • Скрипты для дообучения на наборах данных MRQA (NewsQA, TriviaQA и др.)

  • Скрипты для дообучения на задачах GLUE (RTE)

  • Совместимость с форматами моделей HuggingFace BERT

  • Доступен код для дообучения разрешения кореференции

  • Сравнительные тесты производительности с BERT

  • Загружаемые дообученные модели для последующих задач

  • Реализация статьи SpanBERT: Улучшение предварительного обучения путем представления и предсказания фрагментов

Начало работы с SpanBERT

  1. Доступ к коду: Клонируйте репозиторий SpanBERT на GitHub.

  2. Настройка среды: Установите необходимые зависимости, включая Apex (рекомендуется определенный коммит).

  3. Загрузка предварительно обученных моделей: Используйте предоставленные скрипты для загрузки базовых или больших моделей SpanBERT с учетом регистра.

  4. Дообучение моделей: Запустите предоставленные скрипты Python для таких задач, как SQuAD, TACRED, MRQA или GLUE.

  5. Интеграция через API: Адаптируйте использование модели для пользовательских приложений, используя совместимость с HuggingFace.

  6. Оценка производительности: Запустите скрипты оценки для оценки производительности модели на конкретных задачах NLP.

  7. Загрузка дообученных моделей: Используйте предоставленные скрипты для получения предварительно обученных моделей для последующих задач.

Варианты использования SpanBERT

  • Ответы на вопросы
  • Извлечение отношений
  • Разрешение кореференции
  • Понимание естественного языка
  • Предсказание фрагментов текста
  • Исследования и разработки
  • Оценка по бенчмаркам

Часто задаваемые вопросы SpanBERT

Отзывы о SpanBERT

Загрузка...

Популярные ИИ-инструменты, похожие на SpanBERT

DeBERTa — это крупномасштабная предварительно обученная языковая модель, разработанная Microsoft Research. Она превосходит модели T5 11B по производительности и достигает…

ИИ-модели и LLM

BERT предлагает две многоязычные модели: Cased и Uncased, поддерживающие более 100 языков. Модель Cased рекомендуется для нелатинских алфавитов и общего использования, в то время…

ИИ-модели и LLM

Базовая модель BigBird — это трансформер, расширяющий BERT для обработки гораздо более длинных последовательностей с использованием блочной разреженной самовнимательности. Она…

ИИ-модели и LLM

AI-модели

MPNet — это новый метод предварительного обучения для задач понимания языка, улучшающий BERT и XLNet. Он предлагает унифицированную реализацию для различных моделей…

ИИ-модели и LLM

GODEL — это крупномасштабная предварительно обученная модель на основе Transformer для генерации диалогов, ориентированных на цель. Она превосходно генерирует ответы, основанные…

ИИ-модели и LLM

AI-модели

ConvBERT — это модель ИИ с открытым исходным кодом для предварительного обучения языковых моделей, представляющая новую архитектуру с динамической сверткой на основе сегментов.…

ИИ-модели и LLM

AI-модели

RETRO (Retrieval Enhanced Transformers) — это ИИ-модель, которая расширяет трансформерные архитектуры возможностями поиска. Она обращается к обширной базе текстовых фрагментов,…

ИИ-модели и LLM

AI-модели

RAG (Retrieval-Augmented Generation) объединяет предварительно обученные языковые модели с внешними источниками данных. Он извлекает релевантные фрагменты для обусловливания…

ИИ-модели и LLM