Описание
Adept выпускает Fuyu-8B — компактную версию мультимодальной модели ИИ, которая лежит в основе их продукта. Модель доступна на HuggingFace под лицензией CC-BY-NC. Эта модель отличается значительно более простой архитектурой и процедурой обучения по сравнению с другими мультимодальными моделями, что повышает ее понятность, масштабируемость и удобство развертывания.
Fuyu-8B разработана с нуля для цифровых агентов, что позволяет ей обрабатывать изображения произвольного разрешения. Эта возможность имеет решающее значение для таких задач, как ответы на вопросы о графиках и диаграммах, обработка запросов на основе пользовательского интерфейса и точная локализация на изображениях экрана. Ключевым преимуществом является скорость: модель выдает ответы для больших изображений менее чем за 100 миллисекунд. Несмотря на оптимизацию под конкретный сценарий использования Adept, Fuyu-8B демонстрирует высокую производительность на стандартных бенчмарках понимания изображений, таких как визуальный ответ на вопросы (visual question-answering) и создание описаний естественным языком для изображений (natural image captioning).
Архитектура отказалась от отдельного энкодера изображений, вместо этого линейно проецируя патчи изображений непосредственно в первый слой трансформера. Это исключает необходимость в поиске в таблице вложений (embedding lookups) и упрощает как обучение, так и инференс. Модель обрабатывает токены изображений аналогично текстовым токенам, поддерживает переменный размер изображений и устраняет необходимость в отдельных этапах обучения для высокого и низкого разрешения. Такой оптимизированный подход позволяет использовать причинно-следственное внимание (causal attention) и отсутствие пулинга, рассматривая декодер трансформера как трансформер изображений.
Хотя Fuyu-8B является базовой моделью, требующей дообучения для конкретных приложений, ее производительность на бенчмарках, таких как VQAv2, OKVQA, COCO Captions и AI2D, конкурентоспособна даже по сравнению с более крупными моделями. Adept подчеркивает, что их внутренние модели, построенные на архитектуре Fuyu, обладают расширенными возможностями, такими как надежное оптическое распознавание символов (OCR) на изображениях высокого разрешения, точная локализация текста и элементов пользовательского интерфейса, а также способность отвечать на вопросы о пользовательских интерфейсах, что дает представление о будущих разработках продукта.
Дизайн Fuyu-8B делает ее особенно подходящей для специалистов, работающих с информацией, и приложений, требующих глубокого визуального понимания и взаимодействия с цифровыми интерфейсами. Открытое распространение этой модели направлено на стимулирование инноваций и развития сообщества в области ИИ-агентов и мультимодального ИИ.
Главное о Fuyu-8B Multimodal Architecture
Мультимодальная модель ИИ для цифровых агентов
Упрощенная архитектура для лучшего понимания, масштабирования и развертывания
Поддержка произвольного разрешения изображений
Быстрое время отклика для больших изображений (менее 100 мс)
Хорошая производительность на стандартных бенчмарках понимания изображений
Разработана для понимания графиков, диаграмм и элементов пользовательского интерфейса
Распространяется под лицензией CC-BY-NC
Доступна на HuggingFace
Отсутствие отдельного энкодера изображений; патчи изображений проецируются непосредственно в трансформер
Обрабатывает токены изображений как текстовые токены для изображений переменного размера
Требует дообучения для конкретных сценариев использования
Начало работы с Fuyu-8B Multimodal Architecture
Доступ к модели: Загрузите веса Fuyu-8B с HuggingFace.
Настройка среды: Подготовьте вашу Python-среду с необходимыми библиотеками.
Интеграция через API: Загрузите модель и токенизатор для инференса.
Обработка изображений: Преобразуйте изображения в последовательности токенов, совместимые с моделью.
Запрос к модели: Введите токены изображений и текстовые запросы для получения ответов.
Дообучение: Адаптируйте модель к требованиям вашего конкретного приложения.
Варианты использования Fuyu-8B Multimodal Architecture
- Разработка ИИ-агентов
- Визуальный ответ на вопросы
- Взаимодействие с пользовательским интерфейсом
- Анализ документов
- Создание описаний изображений
- Интерпретация диаграмм и графиков





