Описание
Vision GNN (ViG) представляет собой значительный прогресс в применении графовых нейронных сетей (GNN) к задачам компьютерного зрения. Разработанный Huawei Noah's Ark Lab, этот проект предоставляет реализации эффективных AI-бэкбонов на PyTorch, фокусируясь на архитектурах ViG и Pyramid ViG. Эти модели рассматривают изображения как графы узлов, что позволяет применять новые подходы к извлечению признаков и обучению представлений.
Проект включает предварительно обученные модели для различных конфигураций ViG, таких как ViG-Ti, ViG-S, ViG-B, Pyramid ViG-Ti, Pyramid ViG-S, Pyramid ViG-M и Pyramid ViG-B. Эти модели оцениваются по количеству параметров (M) и FLOPs (B), а также по точности Top-1 в задачах классификации изображений. Например, ViG-Ti имеет 7,1 млн параметров и 1,3 млрд FLOPs с точностью Top-1 73,9%, в то время как Pyramid ViG-B предлагает 82,6 млн параметров и 16,8 млрд FLOPs с точностью Top-1 83,7%.
Предоставлены подробные инструкции по подготовке данных, оценке и обучению. Пользователи могут оценивать модели с помощью предоставленных скриптов, а команды для обучения ViG и Pyramid ViG на таких наборах данных, как ImageNet, изложены в документации. Команды обучения указывают гиперпараметры, такие как скорость обучения, оптимизатор, количество эпох и методы аугментации, что позволяет настраивать и проводить дальнейшие эксперименты. Репозиторий также содержит ссылки для загрузки предварительно обученных моделей, некоторые из которых требуют специального пароля для доступа.
ViG построен на основе PyTorch 1.7.0 и требует таких библиотек, как timm 0.3.2, torchprofile 0.0.4 и apex. Проект признает частичное использование кода из deep_gcns_torch и timm. Эта инициатива направлена на расширение возможностей моделей зрения путем использования графовых представлений, предлагая мощную альтернативу традиционным сверточным нейронным сетям для ряда приложений компьютерного зрения.
Главное о Vision GNN (ViG)
Реализация архитектур Vision GNN (ViG) и Pyramid ViG на PyTorch
Включает предварительно обученные модели для различных конфигураций ViG
Предоставляет метрики производительности моделей (Параметры, FLOPs, Точность Top-1)
Предлагает скрипты для обучения моделей ViG и Pyramid ViG
Поддерживает набор данных ImageNet для оценки и обучения
Требует PyTorch 1.7.0, timm 0.3.2, torchprofile 0.0.4 и apex
Кодовая база частично использует deep_gcns_torch и timm
Модели рассматривают изображения как графы узлов для обучения признаков
Включает подробные инструкции по подготовке данных и оценке
Доступны для загрузки предварительно обученные модели с некоторой защитой паролем
Начало работы с Vision GNN (ViG)
Доступ к модели: Клонируйте репозиторий GitHub на ваш локальный компьютер.
Настройка среды: Установите необходимые библиотеки, включая PyTorch 1.7.0, timm, torchprofile и apex.
Подготовка данных: Организуйте ваш набор изображений (например, ImageNet) в соответствии с указанной структурой каталогов.
Оценка модели: Используйте предоставленный скрипт `train.py` с флагом `--evaluate` и путем к предварительно обученным весам.
Обучение модели: Выполните команды обучения для ViG или Pyramid ViG, указав модель, набор данных и гиперпараметры обучения.
Интеграция модели: Загрузите предварительно обученные веса в вашу модель PyTorch для инференса или дообучения на пользовательских задачах.
Варианты использования Vision GNN (ViG)
- Классификация изображений
- Извлечение признаков
- Исследования в области компьютерного зрения
- Разработка моделей
- Трансферное обучение








