Перейти к основному содержимому
ToolPotion

Vision GNN (ViG)

Vision GNN (ViG) — это реализация Vision Graph Neural Networks на PyTorch, разработанная Huawei Noah's Ark Lab. Она предлагает эффективные AI-бэкбоны для задач обработки изображений, включая предварительно обученные модели и скрипты для обучения архитектур ViG и Pyramid ViG.

Посетить URL

Описание

Vision GNN (ViG) представляет собой значительный прогресс в применении графовых нейронных сетей (GNN) к задачам компьютерного зрения. Разработанный Huawei Noah's Ark Lab, этот проект предоставляет реализации эффективных AI-бэкбонов на PyTorch, фокусируясь на архитектурах ViG и Pyramid ViG. Эти модели рассматривают изображения как графы узлов, что позволяет применять новые подходы к извлечению признаков и обучению представлений.

Проект включает предварительно обученные модели для различных конфигураций ViG, таких как ViG-Ti, ViG-S, ViG-B, Pyramid ViG-Ti, Pyramid ViG-S, Pyramid ViG-M и Pyramid ViG-B. Эти модели оцениваются по количеству параметров (M) и FLOPs (B), а также по точности Top-1 в задачах классификации изображений. Например, ViG-Ti имеет 7,1 млн параметров и 1,3 млрд FLOPs с точностью Top-1 73,9%, в то время как Pyramid ViG-B предлагает 82,6 млн параметров и 16,8 млрд FLOPs с точностью Top-1 83,7%.

Предоставлены подробные инструкции по подготовке данных, оценке и обучению. Пользователи могут оценивать модели с помощью предоставленных скриптов, а команды для обучения ViG и Pyramid ViG на таких наборах данных, как ImageNet, изложены в документации. Команды обучения указывают гиперпараметры, такие как скорость обучения, оптимизатор, количество эпох и методы аугментации, что позволяет настраивать и проводить дальнейшие эксперименты. Репозиторий также содержит ссылки для загрузки предварительно обученных моделей, некоторые из которых требуют специального пароля для доступа.

ViG построен на основе PyTorch 1.7.0 и требует таких библиотек, как timm 0.3.2, torchprofile 0.0.4 и apex. Проект признает частичное использование кода из deep_gcns_torch и timm. Эта инициатива направлена на расширение возможностей моделей зрения путем использования графовых представлений, предлагая мощную альтернативу традиционным сверточным нейронным сетям для ряда приложений компьютерного зрения.

Главное о Vision GNN (ViG)

  • Реализация архитектур Vision GNN (ViG) и Pyramid ViG на PyTorch

  • Включает предварительно обученные модели для различных конфигураций ViG

  • Предоставляет метрики производительности моделей (Параметры, FLOPs, Точность Top-1)

  • Предлагает скрипты для обучения моделей ViG и Pyramid ViG

  • Поддерживает набор данных ImageNet для оценки и обучения

  • Требует PyTorch 1.7.0, timm 0.3.2, torchprofile 0.0.4 и apex

  • Кодовая база частично использует deep_gcns_torch и timm

  • Модели рассматривают изображения как графы узлов для обучения признаков

  • Включает подробные инструкции по подготовке данных и оценке

  • Доступны для загрузки предварительно обученные модели с некоторой защитой паролем

Начало работы с Vision GNN (ViG)

  1. Доступ к модели: Клонируйте репозиторий GitHub на ваш локальный компьютер.

  2. Настройка среды: Установите необходимые библиотеки, включая PyTorch 1.7.0, timm, torchprofile и apex.

  3. Подготовка данных: Организуйте ваш набор изображений (например, ImageNet) в соответствии с указанной структурой каталогов.

  4. Оценка модели: Используйте предоставленный скрипт `train.py` с флагом `--evaluate` и путем к предварительно обученным весам.

  5. Обучение модели: Выполните команды обучения для ViG или Pyramid ViG, указав модель, набор данных и гиперпараметры обучения.

  6. Интеграция модели: Загрузите предварительно обученные веса в вашу модель PyTorch для инференса или дообучения на пользовательских задачах.

Варианты использования Vision GNN (ViG)

  • Классификация изображений
  • Извлечение признаков
  • Исследования в области компьютерного зрения
  • Разработка моделей
  • Трансферное обучение

Часто задаваемые вопросы Vision GNN (ViG)

Отзывы о Vision GNN (ViG)

Загрузка...

Популярные ИИ-инструменты, похожие на Vision GNN (ViG)

AI-модели

SAGPool — это официальная реализация метода Self-Attention Graph Pooling на PyTorch, представленная на конференции ICML 2019. Этот архивный репозиторий только для чтения содержит…

ИИ-модели и LLM

AI-модели

SPP_net — это перереализация алгоритма Spatial Pyramid Pooling для глубоких сверточных сетей в области визуального распознавания. Цель проекта — воспроизвести результаты…

ИИ-модели и LLM

AI-модели

RepVGG — это мощная и простая архитектура сверточных нейронных сетей (ConvNet), достигающая высокой точности на ImageNet. Она использует дизайн в стиле VGG с техниками…

ИИ-модели и LLM

AI-модели

DGCNN — это модель ИИ для обучения на облаках точек, реализующая Dynamic Graph CNN. Она демонстрирует передовую производительность в таких задачах, как классификация и сегментация…

ИИ-модели и LLM

Этот репозиторий предоставляет реализацию модели "Simple and Deep Graph Convolutional Networks" (GCNII) на PyTorch. Он включает код для воспроизведения полу- и полностью…

ИИ-модели и LLM

AI-модели

Репозиторий Vision Transformer (ViT) предоставляет модели и код для задач распознавания изображений. Он включает реализации архитектур Vision Transformer и MLP-Mixer,…

ИИ-модели и LLM

Этот репозиторий GitHub предоставляет реализации DeepGCNs, DeeperGCN и GNN1000 на PyTorch. Он позволяет обучать очень глубокие сверточные графовые сети (GCN), адаптируя концепции…

Платформы машинного обучения

Этот репозиторий предоставляет реализацию Principal Neighbourhood Aggregation (PNA) для графовых нейронных сетей. Он поддерживает фреймворки PyTorch, DGL и PyTorch Geometric,…

Платформы машинного обучения