跳转到主要内容
ToolPotion

Vision GNN (ViG)

Vision GNN (ViG) 是华为诺亚方舟实验室开发的 Vision Graph Neural Networks 的 PyTorch 实现。它为图像处理任务提供了高效的 AI 主干网络,包括 ViG 和 Pyramid ViG 架构的预训练模型和训练脚本。

访问URL

描述

Vision GNN (ViG) 代表了图神经网络 (GNN) 在计算机视觉任务应用中的一项重大进展。该项目由华为诺亚方舟实验室开发,提供了高效 AI 主干网络的 PyTorch 实现,重点关注 ViG 和 Pyramid ViG 架构。这些模型将图像视为节点图,从而实现了新颖的特征提取和表示学习方法。

该项目包括各种 ViG 配置的预训练模型,例如 ViG-Ti、ViG-S、ViG-B、Pyramid ViG-Ti、Pyramid ViG-S、Pyramid ViG-M 和 Pyramid ViG-B。这些模型的性能通过其参数量 (M) 和 FLOPs (B) 以及在图像分类任务上的 Top-1 准确率进行基准测试。例如,ViG-Ti 拥有 7.1M 参数和 1.3B FLOPs,Top-1 准确率为 73.9%,而 Pyramid ViG-B 提供 82.6M 参数和 16.8B FLOPs,Top-1 准确率为 83.7%。

提供了数据准备、评估和训练的详细说明。用户可以使用提供的脚本评估模型,并概述了在 ImageNet 等数据集上训练 ViG 和 Pyramid ViG 的命令。训练命令指定了学习率、优化器、训练轮数和增强技术等超参数,允许进行定制和进一步的实验。该存储库还包含下载预训练模型的链接,其中一些需要特定的密码才能访问。

ViG 基于 PyTorch 1.7.0 构建,需要 timm 0.3.2、torchprofile 0.0.4 和 apex 等库。该项目承认部分使用了来自 deep_gcns_torch 和 timm 的代码。该计划旨在通过利用基于图的表示来突破视觉模型的界限,为一系列计算机视觉应用提供传统卷积神经网络的强大替代方案。

Vision GNN (ViG)亮点

  • Vision GNN (ViG) 和 Pyramid ViG 架构的 PyTorch 实现

  • 包含各种 ViG 配置的预训练模型

  • 提供模型性能指标(参数、FLOPs、Top-1 准确率)

  • 提供 ViG 和 Pyramid ViG 模型的训练脚本

  • 支持 ImageNet 数据集进行评估和训练

  • 需要 PyTorch 1.7.0、timm 0.3.2、torchprofile 0.0.4 和 apex

  • 代码库部分使用了 deep_gcns_torch 和 timm

  • 模型将图像视为节点图以进行特征学习

  • 包含数据准备和评估的详细说明

  • 提供可下载的预训练模型,部分需要密码保护

Vision GNN (ViG)入门

  1. 访问模型:将 GitHub 存储库克隆到本地机器。

  2. 设置环境:安装所需的库,包括 PyTorch 1.7.0、timm、torchprofile 和 apex。

  3. 准备数据:根据指定的目录结构组织图像数据集(例如 ImageNet)。

  4. 评估模型:使用提供的 `train.py` 脚本,并带上 `--evaluate` 标志和预训练权重路径。

  5. 训练模型:执行 ViG 或 Pyramid ViG 的训练命令,指定模型、数据集和训练超参数。

  6. 集成模型:将预训练权重加载到您的 PyTorch 模型中,用于推理或在自定义任务上进行微调。

Vision GNN (ViG)的使用案例

  • 图像分类
  • 特征提取
  • 计算机视觉研究
  • 模型开发
  • 迁移学习

Vision GNN (ViG)的常见问题

Vision GNN (ViG) 评价

加载中...

与 Vision GNN (ViG) 类似的热门AI工具

AI 模型

SAGPool 是 Self-Attention Graph Pooling 的官方 PyTorch 实现,该方法在 ICML 2019 上发表。这个只读的归档仓库提供了新颖的图池化方法的代码,该方法利用自注意力机制来改进图表示学习。它适用于研究人员和开发人员处理图神经网络。

AI 模型与大语言模型

AI 模型

SPP_net 是用于深度卷积网络的空间金字塔池化算法的重新实现,应用于视觉识别领域。它旨在复现一篇 2014 年 ECCV 论文中的目标检测结果,并利用 Caffe 框架方便代码发布。该项目提供了用于训练和微调模型的代码。

AI 模型与大语言模型

AI 模型

RepVGG 是一种强大而简单的卷积神经网络 (ConvNet) 架构,可在 ImageNet 上实现高精度。它采用了 VGG 风格的设计并结合了重参数化技术,从而实现了高效的推理。该项目提供了预训练模型、训练代码以及用于各种计算机视觉任务的示例。

AI 模型与大语言模型

AI 模型

DGCNN 是一款用于点云学习的 AI 模型,实现了动态图卷积神经网络。它在 3D 点云数据的分类和分割等任务中取得了最先进的性能。该模型有 PyTorch 实现版本,并已应用于实际场景。

AI 模型与大语言模型

该存储库提供了“简单深度图卷积网络”(GCNII)模型的 PyTorch 实现。它包含在基准图数据集上复现半监督和全监督结果的代码,以及一个 PyTorch Geometric 参考实现。

AI 模型与大语言模型

Vision Transformer (ViT) 仓库提供了用于图像识别任务的模型和代码。它包括 Vision Transformer 和 MLP-Mixer 架构的实现,这些模型已在 ImageNet 和 ImageNet-21k 数据集上进行了预训练,并提供了 JAX/Flax 中的微调代码。

AI 模型与大语言模型

该 GitHub 仓库提供了 DeepGCNs、DeeperGCN 和 GNN1000 的 PyTorch 实现。它通过借鉴 CNN 的残差连接和空洞卷积等概念,实现了非常深层的图卷积网络训练,从而促进了图神经网络的研究。

机器学习平台

该存储库提供了图神经网络(GNN)的Principal Neighbourhood Aggregation (PNA) 的实现。它支持 PyTorch、DGL 和 PyTorch Geometric 框架,提供用于多任务和真实世界基准测试的脚本,以及灵活的 GNN 框架和比较模型。

机器学习平台