跳转到主要内容
ToolPotion

Vision Transformer

Vision Transformer (ViT) 仓库提供了用于图像识别任务的模型和代码。它包括 Vision Transformer 和 MLP-Mixer 架构的实现,这些模型已在 ImageNet 和 ImageNet-21k 数据集上进行了预训练,并提供了 JAX/Flax 中的微调代码。

访问URL

描述

这个 GitHub 仓库 `google-research/vision_transformer` 为计算机视觉中的 Vision Transformer (ViT) 和 MLP-Mixer 架构提供了全面的资源集合。它作为源自几篇关键研究论文(包括“An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale”和“MLP-Mixer: An all-MLP Architecture for Vision.”)的模型和代码的中心枢纽。

该仓库提供了在 ImageNet 和 ImageNet-21k 等大规模数据集上训练的预训练模型。这些模型可供下载,并可针对特定的下游任务进行微调。代码主要使用 JAX 和 Flax 编写,为在该生态系统中工作的研究人员和开发人员提供了灵活性。

关键功能包括在自定义数据集上微调模型的能力,并提供了 CIFAR-10 和 CIFAR-100 等常见数据集的示例。该仓库还详细介绍了如何在 Google Cloud 上设置带有 GPU 或 TPU 的虚拟机以进行更广泛的训练和实验。此外,它还包括用于探索“How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers”论文中超过 50,000 个检查点的资源,使用户能够根据特定的性能指标选择和微调模型。

该仓库的目标受众包括对利用最先进的基于 Transformer 的模型进行图像识别、分类和其他视觉任务感兴趣的 AI 研究人员、机器学习工程师和计算机视觉从业人员。其价值主张在于提供易于访问、文档齐全的代码和预训练模型,从而加速视觉 Transformer 领域的研究和开发。

除了 ViT 和 MLP-Mixer,该仓库还提供了 LiT(Locked-image text Tuning)模型的资源,支持零样本迁移能力。这扩展了该仓库在涉及图像和文本的多模态应用中的效用。该项目强调可复现性,并提供了有关安装、微调和云部署的详细说明。

Vision Transformer亮点

  • Vision Transformer (ViT) 模型实现

  • MLP-Mixer 架构实现

  • 在 ImageNet 和 ImageNet-21k 上预训练的模型

  • JAX/Flax 中的微调代码

  • 支持 LiT (Locked-image text Tuning) 模型

  • 用于交互式探索和微调的 Colab Notebook

  • 云虚拟机设置(GPU/TPU)的详细说明

  • 可访问超过 50,000 个 ViT 模型检查点

  • 相关研究论文的 BibTeX 引用

  • 包含仓库更新和模型添加的变更日志

  • 数据增强和正则化策略的代码

Vision Transformer入门

  1. 访问模型:克隆 GitHub 仓库或从提供的 GCS 存储桶访问预训练模型。

  2. 设置环境:根据您的硬件(GPU/TPU)安装 JAX、Python 依赖项和 Flaxformer。

  3. 配置训练:为模型架构、数据集和训练参数选择或创建配置文件。

  4. 微调模型:使用 JAX/Flax 代码库,通过您选择的数据集和配置执行微调脚本。

  5. 探索检查点:利用提供的 Colab Notebook 探索并从大量预训练检查点中进行选择。

  6. 云端部署:在 Google Cloud 上设置带有适当加速器(GPU/TPU)的虚拟机,以进行更大规模的训练。

Vision Transformer的使用案例

  • 图像分类
  • 模型微调
  • 零样本迁移
  • 计算机视觉研究
  • 多模态 AI
  • 大规模训练

Vision Transformer的常见问题

Vision Transformer 评价

加载中...

与 Vision Transformer 类似的热门AI工具

FNet 是一种高效的类 Transformer 编码器架构,它用傅里叶变换取代了自注意力机制。该模型由 Google Research 开发,为自然语言处理任务提供了一种高性能的替代方案。该模型使用 Jax/Flax 实现,并在 GitHub 上提供,可用于预训练和微调。

AI 模型与大语言模型

该存储库提供了 ConvMixer 的实现,这是一种用于图像识别任务的卷积神经网络架构。它基于论文 "Patches Are All You Need? 🤷",并提供预训练模型权重用于评估以及在 ImageNet-1k 和 CIFAR-10 等数据集上进行训练的代码。

AI 模型与大语言模型

BEiT 是一个自监督视觉表示模型,它使用掩码图像建模来预训练视觉 Transformer。它将图像分词为视觉标记,并恢复被掩码的图像块,在图像分类和语义分割等下游任务上取得了有竞争力的结果。

AI 模型与大语言模型

AI 模型

ViT-Adapter 是一款人工智能模型,可提高 Vision Transformer (ViT) 在目标检测和分割等密集预测任务上的性能。它在无需预训练的情况下引入了特定于图像的归纳偏置,使普通 ViT 能够取得与专用 Transformer 相当的结果,从而适用于各种下游应用。

计算机视觉工具

AI 框架

一款免费的开源桌面应用程序,可在Mac、Windows和Linux上本地运行和训练AI模型,具有无代码用户界面、代理连接和与OpenAI兼容的API。

精选AI 模型与大语言模型

UniLM 是微软开发的一个大规模自监督预训练框架。它使模型能够跨越文本、图像和音频等多种任务、语言和模态进行学习。该项目为高级人工智能研究和开发提供了基础模型和工具包。

AI 模型与大语言模型

Phi-4-reasoning-vision-15B是微软开发的多模态AI模型,旨在处理需要视觉-语言理解和推理能力的任务。它在科学推理和计算机使用代理任务中表现出色,适用于各种应用。

精选AI 模型与大语言模型

AI 模型

RepVGG 是一种强大而简单的卷积神经网络 (ConvNet) 架构,可在 ImageNet 上实现高精度。它采用了 VGG 风格的设计并结合了重参数化技术,从而实现了高效的推理。该项目提供了预训练模型、训练代码以及用于各种计算机视觉任务的示例。

AI 模型与大语言模型