描述
这个 GitHub 仓库 `google-research/vision_transformer` 为计算机视觉中的 Vision Transformer (ViT) 和 MLP-Mixer 架构提供了全面的资源集合。它作为源自几篇关键研究论文(包括“An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale”和“MLP-Mixer: An all-MLP Architecture for Vision.”)的模型和代码的中心枢纽。
该仓库提供了在 ImageNet 和 ImageNet-21k 等大规模数据集上训练的预训练模型。这些模型可供下载,并可针对特定的下游任务进行微调。代码主要使用 JAX 和 Flax 编写,为在该生态系统中工作的研究人员和开发人员提供了灵活性。
关键功能包括在自定义数据集上微调模型的能力,并提供了 CIFAR-10 和 CIFAR-100 等常见数据集的示例。该仓库还详细介绍了如何在 Google Cloud 上设置带有 GPU 或 TPU 的虚拟机以进行更广泛的训练和实验。此外,它还包括用于探索“How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers”论文中超过 50,000 个检查点的资源,使用户能够根据特定的性能指标选择和微调模型。
该仓库的目标受众包括对利用最先进的基于 Transformer 的模型进行图像识别、分类和其他视觉任务感兴趣的 AI 研究人员、机器学习工程师和计算机视觉从业人员。其价值主张在于提供易于访问、文档齐全的代码和预训练模型,从而加速视觉 Transformer 领域的研究和开发。
除了 ViT 和 MLP-Mixer,该仓库还提供了 LiT(Locked-image text Tuning)模型的资源,支持零样本迁移能力。这扩展了该仓库在涉及图像和文本的多模态应用中的效用。该项目强调可复现性,并提供了有关安装、微调和云部署的详细说明。
Vision Transformer亮点
Vision Transformer (ViT) 模型实现
MLP-Mixer 架构实现
在 ImageNet 和 ImageNet-21k 上预训练的模型
JAX/Flax 中的微调代码
支持 LiT (Locked-image text Tuning) 模型
用于交互式探索和微调的 Colab Notebook
云虚拟机设置(GPU/TPU)的详细说明
可访问超过 50,000 个 ViT 模型检查点
相关研究论文的 BibTeX 引用
包含仓库更新和模型添加的变更日志
数据增强和正则化策略的代码
Vision Transformer入门
访问模型:克隆 GitHub 仓库或从提供的 GCS 存储桶访问预训练模型。
设置环境:根据您的硬件(GPU/TPU)安装 JAX、Python 依赖项和 Flaxformer。
配置训练:为模型架构、数据集和训练参数选择或创建配置文件。
微调模型:使用 JAX/Flax 代码库,通过您选择的数据集和配置执行微调脚本。
探索检查点:利用提供的 Colab Notebook 探索并从大量预训练检查点中进行选择。
云端部署:在 Google Cloud 上设置带有适当加速器(GPU/TPU)的虚拟机,以进行更大规模的训练。
Vision Transformer的使用案例
- 图像分类
- 模型微调
- 零样本迁移
- 计算机视觉研究
- 多模态 AI
- 大规模训练







