跳转到主要内容
ToolPotion

UNITER 研究代码

UNITER 是 ECCV 2020 论文“UNITER: UNiversal Image-TExt Representation Learning”的研究代码库。它提供了用于各种视觉-语言任务(包括 VQA、VCR 和图像-文本检索)的微调和推理代码。UNITER-base 和 UNITER-large 的预训练检查点均可用。

访问URL

描述

UNITER 研究代码库,发表于 ECCV 2020 论文“UNITER: UNiversal Image-TExt Representation Learning”,提供了一套全面的多模态 AI 研究工具。该代码库支持一系列视觉-语言任务的微调和推理,包括视觉问答 (VQA)、视觉常识推理 (VCR)、SNLI-VE(视觉蕴含)、COCO 和 Flickr30k 等数据集的图像-文本检索,以及指代表达式理解 (RefCOCO, RefCOCO+, RefCOCO-g)。

UNITER 基于通用的图像-文本表示学习框架构建。代码同时支持 UNITER-base 和 UNITER-large 的预训练检查点,并提供领域内预训练的选项。该代码库包含数据预处理、模型训练和推理的脚本。它利用了 PyTorch、HuggingFace Transformers、OpenNMT 和 Nvidia 的 DeepLearningExamples 等外部库,并使用 BUTD 提取图像特征。

为方便复现,提供了一个 Docker 镜像,需要特定的 NVIDIA 驱动和 Docker 版本。设置过程包括将源代码和数据目录挂载到容器中。该代码库详细介绍了 NLVR2 等任务的快速入门指南,演示了数据下载、Docker 容器启动、微调以及推理/评估流程。通过命令行参数和 JSON 配置文件支持自定义,并提供使用 Horovod 进行多 GPU 训练的选项。

该项目还概述了下游任务的步骤,例如 VQA、VCR(包括第二阶段预训练选项)、视觉蕴含、图像-文本检索(零样本和使用硬负例进行微调以用于 Flickr30k 和 COCO)、指代表达式以及领域内预训练。用户可以按照指南下载特定数据集并运行相应的训练和推理脚本。该代码库根据 MIT 许可证发布。

UNITER 研究代码亮点

  • ECCV 2020 论文“UNITER: UNiversal Image-TExt Representation Learning”的官方研究代码

  • 支持 NLVR2、VQA、VCR、SNLI-VE、图像-文本检索和指代表达式的微调

  • 提供 UNITER-base 和 UNITER-large 模型的预训练检查点

  • 包含数据预处理、模型训练和推理的脚本

  • 提供 Docker 镜像以简化复现和环境设置

  • 通过 Horovod 支持多 GPU 训练

  • 包含用于图像-文本检索任务的零样本和微调代码

  • 支持领域内预训练和 VCR 第二阶段预训练

UNITER 研究代码入门

  1. 使用提供的 bash 脚本下载预训练检查点和特定任务数据。

  2. 启动 Docker 容器以获得一致且可复现的环境。

  3. 通过运行带有自定义配置的微调脚本来集成模型训练。

  4. 使用专用的推理脚本对下游任务执行推理。

  5. 使用提供的评估脚本或将结果提交到排行榜来评估模型性能。

  6. 通过命令行参数或 JSON 配置文件自定义训练选项。

UNITER 研究代码的使用案例

  • 视觉问答
  • 视觉常识推理
  • 图像-文本检索
  • 指代表达式理解
  • 视觉蕴含
  • 多模态预训练

UNITER 研究代码的常见问题

UNITER 研究代码 评价

加载中...

与 UNITER 研究代码 类似的热门AI工具

Phi-4-reasoning-vision-15B是微软开发的多模态AI模型,旨在处理需要视觉-语言理解和推理能力的任务。它在科学推理和计算机使用代理任务中表现出色,适用于各种应用。

精选AI 模型与大语言模型

Oscar and VinVL are advanced AI models for vision-language tasks. Oscar uses object-semantics alignment for pre-training, achieving state-of-the-art results. VinVL enhances visual…

AI 模型与大语言模型

ALIGN 是一个 AI 模型,它利用来自超过十亿个图像-alt 文本对的嘈杂文本监督,扩展视觉和视觉-语言表示学习。它在跨模态检索和纯视觉任务中取得了最先进的成果,实现了零样本分类和多模态搜索。

AI 模型与大语言模型

AI 模型

MiniGPT-4 是一个人工智能模型,通过将冻结的视觉编码器与大型语言模型对齐,增强了视觉-语言理解能力。它可以生成详细的图像描述、根据草稿创建网站、创作受图像启发的故事情节,并解决视觉问题,展现了先进的多模态能力。

AI 模型与大语言模型

AI 模型

LLaVA 是一个大型多模态模型,它将视觉编码器与语言模型相结合,用于通用的视觉和语言理解。它在多模态聊天能力方面表现出色,模仿 GPT-4,并通过视觉指令调优在 Science QA 等基准测试中取得了最先进的准确率。

AI 模型与大语言模型

LLaVA 是一个视觉指令调优模型,结合了大型语言和视觉能力。其目标是达到 GPT-4V 级别的性能,实现多模态理解和交互。该项目为研究人员和开发者提供了代码、模型和资源。

AI 模型与大语言模型

Flamingo 是来自 Google DeepMind 的单一视觉语言模型 (VLM),在各种多模态任务的少样本学习方面表现出色。它处理交错的图像、视频和文本,以生成相关的语言输出,仅需极少的特定任务示例即可完成,无需额外训练。

AI 模型与大语言模型

Gemini 3.1 Pro 是一款先进的人工智能模型,旨在处理复杂任务和深度推理。它在多模态理解方面表现出色,提供智能且简洁的响应,非常适合学习、规划和构建创新应用。

精选AI 模型与大语言模型