描述
ALIGN 通过利用海量的、超过十亿个图像和 alt 文本对的数据集,在学习鲁棒的视觉和视觉-语言表示方面取得了重大进展。与以往依赖精心策划和标注数据集的最先进模型不同,ALIGN 利用了公开可用但嘈杂的图像 alt 文本数据。这种方法绕过了大量的数据收集和清理步骤,从而能够训练更大、更强大的模型。
ALIGN 的核心创新在于其通过拥抱嘈杂的文本监督来扩展表示学习的能力。该模型采用简单的双编码器架构,包括一个图像编码器和一个文本编码器,并使用对比损失进行训练。此损失函数在对同一批次内的匹配图像-文本对的嵌入进行对齐的同时,将不匹配对的嵌入推开。海量数据集(18 亿图像-文本对)弥补了固有的噪声,从而产生了卓越的表示。
ALIGN 在各种基准测试中都展现了最先进的性能。在 Flickr30K 和 MS-COCO 等跨模态检索任务中,ALIGN 在零样本和微调设置下均优于包括更复杂的交叉注意力模型在内的现有方法。对于纯视觉任务,ALIGN 在 ImageNet 分类上的表现与使用大规模标注数据训练的模型相比具有竞争力或更优。ALIGN 实现的一项关键能力是零样本图像分类,通过利用对齐的嵌入空间,可以对图像进行分类而无需针对这些特定类别进行任何训练数据。
该模型学习到的表示也促进了强大的图像搜索功能。ALIGN 支持跨模态搜索,允许用户使用文本描述检索图像,为图像检索文本,甚至使用图像和文本组合查询进行搜索。这种多模态查询能力是一项新颖的功能,它允许通过嵌入空间中的向量算术进行复杂操作,例如查找视觉类比或在图像中移除/修改属性。
虽然 ALIGN 提供了显著的优势,但作者也承认负责任部署的必要性。对于 alt 文本中可能存在的有害文本数据、公平性、数据平衡以及与人口分布和文化项目相关的偏见的缓解措施的考虑,对于其实际应用至关重要。这项研究强调了一种从现成但嘈杂的网络数据中学习强大视觉和视觉-语言表示的可扩展且有效的方法。
ALIGN:扩展视觉和视觉-语言表示学习的规模亮点
从嘈杂的图像-alt 文本对中学习视觉和视觉-语言表示。
利用超过 18 亿个图像-文本对的数据集。
采用具有对比损失的双编码器架构。
在图像-文本检索方面取得最先进的性能。
实现零样本图像分类,无需特定任务的训练数据。
支持跨模态搜索(图像到文本,文本到图像)。
支持使用图像和文本组合查询进行多模态图像搜索。
在 ImageNet 分类等纯视觉下游任务上展现出强大的性能。
将模型规模扩展到用于图像编码的 EfficientNet-L2 和用于文本编码的 BERT-large。
在对齐的视觉和语言空间中表示嵌入。
在 ImageNet 变体的零样本分类中表现出鲁棒性。
支持对细粒度和复杂概念进行语义搜索。
ALIGN:扩展视觉和视觉-语言表示学习的规模入门
访问模型:获取 ALIGN 模型或其预训练权重。
设置环境:配置必要深度学习框架和库。
通过 API 集成:使用提供的 API 端点进行模型推理。
加载编码器:实例化图像和文本编码器。
生成嵌入:将图像和文本通过各自的编码器。
执行检索:使用嵌入上的余弦相似度进行图像-文本匹配。
分类图像:将类别名称映射到嵌入以进行零样本分类。
ALIGN:扩展视觉和视觉-语言表示学习的规模的使用案例
- 图像-文本检索
- 零样本分类
- 多模态搜索
- 视觉搜索引擎
- 内容理解
- 图像生成指导
- 跨模态应用







