描述
Florence-2 是微软开发的一种复杂视觉基础模型,托管在 Hugging Face 上。它旨在推进多种视觉任务的统一表示。该模型采用基于提示的方法,有效处理广泛的视觉和视觉语言任务,如图像描述、物体检测和分割。Florence-2 利用 FLD-5B 数据集,该数据集包含 54 亿个注释,覆盖 1.26 亿张图像,以在多任务学习中表现出色。
该模型的架构为序列到序列,使其在零样本和微调设置中表现良好。它是一种具有竞争力的视觉基础模型,能够解释简单的文本提示以执行各种任务。Florence-2 已使用 4k 上下文长度进行预训练,仅使用 1 亿个样本进行持续预训练,这可能会影响其训练质量。
Florence-2 的能力包括处理诸如描述到短语定位、物体检测、密集区域描述和带区域输出的 OCR 等任务。该模型在零样本设置中的表现显著,在 COCO 和 NoCaps 数据集上获得了高 CIDEr 分数。此外,Florence-2 已在一系列下游任务上进行了微调,产生了如 Florence-2-base-ft 和 Florence-2-large-ft 等模型,这些模型在各种图像描述和视觉问答任务中表现良好。
该模型提供不同的尺寸,包括具有 2.3 亿参数的 Florence-2-base 和具有 7.7 亿参数的 Florence-2-large。用户可以访问技术报告和 Jupyter Notebook 等资源,以便开始使用该模型。Florence-2 是研究人员和开发人员在视觉和视觉语言任务中工作的宝贵工具,为进一步开发和应用提供了坚实的基础。
Florence-2 模型亮点
先进的视觉基础模型
基于提示的方法
处理视觉语言任务
序列到序列架构
零样本和微调设置
使用 FLD-5B 数据集
支持图像描述和物体检测
带区域输出的 OCR
Florence-2 模型入门
访问页面:访问 Hugging Face 模型页面
加载模型:下载 Florence-2 模型
配置环境:设置必要的依赖项
集成:在应用程序中使用模型
微调:根据特定任务调整模型
Florence-2 模型的使用案例
- 图像描述
- 物体检测
- 视觉语言任务
- 带区域的 OCR
- 密集区域描述









