설명
Florence-2는 Microsoft에서 개발한 정교한 비전 기초 모델로, Hugging Face에 호스팅됩니다. 다양한 비전 작업을 위한 통합 표현을 발전시키기 위해 설계되었습니다. 이 모델은 캡션 작성, 객체 탐지 및 분할과 같은 다양한 비전 및 비전-언어 작업을 효율적으로 처리하기 위해 프롬프트 기반 접근 방식을 사용합니다. Florence-2는 126백만 개의 이미지에 걸쳐 54억 개의 주석을 포함하는 FLD-5B 데이터 세트를 활용하여 다중 작업 학습에서 뛰어난 성능을 발휘합니다.
모델의 아키텍처는 시퀀스-투-시퀀스(sequence-to-sequence)로, 제로샷(zero-shot) 및 파인튜닝(fine-tuned) 설정 모두에서 우수한 성능을 발휘할 수 있습니다. 이 모델은 간단한 텍스트 프롬프트를 해석하여 다양한 작업을 수행할 수 있는 경쟁력 있는 비전 기초 모델입니다. Florence-2는 4k 컨텍스트 길이로 사전 훈련되었으며, 지속적인 사전 훈련을 위해 1억 개의 샘플만 사용하여 훈련 품질에 영향을 미칠 수 있습니다.
Florence-2의 기능에는 캡션을 구문에 맞추기, 객체 탐지, 밀집 지역 캡션 작성 및 지역 출력을 포함한 OCR 작업 처리 등이 포함됩니다. 제로샷 설정에서의 모델 성능은 주목할 만하며, COCO 및 NoCaps 데이터 세트에서 높은 CIDEr 점수를 기록했습니다. 또한, Florence-2는 다양한 하위 작업에 대해 파인튜닝되어 Florence-2-base-ft 및 Florence-2-large-ft와 같은 모델을 생성하였으며, 이는 다양한 캡션 작성 및 VQA 작업에서 우수한 성능을 발휘합니다.
이 모델은 0.23억 개의 매개변수를 가진 Florence-2-base와 0.77억 개의 매개변수를 가진 Florence-2-large를 포함한 다양한 크기로 제공됩니다. 사용자가 모델을 시작하는 데 필요한 기술 보고서 및 Jupyter Notebook과 같은 리소스도 제공됩니다. Florence-2는 비전 및 비전-언어 작업을 수행하는 연구자 및 개발자에게 귀중한 도구로, 추가 개발 및 응용을 위한 강력한 기반을 제공합니다.
Florence-2 모델 하이라이트
고급 비전 기초 모델
프롬프트 기반 접근 방식
비전-언어 작업 처리
시퀀스-투-시퀀스 아키텍처
제로샷 및 파인튜닝 설정
FLD-5B 데이터 세트 사용
캡션 작성 및 객체 탐지 지원
지역 출력을 포함한 OCR
Florence-2 모델 시작하기
페이지 접근: Hugging Face 모델 페이지 방문
모델 로드: Florence-2 모델 다운로드
환경 구성: 필요한 종속성 설정
통합: 애플리케이션에서 모델 사용
파인튜닝: 특정 작업에 맞게 모델 조정
Florence-2 모델의 사용 사례
- 이미지 캡션 작성
- 객체 탐지
- 비전-언어 작업
- 지역별 OCR
- 밀집 지역 캡션 작성









