설명
Adept는 자사 제품을 구동하는 멀티모달 AI 모델의 컴팩트 버전인 Fuyu-8B를 출시하여 CC-BY-NC 라이선스 하에 HuggingFace에서 사용할 수 있도록 했습니다. 이 모델은 다른 멀티모달 모델에 비해 훨씬 단순화된 아키텍처와 학습 절차로 주목받고 있으며, 이는 이해 가능성, 확장성 및 배포 용이성을 향상시킵니다.
Fuyu-8B는 디지털 에이전트를 위해 처음부터 설계되어 임의의 이미지 해상도를 처리할 수 있습니다. 이 기능은 그래프 및 다이어그램에 대한 질문에 답변하고, UI 기반 쿼리에 응답하며, 화면 이미지에 대한 세분화된 로컬라이제이션을 수행하는 것과 같은 작업에 중요합니다. 주요 이점은 속도로, 대규모 이미지에 대한 응답을 100밀리초 이내에 제공합니다. Adept의 특정 사용 사례에 최적화되었음에도 불구하고 Fuyu-8B는 시각적 질문 답변 및 자연 이미지 캡셔닝과 같은 표준 이미지 이해 벤치마크에서 강력한 성능을 보여줍니다.
이 아키텍처는 별도의 이미지 인코더를 사용하지 않고 이미지 패치를 트랜스포머의 첫 번째 레이어로 직접 선형 투영합니다. 이를 통해 임베딩 조회 필요성이 없어지고 학습 및 추론이 모두 단순화됩니다. 모델은 이미지 토큰을 텍스트 토큰과 유사하게 처리하여 가변 이미지 크기를 지원하고 별도의 고해상도 및 저해상도 학습 단계를 제거합니다. 이 간소화된 접근 방식은 인과적 주의와 풀링 없이 트랜스포머 디코더를 이미지 트랜스포머로 취급할 수 있도록 합니다.
Fuyu-8B는 특정 애플리케이션에 대한 미세 조정을 요구하는 원시 모델 릴리스이지만, VQAv2, OKVQA, COCO Captions 및 AI2D와 같은 벤치마크에서의 성능은 더 큰 모델과 비교해도 경쟁력이 있습니다. Adept는 Fuyu 아키텍처를 기반으로 구축된 내부 모델이 고해상도 이미지에 대한 안정적인 OCR, 텍스트 및 UI 요소의 세분화된 로컬라이제이션, 사용자 인터페이스에 대한 질문에 답변하는 능력과 같은 고급 기능을 갖추고 있어 향후 제품 개발에 대한 통찰력을 제공한다고 강조합니다.
Fuyu-8B의 설계는 지식 근로자와 심층적인 시각적 이해 및 디지털 인터페이스와의 상호 작용이 필요한 애플리케이션에 특히 적합합니다. 이 모델의 오픈 소싱은 AI 에이전트 및 멀티모달 AI 분야에서 커뮤니티 혁신과 개발을 촉진하는 것을 목표로 합니다.
Fuyu-8B 멀티모달 아키텍처 하이라이트
디지털 에이전트를 위한 멀티모달 AI 모델
이해, 확장 및 배포 용이성을 위한 단순화된 아키텍처
임의의 이미지 해상도 지원
대규모 이미지에 대한 빠른 응답 시간 (100ms 미만)
표준 이미지 이해 벤치마크에서 우수한 성능
차트, 다이어그램 및 UI 요소 이해를 위해 설계됨
CC-BY-NC 라이선스 하에 오픈 소스 제공
HuggingFace에서 사용 가능
별도의 이미지 인코더 없음; 이미지 패치가 트랜스포머로 직접 투영됨
가변 이미지 크기를 위해 이미지 토큰을 텍스트 토큰처럼 처리
특정 사용 사례에 대한 미세 조정 필요
Fuyu-8B 멀티모달 아키텍처 시작하기
모델 액세스: HuggingFace에서 Fuyu-8B 가중치를 다운로드합니다.
환경 설정: 필요한 라이브러리로 Python 환경을 준비합니다.
API를 통한 통합: 추론을 위해 모델과 토크나이저를 로드합니다.
이미지 처리: 모델과 호환되는 토큰 시퀀스로 이미지를 변환합니다.
모델 쿼리: 이미지 토큰과 텍스트 프롬프트를 입력하여 응답을 얻습니다.
미세 조정: 특정 애플리케이션 요구 사항에 맞게 모델을 조정합니다.
Fuyu-8B 멀티모달 아키텍처의 사용 사례
- AI 에이전트 개발
- 시각적 질문 답변
- UI 상호 작용
- 문서 분석
- 이미지 캡셔닝
- 차트 및 그래프 해석





