설명
Phi-4-Reasoning-Vision-15B는 Microsoft에서 개발한 컴팩트한 오픈 웨이트 다중 모달 추론 모델로, Phi-4-Reasoning 언어 모델 백본과 SigLIP-2 비전 인코더를 기반으로 구축되었습니다. 이 모델은 중간 융합 아키텍처를 활용하여 비전 인코더가 이미지를 시각적 토큰으로 변환하고, 이를 언어 모델의 임베딩 공간으로 투영합니다. 이 혁신적인 접근 방식은 두 개의 사전 훈련된 구성 요소의 강점을 결합하면서도 관리 가능한 훈련 및 추론 비용을 유지합니다.
이 모델은 텍스트와 이미지를 처리할 수 있으며, 컨텍스트 길이는 16,384 토큰입니다. 이 모델은 추론 데이터와 비추론 데이터를 포함한 신중하게 선별된 데이터셋을 사용하여 감독된 미세 조정(SFT)으로 훈련되었습니다. 이를 통해 Phi-4-Reasoning-Vision-15B는 수학적 및 과학적 추론과 같은 복잡한 작업에 대한 확장된 사고 연쇄 추론을 수행할 수 있으며, 캡션 생성 및 객체 탐지와 같은 인식 중심 작업에 대한 직접 추론도 처리할 수 있습니다.
Phi-4-Reasoning-Vision-15B는 메모리 또는 컴퓨팅 제약 환경에서 특히 효과적이며, 일반적인 다중 모달 AI 시스템에 적합합니다. 주요 사용 사례로는 시각적 입력에 대한 과학적 및 수학적 추론, 화면 콘텐츠 해석 및 GUI 요소 로컬라이징을 포함하는 컴퓨터 사용 에이전트 작업이 있습니다. 이 모델은 이미지 캡션 생성, 시각적 질문 응답 및 광학 문자 인식과 같은 일반적인 다중 모달 작업도 수행할 수 있습니다.
모델 훈련에는 240개의 NVIDIA B200 GPU가 사용되었으며, 4일 동안 진행되었습니다. 안전성과 정렬에 중점을 두었습니다. 이 모델은 유해한 콘텐츠에 대한 적절한 반응을 보장하기 위해 오픈 소스 및 내부 생성된 합성 데이터셋의 혼합을 포함하는 안전한 사후 훈련 접근 방식을 통합하고 있습니다. 개발자는 특히 고위험 시나리오에서 모델의 한계를 고려하고, 애플리케이션에 통합할 때 책임 있는 AI 관행을 적용할 것을 권장합니다.
Phi-4-reasoning-vision-15B 하이라이트
모델 유형: 다중 모달
API 사용 가능: 예
라이센스: MIT
매개변수: 15B
컨텍스트 길이: 16,384 토큰
훈련 GPU: 240
훈련 시간: 4일
미세 조정 지원: 예
다중 모달: 예
Phi-4-reasoning-vision-15B 시작하기
모델 접근: Phi-4-Reasoning-Vision-15B의 Hugging Face 페이지를 방문하세요.
인증: API 접근을 위해 Hugging Face 계정을 설정하세요.
환경 설정: 시스템이 기술 요구 사항을 충족하는지 확인하세요.
API를 통한 통합: 제공된 API 문서를 사용하여 모델을 애플리케이션에 통합하세요.
최적화: 특정 사용 사례에 따라 모델을 미세 조정하세요.
Phi-4-reasoning-vision-15B의 사용 사례
- 과학적 추론
- 컴퓨터 사용 에이전트 작업
- 이미지 캡션 생성
- 시각적 질문 응답
- 광학 문자 인식






