설명
MiMo-V2.5-Pro는 총 1.02조 개의 매개변수와 420억 개의 활성 매개변수를 가진 최첨단 오픈 소스 전문가 혼합(MoE) 언어 모델입니다. 이 모델은 가장 까다로운 에이전틱, 복잡한 소프트웨어 엔지니어링 및 장기 작업을 처리하도록 설계되었습니다. 이 모델은 하이브리드 주의 아키텍처를 활용하여 슬라이딩 윈도우 주의(SWA)와 글로벌 주의(GA)를 6:1 비율로 교차하여 KV-캐시 저장소를 크게 줄이면서도 긴 컨텍스트 성능을 유지합니다. 이 아키텍처는 추론 중 출력 속도를 향상시키는 세 개의 경량 다중 토큰 예측(MTP) 모듈로 보완됩니다.
이 모델은 FP8 혼합 정밀도로 27조 개의 토큰에 대해 사전 훈련되었으며 최대 100만 개의 토큰에 대한 컨텍스트 창을 지원합니다. 훈련 후 MiMo-V2.5-Pro는 감독된 미세 조정(SFT), 대규모 에이전틱 강화 학습(RL) 및 다중 교사 온-정책 증류(MOPD)를 사용하여 복잡한 작업에서 우수한 성능을 달성합니다. 이 모델은 100만 개의 토큰 컨텍스트 창에서 복잡한 궤적을 지속하는 데 뛰어나며, 강력한 지시 준수 및 일관성이 필요한 작업에 매우 효과적입니다.
MiMo-V2.5-Pro의 아키텍처는 지역 슬라이딩 윈도우 주의와 글로벌 주의를 통합하여 긴 컨텍스트의 제곱 복잡성을 해결합니다. 훈련 과정은 SFT로 기초 기술을 구축하는 것으로 시작하여 다양한 교사 모델을 통한 도메인 전문 훈련을 거쳐 동적 온-정책 RL을 위한 MOPD로 마무리되는 세 단계의 후 훈련 패러다임을 포함합니다.
모델의 배포는 SGLang 및 vLLM 커뮤니티의 지원을 받으며 최적의 성능을 위한 권장 구성으로 이루어집니다. MiMo-V2.5-Pro는 소프트웨어 엔지니어링 및 다국어 응용 프로그램과 같은 고급 언어 처리 기능이 필요한 산업에 적합합니다.
MiMo-V2.5-Pro 하이라이트
1.02조 개의 총 매개변수
420억 개의 활성 매개변수
하이브리드 주의 아키텍처
다중 토큰 예측(MTP)
27조 개의 토큰에 대한 효율적인 사전 훈련
100만 개의 토큰 컨텍스트 길이
감독된 미세 조정(SFT)
다중 교사 온-정책 증류(MOPD)
슬라이딩 윈도우 주의(SWA)
글로벌 주의(GA)
MiMo-V2.5-Pro 시작하기
페이지 접근: Hugging Face 모델 페이지 방문
모델 로드: MiMo-V2.5-Pro 다운로드
환경 구성: 권장 매개변수로 설정
통합: 애플리케이션에 구현
미세 조정: 특정 작업에 맞게 모델 조정
MiMo-V2.5-Pro의 사용 사례
- 복잡한 소프트웨어 엔지니어링
- 에이전틱 작업
- 다국어 응용 프로그램
- 장기 컨텍스트 추론
- 강화 학습







