본문으로 건너뛰기
ToolPotion

MiMo-V2.5-Pro

MiMo-V2.5-Pro는 복잡한 작업을 위해 설계된 고급 오픈 소스 전문가 혼합 언어 모델입니다. 하이브리드 주의 아키텍처를 특징으로 하며 최대 1M 토큰의 컨텍스트 길이를 지원하여 까다로운 소프트웨어 엔지니어링 및 장기 작업에 적합합니다.

모델 보기
공유

설명

MiMo-V2.5-Pro는 총 1.02조 개의 매개변수와 420억 개의 활성 매개변수를 가진 최첨단 오픈 소스 전문가 혼합(MoE) 언어 모델입니다. 이 모델은 가장 까다로운 에이전틱, 복잡한 소프트웨어 엔지니어링 및 장기 작업을 처리하도록 설계되었습니다. 이 모델은 하이브리드 주의 아키텍처를 활용하여 슬라이딩 윈도우 주의(SWA)와 글로벌 주의(GA)를 6:1 비율로 교차하여 KV-캐시 저장소를 크게 줄이면서도 긴 컨텍스트 성능을 유지합니다. 이 아키텍처는 추론 중 출력 속도를 향상시키는 세 개의 경량 다중 토큰 예측(MTP) 모듈로 보완됩니다.

이 모델은 FP8 혼합 정밀도로 27조 개의 토큰에 대해 사전 훈련되었으며 최대 100만 개의 토큰에 대한 컨텍스트 창을 지원합니다. 훈련 후 MiMo-V2.5-Pro는 감독된 미세 조정(SFT), 대규모 에이전틱 강화 학습(RL) 및 다중 교사 온-정책 증류(MOPD)를 사용하여 복잡한 작업에서 우수한 성능을 달성합니다. 이 모델은 100만 개의 토큰 컨텍스트 창에서 복잡한 궤적을 지속하는 데 뛰어나며, 강력한 지시 준수 및 일관성이 필요한 작업에 매우 효과적입니다.

MiMo-V2.5-Pro의 아키텍처는 지역 슬라이딩 윈도우 주의와 글로벌 주의를 통합하여 긴 컨텍스트의 제곱 복잡성을 해결합니다. 훈련 과정은 SFT로 기초 기술을 구축하는 것으로 시작하여 다양한 교사 모델을 통한 도메인 전문 훈련을 거쳐 동적 온-정책 RL을 위한 MOPD로 마무리되는 세 단계의 후 훈련 패러다임을 포함합니다.

모델의 배포는 SGLang 및 vLLM 커뮤니티의 지원을 받으며 최적의 성능을 위한 권장 구성으로 이루어집니다. MiMo-V2.5-Pro는 소프트웨어 엔지니어링 및 다국어 응용 프로그램과 같은 고급 언어 처리 기능이 필요한 산업에 적합합니다.

MiMo-V2.5-Pro 하이라이트

  • 1.02조 개의 총 매개변수

  • 420억 개의 활성 매개변수

  • 하이브리드 주의 아키텍처

  • 다중 토큰 예측(MTP)

  • 27조 개의 토큰에 대한 효율적인 사전 훈련

  • 100만 개의 토큰 컨텍스트 길이

  • 감독된 미세 조정(SFT)

  • 다중 교사 온-정책 증류(MOPD)

  • 슬라이딩 윈도우 주의(SWA)

  • 글로벌 주의(GA)

MiMo-V2.5-Pro 시작하기

  1. 페이지 접근: Hugging Face 모델 페이지 방문

  2. 모델 로드: MiMo-V2.5-Pro 다운로드

  3. 환경 구성: 권장 매개변수로 설정

  4. 통합: 애플리케이션에 구현

  5. 미세 조정: 특정 작업에 맞게 모델 조정

MiMo-V2.5-Pro의 사용 사례

  • 복잡한 소프트웨어 엔지니어링
  • 에이전틱 작업
  • 다국어 응용 프로그램
  • 장기 컨텍스트 추론
  • 강화 학습

MiMo-V2.5-Pro의 FAQ

From Xiaomi

a model in MiMo.

MiMo-V2.5-Pro 리뷰

로딩 중...

MiMo-V2.5-Pro와(과) 비슷한 인기 AI 도구

DeepSeek-V3는 6710억 개의 매개변수를 가진 전문가 혼합 언어 모델로, 효율적인 추론과 비용 효율적인 훈련을 위해 설계되었습니다. 자연어 처리 작업에서 강력한 성능을 보여주는 다양한 벤치마크에서 우수한 성능을 발휘합니다.

추천AI 모델 및 LLM

DeepSeek-V4-Pro는 효율적인 백만 토큰 컨텍스트 인텔리전스를 위해 설계된 고급 AI 모델입니다. 하이브리드 주의 아키텍처를 특징으로 하며, 32조 개 이상의 토큰으로 사전 훈련되어 복잡한 추론 작업 및 코딩 벤치마크에 적합합니다.

추천AI 모델 및 LLM

Kimi K3는 장기 코딩, 지식 작업 및 추론을 위해 설계된 고급 오픈 가중치 다중 모달 AI 모델입니다. 100만 토큰의 컨텍스트 창을 특징으로 하며, 효율성과 성능을 향상시키기 위한 혁신적인 아키텍처를 기반으로 구축되었습니다.

추천AI 모델 및 LLM

MiMo-V2.5는 Xiaomi의 플래그십 AI 모델로, 실제 생산성을 위한 조정 가능한 조정 기능을 제공합니다. 이 모델은 장기 작업에서 뛰어난 성능을 발휘하며, 단일 컨텍스트에서 최대 100만 개의 토큰을 지원하여 복잡한 프로젝트에 적합합니다.

AI 모델 및 LLM

Kimi-K2-Instruct는 고급 AI 작업을 위해 설계된 최첨단 전문가 혼합 언어 모델입니다. 이 모델은 추론, 코딩 및 도구 사용에서 뛰어난 성능을 제공하며, 320억 개의 활성화된 매개변수를 갖추고 있습니다.

AI 모델 및 LLM

NVIDIA Nemotron 3 Ultra는 복잡한 추론 및 다국어 작업을 위해 설계된 강력한 AI 모델입니다. 5500억 개의 매개변수를 갖춘 이 모델은 긴 맥락 분석 및 도구 사용에 뛰어나며, 다양한 산업에서 고위험 응용 프로그램에 적합합니다.

추천AI 모델 및 LLM

Longformer Base 4096은 긴 문서를 처리하도록 설계된 트랜스포머 모델입니다. RoBERTa를 기반으로 하며 최대 4,096 토큰의 확장된 시퀀스에 대해 사전 학습되었습니다. 이 모델은 슬라이딩 윈도우와 글로벌 어텐션을 결합한 하이브리드 어텐션 메커니즘을 사용하여 효율적인 긴 문서 이해 및 작업별 표현…

AI 모델 및 LLM

DeepSeek-v3는 고급 MoE 아키텍처와 최첨단 언어 모델을 기반으로 즉각적인 AI 솔루션을 제공합니다. 효율적인 추론 및 다양한 하드웨어 배포에 걸친 다국어 지원을 위해 설계된 이 안정적이고 무료이며 무제한적인 모델로 최첨단 AI 기능을 경험해 보세요.

AI 모델 및 LLM