Описание
MiMo-V2.5-Pro — это передовая открытая языковая модель Mixture-of-Experts (MoE) с общим количеством 1,02 триллиона параметров и 42 миллиардами активных параметров. Она предназначена для выполнения самых требовательных агентных, сложных задач в области разработки программного обеспечения и задач с долгосрочной перспективой. Модель использует гибридную архитектуру внимания, чередуя Sliding Window Attention (SWA) и Global Attention (GA) в соотношении 6:1, что значительно снижает требования к хранению KV-кэша, сохраняя при этом производительность при длинном контексте. Эта архитектура дополнена тремя легковесными модулями Multi-Token Prediction (MTP), которые увеличивают скорость вывода во время инференса.
Модель предварительно обучена на 27 триллионах токенов с использованием смешанной точности FP8 и поддерживает контекстное окно до 1 миллиона токенов. После обучения MiMo-V2.5-Pro использует Supervised Fine-Tuning (SFT), крупномасштабное агентное обучение с подкреплением (RL) и Multi-Teacher On-Policy Distillation (MOPD) для достижения превосходной производительности в сложных задачах. Она отлично справляется с поддержанием сложных траекторий в контексте длиной 1 миллион токенов, что делает её высокоэффективной для задач, требующих строгого следования инструкциям и согласованности.
Архитектура MiMo-V2.5-Pro решает квадратичную сложность длинных контекстов, интегрируя Local Sliding Window Attention и Global Attention. Процесс её обучения включает трехступенчатую парадигму постобучения, которая начинается с SFT для формирования базовых навыков, затем следует специализированное обучение в области с разнообразными моделями-учителями и завершается MOPD для динамического обучения с подкреплением на основе политики.
Развертывание модели поддерживается сообществами SGLang и vLLM с рекомендуемыми конфигурациями для оптимальной производительности. MiMo-V2.5-Pro идеально подходит для отраслей, требующих продвинутых возможностей обработки языка, таких как разработка программного обеспечения и многоязычные приложения.
Главное о MiMo-V2.5-Pro
1.02T общее количество параметров
42B активных параметров
Гибридная архитектура внимания
Multi-Token Prediction (MTP)
Эффективное предварительное обучение на 27T токенах
Длина контекста 1M токенов
Supervised Fine-Tuning (SFT)
Multi-Teacher On-Policy Distillation (MOPD)
Sliding Window Attention (SWA)
Global Attention (GA)
Начало работы с MiMo-V2.5-Pro
Доступ к странице: Посетите страницу модели Hugging Face
Загрузите модель: Скачайте MiMo-V2.5-Pro
Настройте окружение: Установите рекомендуемые параметры
Интегрируйте: Реализуйте в вашем приложении
Тонкая настройка: Настройте модель для конкретных задач
Варианты использования MiMo-V2.5-Pro
- Сложная разработка программного обеспечения
- Агентные задачи
- Многоязычные приложения
- Долгосрочное рассуждение
- Обучение с подкреплением







