설명
DeepSeek-V4-Pro는 오픈 소스 및 오픈 과학을 통해 인공지능을 발전시키고 민주화하는 것을 목표로 하는 DeepSeek-V4 시리즈의 일부입니다. 이 모델은 두 개의 강력한 전문가 혼합(Mixture-of-Experts, MoE) 언어 모델을 통합하고 있으며, DeepSeek-V4-Pro는 1.6조 개의 매개변수를 자랑하며 백만 토큰의 컨텍스트 길이를 지원합니다.
DeepSeek-V4-Pro의 아키텍처에는 압축 희소 주의(Compressed Sparse Attention, CSA)와 강력하게 압축된 주의(Heavily Compressed Attention, HCA)를 결합한 하이브리드 주의 메커니즘과 같은 여러 주요 업그레이드가 포함되어 있습니다. 이 설계는 긴 컨텍스트 효율성을 극적으로 개선하여 이전 모델인 DeepSeek-V3.2에 비해 단일 토큰 추론 FLOP의 27%와 KV 캐시의 10%만을 요구합니다. 또한, 이 모델은 신호 전파의 안정성을 향상시키기 위해 다변량 제약 하이퍼 연결(Manifold-Constrained Hyper-Connections, mHC)을 사용하여 모델의 표현력을 유지합니다.
더 빠른 수렴과 더 큰 훈련 안정성을 보장하기 위해 뮤온 최적화기(Muon optimizer)가 사용됩니다. 이 모델은 32조 개 이상의 다양한 토큰으로 사전 훈련된 후, 도메인별 전문가의 독립적인 배양과 정책 기반 증류(on-policy distillation)를 통한 통합 모델 정제를 포함하는 포괄적인 후 훈련 파이프라인을 거칩니다.
DeepSeek-V4-Pro-Max는 DeepSeek-V4-Pro의 최대 추론 노력 모드로, 오픈 소스 모델의 지식 능력을 크게 향상시킵니다. 코딩 벤치마크에서 최고 수준의 성능을 달성하며, 추론 및 에이전트 작업에서 선도적인 폐쇄형 모델과의 격차를 효과적으로 해소합니다. 이 모델의 능력은 복잡한 문제 해결 및 계획 작업을 포함한 다양한 응용 프로그램에 적합하여 AI 분야의 개발자와 연구자에게 귀중한 도구가 됩니다.
DeepSeek-V4-Pro 하이라이트
모델 유형: 전문가 혼합(Mixture-of-Experts)
총 매개변수: 1.6T
활성화된 매개변수: 49B
컨텍스트 길이: 1M 토큰
하이브리드 주의 아키텍처: 예
뮤온 최적화기: 예
사전 훈련: 32T 토큰
라이센스: MIT
DeepSeek-V4-Pro 시작하기
모델 접근: DeepSeek-V4-Pro의 Hugging Face 페이지를 방문하세요.
인증: 필요시 계정을 생성하세요.
환경 설정: 필요한 라이브러리와 종속성이 있는지 확인하세요.
API를 통한 통합: 제공된 API 문서를 사용하여 모델에 연결하세요.
최적화: 최상의 성능을 위해 샘플링 매개변수를 조정하세요.
DeepSeek-V4-Pro의 사용 사례
- 복잡한 문제 해결
- 코딩 벤치마크
- 연구 응용
- 자연어 처리
- 에이전트 작업







