설명
nomic-embed-text-v2-moe는 다국어 검색 작업에서 뛰어난 성능을 발휘하도록 설계된 최첨단 다국어 전문가 혼합(MoE) 텍스트 임베딩 모델입니다. 약 100개 언어를 지원하며 16억 쌍 이상의 데이터로 훈련되어 다양한 언어적 응용 프로그램에 매우 효과적입니다. 이 모델은 유연한 임베딩 차원을 제공하며, Matryoshka Embeddings를 활용하여 성능 저하를 최소화하면서 저장 비용을 최대 3배까지 줄일 수 있습니다.
nomic-embed-text-v2-moe의 아키텍처는 총 4억 7500만 개의 매개변수를 포함하며, 추론 중에는 3억 5000만 개가 활성화됩니다. 이 모델은 8개의 전문가와 상위 2개 라우팅을 갖춘 MoE 구성을 특징으로 하여 효율적인 처리와 높은 성능을 제공합니다. 모델의 최대 시퀀스 길이는 512 토큰이며, 768에서 256까지의 임베딩 차원을 지원합니다.
nomic-embed-text-v2-moe는 완전한 오픈 소스이며, 모델 가중치, 코드 및 훈련 데이터가 공개되어 있습니다. 이러한 투명성은 재현성을 보장하고 추가 연구 및 개발을 촉진합니다. 이 모델은 BEIR 및 MIRACL과 같은 벤치마크에서 우수한 성능을 보여주며, 동일한 매개변수 클래스의 모델보다 뛰어난 성능을 발휘하고 더 큰 모델과의 경쟁력도 유지하고 있습니다.
강점에도 불구하고 사용자는 특정 제한 사항을 인식해야 합니다. 성능은 언어에 따라 다를 수 있으며, MoE 아키텍처로 인해 자원 요구 사항이 전통적인 밀집 모델보다 높을 수 있습니다. 또한, 사용자는 모델을 로드할 때 custom architecture 구현을 활용하기 위해 trust_remote_code=True를 활성화해야 합니다.
전반적으로, nomic-embed-text-v2-moe는 다국어 텍스트 임베딩 작업을 위한 강력한 도구로, 다양한 응용 프로그램에 대해 유연성, 효율성 및 높은 성능을 제공합니다.
nomic-embed-text-v2-moe 하이라이트
최첨단 다국어 성능
약 100개 언어 지원
16억 쌍 이상의 데이터로 훈련
유연한 임베딩 차원
오픈 소스 모델 가중치 및 코드
전문가 혼합 아키텍처
Matryoshka Embeddings를 통한 효율적인 저장
BEIR 및 MIRACL 벤치마크에서 높은 성능
nomic-embed-text-v2-moe 시작하기
페이지 접근: Hugging Face 모델 페이지 방문
모델 로드: SentenceTransformers 또는 Transformers 사용
환경 구성: 최상의 성능을 위해 GPU 설정
통합: 쿼리 및 문서에 작업 지침 접두사 사용
미세 조정: 특정 요구에 맞게 임베딩 차원 조정
nomic-embed-text-v2-moe의 사용 사례
- 다국어 검색
- 텍스트 임베딩
- 데이터 분석
- 언어 처리
- 연구 및 개발







