본문으로 건너뛰기
ToolPotion

Jina Embeddings v3

Jina Embeddings v3는 다양한 NLP 애플리케이션을 위해 설계된 다국어, 다중 작업 텍스트 임베딩 모델입니다. 긴 입력 시퀀스와 작업별 임베딩을 지원하여 다양한 사용 사례에 적합합니다.

모델 보기
공유

설명

Jina Embeddings v3는 Jina AI에서 개발한 정교한 다국어 텍스트 임베딩 모델입니다. 이 모델은 광범위한 자연어 처리(NLP) 애플리케이션을 지원하도록 설계되었습니다. 모델은 Jina-XLM-RoBERTa 아키텍처를 기반으로 하며, Rotary Position Embeddings(RoPE)를 통합하여 최대 8192 토큰까지 긴 입력 시퀀스를 처리할 수 있습니다. 이 기능은 광범위한 텍스트 처리가 필요한 애플리케이션에 특히 유용합니다.

모델은 다섯 개의 LoRA 어댑터를 특징으로 하여 작업별 임베딩을 효율적으로 생성할 수 있습니다. 사용자는 검색 쿼리, 패시지 임베딩, 클러스터링, 분류 및 텍스트 매칭을 포함한 다양한 작업에 대해 임베딩을 사용자 정의할 수 있습니다. 이러한 유연성 덕분에 Jina Embeddings v3는 비대칭 검색 작업, 클러스터링 및 재순위 애플리케이션, 분류 작업 및 텍스트 유사성을 정량화하는 작업에 적합합니다.

Jina Embeddings v3는 Matryoshka Embeddings를 지원하여 32에서 1024까지 유연한 임베딩 크기를 제공합니다. 이 기능은 사용자가 특정 애플리케이션 요구에 맞게 임베딩을 잘라낼 수 있도록 합니다. 이 모델은 아랍어, 중국어, 영어, 프랑스어, 독일어, 힌디어, 일본어, 한국어 및 스페인어를 포함한 30개 언어에 대해 조정되었습니다.

모델의 주목할 만한 업데이트는 인코드 함수의 버그를 수정하여 잘린 임베딩의 일관된 정규화를 보장하는 것입니다. 사용자는 모델을 통합할 때 평균 풀링을 적용하는 것이 좋습니다. 이 접근 방식은 고품질 문장 임베딩을 생성합니다. 모델은 Jina Embedding API를 통해 또는 Transformers 패키지를 통해 직접 사용할 수 있습니다.

Jina Embeddings v3는 Ampere, Ada 또는 Hopper GPU와 같은 FlashAttention-2를 지원하는 GPU와 호환됩니다. 이 모델은 CC BY-NC 4.0 라이센스 하에 있으며, 상업적 사용 문의는 Jina AI로 직접 하시기 바랍니다. 이 모델은 지난달 200만 회 이상의 다운로드가 이루어졌으며, AWS 및 Azure 플랫폼에 등록되어 있습니다.

Jina Embeddings v3 하이라이트

  • 30개 언어에 대한 다국어 지원

  • 최대 8192 토큰까지 확장된 시퀀스 길이

  • LoRA 어댑터를 통한 작업별 임베딩

  • 유연한 크기를 위한 Matryoshka Embeddings

  • 고품질 문장 임베딩을 위한 평균 풀링

  • FlashAttention-2 GPU와의 호환성

  • SentenceTransformerTrainer를 통한 미세 조정 지원

  • 효율적인 처리를 위한 ONNX 추론

  • 인코드 함수 정규화에 대한 버그 수정

  • CC BY-NC 4.0 라이센스

Jina Embeddings v3 시작하기

  1. 페이지 접근: huggingface.co/jinaai/jina-embeddings-v3 방문

  2. 모델 로드: AutoModel.from_pretrained 사용

  3. 환경 구성: GPU 호환성 확인

  4. 통합: 임베딩에 평균 풀링 적용

  5. 미세 조정: 작업을 위해 SentenceTransformerTrainer 사용

Jina Embeddings v3의 사용 사례

  • 텍스트 검색
  • 텍스트 분류
  • 클러스터링
  • 텍스트 매칭
  • 다국어 처리

Jina Embeddings v3의 FAQ

From Jina AI

Jina Embeddings v3 리뷰

로딩 중...

Jina Embeddings v3와(과) 비슷한 인기 AI 도구

nomic-embed-text-v2-moe는 최첨단 다국어 전문가 혼합 텍스트 임베딩 모델입니다. 약 100개 언어를 지원하며 다국어 검색 작업에서 뛰어난 성능을 발휘하며 유연한 임베딩 차원과 저장 비용 절감을 제공합니다.

AI 모델 및 LLM

BAAI/bge-large-en-v1.5는 검색 보강 언어 모델을 위해 설계된 최첨단 임베딩 모델입니다. 이 모델은 검색 기능을 향상시키고 다양한 작업을 지원하여 자연어 처리 및 AI 연구에 적합한 응용 프로그램에 활용될 수 있습니다.

추천AI 모델 및 LLM

BAAI/bge-small-en-v1.5는 검색 보강 언어 모델 작업을 위해 설계된 소규모 임베딩 모델입니다. 다양한 자연어 처리 애플리케이션에서 경쟁력 있는 성능을 제공하여 AI 분야의 개발자와 연구자에게 적합합니다.

추천AI 모델 및 LLM

intfloat multilingual-e5-large 모델은 다국어 텍스트 임베딩을 위해 설계된 강력한 AI 도구입니다. 100개 언어를 지원하며, 텍스트 검색 및 의미적 유사성과 같은 작업에 최적화되어 다양한 데이터 세트에서 높은 성능을 제공합니다.

AI 모델 및 LLM

Longformer Base 4096은 긴 문서를 처리하도록 설계된 트랜스포머 모델입니다. RoBERTa를 기반으로 하며 최대 4,096 토큰의 확장된 시퀀스에 대해 사전 학습되었습니다. 이 모델은 슬라이딩 윈도우와 글로벌 어텐션을 결합한 하이브리드 어텐션 메커니즘을 사용하여 효율적인 긴 문서 이해 및 작업별 표현…

AI 모델 및 LLM

MUSE는 비지도 및 지도 학습 방법을 모두 지원하는 다국어 단어 임베딩 생성용 Python 라이브러리입니다. fastText 임베딩을 공통 공간으로 정렬하고, 훈련 및 평가를 위한 대규모 이중 언어 사전을 제공하여 교차 언어 NLP 작업을 가능하게 합니다.

AI 모델 및 LLM

Qwen1.5-110B는 상당한 성능 향상, 다국어 지원 및 안정적인 32K 컨텍스트 길이를 제공하는 변환기 기반 언어 모델입니다. 고급 AI 애플리케이션에 적합합니다.

AI 모델 및 LLM

BAAI/bge-reranker-v2-m3는 빠른 추론과 쉬운 배포를 위해 설계된 경량 다국어 재정렬 모델입니다. 이 모델은 쿼리와 문서에 대한 유사성 점수를 출력하며, 중국어와 영어를 모두 지원합니다.

AI 모델 및 LLM