설명
Gemma-3n-E4B-it은 Google에서 개발한 Gemma 모델 패밀리의 일원으로, 오픈 소스 및 오픈 과학을 통해 AI 기능을 발전시키기 위해 설계되었습니다. 이 모델은 저자원 장치에서 효율적으로 실행되도록 최적화되어 있어 다양한 응용 프로그램에서 접근할 수 있습니다. 텍스트, 이미지, 비디오 및 오디오를 포함한 다중 모드 입력을 지원하며, 텍스트 출력을 생성할 수 있습니다. 이 모델은 MatFormer 아키텍처를 사용하여 E4B 모델 내에 하위 모델을 중첩할 수 있도록 하여 모델 크기와 성능의 유연성을 제공합니다.
Gemma-3n-E4B-it 모델은 원시 매개변수 수가 8B임에도 불구하고 전통적인 4B 모델과 유사한 메모리 풋프린트로 작동하도록 설계되었습니다. 이는 저사용 매트릭스를 가속기에서 오프로드하여 효율적인 매개변수 관리를 가능하게 합니다. 이 모델은 총 32K 토큰의 입력 컨텍스트를 지원하며, 동일한 길이의 출력을 생성할 수 있어 광범위한 컨텍스트가 필요한 복잡한 작업에 적합합니다.
Gemma-3n-E4B-it의 훈련 데이터는 약 11조 개의 토큰으로 구성된 다양한 출처를 포함하며, 지식 컷오프 날짜는 2024년 6월입니다. 이 데이터는 140개 이상의 구어체 언어, 웹 문서, 코드, 수학, 이미지 및 오디오를 포함하여 모델이 다양한 언어 스타일과 주제에 노출되도록 보장합니다. 해로운 및 불법 콘텐츠를 제외하기 위해 엄격한 필터링 방법이 적용되었습니다.
Gemma-3n-E4B-it은 다양한 벤치마크에 대해 평가되어 추론, 사실성, 다국어 능력, STEM 및 코드 작업에서 높은 성능을 보여줍니다. 이 모델은 상당한 계산 능력과 비용 효율성을 제공하는 텐서 처리 장치(TPU) 하드웨어를 사용하여 훈련됩니다. JAX 및 ML Pathways를 사용하여 구현되어 효율적인 훈련 및 개발이 가능합니다.
이 모델은 콘텐츠 생성, 커뮤니케이션, 연구 및 교육을 포함한 다양한 응용 프로그램을 위해 설계되었습니다. 그러나 사용자는 훈련 데이터의 잠재적 편향 및 개방형 작업의 도전과 같은 한계를 인식해야 합니다. 윤리적 고려 사항에는 편향 및 공정성, 잘못된 정보 및 개인 정보 침해가 포함되며, 책임 있는 사용을 위한 지침이 제공됩니다.
gemma-3n-E4B-it 모델 하이라이트
텍스트, 이미지, 비디오 및 오디오 입력 지원
텍스트 출력 생성
MatFormer 아키텍처 사용
8B 매개변수로 작동
효율적인 매개변수 관리
11조 개의 토큰으로 훈련됨
140개 이상의 언어 지원
다양한 벤치마크에서 평가됨
TPU 하드웨어를 사용하여 훈련됨
JAX 및 ML Pathways로 구현됨
gemma-3n-E4B-it 모델 시작하기
페이지 접근: Hugging Face 리포지토리 방문
모델 로드: Gemma-3n-E4B-it 초기화
환경 구성: Transformers 라이브러리로 설정
통합: Hugging Face transformers와 함께 사용
미세 조정: Mix-and-Match 방법으로 사용자 정의
gemma-3n-E4B-it 모델의 사용 사례
- 콘텐츠 생성
- 대화형 AI
- 텍스트 요약
- 이미지 데이터 추출
- 오디오 데이터 추출












