설명
BLOOM은 BigScience에서 개발한 자기 회귀 대형 언어 모델(LLM)로, 오픈 소스 및 오픈 과학을 통해 인공지능을 발전시키고 민주화하기 위해 설계되었습니다. 2022년 7월 11일에 출시된 이 모델은 46개 자연어와 13개 프로그래밍 언어로 일관된 텍스트를 생성할 수 있어 자연어 처리의 다양한 응용 프로그램에 적합한 도구입니다.
BLOOM의 아키텍처는 Megatron-LM GPT2에서 수정된 변환기 모델을 기반으로 합니다. 1760억 개의 매개변수를 가지고 있으며, 70개의 층과 112개의 주의 헤드를 특징으로 하여 텍스트를 효과적으로 처리하고 생성할 수 있습니다. 이 모델은 3500억 개의 고유 토큰을 포함하는 1.6TB의 전처리된 텍스트 데이터셋으로 훈련되었습니다. 이러한 광범위한 훈련을 통해 BLOOM은 정보 추출, 질문 응답 및 요약을 포함한 텍스트 생성 작업을 수행할 수 있으며, 명시적으로 훈련되지 않은 작업에 대해서도 수행할 수 있습니다.
BLOOM은 대형 언어 모델에 대한 공개 연구를 위해 설계되어 연구자, 교육자 및 개발자가 접근할 수 있도록 합니다. Hugging Face의 생태계를 사용하여 애플리케이션에 쉽게 통합할 수 있으며, transformers 및 accelerate의 설치가 필요합니다. 모델의 주요 사용자는 일반 대중, 연구자, 학생 및 엔지니어 등입니다. 그러나 모델은 사실처럼 보이는 출력을 생성할 수 있으므로 고위험 환경이나 중요한 의사 결정에 사용해서는 안 됩니다.
BLOOM의 훈련은 Jean Zay 공공 슈퍼컴퓨터에서 384개의 A100 80GB GPU를 활용하여 진행되었으며, 프랑스 정부의 자금 지원을 받았습니다. 훈련 과정의 환경 영향을 줄이기 위해 원자력 에너지를 사용하며, 발생한 열은 캠퍼스 주택에 재사용됩니다. 전반적으로 BLOOM은 AI 분야에서 중요한 진전을 나타내며, 언어 생성 및 연구를 위한 강력한 도구를 제공합니다.
bigscience/bloom 하이라이트
모델 유형: 변환기 기반 언어 모델
매개변수: 176B
지원 언어: 46개 자연어, 13개 프로그래밍 언어
라이선스: RAIL 라이선스 v1.0
출시일: 2022년 7월 11일
훈련 데이터 크기: 1.6TB
훈련 토큰: 350B 고유 토큰
컴퓨팅 인프라: Jean Zay 공공 슈퍼컴퓨터
bigscience/bloom 시작하기
접속 페이지: Hugging Face 웹사이트에서 BLOOM을 방문하세요.
모델 로드: Hugging Face의 transformers 라이브러리를 사용하여 BLOOM 모델을 다운로드하세요.
환경 구성: 환경에 transformers 및 accelerate가 설치되어 있는지 확인하세요.
통합: 필요에 따라 텍스트 생성 작업에 모델을 사용하세요.
미세 조정: 특정 응용 프로그램을 위해 모델을 선택적으로 미세 조정하세요.
bigscience/bloom의 사용 사례
- 텍스트 생성
- 정보 추출
- 질문 응답
- 요약
- 언어 연구








