설명
Falcon3-10B-Instruct는 기술 혁신 연구소에서 개발한 Open Foundation Models의 Falcon3 계열의 일부입니다. 이는 40개의 디코더 블록과 더 빠른 추론을 위한 그룹화된 쿼리 주의를 특징으로 하는 변환기 기반의 인과 디코더 전용 아키텍처입니다. 이 모델은 추론, 언어 이해, 지침 수행, 코드 및 수학 작업에서 최첨단 결과를 달성하도록 설계되었습니다. 영어, 프랑스어, 스페인어 및 포르투갈어의 네 가지 언어를 지원하며 최대 32K의 컨텍스트 길이를 제공합니다.
이 모델은 STEM, 대화, 코드, 안전 및 함수 호출 데이터의 120만 샘플에 대해 후속 훈련을 받았으며, 1024개의 H100 GPU 칩을 활용합니다. Falcon3-10B-Instruct는 TII Falcon-LLM 라이선스 2.0에 따라 라이선스가 부여되며 2024년 12월에 출시될 예정입니다. IFEval, BBH, MATH Lvl-5, GPQA 및 MUSR을 포함한 다양한 벤치마크에서 높은 성능을 보여주었습니다.
Falcon3-10B-Instruct는 여러 언어에서 복잡한 작업을 처리할 수 있는 강력한 언어 모델을 찾는 개발자와 연구자에게 적합합니다. 속도와 정확성 측면에서 상당한 이점을 제공하여 AI 기반 프로젝트에 유용한 도구가 됩니다. 모델의 아키텍처와 훈련 데이터는 포괄적인 언어 이해 및 지침 수행 기능을 보장합니다.
Falcon3-10B-Instruct 모델 하이라이트
변환기 기반의 인과 디코더 전용 아키텍처
40개의 디코더 블록
더 빠른 추론을 위한 그룹화된 쿼리 주의
영어, 프랑스어, 스페인어, 포르투갈어 지원
32K 컨텍스트 길이
120만 샘플에 대해 후속 훈련
긴 컨텍스트 이해를 위한 높은 RoPE 값
SwiGLu 및 RMSNorm 사용
131K 어휘 크기
기술 혁신 연구소에서 개발
라이선스: TII Falcon-LLM 라이선스 2.0
모델 출시 날짜: 2024년 12월
벤치마크 성능: IFEval, BBH, MATH Lvl-5
1024개의 H100 GPU 칩 활용
Falcon3-7B-Base에서 깊이 업스케일
Falcon3-10B-Instruct 모델 시작하기
접속 페이지: Hugging Face 모델 저장소 방문
모델 로드: 환경에서 Falcon3-10B-Instruct 초기화
환경 구성: 필요한 종속성 및 구성 설정
통합: 모델을 애플리케이션과 연결
미세 조정: 특정 작업을 위한 모델 매개변수 조정
Falcon3-10B-Instruct 모델의 사용 사례
- 언어 이해
- 지침 수행
- 추론 작업
- 코드 분석
- 수학 작업








