본문으로 건너뛰기
ToolPotion

SmolLM3 언어 모델

SmolLM3는 소형 모델의 한계를 확장하기 위해 설계된 30억 매개변수 언어 모델입니다. 이 모델은 이중 모드 추론, 6개 언어 지원 및 긴 컨텍스트 처리를 지원하며, 30억에서 40억 규모에서 강력한 성능을 제공합니다.

모델 보기
공유

설명

SmolLM3는 인공지능에서 소형 모델의 능력을 향상시키기 위해 개발된 30억 매개변수 언어 모델입니다. 이 모델은 이중 모드 추론을 지원하며, 영어, 프랑스어, 스페인어, 독일어, 이탈리아어, 포르투갈어의 6개 언어를 기본적으로 지원하는 다국어 모델입니다. 모델은 완전히 공개되어 있으며, 공개 가중치와 함께 공개 데이터 혼합 및 훈련 구성에 대한 포괄적인 세부정보를 제공합니다.

SmolLM3의 아키텍처는 GQA와 NoPE를 사용한 디코더 전용 변환기이며, 비율은 3:1입니다. 이 모델은 웹, 코드, 수학 및 추론 데이터를 포함한 단계적 커리큘럼을 사용하여 11.2조 개의 토큰으로 사전 훈련되었습니다. 훈련 후에는 1400억 개의 추론 토큰에 대한 중간 훈련이 진행되었으며, 이후 감독된 미세 조정 및 Anchored Preference Optimization (APO)을 통한 정렬이 이루어졌습니다.

SmolLM3는 하이브리드 추론에 최적화되어 있으며, 64k 컨텍스트에서 훈련되어 YARN 외삽을 사용하여 최대 128k 토큰을 처리할 수 있는 긴 컨텍스트 처리를 지원합니다. 이 모델은 vLLM 및 SGLang을 사용하여 배포할 수 있으며, OpenAI 형식 API와 호환됩니다. 또한 XML 또는 Python 함수 호출을 통해 다양한 도구와의 통합을 허용하는 도구 호출을 지원합니다.

로컬 추론을 위해 SmolLM3는 llama.cpp, ONNX, MLX, MLC 및 ExecuTorch와 함께 사용할 수 있습니다. 효율적인 배포를 위한 양자화된 체크포인트가 제공됩니다. 이 모델의 성능은 다양한 벤치마크에서 평가되었으며, 다국어 Q&A, 경쟁 프로그래밍 및 지침 따르기 작업에서 강력한 결과를 보여주었습니다.

SmolLM3는 다국어 및 복잡한 추론 작업을 활용하려는 개발자와 연구자에게 유용한 도구입니다. 그러나 사용자는 생성된 콘텐츠가 항상 사실적으로 정확하거나 훈련 데이터에 존재하는 편향으로부터 자유롭지 않을 수 있음을 인지해야 합니다.

SmolLM3 언어 모델 하이라이트

  • 30억 매개변수 언어 모델

  • 이중 모드 추론 지원

  • 다국어: 6개 언어

  • 최대 128k 토큰의 긴 컨텍스트 처리

  • 공개 모델 및 공개 가중치

  • 하이브리드 추론에 최적화된 지시 모델

  • 도구 호출 지원

  • vLLM 및 SGLang과 호환

SmolLM3 언어 모델 시작하기

  1. 페이지 접근: Hugging Face 모델 페이지 방문

  2. 모델 로드: transformers v4.53.0 또는 최신 vllm 사용

  3. 환경 구성: 샘플링 매개변수 및 컨텍스트 길이 설정

  4. 통합: XML 또는 Python 함수로 도구 호출 사용

  5. 미세 조정: 감독된 미세 조정 및 정렬 적용

SmolLM3 언어 모델의 사용 사례

  • 다국어 Q&A
  • 하이브리드 추론
  • 도구 통합
  • 긴 컨텍스트 처리
  • 지침 따르기

SmolLM3 언어 모델의 FAQ

From Hugging Face

SmolLM3 언어 모델 리뷰

로딩 중...

SmolLM3 언어 모델와(과) 비슷한 인기 AI 도구

Qwen3-8B는 고급 추론, 지시 따르기 및 다국어 지원을 위해 설계된 대형 언어 모델입니다. 다양한 시나리오에서 최적의 성능을 위해 원활한 모드 전환 기능을 제공하여 AI의 다양한 응용 프로그램에 적합합니다.

추천AI 모델 및 LLM

Gemma 3-27B IT는 텍스트 및 이미지 입력을 처리하여 텍스트 출력을 생성할 수 있는 구글의 최첨단 다중 모달 AI 모델입니다. 140개 이상의 언어를 지원하며, 자원이 제한된 환경에서 효율적으로 배포되도록 설계되었습니다.

AI 모델 및 LLM

Falcon3-10B-Instruct는 추론, 언어 이해 및 지침 수행 작업을 위해 설계된 최첨단 언어 모델입니다. 여러 언어를 지원하며 향상된 이해를 위해 긴 컨텍스트 길이를 제공합니다.

AI 모델 및 LLM

AI 모델

Tencent Hunyuan의 Hy3 Preview는 2950억 개의 매개변수를 가진 오픈 소스 언어 모델입니다. 수학, 코딩 및 다국어 작업에서 뛰어난 성능을 발휘하며, 256K 컨텍스트 윈도우를 제공합니다. Tencent Cloud 및 OpenRouter에서 이용 가능합니다.

AI 모델 및 LLM

Kimi K3는 장기 코딩, 지식 작업 및 추론을 위해 설계된 고급 오픈 가중치 다중 모달 AI 모델입니다. 100만 토큰의 컨텍스트 창을 특징으로 하며, 효율성과 성능을 향상시키기 위한 혁신적인 아키텍처를 기반으로 구축되었습니다.

추천AI 모델 및 LLM

Phi-4-reasoning-plus는 Microsoft Research에서 개발한 최첨단 추론 모델입니다. 이는 Phi-4에서 감독 학습과 강화 학습을 통해 미세 조정되어 수학, 과학 및 코딩의 고급 추론 작업을 위해 설계되었습니다.

AI 모델 및 LLM

Mistral Small 4는 추론, 코딩 및 다중 모드 기능을 단일 플랫폼으로 통합한 다재다능한 AI 모델입니다. 사용자는 AI 어시스턴트 및 에이전트를 효율적으로 사용자 정의하고 미세 조정하며 배포할 수 있어 다양한 기업 애플리케이션에 적합합니다.

추천AI 모델 및 LLM

Llama-3.1-8B-Instruct는 Meta에서 개발한 다국어 대형 언어 모델로, 지시 기반 작업에 최적화되어 있습니다. 상업적 및 연구 응용 프로그램을 위해 설계되었으며, 자연어 이해 및 생성에서 고급 기능을 제공합니다.

추천AI 모델 및 LLM