설명
AI 기반 이미지 및 비디오 세분화의 중요한 발전인 Meta Segment Anything Model 2 (SAM 2)를 소개합니다. Meta FAIR에서 개발한 SAM 2는 놀라운 속도와 정확도로 정적 이미지와 동적 비디오 모두에서 객체를 세분화할 수 있는 최초의 통합 모델입니다. 이 강력한 도구를 사용하면 클릭, 경계 상자 또는 마스크와 같은 간단한 입력을 사용하여 이미지 또는 비디오 프레임 내의 모든 객체를 선택할 수 있습니다.
SAM 2의 핵심 혁신은 프롬프트 가능한 세분화를 비디오 도메인으로 확장하는 능력에 있습니다. 프레임 간에 대상 객체에 대한 정보를 유지하는 세션별 메모리 모듈을 통합합니다. 이를 통해 SAM 2는 이전 프레임의 컨텍스트 정보를 활용하여 객체가 일시적으로 시야에서 사라지더라도 선택한 객체를 추적할 수 있습니다. 또한 사용자는 모든 프레임에서 추가 프롬프트를 제공하여 모델 예측을 개선할 수 있으므로 세분화 마스크를 정밀하게 조정할 수 있습니다.
이 모델은 제로샷 성능이 뛰어나 훈련 중에 접하지 않은 객체, 이미지 및 비디오를 효과적으로 세분화할 수 있습니다. 이러한 적응성 덕분에 SAM 2는 광범위한 실제 애플리케이션에 적합합니다. 디자인은 스트리밍 추론을 통한 효율적인 비디오 처리를 우선시하여 실시간 상호 작용 애플리케이션을 촉진합니다. SAM 2는 객체 세분화에서 기존 모델을 능가하는 최첨단 성능을 달성하며, 특히 객체 부분을 추적하고 다른 대화형 비디오 세분화 방법과 비교하여 상호 작용 시간이 덜 필요합니다.
Meta는 오픈 혁신에 전념하여 사전 훈련된 SAM 2 모델, SA-V 데이터셋, 데모 및 관련 코드를 연구 커뮤니티에 공개합니다. 약 51,000개의 비디오에 걸쳐 600,000개 이상의 마스크릿으로 구성된 SA-V 데이터셋은 대화형 모델 인 루프 데이터 엔진을 사용하여 생성되었으며 지리적 다양성과 실제 시나리오를 강조합니다. 이 릴리스는 AI 기반 세분화 분야의 추가 연구 및 개발을 촉진하는 것을 목표로 합니다.
Meta Segment Anything Model 2 하이라이트
이미지와 비디오를 위한 통합 세분화 모델
클릭, 상자 또는 마스크 프롬프트를 통한 정확한 객체 선택
비디오 프레임 간 객체 추적을 위한 세션별 메모리 모듈
모든 프레임에서 추가 프롬프트를 사용한 개선 기능
보지 못한 객체 및 비디오에 대한 강력한 제로샷 성능
스트리밍 추론을 통한 실시간 상호 작용
객체 세분화에서 최첨단 성능
기존 비디오 객체 세분화 모델 능가
전통적인 방법보다 적은 상호 작용 시간 필요
오픈 소스 사전 훈련된 모델, 데이터셋 및 코드
600K 이상의 마스크릿을 포함하는 크고 다양한 SA-V 데이터셋
훈련 데이터의 지리적으로 다양한 실제 시나리오
다른 AI 시스템과의 통합을 위한 확장 가능한 출력
창의적인 실시간 상호 작용을 위한 확장 가능한 입력
Meta Segment Anything Model 2 시작하기
데모 탐색: SAM 2와 상호 작용하여 샘플 이미지 및 비디오에서 객체를 세분화합니다.
모델 다운로드: 프로젝트에 통합하기 위해 사전 훈련된 SAM 2 모델을 얻습니다.
데이터셋 탐색: 훈련 및 연구 목적으로 SA-V 데이터셋에 액세스합니다.
SAM 2 통합: 사용자 지정 세분화 작업을 위해 모델의 API 또는 코드를 활용합니다.
예측 개선: 필요한 경우 추가 프롬프트를 사용하여 세분화 마스크를 조정합니다.
애플리케이션에 적용: 비디오 편집, 콘텐츠 제작 등을 위해 SAM 2의 기능을 활용합니다.
Meta Segment Anything Model 2의 사용 사례
- 비디오 객체 추적
- 이미지 세분화
- 대화형 비디오 편집
- 콘텐츠 제작
- 실시간 애플리케이션
- AI 연구
- 객체 마스크 생성
- 제로샷 세분화










