Hugging Face

facebook/sam3

Meta, 이미지·영상에서 텍스트로 객체를 찾고 추적하는 SAM 3 공개

SAM 3는 텍스트나 시각 프롬프트로 이미지·영상 속 객체를 분할하고 추적하는 기반 모델입니다. 짧은 텍스트가 가리키는 개념에 해당하는 객체를 빠짐없이 찾는 기능을 도입했으며, Meta는 27만 개 개념으로 구성한 SA-CO 벤치마크에서 인간 성능의 75~80%를 기록했다고 밝혔습니다.

AI 요약

Meta가 공개한 SAM 3는 이미지와 영상에서 객체를 분할하는 통합 기반 모델입니다. 텍스트 문구뿐 아니라 점, 박스, 마스크 같은 시각 프롬프트도 입력으로 받습니다. SAM 2가 프롬프트로 지정한 개별 객체를 분할하는 데 초점을 뒀다면, SAM 3는 짧은 문구나 예시 이미지가 가리키는 개념에 해당하는 객체 인스턴스를 이미지 안에서 모두 찾아 분할하는 Promptable Concept Segmentation(PCS)을 지원합니다.

개방형 어휘 개념 분할

예를 들어 텍스트로 “귀”나 “손잡이”를 입력하면 해당 개념에 맞는 객체들을 찾습니다. 텍스트만으로 결과를 좁히기 어렵다면 양성 박스로 포함할 영역을 지정하거나 음성 박스로 제외할 영역을 알려줄 수 있습니다. 여러 점이나 박스를 함께 입력해 분할 결과를 조정하는 방식도 제공합니다. 모델은 객체별 마스크와 바운딩 박스, 점수를 반환하며, 인스턴스 분할 외에 단일 채널 의미론적 분할 결과도 제공합니다.

Meta는 개방형 어휘 프롬프트의 범위를 기존 연구보다 크게 넓혔다고 설명합니다. 새로 만든 SA-CO 벤치마크에는 고유 개념 27만 개가 포함됩니다. Meta에 따르면 이는 기존 벤치마크보다 50배 이상 큰 규모이며, SAM 3는 해당 벤치마크에서 인간 성능의 75~80%를 기록했습니다. 이 수치는 모델 카드에 제시된 Meta의 평가 결과입니다.

이미지와 영상 처리

이미지에서는 Hugging Face Transformers의 Sam3Model과 Sam3Processor를 사용해 모델을 불러오고, 텍스트나 박스 프롬프트를 전달할 수 있습니다. 여러 이미지를 배치로 처리하면서 이미지마다 다른 텍스트 프롬프트를 주거나, 한 이미지에는 텍스트를 주고 다른 이미지에는 박스를 주는 구성도 안내합니다. 반환된 마스크는 원본 이미지 크기로 후처리할 수 있습니다.

영상용 SAM 3는 텍스트 프롬프트에 맞는 여러 객체를 프레임마다 검출하고 추적합니다. 미리 준비한 영상 프레임을 처리하는 방식과 프레임이 도착하는 대로 처리하는 스트리밍 방식을 모두 제공합니다. 예제에서는 “사람”을 텍스트 프롬프트로 입력해 51개 프레임을 처리하고 객체 ID, 점수, 박스, 마스크를 확인합니다.

기존 SAM 2 작업 흐름과의 호환

모델 카드에는 객체 단위 추적을 위한 Sam3Tracker와 Sam3TrackerVideo도 소개합니다. 이 변형은 점, 박스, 마스크 같은 시각 프롬프트로 지정한 특정 객체를 이미지에서 분할하거나 영상 전체에 걸쳐 추적합니다. SAM 2 및 SAM 2 Video와 같은 API를 유지하면서 성능을 개선한 대체 모델로 설명하며, 기존 SAM 2 작업 흐름에 적용하는 방법을 제공합니다. 공식 코드는 sam3 저장소에서 공개했습니다.

모델을 내려받으려면 연락처 정보를 Meta와 공유하는 조건에 동의해야 합니다. 모델 카드에는 PyTorch와 Transformers를 이용한 이미지·영상 추론 예제가 함께 실려 있습니다.

원문: Hugging Face / 번역·요약: Trawling