google/embeddinggemma-2
Google EmbeddingGemma 2, 텍스트·이미지·영상·음성을 하나의 벡터 공간에 임베딩
Google DeepMind가 텍스트와 코드, 이미지, 영상, 음성을 768차원 공간에 표현하는 오픈 임베딩 모델 EmbeddingGemma 2를 공개했습니다. 총 7억 4천만 개 매개변수로 구성되며, 모달리티별 인코더를 선택해 적재하거나 임베딩 차원을 줄여 저장 공간을 절약할 수 있습니다.
- 주제
AI 요약
EmbeddingGemma 2는 텍스트와 코드, 이미지, 영상, 음성을 하나의 768차원 벡터 공간으로 변환하는 Google DeepMind의 오픈 멀티모달 임베딩 모델입니다. Apache 2.0 라이선스로 배포하며, 모바일 기기와 노트북 같은 소비자용 하드웨어에서 검색, RAG, 분류, 군집화에 쓰도록 설계했습니다. 전체 매개변수는 7억 4천만 개입니다. 이 가운데 텍스트 모델은 2억 7천만 개이며, 비전 인코더는 1억 7천만 개, 오디오 인코더는 3억 개입니다.
모달리티별로 인코더를 선택합니다
텍스트 백본은 1억 3천만 개 매개변수, 임베더는 1억 4천만 개 매개변수로 구성됩니다. 비전·오디오 인코더는 별도 구성 요소라서 필요한 모달리티만 적재할 수 있습니다. 텍스트만 쓰면 모델 크기는 2억 7천만 개, 텍스트와 이미지를 쓰면 4억 4천만 개, 텍스트와 오디오를 쓰면 5억 7천만 개입니다. 전부 적재하면 7억 4천만 개가 됩니다.
모델은 100개가 넘는 언어를 지원하며, 이전 버전보다 코드 작업 점수가 약 14% 높아졌습니다. MTEB 다국어 v2 평균 점수는 61.36으로 이전 버전의 61.15와 비슷합니다. MTEB 코드 v1 NDCG@10 점수는 78.68로, 이전 버전의 68.76보다 높습니다. 이미지·시각 문서·영상·오디오 벤치마크도 제시하지만, 해당 항목에는 이전 버전 점수가 없습니다.
임베딩 길이를 줄여 저장 공간을 아낍니다
Matryoshka Representation Learning(MRL)을 지원해 기본 768차원 출력을 512, 256, 128차원으로 자를 수 있습니다. 256차원으로 줄이면 저장 공간은 3분의 1이며, 다국어 MTEB 점수는 61.36에서 60.41로 낮아집니다. 128차원은 저장 공간을 6분의 1로 줄이지만, 다국어 MTEB 점수는 57.89, 멀티모달 MMEB v2 종합 점수는 45.65로 하락합니다. 문서는 256차원까지 품질 저하가 작다고 설명하며, 128차원은 텍스트 전용 작업에 적합하다고 안내합니다.
차원을 자른 벡터는 다시 L2 정규화해야 합니다. 정규화하지 않으면 오류 대신 순위 품질이 조용히 떨어질 수 있습니다. 검색할 질의와 문서 벡터는 같은 차원을 써야 합니다. Sentence Transformers에서는 truncate_dim과 normalize_embeddings=True를 함께 지정할 수 있습니다.
작업에 맞는 지시문을 붙입니다
텍스트 입력에는 작업별 지시문 접두사를 붙이는 방식으로 학습했습니다. 검색처럼 질의와 문서 역할이 다른 비대칭 작업에서는 질의에 SearchQuery, 문서에 Document 같은 서로 다른 접두사를 씁니다. 분류나 유사도 비교처럼 입력끼리 대칭인 작업에서는 같은 작업 접두사를 적용합니다. 문서에 제목이 있으면 title: {title} | text: {content} 형식으로 넣고, 제목이 없으면 title: none을 씁니다. 접두사를 생략해도 작동하지만 정밀도가 낮아질 수 있습니다.
추론 시 정밀도와 입력 길이를 확인합니다
모델은 8,192토큰 문맥을 사용하며, 텍스트와 미디어를 한 입력 안에 섞을 수 있습니다. 기본 설정에서 이미지 하나는 280토큰, 영상 프레임 하나는 140토큰, 오디오는 초당 25토큰을 차지합니다. 영상은 기본 초당 한 프레임으로 처리하고, 오디오는 모노 16kHz 입력을 권장합니다. 이미지와 영상은 비전 토큰 예산을 조절해 품질과 지연 시간을 맞출 수 있습니다.
추론에는 bfloat16 또는 float32를 사용해야 합니다. float16에서는 활성값 범위를 감당하지 못해 NaN이 나오거나 임베딩 품질이 조용히 떨어질 수 있습니다. bfloat16을 지원하는 하드웨어에서는 이를 권장하며, 지원하지 않는 환경에서는 float32를 사용합니다.
학습 데이터는 웹 문서, 코드, 이미지, 영상, 오디오와 모달리티가 짝지어진 자료를 포함하며, 수집 기준 시점은 2025년 1월입니다. 데이터 준비 과정에서 아동 성착취물과 일부 개인정보 등 민감한 정보를 필터링했다고 설명합니다. 다만 임베딩 모델은 생성 모델처럼 사후 정렬이나 출력 단계 조정을 거치지 않습니다. 운영자는 검색 필터와 공정성 평가 등 실제 서비스에 맞는 안전 조치를 마련해야 합니다.
원문: Hugging Face / 번역·요약: Trawling