meituan-longcat/LongCat-Video
Meituan LongCat-Video, 여러 영상 생성 작업을 지원하는 136억 매개변수 모델
Meituan이 공개한 LongCat-Video는 텍스트·이미지 기반 영상 생성과 기존 영상 이어 만들기를 한 모델에서 지원합니다. 시간·공간 축의 단계적 생성과 Block Sparse Attention으로 추론 효율을 높였으며, 모델 가중치는 MIT 라이선스로 공개했습니다.
- 주제
AI 요약
Meituan LongCat 팀이 공개한 LongCat-Video는 매개변수 136억 개를 갖춘 영상 생성 모델입니다. Text-to-Video, Image-to-Video, Video-Continuation을 단일 모델과 통합 프레임워크로 처리합니다. 저장소에는 기본 모델과 오디오 기반 인물 영상 생성 모델인 LongCat-Video-Avatar, Whisper-Large-v3 인코더와 증류 추론을 적용한 Avatar 1.5도 함께 안내되어 있습니다.
긴 영상 생성과 추론
LongCat-Video는 Video-Continuation 작업으로 사전 학습했습니다. 이를 바탕으로 색이 변하거나 화질이 낮아지는 현상을 억제하면서 수 분 길이의 영상을 생성한다고 설명합니다. 추론 단계에서는 시간축과 공간축 모두에서 거친 결과를 먼저 만들고 세부 결과를 보완하는 coarse-to-fine 전략을 사용합니다. 고해상도 처리 효율은 Block Sparse Attention으로 높입니다. 저장소는 720p, 초당 30프레임 영상을 수 분 안에 생성한다고 밝히지만, 이 성능은 사용 하드웨어와 설정에 따라 달라질 수 있습니다.
평가 결과
팀은 자체 Text-to-Video 평가에서 LongCat-Video의 텍스트 정합도 3.76, 시각 품질 3.25, 동작 품질 3.74, 종합 품질 3.38점을 제시했습니다. 비교 대상 중 공개 모델인 Wan 2.2-T2V-A14B는 각각 3.70, 3.26, 3.78, 3.35점입니다. Image-to-Video 평가에서는 LongCat-Video가 이미지 정합도 4.04, 텍스트 정합도 3.49, 시각 품질 3.27, 동작 품질 3.59, 종합 품질 3.17점을 기록했습니다. 해당 표에서 Wan 2.2-I2V-A14B의 종합 품질은 3.26점입니다. 평가는 팀의 내부 벤치마크 결과이며, 저장소는 여러 보상 신호를 사용하는 Group Relative Policy Optimization(GRPO) 기반 RLHF도 모델 학습에 활용했다고 설명합니다.
실행과 공개 범위
저장소는 Python 3.10, PyTorch 2.6.0, CUDA 12.4 환경 설치 예시를 제공합니다. FlashAttention-2를 기본으로 사용하며 설정을 바꿔 FlashAttention-3 또는 xformers를 적용할 수 있습니다. 텍스트·이미지 입력, 영상 이어 만들기, 긴 영상, 대화형 영상 생성용 실행 스크립트가 있고 단일 GPU와 다중 GPU 실행 예시도 포함합니다. 모델 가중치는 Hugging Face에서 내려받으며 MIT 라이선스로 공개했습니다. 캐시 가속 도구 CacheDiT를 적용하면 정밀도 손실이 두드러지지 않는 조건에서 약 1.7배 속도를 높였다는 외부 기여도 소개합니다.