Hugging Face

pablodawson/MiniMax-H3-360-Orbit-LoRA

한 장의 사진으로 만드는 360도 카메라 오비트 LoRA

MiniMax-H3 FL2VA용 LoRA가 한 장의 사진을 시작·종료 키프레임으로 받아, 장면을 고정한 채 카메라를 360도 회전시키고 시작 프레임으로 돌아옵니다. 28개의 정적 3D Gaussian splat 장면으로 학습했으며, 현재 사람 중심의 정사각형 영상에 맞춘 좁은 범위의 실험입니다.

AI 요약

MiniMax-H3의 FL2VA 변형을 위한 LoRA입니다. 같은 이미지를 첫 프레임과 마지막 프레임에 지정하면, 피사체와 배경은 고정한 채 카메라가 주변을 한 바퀴 돌고 시작 화면으로 돌아옵니다. 클립의 처음과 끝이 같은 프레임에 맞춰져 있어 여러 영상을 이어 붙이거나 반복 재생할 때 이음새가 드러나지 않도록 설계했습니다.

기본 모델과 LoRA 비교

같은 입력 이미지와 시드, 프롬프트, 해상도, 스텝 수를 사용해 세 가지 결과를 비교합니다. 기본 모델에 첫 프레임만 주면 카메라는 움직이지만 시작 화면으로 돌아오지 않고 시점이 벗어납니다. 첫 프레임과 마지막 프레임을 모두 같은 이미지로 지정하면 기본 모델은 영상을 정지 화면처럼 해석해 움직임이 거의 없습니다. LoRA를 적용하면 카메라가 전체 궤도를 돌고 시작 프레임으로 돌아오며, 장면 전환 없이 부드럽게 움직입니다.

기존 Ref2VA(Reference-to-video)는 입력 이미지를 외형 참고 자료처럼 다룹니다. 그래서 영상이 특정 프레임에서 끝난다고 보장하기 어렵고, 여러 클립을 매끄럽게 잇기도 어렵습니다. FL2VA(First–last-frame generation)는 양 끝 프레임을 고정하지만, 두 이미지가 같으면 기본 모델이 멈추는 문제가 있습니다. 이 LoRA는 장면의 기하 구조를 유지하는 카메라 오비트 동작을 학습하고, 추론 때 FL2VA의 키프레임 고정 기능으로 양 끝을 일치시킵니다.

추론 설정과 프롬프트

제작자는 장면 속 사람과 물체의 위치, 방향, 모양, 자세를 유지하고 카메라 시차만 움직임의 원천으로 삼으라고 지시하는 프롬프트를 제공합니다. 공중에 떠 있는 물체도 흔들리거나 회전하거나 떨어지지 않도록 명시합니다. 권장 설정은 MiniMax-H3 FL2VA 프루닝 가중치, 768×768 해상도, 73프레임, 28스텝이며, LoRA 강도는 1.0입니다. 약 3초 길이로 초당 24프레임에 해당합니다. 모델은 guidance-distilled 상태라 CFG와 negative prompt를 사용하지 않습니다. 오디오도 끕니다.

가중치는 ostris/ai-toolkit과 minimax_h3 모델 확장 기능으로 학습하고 테스트했습니다. 가중치 키는 ComfyUI 명명 규칙인 diffusion_model.*을 사용합니다.

데이터와 학습 방식

학습 데이터는 인터넷에서 선별한 사람 중심의 고품질 Gaussian splat 3D 장면 28개입니다. 각 장면을 둘러싼 카메라 오비트 영상을 렌더링했습니다. 장면 자체가 정적인 3D 공간이므로 프레임마다 기하 구조가 일관됩니다. 학습 자료는 카메라만 움직이고 다른 요소는 움직이지 않는 동작을 보여주도록 구성했습니다. 영상은 768×768, 73프레임, 초당 24프레임이며, 모든 클립에 같은 프롬프트를 붙이고 캡션 드롭아웃 비율은 0.05로 설정했습니다.

학습에는 MiniMax-H3 FL2VA 프루닝 모델과 int8 ConvRot 가중치를 사용했습니다. 텍스트 인코더는 nvfp4 형식의 Qwen3-VL-32B입니다. LoRA는 rank 16, alpha 16으로 설정하고, adaln_proj를 제외한 트랜스포머 선형 계층 208개에 적용했습니다. 총 3,000스텝, 약 107에포크를 학습했으며 배치 크기는 1입니다. 옵티마이저는 8비트 AdamW이고 학습률과 weight decay는 각각 1e-4입니다. bf16 정밀도와 gradient checkpointing을 적용하고, flow matching 기반 shifted timestep 노이즈 스케줄과 MSE 손실을 사용했습니다. 학습은 NVIDIA A100 80GB 한 장에서 10시간 24분 걸렸으며, 스텝당 약 12.5초가 소요됐습니다.

적용 범위와 한계

제작자는 학습 자료가 73프레임 길이의 사람 중심 정사각형 영상 28개뿐이라 범위가 좁다고 밝힙니다. 다른 피사체와 화면 비율, 영상 길이는 시험하지 않았습니다. 결과에 눈 깜빡임 같은 미세한 움직임이 남을 수도 있습니다.

원문: Hugging Face / 번역·요약: Trawling