akatz-ai/MiniMax-H3-Character-Swap-LoRA
MiniMax H3 캐릭터 교체 LoRA — 장면 보존을 목표로 한 실험 어댑터
Akatz Labs가 MiniMax H3용으로 학습한 캐릭터 교체 LoRA를 공개했습니다. 배경 보존은 기본 모델보다 나은 경우가 있었지만 긴 영상의 움직임과 표정, 장면 전환은 불안정하며, 라이선스의 표준 허용 지역에서 한국이 제외됩니다.
- 주제
AI 요약
Akatz Labs가 영상 속 인물을 참고 이미지의 캐릭터로 바꾸는 실험용 LoRA를 공개했습니다. 원본 장면은 유지하면서 선택한 인물만 교체하는 작업을 목표로 합니다. 제작자의 로컬 비교에서는 기본 모델보다 배경을 더 잘 보존하는 사례가 있었지만, 움직임의 타이밍과 표정, 급격한 장면 전환은 여전히 불안정했습니다.
설치와 사용
공개된 파일은 1,000 업데이트 시점의 최종 체크포인트 하나입니다. 독립 실행 모델이 아니라 어댑터이므로 MiniMax H3 기본 모델과 VAE를 별도로 준비해야 합니다. H3 Ref2VA를 지원하는 런타임이 필요하며, ComfyUI에서는 .safetensors 파일을 ComfyUI/models/loras/ 또는 설정한 공용 LoRA 디렉터리에 둡니다. 호환되는 모델 전용 LoRA 로더로 H3 모델에 연결하고 강도는 1.0부터 시작합니다. Turbo LoRA, Spectrum, Sol attention은 이 캐릭터 교체 LoRA의 필수 조건이 아닙니다.
입력 영상은 <Video 1>, 교체할 캐릭터 이미지나 캐릭터 시트는 <Picture 1>로 지정합니다. 프롬프트에서 교체 대상 인물을 설명해야 하며, 학습 과정에 별도의 트리거 단어는 사용하지 않았습니다. 제작자는 원본 영상의 카메라와 배경, 조명, 사물, 다른 인물을 보존하고 대상의 위치와 크기, 자세, 움직임을 맞추라고 안내합니다. 다만 보존 지시가 일부 평가에서 도움이 됐어도 프롬프트가 원본과의 엄격한 일치를 보장하지는 않습니다. 표정 지시를 강하게 넣으면 교체 자체가 잘 되지 않는 경우도 있었습니다.
학습 데이터와 설정
학습에는 합성 이미지 편집 트립렛 94개와 변경하지 않는 영상·오디오 예시 40개를 준비했습니다. 이 가운데 편집 데이터 76개와 정규화 클립 32개를 최적화에 사용하고, 편집 데이터 18개와 클립 8개는 평가용으로 남겼습니다. 편집 대상은 단일 정지 이미지이며, 원본 영상 제어 자료도 5프레임짜리 정지 영상입니다. 따라서 긴 영상에서 움직이는 인물을 교체하는 목표로 학습한 데이터는 아닙니다. 여러 화풍과 캐릭터 시트를 포함하지만 교체 대상은 한 인물입니다.
학습은 RunPod RTX PRO 4500 Blackwell 32GB에서 진행했습니다. 1,000회 업데이트 동안 250회마다 저장했고, LoRA rank와 alpha는 각각 16으로 설정했습니다. 최적화에는 AdamW8bit와 학습률 5e-5를 사용했습니다. 정밀도는 BF16이며, transformer에는 convrot8, 텍스트 인코더에는 NVFP4를 적용했습니다. 메모리 절약을 위해 gradient checkpointing, layer offload, 캐시된 latent와 텍스트, chunked MLP를 사용했습니다. 제작자가 제시한 야간 대여 비용 약 11달러는 추정치이며 측정된 비용 벤치마크는 아닙니다.
평가와 한계
짧고 연속적인 약 4~5초 영상이 14초 전체 구간보다 나은 결과를 보였지만, 정확한 최대 길이는 확인되지 않았습니다. 24fps와 런타임이 지원하는 H3 프레임 그리드를 사용해야 합니다. 긴 구간에서는 구도나 인물 위치, 원본 타이밍이 어긋날 수 있고, 급격한 장면 전환이 줌이나 점진적인 위치 이동으로 바뀌기도 합니다. 얼굴 클로즈업의 표정은 원본 연기와 맞지 않을 수 있습니다. 두 인물 입력도 시험했지만 여러 인물을 교체하는 목표는 학습 데이터에서 다루지 않았습니다.
일부 연속 구간에서는 짧은 영상 조각을 이어 붙이는 방식이 연결부를 개선했지만, 카메라 컷 타이밍이나 원본 준수를 보장하지는 않았습니다. 오디오도 초기 비교에서는 더 가까운 사례가 있었으나 연속 생성 시험에서는 건너뛰거나 어긋났습니다. 이후 평가에서 원본 오디오를 생성 영상에 복사한 결과는 후처리이므로 LoRA의 오디오 충실도를 입증하지 않습니다. 오디오를 다시 합쳐도 립싱크 어긋남은 해결되지 않습니다. 다음 실험으로는 움직임에 맞춘 교체 데이터, 급격한 컷 예시, 표정 감독, 긴 시퀀스를 계획하고 있습니다. VRAM을 늘리면 품질이 개선된다는 근거는 제시하지 않았습니다.
라이선스
어댑터는 MiniMax H3 Community License Agreement를 따릅니다. Apache-2.0 라이선스가 아니며, 표준 사용 허용 지역에서 미국, EU, 영국, 대한민국을 제외하고 별도 승인을 언급합니다. 사용이나 배포 전에 전체 약관을 확인해야 합니다. 별도로 공개한 데이터셋은 Akatz Labs 기여분에 Apache-2.0을 적용하고 원본 VidGen 라이선스와 출처를 유지합니다. 데이터셋 라이선스가 어댑터의 이용 조건을 대신하지는 않습니다.
원문: Hugging Face / 번역·요약: Trawling