The Stack I'd Need for Claude to Direct a Whole YouTube Video in Blender
Claude가 Blender에서 유튜브 영상 전체를 연출하려면 필요한 기술 스택
Blender를 처음 다룬 뒤 Claude Code와 3D 장면을 만든 저자가, 한 문단으로 유튜브 영상 초안을 만드는 자동화 구성을 제안합니다. LLM에는 코드와 장면 구성을 맡기고, 사람의 움직임·음성·효과음은 전문 도구에서 가져오며 각 장면을 자동 검사하는 방식입니다.
- 주제
AI 요약
저자는 앞선 글 두 편에서 Blender를 처음 사용해 Claude Code와 3D 장면을 만들었습니다. Claude는 bpy 코드 작성, 깨진 텍스처 연결, 타임라인 편집에는 능했지만, 사람이 점프한 뒤 착지하는 동작을 만들어내지는 못했습니다. 실제 동작은 모션 캡처 자료인 Mixamo에서 가져왔습니다. 저자는 이 경험을 바탕으로 LLM에는 구조와 코드를 맡기고, 인체 동작·음성·효과음처럼 전문성이 필요한 요소는 각각 적합한 도구에서 가져오는 영상 제작 구성을 제안합니다.
Blender 연결과 연출 도구
저자는 Blender용 MCP 서버 네 가지를 비교합니다. 기존에 사용한 mcp-for-blender는 Python 코드 실행과 뷰포트 스크린샷을 제공하고 Poly Haven, Sketchfab 등에서 에셋을 가져오는 기능도 포함합니다. Blender 개발자가 만든 공식 MCP는 복잡한 장면과 노드 설정을 파악하는 데 초점을 둡니다. 저자의 선택은 mcp-for-blender 하나를 제작용 브리지로 쓰고, 공식 서버는 장면 성능 문제를 조사할 때 활용하는 방식입니다.
도구가 많다고 작업이 나아지는 것도 아니라고 지적합니다. MCP 도구마다 이름, 설명, 인자 스키마가 붙고, 모델은 여러 도구 중 하나를 골라야 합니다. Blender 조작이 결국 bpy 코드로 이어지는 만큼, 저자는 248개 도구를 제공하는 서버보다 bpy 코드를 실행하는 도구 하나와 코드 작성 능력이 낫다고 봅니다. 다만 LLM이 만든 코드를 별도 보호 장치 없이 Blender에서 실행하는 MCP 서버가 있으므로, 민감한 정보가 없는 가상 머신이나 별도 환경에서 사용하라는 경고도 짚습니다.
카메라 움직임과 조명은 매번 자연어로 새로 지시하기보다 검증된 코드가 붙은 Claude Code 스킬로 만듭니다. 예를 들어 establishing_wide, push_in, orbit 같은 카메라 동작과 rainy_night, golden_hour 같은 조명 설정을 미리 준비합니다. 그러면 모델은 카메라 움직임을 직접 발명하지 않고, 스킬을 조합해 장면을 구성합니다.
인체 동작과 얼굴 애니메이션
저자는 LLM에 사람의 관절 움직임을 키프레임으로 만들게 하지 말라고 권합니다. 모션 캡처에는 체중 이동과 착지 뒤의 흔들림처럼 사람다운 요소가 담겨 있기 때문입니다. 후보로는 자동 리깅과 애니메이션 클립을 제공하는 Mixamo, 약 2,500개 클립이 있는 CMU Motion Capture Database, 단일 카메라로 직접 연기한 동작을 얻는 Rokoko Vision을 꼽습니다. CMU 자료에는 리타게팅 과정이 필요하고, Mixamo 캐릭터에는 무료 Mixamo Rig 확장 기능을 쓰거나 약 50달러인 Auto-Rig Pro를 사용할 수 있다고 설명합니다.
대사 장면에서는 먼저 음성을 생성한 뒤 얼굴을 맞춥니다. Rhubarb Lip Sync는 음성 파일에서 입 모양 변화를 읽어 타임스탬프가 붙은 JSON을 만듭니다. 이 자료를 Blender의 shape key에 연결하면 대사에 맞춰 입 모양을 키프레임으로 기록할 수 있습니다. 저자는 눈 깜빡임을 2~6초 간격으로 넣고, 인물이 반응하는 대상을 향해 시선을 조금 움직이는 작업도 절차적으로 처리할 수 있다고 설명합니다.
에셋과 오디오
Poly Haven은 CC0 라이선스의 HDRI, 텍스처, 모델을 제공하며, 저자는 HDRI만으로도 장면의 조명과 현실감을 개선할 수 있다고 말합니다. Sketchfab은 모델이 다양하지만 에셋마다 라이선스를 확인해야 합니다. 없는 소품은 Hunyuan3D, TripoSR 같은 이미지·텍스트 기반 3D 도구로 만들 수 있습니다. 다만 생성 모델은 삼각형이 지나치게 촘촘한 메시를 만들기 쉬워, 휘어야 하는 인물이나 주요 캐릭터에는 부적합할 수 있습니다. 저자는 배경 소품은 생성 모델로 만들고, 주인공은 직접 만들거나 기존 에셋을 쓰는 방향을 제안합니다.
오디오는 대사, 효과음·환경음, 음악을 별도 트랙으로 유지합니다. 대사를 먼저 만들어야 입 모양을 맞출 수 있고, FFmpeg의 sidechaincompress 필터를 쓰면 대사가 나올 때 음악 음량을 자동으로 낮출 수 있습니다. 트랙을 하나로 합쳐버리면 음량 조정이나 자동 덕킹을 따로 할 수 없습니다. 음악 생성 도구로는 로컬 실행이 가능한 stable-audio-tools도 소개하며, 수익화 채널에 사용할 때 라이선스를 확인하라고 덧붙입니다.
렌더링과 장면별 검사
Blender는 UI 없이 실행하는 headless 모드로 구동하고, 최종 영상 파일 대신 프레임 이미지 시퀀스로 렌더링합니다. 렌더 도중 문제가 생겨도 실패한 프레임부터 다시 작업할 수 있기 때문입니다. 초안은 360p로 만들고 카메라, 조명, 연속성을 검토한 뒤 최종 렌더를 진행합니다. FFmpeg가 프레임과 대사·효과음·음악 트랙을 MP4로 합칩니다. 제시한 명령에서는 libx264와 yuv420p를 사용하고, 대사 트랙을 음악 음량 조절의 기준으로 연결합니다.
검수에는 시각적 확인과 자동 검사를 모두 둡니다. Claude는 여러 프레임을 모은 contact sheet를 보고 구도, 조명, 분위기를 확인합니다. 별도 스크립트는 발이 바닥에 닿는지, 인물이 장면 밖으로 벗어나지 않는지, 컷 사이에 위치가 튀지 않는지, 텍스처가 빠지지 않았는지 검사합니다. 정지 이미지 몇 장만 보면 프레임 사이의 순간적인 튐을 놓칠 수 있으므로, 수치로 확인할 항목은 assertion으로 검사합니다.
한 문단을 장면 계획으로
전체 제작 과정은 Claude가 한 문단을 YAML 형식의 샷 목록으로 바꾸는 데서 시작합니다. YAML에는 프레임률, 캐릭터, 샷 길이, 배경, 카메라 스킬, 모션 클립, 대사와 효과음이 들어갑니다. 각 샷은 대사·효과음 생성, 립싱크, 에셋과 동작 연결, bpy 스크립트 실행, 저해상도 렌더링, 자동 검사와 시각 검토를 거칩니다. 실패한 샷만 다시 만들기 때문에 영상 전체를 처음부터 렌더링하지 않아도 됩니다.
저자는 이 구성이 Pixar 수준의 단편을 만든다고 주장하지 않습니다. 목표는 한 달 전에는 만들지 못했던 30초 장면을, 인물 동작과 대사 입 모양, 배경음까지 갖춰 기계가 조립하는 것입니다. 도입 순서도 제시합니다. 먼저 Blender 브리지와 카메라·조명 스킬을 안정화하고, 모션 자료와 리깅을 연결합니다. 그다음 오디오와 얼굴 애니메이션을 붙이고, 자동 검사를 여러 샷에 적용한 뒤 마지막으로 전체를 지휘하는 디렉터 스킬을 만듭니다.
원문: dev.to / 번역·요약: Trawling