browser-use/video-use — Edit videos with coding agents
browser-use/video-use — 코딩 에이전트로 영상 편집하기
video-use는 원본 영상을 폴더에 넣고 Claude Code 같은 코딩 에이전트에 자연어로 편집을 지시하는 오픈소스 도구입니다. 음성 전사와 필요할 때만 생성하는 시각 자료를 조합해 컷을 결정하고, ffmpeg로 렌더링한 결과를 컷 경계마다 다시 검사합니다.
- 주제
AI 요약
video-use는 원본 영상을 폴더에 넣은 뒤 Claude Code, Codex, Hermes, Openclaw 같은 셸 접근 가능 에이전트에 편집을 지시하는 오픈소스 프로젝트입니다. 에이전트가 소스를 확인하고 편집 전략을 제안하면 사용자가 승인합니다. 이후 결과물을 <videos_dir>/edit/final.mp4에 저장합니다. 말 더듬이나 불필요한 추임새, 테이크 사이의 빈 공간을 자르고, 영상 성격에 맞춰 색보정을 적용하며, 컷마다 30ms 오디오 페이드를 넣어 팝 노이즈를 줄입니다.
편집 기능
자막은 기본적으로 두 단어씩 묶은 대문자(UPPERCASE) 형태로 영상에 입힙니다. 자막 스타일은 바꿀 수 있습니다. 애니메이션 오버레이는 HyperFrames, Remotion, Manim, PIL 중 하나를 사용해 만들고, 애니메이션마다 하위 에이전트를 하나씩 실행해 병렬 처리합니다. 말하는 영상, 몽타주, 튜토리얼, 여행 영상, 인터뷰처럼 콘텐츠 유형별 프리셋이나 메뉴에 의존하지 않는 방식입니다.
세션 상태는 project.md에 저장합니다. 다음 주에 같은 프로젝트를 다시 열어도 이전 작업 맥락을 이어갑니다. 항상 켜 둔 편집 환경이 필요하면 Browser Use Box에서 에이전트를 실행하고 VPS나 Telegram과 연결할 수 있습니다.
영상 정보를 LLM에 전달하는 방식
LLM이 영상을 프레임 단위로 직접 보는 구조는 아닙니다. 먼저 각 소스를 ElevenLabs Scribe로 한 번씩 전사합니다. 전사 결과에는 단어 단위 타임스탬프, 화자 분리 정보, 웃음·박수·한숨 같은 오디오 이벤트가 포함됩니다. 모든 테이크는 하나의 takes_packed.md 파일로 묶이며, 크기는 약 12KB입니다. 예를 들어 다음처럼 구간과 화자, 발화를 읽습니다.
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
필요한 순간에는 timeline_view가 특정 시간 범위의 필름스트립, 파형, 단어 라벨을 PNG로 만듭니다. 모호한 멈춤 구간, 재촬영 비교, 컷 지점 확인처럼 판단이 필요한 경우에만 호출합니다. 원문은 프레임 30,000개를 각각 약 1,500토큰으로 보내면 4,500만 토큰 규모의 잡음이 생길 수 있다고 설명합니다. video-use는 12KB 텍스트와 소수의 PNG를 조합해 이 부담을 줄입니다. 브라우저 자동화 도구가 스크린샷 대신 구조화한 DOM을 제공하는 방식과 같은 발상을 영상에 적용한 셈입니다.
렌더링과 자체 검증
전체 흐름은 Transcribe → Pack → LLM Reasons → EDL → Render → Self-Eval입니다. LLM은 음성 경계와 침묵 구간을 중심으로 컷을 정하고 EDL(Edit Decision List)을 만든 뒤 렌더링합니다. 렌더링이 끝나면 모든 컷 경계에서 timeline_view를 다시 실행합니다. 이 단계에서 화면의 갑작스러운 점프, 오디오 팝, 가려진 자막을 확인합니다. 문제가 발견되면 수정하고 다시 렌더링하며, 재시도 횟수는 최대 3회입니다. 검사를 통과한 뒤에야 미리보기를 보여줍니다.
프로젝트는 음성을 편집의 기본 신호로 삼고 영상 정보는 필요할 때 보완합니다. 사용자의 전략 승인을 먼저 받고 실행하며, 편집 후 자체 검증과 세션 저장까지 이어집니다. 문서에는 제작상 지켜야 할 규칙 12개를 두고, 콘텐츠에 맞는 편집 감각은 에이전트의 판단에 맡긴다고 적혀 있습니다.
설치와 사용
수동 설치는 저장소를 클론한 뒤 Claude Code나 Codex의 skills 디렉터리에 심볼릭 링크를 만드는 방식입니다. 의존성은 uv sync 또는 pip install -e .로 설치하고, 필수 도구인 ffmpeg를 준비합니다. 온라인 소스를 내려받으려면 선택 사항인 yt-dlp도 설치합니다. .env 파일에 ELEVENLABS_API_KEY를 등록하면 됩니다.
에이전트에는 먼저 저장소의 install.md를 읽고 ffmpeg와 스킬을 설정하라고 지시합니다. 설치 뒤에는 SKILL.md와 helpers/를 읽게 합니다. helpers 디렉터리에 실제 편집 스크립트가 들어 있기 때문입니다. 설치 과정에서 전사를 임의로 시작하지 않고, API 키를 한 번 요청한 뒤 준비가 끝났다고 알리고 원본 폴더를 기다리도록 구성합니다. 이후 영상 폴더에서 edit these into a launch video처럼 자연어 명령을 입력하면 소스를 정리하고 전략을 제안한 뒤 승인된 편집을 수행합니다.
원문: GitHub / 번역·요약: Trawling