← 가이드 목록비디오
ComfyUI 비디오 생성 가이드: Text-to-Video & Image-to-Video
Wan 2.2, HunyuanVideo, LTX-Video 모델로 AI 비디오를 생성하는 방법을 안내합니다.
2026-03-17AI 영상 생성의 현재
이미지 생성이 한 장을 만드는 일이라면, 영상 생성은 여러 장을 만들되 서로 자연스럽게 이어지게 만드는 일입니다. 장수가 늘어난 만큼 자원 요구도 함께 늘어납니다.
■ 두 가지 방식
• Text-to-Video (t2v) — 문장만으로 영상을 만듭니다. 자유롭지만 결과 예측이 어렵습니다.
• Image-to-Video (i2v) — 시작 이미지를 주고 그것을 움직입니다. 통제가 쉬워 실용적입니다.
원하는 장면이 명확하다면 먼저 이미지로 완성한 뒤 i2v로 움직이는 편이 훨씬 효율적입니다. 마음에 드는 첫 프레임을 확보하고 시작하기 때문입니다.
■ 현실적인 기대치
현재 개인 장비로 만들 수 있는 것은 대개 2~5초 분량입니다. 그 이상은 VRAM과 시간이 급격히 늘어나며, 뒤로 갈수록 형태가 무너지는 경향이 있습니다.
긴 영상이 필요하다면 짧은 클립을 여러 개 만들어 편집으로 잇는 방식이 현실적입니다.
■ 잘 되는 것과 안 되는 것
카메라가 천천히 움직이거나, 머리카락과 옷이 흔들리거나, 배경 요소가 미세하게 움직이는 것은 잘 표현됩니다.
반대로 걷기·달리기 같은 전신 동작, 손으로 물건을 다루는 정밀한 동작, 여러 인물의 상호작용은 아직 어렵습니다. 얼굴이 바뀌거나 팔다리가 뒤엉키는 경우가 많습니다.
필요한 준비물
영상 모델은 이미지 모델과 구성이 다릅니다. 확산 모델, 텍스트 인코더, 전용 VAE를 따로 불러옵니다.
models/unet/ 확산 모델
models/clip/ 텍스트 인코더
models/vae/ 영상용 VAE
워크플로우도 UNETLoader, DualCLIPLoader, VAELoader로 시작하며, 마지막 저장 노드가 SaveImage가 아니라 애니메이션 저장 노드로 바뀝니다.
■ VRAM 요구
영상 생성은 이미지보다 훨씬 무겁습니다. 잠재 데이터가 프레임 수만큼 곱해지기 때문입니다.
• 12GB — 낮은 해상도의 짧은 클립. 경량 버전 필요.
• 16GB — 실용적인 최소 구간입니다.
• 24GB 이상 — 여유롭게 작업 가능.
■ 생성 시간
이미지 한 장이 수 초라면 영상은 수 분에서 수십 분입니다. 설정을 잘못 잡고 오래 기다린 뒤 실패하는 일이 흔하므로, 먼저 아주 짧고 낮은 해상도로 시험한 뒤 본 작업에 들어가세요.
■ 결과 저장 형식
애니메이션 WebP나 GIF로 저장할 수 있고, 프레임을 낱장 이미지로 저장한 뒤 편집 프로그램에서 합치는 방법도 있습니다. 후자가 품질과 편집 자유도 면에서 유리합니다.
설정값 다루기
■ 프레임 수
가장 직접적으로 부담을 결정합니다. 16~24프레임에서 시작하세요. 초당 프레임을 8로 두면 16프레임은 2초입니다.
프레임을 두 배로 늘리면 메모리와 시간도 대략 두 배가 됩니다.
■ 해상도
이미지보다 낮게 잡는 것이 정상입니다. 512~768 구간에서 시작하고, 결과가 만족스러우면 업스케일로 키우세요. 처음부터 1024로 만들려 하면 대부분 메모리 부족으로 끝납니다.
■ steps
20~30이면 충분합니다. 영상은 프레임마다 계산하므로 steps를 올리면 시간이 크게 늘어납니다. 실험 단계에서는 15 정도로 두세요.
■ 움직임의 크기
모델에 따라 움직임 강도를 조절하는 값이 있습니다. 너무 크게 주면 형태가 무너지고, 너무 작으면 정지 화면처럼 보입니다. 중간값에서 시작해 조금씩 조정하세요.
■ 시드
같은 시드에 같은 설정이면 같은 영상이 나옵니다. 마음에 드는 움직임이 나왔다면 시드를 기록해두고 프롬프트만 미세 조정하세요.
■ i2v에서 첫 프레임
시작 이미지의 품질이 결과를 크게 좌우합니다. 흐릿하거나 구도가 애매한 이미지를 넣으면 영상도 그렇게 나옵니다. 이미지 단계에서 충분히 다듬은 뒤 넘기세요.
품질을 올리는 방법
■ 프롬프트에 움직임을 명시
정적인 묘사만 적으면 거의 움직이지 않습니다. 무엇이 어떻게 움직이는지 적으세요. "카메라가 천천히 앞으로", "머리카락이 바람에 날린다"처럼 구체적일수록 좋습니다.
반대로 너무 많은 동작을 요구하면 서로 충돌해 뭉개집니다. 하나의 주된 움직임에 집중하세요.
■ 프레임 보간
만들어진 영상의 프레임 사이를 채워 부드럽게 만드는 방법입니다. 8프레임으로 만든 것을 16이나 24로 늘려 재생하면 훨씬 자연스러워 보입니다.
생성 단계에서 프레임을 늘리는 것보다 자원 소모가 훨씬 적으므로 우선 고려할 만합니다.
■ 업스케일
낮은 해상도로 만든 뒤 프레임별로 키우는 방식입니다. 다만 프레임마다 다르게 처리되면 깜빡임이 생기므로, 영상용 업스케일 방법을 쓰거나 낮은 강도로 처리해야 합니다.
■ 실패를 줄이는 순서
1. 아주 짧게(8프레임), 낮은 해상도로 시험합니다. 방향이 맞는지만 봅니다.
2. 마음에 드는 시드를 찾습니다.
3. 프레임 수를 늘려 다시 만듭니다.
4. 보간과 업스케일로 마무리합니다.
처음부터 최종 설정으로 돌리면 실패했을 때 잃는 시간이 너무 큽니다.
■ 편집으로 보완하기
AI가 만든 클립을 그대로 쓰기보다, 여러 개를 만들어 좋은 구간만 잘라 잇는 편이 완성도가 높습니다. 뒷부분이 무너진 클립도 앞 1초는 쓸 만한 경우가 많습니다.
관련 가이드
ComfyUI 초보자 가이드: 설치부터 첫 이미지 생성까지
ComfyUI를 처음 시작하는 분들을 위한 완벽 가이드. 설치, 기본 개념, 첫 이미지 생성, 자주 만나는 오류 해결까지 단계별로 안내합니다.
ComfyUI 워크플로우 완벽 가이드
노드 구성부터 고급 기법까지, ComfyUI 워크플로우의 모든 것을 알아봅니다.
ComfyUI 모델 설치 및 추천 가이드
체크포인트, LoRA, ControlNet 등 다양한 모델의 설치 방법과 추천 모델을 안내합니다.
ComfyUI vs Automatic1111 WebUI: 완벽 비교 가이드
두 가지 대표적인 Stable Diffusion UI의 장단점과 사용 시나리오를 비교합니다.
ControlNet 완벽 가이드: 유형별 활용법
Canny, Depth, OpenPose, Scribble 등 ControlNet의 모든 유형과 활용 방법을 상세히 안내합니다.
LoRA 사용법과 추천: 스타일을 자유롭게 적용하기
LoRA의 개념부터 설치, 추천 모델, 고급 활용법까지 상세히 안내합니다.
VRAM 최적화 가이드: 저사양 GPU에서 최대 성능 끄어내기
4~8GB VRAM 환경에서 ComfyUI를 최적화하는 방법을 상세히 안내합니다.
Flux 모델 사용법: 차세대 AI 이미지 생성
Black Forest Labs의 Flux 모델의 특징, 설치 방법, 최적 설정을 안내합니다.
ComfyUI 커스텀 노드 추천: 필수 설치 목록
작업 효율을 높여주는 필수 커스텀 노드 팩을 소개하고 설치 방법을 안내합니다.
프롬프트 엔지니어링 가이드: AI 이미지 품질을 높이는 방법
Stable Diffusion/Flux에서 효과적인 프롬프트 작성법과 팁을 상세히 안내합니다.
