📌 한 줄 답
Krea 2로 플랫한 애니풍 첫 프레임을 만들고, MiniMax H3에 1초 안팎의 빠른 컷으로 넣으면 지금 바로 쓸 만한 15초 영상이 나온다.
- ✅ 잘 되는 조건: 플랫 벡터 애니 · 15초에 13컷 · 그래픽이 화면의 80%
- ⚠️ 롱테이크·클로즈업도 되지만, 틀리는 지점을 문장으로 하나씩 막아야 한다
- 🔑 핵심 요령: 첫 프레임을 보고 나서 캐릭터 설명을 다시 쓸 것
AI 영상, 데모는 멋진데 내가 뽑으면 왜 이상할까? 🤔
손가락이 녹거나, 걷는 발이 미끄러진다. 컷마다 얼굴이 조금씩 다른 사람이 되기도 한다. 근데 유료 토큰은 너무 비싸고, 로컬은 너무 너무 느려서 쓸 수가 없다. 그래서 이 지점에서 몇 번 접었다.
그런데 방향을 하나 틀었더니 결과가 달라졌다. 실사를 버리고 플랫 애니풍 + 빠른 컷으로 간 거다.
이 글은 Krea 2 MiniMax H3 영상 제작 과정을 직접 돌려 본 기록이다.
AI 영상, 실사로 뽑으면 왜 자꾸 접게 될까?
실사는 검증 기준이 현실이기 때문이다. 우리 뇌는 사람 얼굴과 걸음걸이를 평생 봐 왔기 때문에, 0.5초짜리 오차도 바로 잡아낸다.
모델이 99%를 맞춰도 남은 1%에서 들키는 것이다. 그래서 나는 전략을 바꿨다.
눈이 오차를 덜 따지는 영역으로 가보자.
Krea 2와 MiniMax H3는 각각 무슨 역할을 맡을까?
Krea 2는 그림체를 정하고, MiniMax H3는 움직임과 소리를 만든다. 역할이 겹치지 않아서 파이프라인이 단순하다.
- MiniMax H3: 텍스트·이미지·영상·오디오를 한 맥락으로 읽는 영상 모델. 2026년 7월 31일 공개됐고, 최대 15초·2K 영상을 스테레오 사운드와 함께 만든다. 첫 프레임 이미지로 시작하는 이미지투비디오(I2V)를 지원한다.
- Krea 2: Krea가 처음부터 직접 학습한 이미지 모델. 2026년 5월 12일 공개됐다. 스타일 레퍼런스와 무드보드로 그림체를 잡는 게 강점이다.
| 단계 | 도구 | 결정하는 것 |
|---|---|---|
| ① 첫 프레임 | Krea 2 | 캐릭터 외형, 그림체, 팔레트, 비율 |
| ② 영상 | MiniMax H3 (API) | 컷 구성, 카메라, 모션그래픽, BGM |
⚠️ 라이선스 확인 — 한국에서 H3 로컬 실행은 라이선스로 막혀 있다
H3 오픈 웨이트의 커뮤니티 라이선스는 한국을 자기 하드웨어 실행 제외 지역으로 명시한다(미국·EU·영국도 포함). 그래서 이 글은 로컬 ComfyUI가 아니라 MiniMax API(종량제)로 진행했다.
API는 커뮤니티 라이선스와 별개로 플랫폼 약관을 따르니, 상업적으로 쓰기 전에 약관을 직접 확인하자.
어떤 조건에서 H3 결과가 확 좋아질까?
세 가지 조건이 겹칠 때 결과가 좋아진다.
- 플랫 벡터 애니 스타일 — 음영과 그라데이션 없이, 굵은 외곽선과 색면으로만 그린 그림
- 1초 안팎의 짧은 컷 — 15초에 13컷
- 모션그래픽 80% + 캐릭터 20% — 타이포·도형·UI가 화면을 끌고, 캐릭터는 그 사이를 지나간다
이렇게 뽑았더니 솔직히 예상보다 잘 나왔다. 광고 타이틀 시퀀스처럼 보인다(제품 광고는 프롬프트를 잘 짜면 괜찮게 나오지 않을까 싶다). 🎬
Krea 2 → H3, 실제로 어떻게 만들었나?
1단계: Krea 2로 첫 프레임 1장
이미지 비율은 영상과 똑같이 맞춘다. 16:9 영상이면 이미지도 16:9다. 다르면 잘리거나 늘어나면서 레퍼런스가 망가진다.
Flat vector anime illustration, clean bold outlines, limited palette, retro graphic-poster composition, full body, standing, 16:9 landscape, placed slightly left of center so the typography stays readable on the right. [캐릭터 묘사] Background: pale ivory field with concentric flat rings in black, gold and soft magenta. Huge bold black sans-serif typography "STAGE" behind her, partially covered by her body. Palette: gold, black, ivory, soft magenta. No gradients, no photorealism, no 3D shading, no extra characters.
합격 기준을 미리 정해 두면 뒤가 편하다.
- 배경이 플랫할 것 — 질감이 들어가면 영상에서 반실사로 흐른다
- 전신이 잘리지 않을 것 — 뛰는 동작에는 다리·신발 정보가 필요하다
- 눈에 띄는 식별 요소 2개 이상 — 미세한 디테일은 컷이 넘어가면 사라진다

2단계: H3 API에 첫 프레임 + 컷 단위 프롬프트
이미지를 첫 프레임으로 넣고 I2V로 요청한다. 길이·해상도는 프롬프트가 아니라 요청 설정값이 정한다.

왜 이 조합이 잘 맞을까?
※ 아래 네 가지는 영상 결과를 보고 세운 내 해석이다.
- 플랫 애니는 어색함의 기준선이 낮다. 대조할 현실이 없으니 작은 오류가 그림체로 읽힌다.
- 짧은 컷은 무너질 시간을 안 준다. 캐릭터가 조금씩 변하는 드리프트가 쌓이기 전에 컷이 바뀐다.
- 도형과 글자는 틀리기 어렵다. 사람 손보다 사각형이 쉽다. 그래픽이 부담을 나눠 가진다.
- 비트에 맞춘 하드컷은 원래 편집 문법이다. 연결이 조금 튀어도 리듬으로 흡수된다.
그대로 쓸 수 있는 H3 프롬프트 뼈대는?
캐릭터·스타일 정의를 맨 위에 둔다. 순서가 결과를 바꾼다.
CHARACTER — lock this design, never redesign. The reference still is the truth; if this text and the image ever disagree, follow the image: [첫 프레임 이미지에 실제로 나온 모습 그대로 묘사] She wears this exact outfit in every single frame. No [예전에 잘못 나왔던 옷·소품을 하나씩 나열]. Preserve exact face, proportions, hairstyle, outfit, materials, accessories and colors in every frame. This film is in 16:9 landscape, exactly 13 distinct cuts, 15 seconds. It is 80% bold graphic design in motion and 20% character action. Graphic language: [음악방송 UI / 러닝 트래커 / 잡지 레이아웃 등] Typography is English only: [화면에 띄울 단어들] Palette: [4~5색, 색 이름으로] Style: premium AAA motion-graphics title sequence × [장르]. Flat anime rendering, clean outlines, no photorealism. Every graphic element moves fast and snaps hard on the beat. CUT 01 | 0.00–1.00s [장면] CUT 02 | 1.00–2.00s [장면] ... (CUT 13까지) Editing: hard cuts on every beat, whip pans, snap zooms, impact shakes. Every cut must feel compositionally different. Typography should always be fully readable before the character overlaps it. BGM: [음악 지시]
🚨 제일 중요한 한 가지
CHARACTER 블록은 첫 프레임이 나온 뒤, 그 그림을 보고 써야 한다. 다른 캐릭터용 블록을 재활용했더니 0.3초 만에 옷이 바뀌었다. 프레임을 뜯어 보니 바뀐 옷이 내 텍스트와 그대로 일치했다. 둘이 다른 말을 하면 H3는 옷은 텍스트를, 얼굴·머리는 이미지를 따라갔다.
그래서 다음 시도에서 세 가지를 고쳤다. ① 캐릭터 설명을 첫 프레임에 맞춰 새로 썼다. ② 첫 줄에 “텍스트와 이미지가 다르면 이미지를 따르라”를 넣었다. ③ 잘못 나왔던 옷을 No 목록으로 적었다. 결과는 옷이 끝까지 유지됐다 ✅ (아래 2차 실측) 위 뼈대가 그 형태다. 다만 세 가지를 한꺼번에 바꿔서, 어느 것이 결정적이었는지는 가르지 못했다.
- 한글 타이포는 깨졌다. 화면 속 글자는 영문으로 쓰고, 한글은 편집 단계에서 추가하도록 하자.
- 카메라 표현: whip pan, snap zoom 말고도 crash zoom, dutch angle, 360 arc shot 같은 용어를 컷 설명에 섞어 볼 만하다. 다만 표현별 효과 차이는 아직 따로 비교하지 않았다.
느린 롱테이크는 안 될까? 1차 실패 → 2차 성공 (실측)
된다. 다만 한 번 실패했고, 틀린 지점을 문장으로 하나씩 막아야 했다.
정반대 조건으로 돌려 봤다. 10초에 4컷, 캐릭터 연기 70% + 분위기 30%다. 빠른 버전의 80:20을 뒤집은 비율이다. 장면은 공연이 끝난 비 오는 밤이다. 소녀가 길고양이에게 우산을 건네고 빗속에 앉는다.
1차 결과는 곳곳이 어긋났다. 그래서 2차 프롬프트에서 틀린 지점마다 구체적인 지시를 넣었다.
두 결과를 프레임 단위로 비교했다(둘 다 864×480 / 24fps).
- 1차 결과
| 항목 | 1차 결과 | 2차에 넣은 지시 | 2차 결과 |
|---|---|---|---|
| 복장 | 0.3초 만에 텍스트대로 옷이 바뀜 |
이미지 기준 재작성 + “follow the image” + No 목록 | 끝까지 유지 ✅ |
| 컷 수 | 4컷 지시에도 컷 추가, 뒷모습 컷 등장 |
“never cut to a shot from behind her back”, “no extra shots, no reverse angles” | 정확히 4컷 ✅ |
| 동선 | 멈춰야 할 박스를 지나침 |
“STOPS there — she never walks past it” | 박스 옆에 멈춤 ✅ |
| 클로즈업 | 고양이만 털·명암 작화 | “every frame including close-ups”, “no fur texture” | 플랫 작화 유지 ✅ |
| 프레이밍 | 마지막 컷이 다리만 잡음 | “BOTH her face and her lap in frame” | 얼굴과 무릎 모두 ✅ |
| 길이 | 10초 지시에 15초 | “Hold until exactly 10.000 seconds” | 여전히 15.083초 ⚠️ |
2차에서 우산을 내려놓고 손을 떼는 동작, 고양이가 무릎에 올라와 손을 얹는 동작도 지시대로 나왔다.
비를 맞은 뒤 머리의 물방울과 재킷의 젖은 얼룩까지 표현됐다.
컷 전환은 4.75초, 7.83초, 10.58초에서 일어났다.
10초 기준으로 쓴 타이밍이 15초에 맞춰 늘어난 셈이다.
2차에도 아쉬운 점은 남았다. STAY는 1초가 아니라 2초 넘게 떠 있었다. 흠뻑 젖어 귀를 눕힌 고양이는 뽀송한 모습으로 나왔다. 마지막 컷은 배경이 밝아져 밤 분위기가 옅어졌다. 그래도 전체 결과는 충분히 만족스럽다 😊

여기서 얻은 교훈은 이거다.
긴 컷은 모델이 알아서 채우는 시간이 길다. 그러니 빈칸을 문장으로 먼저 막아 둬야 한다.
빠른 컷은 그 빈칸이 애초에 짧다. 이건 1차·2차 한 쌍의 비교에서 나온 해석이다.
- 2차 결과
📄 2차 시도에 쓴 프롬프트 전문 (펼치기)
※ 프롬프트에는 단발(chin-length bob)이라고 썼지만, 첫 프레임 이미지는 긴 머리였다. 영상은 15초 내내 이미지 쪽 긴 머리를 따랐다.
CHARACTER — lock this design, never redesign. The reference still is the truth; if this text and the image ever disagree, follow the image: Korean anime girl, late teens. Straight jet-black chin-length bob with blunt straight bangs, no ponytail. Calm, tired, half-lidded dark eyes, small neutral mouth. Large gold over-ear headphones worn over the bob. Cream-white oversized zip-up jacket, worn closed, with a mustard-gold collar and a mustard-gold necktie visible at the throat. Mustard-gold pleated mini skirt. Bare pale legs with white ankle socks. Brown leather loafers. A mustard-gold shoulder bag hanging on her left shoulder. A clear transparent umbrella with a white rim, held in her right hand. She wears this exact outfit in every single frame. No black bomber jacket, no gold sleeve stripes, no knee-high socks, no sneakers, no ponytail, no chest patch, no shorts. Her skirt length never changes. This film is in 16:9 landscape, exactly 4 cuts, 10 seconds. It is 70% character acting and 30% atmosphere. A quiet, wordless moment after the show: she gives her umbrella to a stray cat. Consistent rendering, every frame including close-ups: flat vector anime, thick clean black outlines, flat color fills, no soft shading, no gradients, no fur texture, no glossy highlights, no photorealism. The cat is drawn in this same flat style as everything else. Graphic accents only: rain drawn as thin straight ivory diagonal lines over the whole frame in every cut, neon reflections on wet asphalt, a soft magenta glow, one on-screen word STAY. No UI, no typography barrages, no speed lines. Palette: charcoal, gold, ivory, soft magenta. Camera: slow or static. Stay in front of her; never cut to a shot from behind her back; never let her walk past the camera. CUT 01 | 0.00–3.00s LONG TAKE, one continuous shot, camera static at eye level facing her. Wet alley at night, rain falling. She walks slowly toward camera under the clear umbrella, headphones on, eyes down. She reaches the cardboard box on the right and STOPS there — she never walks past it and never leaves frame. She stands still for a beat, then her head turns down and to the right toward the box. Hold on her face looking down. CUT 02 | 3.00–4.80s Her point of view, camera low, looking down into the box. Inside, a small white cat drawn in the same flat vector style with thick black outlines, soaked, ears flat, looking up at her. Rain lines fall into the box. One raindrop hits its nose and it blinks and flinches. Hold, no camera movement. CUT 03 | 4.80–7.80s LONG TAKE, side angle, medium-wide, her whole body visible. She crouches beside the box. Clearly and slowly she lowers the clear umbrella and plants its handle on the ground so the canopy covers the box completely — then she LETS GO of it and it stays there over the cat. Now nothing covers her: rain lands on her head, her bob goes wet and flat, her cream jacket darkens with water. She sits down on the wet step beside the box, knees together, and looks out at the street, not at the cat. The word STAY fades in small in the lower-right corner for one second and fades out. CUT 04 | 7.80–10.00s MEDIUM shot from the side, framed so that BOTH her face and her lap are in frame — do not crop to her legs, do not close in on her skirt or thighs. She is sitting in the rain, hair wet, the umbrella standing over the box beside her. The white cat climbs out of the box and settles on her lap. She looks down at it and her hand comes to rest on its back. The faintest smile. Hold until exactly 10.000 seconds. Editing: four cuts only, each held; two long takes; no fast cuts anywhere; no extra shots, no reverse angles, no inserts. No dialogue. No text except STAY. Sound: steady rain throughout, distant traffic, muffled music leaking from her headphones in CUT 01 that fades out when she stops, the umbrella handle tapping the ground in CUT 03, fabric rustle, one small meow in CUT 04. BGM: none until CUT 03, then a single soft piano line under the rain. Premium quality, flat vector anime cinematic rendering, quiet and warm, consistent character design and consistent art style in every cut, exactly 4 cuts.
MiniMax API로 돌리면 비용은 얼마나 들까?
15초 기준으로 H3 2K는 약 1.95달러, H3 Max 480P는 약 0.75달러다. 아래는 2026년 9월 6일 기준 종량제 단가다.
| 모델 · 해상도 | 초당 단가 | 15초 환산 |
|---|---|---|
| H3 · 2K | $0.13 | $1.95 |
| H3 · 768P | $0.08 | $1.20 |
| H3 768P → 2K 재생성 | $0.05 | $0.75 |
| H3 Max · 480P | $0.05 | $0.75 |
| H3 Max · 768P | $0.08 | $1.20 |
H3 Max는 fal이 H3를 추가 학습해 속도를 끌어올린 모델이다. 480P·768P만 지원하지만 H3보다 빠르다.

흔히 “768P로 초안, 2K로 업그레이드”하면 싸다고 한다. 그런데 살린 컷은 0.08+0.05=0.13달러로 2K 직행과 같다.
절약되는 건 버리는 컷뿐이다. 그러니 초안 전략은 버리는 테이크가 많을 때만 이득이다 💡
※ 단가는 바뀔 수 있다. 결제 전에 MiniMax 플랫폼 요금표를 꼭 다시 확인하자.
그래서 지금 써도 될까?
조건만 맞추면 지금 써도 된다. 오른쪽도 가능하지만 한두 번은 다시 뽑을 각오를 하자.
| ✅ 지금 써도 되는 경우 | ⚠️ 지시를 촘촘히 써야 하는 경우 |
|---|---|
| 광고 타이틀 시퀀스, 브랜드 티저 | 3초 넘게 유지되는 롱테이크 |
| 제품 홍보 15초, 캐릭터 IP 소개 | 표정 중심의 잔잔한 연기 |
| 쇼츠·릴스용 빠른 편집물 | 클로즈업이 많은 구성, 정확한 컷 수 |
“AI 영상이 별로다”가 아닐 수도 있다. 모델이 잘하는 조건을 안 넣었을 뿐일 수 있다. 이번에 얻은 결론이 그거다.
자주 묻는 질문 (FAQ)
Q. 컷은 몇 초로 잡아야 하나?
1초 안팎을 권한다. 15초 13컷이 안정적이었다. 2초를 넘기면 그림체가 흔들릴 여지가 생긴다.
Q. 3초짜리 롱테이크도 쓸 수 있나?
쓸 수 있다. 다만 멈출 위치, 금지할 앵글, 프레임에 넣을 신체 범위까지 문장으로 적어야 한다. 내 경우 2차에서 원하는 결과가 나왔다.

Q. 캐릭터가 컷마다 달라진다면?
캐릭터 설명이 첫 프레임과 다른 말을 하고 있을 가능성이 크다. 이미지를 보고 CHARACTER 블록을 다시 쓰고, 첫 줄에 “다르면 이미지를 따르라”를 넣자.
Q. 한글 자막을 영상에 바로 넣을 수 있나?
내 테스트에서는 깨졌다. 영문으로 쓰거나 편집 단계에서 얹는 게 안전하다.
Q. 지정한 길이대로 안 나온다면?
길이·해상도는 프롬프트 문장이 아니라 요청 설정값이 결정한다. 설정부터 확인하자.
Q. 한국에서 H3를 로컬로 돌려도 되나?
오픈 웨이트 라이선스가 한국을 자체 실행 제외 지역으로 둔다. 한국에서는 API나 호스팅 서비스를 쓰는 게 맞다.
🚀 오늘 바로 해볼 것
Krea 2로 플랫 애니 캐릭터 1장을 뽑아 보자. 위 뼈대에 CHARACTER 블록만 새로 쓰면 첫 15초가 나온다. 결과가 이상하면 컷 길이부터 줄여 보자.