왜 필요한가? 한 편의 시나리오는 수십 개 장면의 집합입니다. 장면별로 분리해야 "이 씬에는 누가 나오지?", "어디가 배경이지?"를 AI가 정확히 판단할 수 있습니다.
👥
Stage 03 · Discover
등장 요소 발견
각 장면에서 등장하는 인물 · 장소 · 소품과 인물의 의상을 찾아 정리합니다. 각 요소에 짧은 코드(C01, L01, P01, O01)를 부여하여 이후 단계에서 간결하게 참조합니다.
입력 (Input)
씬 텍스트 전체 + 세계관 규칙
출력 (Output)
인물 카드 · 장소 카드 · 소품 카드 · 의상 카드 (이미지 생성 시 참고할 묘사 포함)
과정 인물 → 장소 → 소품 3단계로 분리해서 각각 별도 AI 호출. 한 번에 다 뽑으면 AI가 인물에만 집중해 소품을 놓치기 때문입니다. 이후 중복 병합(같은 인물을 다르게 부른 경우), 저빈도 필터(3씬 이하 등장 요소는 제거 여부 판단), T2I 프롬프트 생성(이미지 생성용 영문 묘사)까지 진행합니다.
예시 · 추출된 인물 카드
short_id
C01
name
수진
description
40대 한국 여성. 단정한 단발머리, 피곤한 눈매. 주부.
scenes
씬 5, 7, 8, 12, 15 (총 15회 등장)
t2i_prompt
a Korean woman in her 40s, neat bob-cut hair, tired eyes, casual home wear
💡
의상(아웃룩) 시스템 — 같은 인물이라도 씬마다 옷이 달라집니다. "수진이 씬 5에서는 잠옷(O01), 씬 12에서는 정장(O03)" 식으로 인물 + 의상을 분리 관리합니다. 변신·빙의처럼 얼굴 자체가 바뀌는 경우엔 비주얼 유사성 없음(O00)으로 처리.
왜 필요한가? AI가 수진의 얼굴을 매 장면마다 일관되게 그리려면 "C01이 수진이다"라는 단일 레퍼런스가 필요합니다. 짧은 코드는 이후 수천 자의 이미지 지시문을 간결하게 만들어줍니다.
🎭
Stage 04 · Direct
장면 연출
이제 AI가 감독 역할을 맡습니다. 각 씬에서 누가 실제로 카메라에 보이는지(빙의한 영혼처럼 대사만 있고 안 보이는 존재 제외), 어떤 의상을 입는지를 판정합니다.
입력 (Input)
씬 원문 + 인물/장소/소품 카드 + 세계관 규칙
출력 (Output)
씬별 등장 요소 목록(Visible Entities) + 씬별 의상 배정
과정Gemini Pro(가장 정교한 판단용 AI)가 씬 감독이 되어 "이 씬에 물리적으로 보이는 건 C01 · C02 · L01" 같이 확정합니다. 이어서 의상 배정 3단계가 돌아갑니다: ① 전체 의상 목록 뽑기 ② 씬별로 "C01은 O01 착용" 매핑 ③ 유사 의상 병합·정리.
a
씬 감독 (scene_director)"이 씬에 누가 실제로 보이는가?" 판정 — 반드시 Gemini Pro (영혼/빙의 판별 정확)
b
의상 목록 · 매핑 · 병합인물 × 씬 조합마다 어떤 의상인지 확정
예시 · 씬 감독 결과 (씬 12)
scene_index
12
primary_location
L02 (사무실)
present_entity_ids
C01 (수진), C03 (상사), L02, P02 (서류)
outfit_assignments
C01 → O03 (정장), C03 → O05 (셔츠)
왜 필요한가? 시나리오에는 "텔레파시로 대화하는 영혼" 같은 보이지 않는 존재가 등장할 수 있습니다. 이미지에는 그런 존재를 그리면 안 됩니다. 또 같은 인물도 씬마다 복장이 바뀌므로 이 단계에서 미리 정리해야 합니다.
📷
Stage 05 · Design
샷 설계
한 장면을 여러 개의 "찰나"로 쪼갭니다. 카메라 셔터가 1/1000초만에 찍히는 한 순간 = 한 샷. 그중 이미지로 만들 가치가 있는 것만 선택하고, 카메라 앵글·조명·인물 자세를 설계합니다.
입력 (Input)
씬별 원문 + 감독 판정 결과 + 의상 배정
출력 (Output)
각 씬마다 선택된 3~5개 샷 + 샷별 카메라 설계안
과정 ① Beat 추출: 씬 안의 감정/상태 변화 지점 찾기 → ② Shot 추출: 각 Beat를 정지 순간으로 분해 ("문을 열고 들어와 앉는다" = 3 샷) → ③ Shot 검증: "한 찰나" 원칙 위반 시 재작성 → ④ 중요 샷 선택: 이미지화 가치 기준 최대 5개 선별 → ⑤ 카메라 플로우 & 샷 연출: 씬 전체의 카메라 이동 경로 + 샷별 앵글/조명/인물 자세 → ⑥ 씬 일관성: 같은 씬의 여러 샷이 공유해야 할 요소(깨진 창문, 쓰러진 인물 등) 정리.
①
Beat / Shot 추출씬 → 상태변화 → 정지 순간으로 3단계 분해
②
Shot 검증 NEW v0.5.4"한 찰나 = 1/1000초" 원칙 위반 재작성 (시간 연결어 "그리고 나서" 금지 등)
③
중요 샷 선택감정 전환점 · 공간 전환 · 시각 임팩트 기준 (씬당 최대 5개)
④
카메라 플로우 NEW v0.5.0씬 전체를 관통하는 카메라 이동 경로 설계 → 샷이 그 위에 배정
⑤
샷 연출앵글, 조명, 인물 자세, 시선 방향, 핵심 배경 요소
⑥
씬 일관성 NEW v0.5.0여러 샷이 공유해야 할 고정 요소 (깨진 창문, 쓰러진 인물의 위치/자세)
⑦
씬 상세 (T2I 프롬프트)각 샷의 최종 영문 이미지 프롬프트 조립 (C01 + O03 + 씬 묘사)
예시 · 한 찰나 = 한 샷 (Shot 추출 결과)
씬 5 (수진이 창밖을 본다)
Shot 1: 수진이 소파에서 일어나는 순간 (발이 바닥에 닿음)
Shot 2: 수진이 창가로 걷는 동안 — 옆모습
Shot 3: 수진이 창틀에 손을 얹는 순간 — 손 클로즈업
Shot 4: 수진이 창밖을 보는 모습 — 뒷모습
※ "일어나서 걸어가 손을 얹는다" 한 문장이 4개 찰나로 분해됨.
예시 · 최종 T2I 프롬프트 (Shot 4)
Photorealistic cinematic still. C01 stands at the window from behind,
hand resting on the frame, [L01: traditional Korean apartment living room,
warm evening light filtering through lace curtains], soft silhouette,
contemplative atmosphere.
🎯
한 샷 = 한 찰나 원칙. AI가 "수진이 일어나서 걸어가 창밖을 본다" 한 문장으로 이미지를 만들면 여러 동작이 섞인 어색한 그림이 나옵니다. 1/1000초 단위로 쪼개야 각 샷이 깔끔한 정지 이미지가 됩니다.
왜 필요한가? 웹툰의 각 컷은 하나의 정지 순간입니다. 시나리오의 연속된 서술을 그대로 이미지화하면 모호한 그림이 됩니다. 이 단계에서 "어느 순간을 그릴지" 정교하게 쪼개야 콘티 같은 명확한 이미지가 나옵니다.
🖼️
Stage 06 · Generate
이미지 생성
준비된 프롬프트와 참조 이미지를 AI 이미지 모델에 넣어 실제 그림을 만듭니다. 인물의 얼굴 일관성, 배경 연속성을 유지하기 위해 여러 단계를 거칩니다.
입력 (Input)
샷별 T2I 프롬프트 + 참조 이미지(인물 얼굴, 의상, 배경)
출력 (Output)
각 샷마다 씬 이미지 PNG (보통 샷당 1~2개 변형)
과정 단계적으로 이미지가 쌓입니다: 참조 이미지 생성(인물 얼굴 증명사진, 소품, 장소) → 합성 이미지(인물 얼굴 + 의상을 합쳐 전신 이미지) → 상태 변형(사망·부상 등 특수 상태의 variant) → 최종 씬 이미지(참조들을 Gemini Image 모델에 전부 넣고 프롬프트 실행 → 검증 → 앵글 조정 → 최종 선택).
a
참조 이미지 생성인물 = 증명사진 / 장소 = 공간 전경 / 소품 = 정면도
b
합성 이미지인물 얼굴 + 의상을 하나로 합쳐 일관된 전신 이미지
c
상태 변형 NEW v0.5.0사망·의식불명·중상 인물을 위한 별도 참조 (일상 포즈가 그려지는 문제 해결)
d
씬 이미지 생성참조들 + 프롬프트 → Gemini Image 모델 → 여러 장 생성
e
검증 · 앵글 · 최종 선택GPT Vision이 품질 검증 → fal.ai로 앵글 조정 (옵션) → 대표 선택
예시 · Gemini가 받는 최종 지시
[입력 참조 이미지]
Image 1: character C01 reference — 수진 (증명사진)
Image 2: character C03 reference — 상사 (증명사진)
Image 3: outfit appearance — 정장 (의상만)
Image 4: BACKGROUND from previous shot (SAME ROOM) — 이전 샷 배경
[지시문]
Use image 1 as character appearance reference.
Use the background from image 4 as-is.
Do NOT copy any standing/moving people from image 4.
[프롬프트]
C01 sits across from C03 at a wooden desk, both in formal wear,
late-afternoon sunlight through blinds, tense atmosphere.
🧩
배경 연속성의 비밀. 같은 장소의 이전 샷 이미지를 "배경만 참고하라"는 라벨로 함께 넣어서 공간감이 유지되도록 합니다. 동시에 "인물은 복사하지 마라"고 지시해서 이전 씬의 인물이 겹치지 않게 합니다.
왜 필요한가? 수진의 얼굴이 매 씬마다 다른 사람이면 웹툰이 성립하지 않습니다. 여러 장의 참조 이미지를 AI에 함께 제공해 얼굴 · 의상 · 공간의 일관성을 강제해야 합니다.
✨
Stage 07 · Edit
사용자 편집
AI가 완성한 결과물을 사용자가 UI에서 직접 조정합니다. 앵글을 바꾸거나, 특정 샷을 선택/제외하거나, 엔티티 정보(이름/설명)를 수정할 수 있습니다.
입력 (Input)
완성된 씬 이미지 + 샷 목록 + 엔티티 카드 (전 단계 출력 전체)
출력 (Output)
최종 웹북 / 웹툰 (필요 시 PDF로도 출력 가능)
과정 웹 UI에서 실시간 편집: ① 샷 선택 토글(비선택 샷도 보존되어 되살릴 수 있음) ② 엔티티 편집(수진의 설명 수정, 의상 추가/교체) ③ 이미지 앵글 조정(fal.ai로 가로/세로 각도·줌 변경) ④ 재생성 트리거(특정 단계만 다시 실행). 모든 편집은 즉시 DB에 저장되고 관련 이미지는 자동 갱신됩니다.
a
샷 선택/해제비선택 샷도 "+선택" 토글로 언제든 되살릴 수 있음 (맥락 보존)
b
엔티티 편집인물 설명 수정, 의상 참조 이미지 업로드, 소품 추가
c
앵글 변경fal.ai API로 생성된 이미지에 가로/세로 각도·줌을 재적용
d
재생성특정 단계만 "force 실행"하여 해당 샷/엔티티만 다시 만들기
🎨
AI는 초안, 사람이 완성. 7단계 파이프라인은 사람 감독의 80~90%를 대체하지만, 마지막 디테일 조정은 반드시 사람의 판단이 필요합니다. 이 편집 단계에서 브랜드 톤, 감정 강도, 색감을 조율합니다.
왜 필요한가? 완전 자동화된 결과물은 항상 일부가 어긋납니다. 사용자가 마지막 한 겹의 감수를 더해야 상업적 품질이 완성됩니다.