TheRoad Scene Lab · Pipeline Guide

시나리오를 웹툰 이미지
바꾸는 7단계 여정

대본 PDF 한 편이 어떻게 AI의 손을 거쳐 수십 장의 씬 이미지로 완성되는지, 기획자·감독·마케터가 한눈에 이해할 수 있도록 단계별로 설명합니다.

7핵심 단계
40+AI 처리 작업
6전용 AI 모델
3~5씬당 이미지 변형

한눈에 보는 흐름

원본 대본이 입력되면 오른쪽으로 흘러가며 각 단계에서 AI가 정보를 추출·정제·생성합니다.

INPUT → OUTPUT 📄 원본 읽기 PDF → 정리된 텍스트 ① Read 🎬 씬 나누기 텍스트 → 개별 장면 ② Split 👥 등장 요소 발견 인물/장소/소품/의상 ③ Discover 🎭 장면 연출 누가/어디서/어떻게 ④ Direct 📷 샷 설계 씬 → 여러 찰나 ⑤ Design 🖼️ 이미지 생성 AI가 실제 그림 제작 ⑥ Generate 사용자 편집 수동 앵글/색감/선택 ⑦ Edit
Stage 01 · Read

원본 읽기

시나리오 PDF 원본을 AI가 그대로 읽어 깨끗한 텍스트로 정리합니다. 페이지 머리말·쪽번호·깨진 문자를 제거하되, 등장인물 이름과 원문 대사는 단 한 글자도 삭제하지 않습니다.

입력 (Input)

시나리오 PDF 파일 (예: 60쪽짜리 드라마 대본 1편)

출력 (Output)

깔끔하게 정리된 시나리오 텍스트 전문 (원문 그대로 보존)

과정 Gemini AI가 PDF를 직접 읽어 페이지 번호·머리말 같은 노이즈를 제거하고, 시나리오 본문만 남긴 정리된 텍스트를 내보냅니다.

예시 · 입력 PDF 일부
— 3 —              (페이지 번호)
시나리오 "산책"   (머리말)

씬 5. 실내 - 거실 - 저녁

수진 (40대, 피곤한 얼굴) 소파에 앉아
창밖을 본다.
        SUJIN
     오늘도 이렇게 저무는구나.
예시 · 정리된 출력
씬 5. 실내 - 거실 - 저녁

수진 (40대, 피곤한 얼굴) 소파에 앉아 창밖을 본다.
        SUJIN
     오늘도 이렇게 저무는구나.
왜 필요한가? 지저분한 PDF 추출 결과를 그대로 AI에 넣으면 페이지 번호가 등장인물 이름으로 오인되는 등 오류가 발생합니다.
Stage 02 · Split

씬 나누기

연속된 시나리오 텍스트를 "씬 1, 씬 2, 씬 3…" 개별 장면으로 쪼갭니다. 이후 모든 작업은 씬 단위로 진행됩니다.

입력 (Input)

정리된 시나리오 텍스트 (Stage 01의 출력)

출력 (Output)

씬 번호 · 헤딩 · 본문이 분리된 장면 리스트 (보통 30~60개)

과정 AI가 "씬 1. 실내 - …" 같은 씬 헤딩 패턴을 찾아낸 다음, 원문을 자르지 않고 그대로 구간별로 나눠 번호를 매깁니다. 동시에 에피소드 전체 요약, 시각적 세계관 규칙(시대·지역·복장·물리법칙)도 추출합니다.

a
씬 세그먼테이션헤딩 패턴 감지 → 씬 번호/시작·끝 위치 부여
b
에피소드 요약전체 시나리오를 500자 내외로 압축 (전체 맥락 유지용)
c
시각적 세계관 규칙시대(1990년대 / 근미래) · 지역(한국 / 유럽) · 복장 · 마법·빙의 여부 등 추출
d
씬별 요약각 씬의 짧은 1~2줄 설명 (후속 단계의 맥락 참고용)
예시 · 씬 나눔 결과
scene_index
5
heading
씬 5. 실내 - 거실 - 저녁
length
1,243자
text
"수진 (40대, 피곤한 얼굴) 소파에 앉아 창밖을 본다…"
왜 필요한가? 한 편의 시나리오는 수십 개 장면의 집합입니다. 장면별로 분리해야 "이 씬에는 누가 나오지?", "어디가 배경이지?"를 AI가 정확히 판단할 수 있습니다.
Stage 03 · Discover

등장 요소 발견

각 장면에서 등장하는 인물 · 장소 · 소품과 인물의 의상을 찾아 정리합니다. 각 요소에 짧은 코드(C01, L01, P01, O01)를 부여하여 이후 단계에서 간결하게 참조합니다.

입력 (Input)

씬 텍스트 전체 + 세계관 규칙

출력 (Output)

인물 카드 · 장소 카드 · 소품 카드 · 의상 카드 (이미지 생성 시 참고할 묘사 포함)

과정 인물 → 장소 → 소품 3단계로 분리해서 각각 별도 AI 호출. 한 번에 다 뽑으면 AI가 인물에만 집중해 소품을 놓치기 때문입니다. 이후 중복 병합(같은 인물을 다르게 부른 경우), 저빈도 필터(3씬 이하 등장 요소는 제거 여부 판단), T2I 프롬프트 생성(이미지 생성용 영문 묘사)까지 진행합니다.

예시 · 추출된 인물 카드
short_id
C01
name
수진
description
40대 한국 여성. 단정한 단발머리, 피곤한 눈매. 주부.
scenes
씬 5, 7, 8, 12, 15 (총 15회 등장)
t2i_prompt
a Korean woman in her 40s, neat bob-cut hair, tired eyes, casual home wear
💡
의상(아웃룩) 시스템 — 같은 인물이라도 씬마다 옷이 달라집니다. "수진이 씬 5에서는 잠옷(O01), 씬 12에서는 정장(O03)" 식으로 인물 + 의상을 분리 관리합니다. 변신·빙의처럼 얼굴 자체가 바뀌는 경우엔 비주얼 유사성 없음(O00)으로 처리.
왜 필요한가? AI가 수진의 얼굴을 매 장면마다 일관되게 그리려면 "C01이 수진이다"라는 단일 레퍼런스가 필요합니다. 짧은 코드는 이후 수천 자의 이미지 지시문을 간결하게 만들어줍니다.
Stage 04 · Direct

장면 연출

이제 AI가 감독 역할을 맡습니다. 각 씬에서 누가 실제로 카메라에 보이는지(빙의한 영혼처럼 대사만 있고 안 보이는 존재 제외), 어떤 의상을 입는지를 판정합니다.

입력 (Input)

씬 원문 + 인물/장소/소품 카드 + 세계관 규칙

출력 (Output)

씬별 등장 요소 목록(Visible Entities) + 씬별 의상 배정

과정 Gemini Pro(가장 정교한 판단용 AI)가 씬 감독이 되어 "이 씬에 물리적으로 보이는 건 C01 · C02 · L01" 같이 확정합니다. 이어서 의상 배정 3단계가 돌아갑니다: ① 전체 의상 목록 뽑기 ② 씬별로 "C01은 O01 착용" 매핑 ③ 유사 의상 병합·정리.

a
씬 감독 (scene_director)"이 씬에 누가 실제로 보이는가?" 판정 — 반드시 Gemini Pro (영혼/빙의 판별 정확)
b
의상 목록 · 매핑 · 병합인물 × 씬 조합마다 어떤 의상인지 확정
예시 · 씬 감독 결과 (씬 12)
scene_index
12
primary_location
L02 (사무실)
present_entity_ids
C01 (수진), C03 (상사), L02, P02 (서류)
outfit_assignments
C01 → O03 (정장), C03 → O05 (셔츠)
왜 필요한가? 시나리오에는 "텔레파시로 대화하는 영혼" 같은 보이지 않는 존재가 등장할 수 있습니다. 이미지에는 그런 존재를 그리면 안 됩니다. 또 같은 인물도 씬마다 복장이 바뀌므로 이 단계에서 미리 정리해야 합니다.
Stage 05 · Design

샷 설계

한 장면을 여러 개의 "찰나"로 쪼갭니다. 카메라 셔터가 1/1000초만에 찍히는 한 순간 = 한 샷. 그중 이미지로 만들 가치가 있는 것만 선택하고, 카메라 앵글·조명·인물 자세를 설계합니다.

입력 (Input)

씬별 원문 + 감독 판정 결과 + 의상 배정

출력 (Output)

각 씬마다 선택된 3~5개 샷 + 샷별 카메라 설계안

과정Beat 추출: 씬 안의 감정/상태 변화 지점 찾기 → ② Shot 추출: 각 Beat를 정지 순간으로 분해 ("문을 열고 들어와 앉는다" = 3 샷) → ③ Shot 검증: "한 찰나" 원칙 위반 시 재작성 → ④ 중요 샷 선택: 이미지화 가치 기준 최대 5개 선별 → ⑤ 카메라 플로우 & 샷 연출: 씬 전체의 카메라 이동 경로 + 샷별 앵글/조명/인물 자세 → ⑥ 씬 일관성: 같은 씬의 여러 샷이 공유해야 할 요소(깨진 창문, 쓰러진 인물 등) 정리.

Beat / Shot 추출씬 → 상태변화 → 정지 순간으로 3단계 분해
Shot 검증 NEW v0.5.4"한 찰나 = 1/1000초" 원칙 위반 재작성 (시간 연결어 "그리고 나서" 금지 등)
중요 샷 선택감정 전환점 · 공간 전환 · 시각 임팩트 기준 (씬당 최대 5개)
카메라 플로우 NEW v0.5.0씬 전체를 관통하는 카메라 이동 경로 설계 → 샷이 그 위에 배정
샷 연출앵글, 조명, 인물 자세, 시선 방향, 핵심 배경 요소
씬 일관성 NEW v0.5.0여러 샷이 공유해야 할 고정 요소 (깨진 창문, 쓰러진 인물의 위치/자세)
씬 상세 (T2I 프롬프트)각 샷의 최종 영문 이미지 프롬프트 조립 (C01 + O03 + 씬 묘사)
예시 · 한 찰나 = 한 샷 (Shot 추출 결과)
씬 5 (수진이 창밖을 본다)
  Shot 1: 수진이 소파에서 일어나는 순간 (발이 바닥에 닿음)
  Shot 2: 수진이 창가로 걷는 동안 — 옆모습
  Shot 3: 수진이 창틀에 손을 얹는 순간 — 손 클로즈업
  Shot 4: 수진이 창밖을 보는 모습 — 뒷모습

※ "일어나서 걸어가 손을 얹는다" 한 문장이 4개 찰나로 분해됨.
예시 · 최종 T2I 프롬프트 (Shot 4)
Photorealistic cinematic still. C01 stands at the window from behind,
hand resting on the frame, [L01: traditional Korean apartment living room,
warm evening light filtering through lace curtains], soft silhouette,
contemplative atmosphere.
🎯
한 샷 = 한 찰나 원칙. AI가 "수진이 일어나서 걸어가 창밖을 본다" 한 문장으로 이미지를 만들면 여러 동작이 섞인 어색한 그림이 나옵니다. 1/1000초 단위로 쪼개야 각 샷이 깔끔한 정지 이미지가 됩니다.
왜 필요한가? 웹툰의 각 컷은 하나의 정지 순간입니다. 시나리오의 연속된 서술을 그대로 이미지화하면 모호한 그림이 됩니다. 이 단계에서 "어느 순간을 그릴지" 정교하게 쪼개야 콘티 같은 명확한 이미지가 나옵니다.
Stage 06 · Generate

이미지 생성

준비된 프롬프트와 참조 이미지를 AI 이미지 모델에 넣어 실제 그림을 만듭니다. 인물의 얼굴 일관성, 배경 연속성을 유지하기 위해 여러 단계를 거칩니다.

입력 (Input)

샷별 T2I 프롬프트 + 참조 이미지(인물 얼굴, 의상, 배경)

출력 (Output)

각 샷마다 씬 이미지 PNG (보통 샷당 1~2개 변형)

과정 단계적으로 이미지가 쌓입니다: 참조 이미지 생성(인물 얼굴 증명사진, 소품, 장소) → 합성 이미지(인물 얼굴 + 의상을 합쳐 전신 이미지) → 상태 변형(사망·부상 등 특수 상태의 variant) → 최종 씬 이미지(참조들을 Gemini Image 모델에 전부 넣고 프롬프트 실행 → 검증 → 앵글 조정 → 최종 선택).

a
참조 이미지 생성인물 = 증명사진 / 장소 = 공간 전경 / 소품 = 정면도
b
합성 이미지인물 얼굴 + 의상을 하나로 합쳐 일관된 전신 이미지
c
상태 변형 NEW v0.5.0사망·의식불명·중상 인물을 위한 별도 참조 (일상 포즈가 그려지는 문제 해결)
d
씬 이미지 생성참조들 + 프롬프트 → Gemini Image 모델 → 여러 장 생성
e
검증 · 앵글 · 최종 선택GPT Vision이 품질 검증 → fal.ai로 앵글 조정 (옵션) → 대표 선택
예시 · Gemini가 받는 최종 지시
[입력 참조 이미지]
  Image 1: character C01 reference — 수진 (증명사진)
  Image 2: character C03 reference — 상사 (증명사진)
  Image 3: outfit appearance — 정장 (의상만)
  Image 4: BACKGROUND from previous shot (SAME ROOM) — 이전 샷 배경

[지시문]
Use image 1 as character appearance reference.
Use the background from image 4 as-is.
Do NOT copy any standing/moving people from image 4.

[프롬프트]
C01 sits across from C03 at a wooden desk, both in formal wear,
late-afternoon sunlight through blinds, tense atmosphere.
🧩
배경 연속성의 비밀. 같은 장소의 이전 샷 이미지를 "배경만 참고하라"는 라벨로 함께 넣어서 공간감이 유지되도록 합니다. 동시에 "인물은 복사하지 마라"고 지시해서 이전 씬의 인물이 겹치지 않게 합니다.
왜 필요한가? 수진의 얼굴이 매 씬마다 다른 사람이면 웹툰이 성립하지 않습니다. 여러 장의 참조 이미지를 AI에 함께 제공해 얼굴 · 의상 · 공간의 일관성을 강제해야 합니다.
Stage 07 · Edit

사용자 편집

AI가 완성한 결과물을 사용자가 UI에서 직접 조정합니다. 앵글을 바꾸거나, 특정 샷을 선택/제외하거나, 엔티티 정보(이름/설명)를 수정할 수 있습니다.

입력 (Input)

완성된 씬 이미지 + 샷 목록 + 엔티티 카드 (전 단계 출력 전체)

출력 (Output)

최종 웹북 / 웹툰 (필요 시 PDF로도 출력 가능)

과정 웹 UI에서 실시간 편집: ① 샷 선택 토글(비선택 샷도 보존되어 되살릴 수 있음) ② 엔티티 편집(수진의 설명 수정, 의상 추가/교체) ③ 이미지 앵글 조정(fal.ai로 가로/세로 각도·줌 변경) ④ 재생성 트리거(특정 단계만 다시 실행). 모든 편집은 즉시 DB에 저장되고 관련 이미지는 자동 갱신됩니다.

a
샷 선택/해제비선택 샷도 "+선택" 토글로 언제든 되살릴 수 있음 (맥락 보존)
b
엔티티 편집인물 설명 수정, 의상 참조 이미지 업로드, 소품 추가
c
앵글 변경fal.ai API로 생성된 이미지에 가로/세로 각도·줌을 재적용
d
재생성특정 단계만 "force 실행"하여 해당 샷/엔티티만 다시 만들기
🎨
AI는 초안, 사람이 완성. 7단계 파이프라인은 사람 감독의 80~90%를 대체하지만, 마지막 디테일 조정은 반드시 사람의 판단이 필요합니다. 이 편집 단계에서 브랜드 톤, 감정 강도, 색감을 조율합니다.
왜 필요한가? 완전 자동화된 결과물은 항상 일부가 어긋납니다. 사용자가 마지막 한 겹의 감수를 더해야 상업적 품질이 완성됩니다.