| 순서 | 스텝 | 유형 | 모델 | 무엇을 하나 (쉬운 설명) | 입력 → 출력 | 조건 |
| 0 | planning_doc_analysis | 글 LLM조건부 | Gemini Flash-Lite | 기획안 PDF를 미리 읽고 작품의 배경 설정·인물 정보를 파악해 둡니다. 뒤 단계들이 이 지식을 참고합니다. | 기획안 PDF → 기획 분석 메모 | planning_doc |
| 1 | text_cleanup | 글 LLM | Gemini Flash-Lite | PDF에서 뽑아낸 시나리오 글에서 페이지 번호·머리글 같은 잡티를 지워 깨끗한 원고로 만듭니다. | 업로드 원문 → 깨끗한 전문 | |
| 2 | scene_segmentation | 글 LLM | Gemini 3.1 Flash | 긴 시나리오를 '씬(장면)' 단위로 자를 위치를 찾습니다. | 전문 → 씬 경계 목록 | |
| 3 | episode_summary | 글 LLM | Gemini Flash | 에피소드 전체 줄거리를 한 문단으로 요약합니다. 뒤 단계들의 전체 맥락 역할. | 전문 → 줄거리 요약 | |
| 4 | visual_world_rules | 글 LLM | GPT-5.6 Sol | 이 작품의 시각 규칙을 뽑아 둡니다 — 귀신이 눈에 보이는 존재인지, 시대·장소는 어디인지 등. 감독 계열 단계들이 이 규칙(director_notes)을 계속 참고합니다. | 전문 → 시각 규칙 | |
| 6 | scene_save | 코드 | 코드 | 잘린 씬들을 원문 그대로 DB에 저장합니다. LLM을 쓰지 않는 순수 저장 단계. | 씬 경계 → 씬 30개 저장 | |
| 6.5 | entity_character_list | 글 LLM | GPT-5.6 Sol | 시나리오에 나오는 등장인물 이름 목록을 미리 뽑아 둡니다. 뒤의 비트/샷 추출이 이 명단을 보고 인물을 정확히 지칭합니다. | 씬 전문 → 인물 명단 | |
| 7 | scene_summary | 글 LLM | Gemini Flash | 씬 하나하나를 짧게 요약합니다 (30씬 병렬). | 씬 원문 → 씬 요약 | |
| 7.1 | beat_extract | 글 LLM | Gemini 3.1 Pro | 각 씬을 '비트'(이야기가 한 번 움직이는 최소 단위)로 잘게 나눕니다. | 씬 원문 → 비트 목록 | |
| 7.2 | shot_extract | 글 LLM | Gemini 3.1 Pro | 비트마다 사진 한 장으로 찍을 만한 순간(샷)을 골라냅니다. 한 샷 = 한 순간·한 장소가 원칙. | 비트 → 샷 후보 | |
| 7.25 | shot_validator | 글 LLM | Gemini 3.1 Pro | 뽑힌 샷들이 규칙을 지켰는지 검사합니다 — 회상·몽타주가 섞이지 않았는지, 변신 전/후 인물이 섞이지 않았는지 등. | 샷 → 검증된 샷 | |
| 8 | entity_all_character | 글 LLM | GPT-5.6 Sol | 전체 샷을 훑어 실제 그림에 등장할 인물의 최종 명단을 확정합니다. | 전체 샷 → 인물 최종 명단 | |
| 9 | entity_extract_character | 글 LLM | GPT-5.6 Sol | 인물마다 생김새·변하지 않는 특징을 정리해 '인물 카드'(캐논)를 만듭니다. 변신하는 캐릭터는 형태별로 카드를 따로 만듭니다. | 명단 → 인물 카드 | |
| 10 | entity_all_location | 글 LLM | GPT-5.6 Sol | 이야기에 나오는 장소 목록을 확정합니다. | 전체 샷 → 장소 명단 | |
| 11 | entity_extract_location | 글 LLM | Gemini 3.1 Pro | 장소마다 생김새 설명을 정리해 '장소 카드'를 만듭니다. | 명단 → 장소 카드 | |
| 12 | entity_all_prop | 글 LLM | GPT-5.6 Sol | 중요한 소품(사진, 주사기 같은 물건) 목록을 확정합니다. | 전체 샷 → 소품 명단 | |
| 13 | entity_extract_prop | 글 LLM | Gemini 3.1 Pro | 소품마다 설명을 정리해 '소품 카드'를 만듭니다. | 명단 → 소품 카드 | |
| 13.5 | entity_merge | 글 LLM | GPT-5.6 Sol | 같은 대상이 이름만 다르게 두 번 등록된 경우를 찾아 하나로 합칩니다. | 카드 전체 → 중복 정리 | |
| 13.6 | entity_relation | 글 LLM | GPT-5.6 Sol | 카드끼리의 관계를 연결합니다 — 예: '이 검은 형상은 민숙의 변형이다'. | 카드 → 관계 연결 | |
| 13.7 | entity_filter | 글 LLM | Gemini Flash | 3씬 이하로만 나오는 사소한 요소를 지울지 LLM에게 판단시킵니다. | 카드+등장 횟수 → 정리 | |
| 14 | entity_detail | 글 LLM | GPT-5.6 Sol | 카드의 외형 설명을 더 자세하게 다듬습니다. | 카드 → 상세 카드 | |
| 15 | entity_t2i | 글 LLM | Gemini 3.1 Pro | 각 카드로 참조 사진을 만들 수 있게 그림 생성용 영어 문장(T2I 프롬프트)을 씁니다. | 카드 → 그림 주문서 | |
| 15.5 | shot_selection | 글 LLM | Gemini Flash | 씬마다 실제로 그림으로 만들 샷을 최대 3개 고릅니다. 비슷한 그림이 중복되지 않게. | 샷 후보 → 선택 표시 | |
| 16 | scene_director | 글 LLM | Gemini 3.1 Pro | '씬 감독' — 각 씬에 어떤 인물이 등장하는지 최종 확정합니다. 이 확정 데이터로 코드가 샷별 등장 목록(VE)을 자동으로 만듭니다. | 씬+카드 → 인물 배정 | |
| 16.5 | shot_director | 글 LLM | GPT-5.6 Sol | 샷마다 카메라 촬영 기법을 2가지씩 정합니다 (→ 그림도 2가지 버전). | 선택 샷 → 촬영 기법 2종 | |
| 17.05 | scene_camera_flow | 글 LLM | GPT-5.6 Sol | 씬 안에서 카메라가 어떻게 이어질지(멀리→가까이 등) 흐름을 설계합니다. | 선택 샷 → 카메라 흐름 | |
| 18.1 | shot_dependency | 글 LLM | GPT-5.6 Sol | 이 샷이 앞의 어떤 샷과 같은 장소·인물인지 연결 관계를 찾습니다. 나중에 참조 사진으로 이어 붙일 근거. | 선택 샷 → 연결 그래프 | |
| 19 | outlook_phase1 | 글 LLM | Gemini 3.1 Pro | 인물들이 입는 옷(아웃룩) 목록을 뽑습니다. | 전문+카드 → 옷 목록 | |
| 19.1 | outlook_phase2 | 글 LLM | Gemini 3.1 Pro | 씬마다 누가 어떤 옷을 입고 있는지 짝을 맞춥니다. | 옷 목록 → 씬별 매핑 | |
| 19.2 | outlook_phase3 | 글 LLM | Gemini 3.1 Pro | 비슷한 옷을 합치고 정리해 최종 '옷 카드'(O01…)를 확정합니다. | 매핑 → 옷 카드 | |
| 19.5 | shot_staging | 글 LLM | GPT-5.6 Sol | 샷마다 인물이 어디에 서고 어떤 자세인지(블로킹)를 정합니다. | 선택 샷 → 배치 계획 | |
| 19.51 | background_classify | 글 LLM조건부 | GPT-5.6 Sol | 장소마다 실내인지 야외인지 나눕니다. 이 결과로 배경 제작 방식이 갈립니다(실내=도면 방식 / 야외=항공뷰 방식). | 장소 카드 → 실내/야외 표 | background_mode |
| 19.52 | background_master_plan | 글 LLM조건부 | GPT-5.6 Sol | 장소별로 배경 그림을 몇 장, 어떤 각도로 만들지 계획표(L03B01 같은 번호)를 짭니다. | 장소+샷 → 배경 계획표 | background_mode |
| 19.61 | floor_plan_prompt | 글 LLM조건부 | GPT-5.6 Sol | 실내 장소의 평면도(도면)를 그리기 위한 주문서를 씁니다. | 실내 장소 → 도면 주문서 | background_mode |
| 19.7 | shot_essence_extraction | 글 LLM조건부꺼짐 | GPT-5.6 Sol | (꺼진 기능) 샷의 핵심만 요약. | 샷 → 요약 | shot_essence_enabled |
| 19.9 | scene_consistency | 글 LLM | Gemini 3.1 Pro | 씬들 사이에 모순이 없는지 최종 교차 점검합니다. | 전체 확정 데이터 → 점검 결과 | |
| 21.55 | floor_plan_render | 이미지 생성조건부 | GPT-5.6 Sol | 실내 평면도 이미지를 실제로 그립니다. 방·가구 위치에 알파벳 마커가 찍힌 도면. | 도면 주문서 → 도면 이미지 | background_mode |
| 21.56 | floor_plan_light_sidecar | 글 LLM조건부 | GPT-5.6 Sol | 도면에 조명 정보(창·광원 위치)를 덧붙입니다. | 도면 → 조명 메모 | background_mode |
| 21.57 | floor_plan_overlay_payload | 글 LLM조건부 | GPT-5.6 Sol | 도면 위 마커 라벨 표시용 데이터를 만듭니다. | 도면 → 마커 데이터 | background_mode |
| 21.58 | base_location_dossier | 글 LLM조건부 | GPT-5.6 Sol | 장소에 대해 확정된 사실들을 한 문서로 모읍니다. | 장소+도면 → 장소 대장 | background_mode |
| 21.59 | floor_plan_geometry_readback | VLM 판독조건부 | GPT-5.6 Sol | 그려진 도면을 VLM이 '눈으로 보고' 마커가 제대로 찍혔는지 되읽어 검사합니다. 마커가 겹치면 그 도면은 다시 그립니다(회차당 1~2장 발생하는 만성 이슈). | 도면 이미지 → 판독 결과 | background_mode |
| 21.591 | floor_plan_semantic_readback | VLM 판독조건부 | GPT-5.6 Sol | 도면의 의미(어느 방이 어디인지)를 VLM이 되읽어 확인합니다. | 도면 이미지 → 의미 판독 | background_mode |
| 21.593 | shot_projection_card | 글 LLM조건부 | GPT-5.6 Sol | (조건부) 샷 카메라를 도면 위에 투영한 카드를 만듭니다. | 도면+샷 → 투영 카드 | background_mode |
| 21.594 | bg_space_partition | 글 LLM조건부 | GPT-5.6 Sol | (조건부) 큰 공간을 구역으로 나눕니다. | 도면 → 구역 나눔 | background_mode |
| 21.5945 | dwelling_zone_map | 글 LLM조건부 | GPT-5.6 Sol | (조건부) 주거 공간의 구역 지도를 만듭니다. | 도면 → 구역 지도 | background_mode |
| 21.595 | shot_aware_bg_render_plan | 글 LLM조건부 | GPT-5.6 Sol | 샷의 카메라 각도를 반영해 배경 그림을 어떻게 변형해 만들지 계획합니다. | 샷+도면 판독 → 렌더 계획 | background_mode |
| 21.6 | background_prompt | 글 LLM조건부 | GPT-5.6 Sol | 배경 그림 주문서를 씁니다. '2026년 대한민국'을 명시해 배경이 외국풍이 되는 것을 막는 지점. | 배경 계획표 → 배경 주문서 | background_mode |
| 21.65 | episode_reference_policy | 글 LLM | GPT-5.6 Sol | 그림 만들 때 어떤 참조 사진(배경/인물/직전 샷)을 붙일지 규칙을 정합니다. | 샷+카드 → 참조 규칙 | |
| 21.66 | visual_continuity_anchor | 글 LLM조건부 | GPT-5.6 Sol | (조건부) 샷 사이 시각 연속성을 잡아주는 기준점을 만듭니다. | 샷 → 기준점 | visual_continuity_anchor_enabled |
| 21.7 | scene_detail | 글 LLM | Gemini 3.1 Pro | 샷마다 최종 그림 주문서(스틸 T2I)를 씁니다. 등장 목록(VE)에 없는 인물을 쓰면 자동으로 걸러내고 다시 씁니다. | 샷+VE+옷 카드 → 스틸 주문서 | |
| 21.71 | shot_dependency_t2i | 글 LLM | Gemini Flash | 앞 샷과의 연결 정보를 주문서 문구에 반영합니다. | 연결 그래프 → 보강 주문서 | |
| 21.72 | t2i_review | 글 LLM | GPT-5.6 Sol | 주문서 전체를 한 번에 검토하고 규칙 위반을 고칩니다. | 전체 주문서 → 검수 결과 | |
| 21.73 | zoom_continuity_anchor | 코드VLM 판독조건부 | GPT-5.6 Sol | (조건부) 같은 장소를 당겨 찍은 샷을 위해 기존 그림에서 잘라낸 확대 참조를 만듭니다. | 샷 쌍 → 확대 참조 | zoom_continuity_anchor_enabled |
| 21.76 | outdoor_site_layout | 글 LLM이미지 생성조건부 | GPT-5.6 Sol | 야외 장소를 위에서 내려다본 항공뷰 3종을 만듭니다 — ①마커 찍힌 기본 항공뷰 ②인물 위치 표시 ③카메라 위치 스케치. (오래 걸리는 단계, 90분+ 사례) | 야외 장소+샷 → 항공뷰 3종 | outdoor_site_layout_enabled |
| 21.77 | outdoor_place_spec | 글 LLM조건부꺼짐 | GPT-5.6 Sol | [꺼짐] 야외 장소의 구역·마커 명세서를 씁니다. 시나리오에 근거 있는 것만(evidence-bound). | 씬 근거 → 마커 명세 | outdoor_direct_compose |
| 21.78 | outdoor_place_canon | 이미지 생성VLM 판독조건부꺼짐 | GPT-5.6 Sol | [꺼짐] 야외 장소의 대표 실사 사진과 지도를 만듭니다 — 후보 3장을 생성하고 GPT/Gemini VLM이 점수를 매겨 뽑은 뒤, 결함을 고치고 지도로 재투영. | 명세 → 대표 실사+지도 | outdoor_direct_compose |
| 21.79 | outdoor_shot_grounding | 글 LLM조건부꺼짐 | GPT-5.6 Sol | [꺼짐] 각 샷이 지도의 어느 지점에서, 어느 방향을 보고 찍는지 판정합니다. | 지도+샷 → 위치·카메라 판정 | outdoor_direct_compose |
| 22 | world_guide | 글 LLM | GPT-5.6 Sol | 지금까지의 확정 내용을 모아 월드 가이드 문서를 만듭니다. | 전체 산출물 → 가이드 문서 | |
| 22.5 | space_set_bg | 글 LLM조건부꺼짐 | GPT-5.6 Sol | (조건부) 공간 세트 배경. | — | background_mode |
| 23 | ref_image_gen | 이미지 생성 | Gemini 3.1 Flash Image | 카드들의 참조 사진을 실제로 그립니다 — 1차: 인물 얼굴(증명사진풍) → 2차: 옷(마네킹 착장) → 장소·소품 순. | 그림 주문서 → 참조 사진들 | |
| 24 | composite_image_gen | 이미지 생성조건부 | Gemini 3.1 Flash Image | 인물 얼굴 + 옷을 합쳐 '이 옷을 입은 이 사람' 전신 사진을 만듭니다. 스틸을 그릴 때 실제로 첨부되는 인물 참조. | 얼굴+옷 → 합성 전신 | has_outlooks |
| 24.5 | character_state_variant | 이미지 생성 | Gemini 3.1 Flash Image | 특수 상태의 인물 사진을 만듭니다 — 예: 시신 상태. 기존 합성 사진을 변형(i2i). | 합성 사진+상태 → 상태 변형 | |
| 24.72 | background_render | 이미지 생성조건부 | GPT-5.6 Sol | 배경 그림을 실제로 그립니다. 실내는 도면을 참조로, 야외는 항공뷰를 참조로. 검열에 걸리면 문구를 순화해 1회 재시도. | 배경 주문서+도면/항공뷰 → 배경 그림 | background_mode |
| 25 | scene_image_pipeline | 이미지 생성VLM 판독 | 혼합 | 최종 스틸을 그립니다. ①참조 꾸러미 조립(배경+직전 샷+구도 가이드+인물 합성) → ②주문서 영어 번역 → ③그림 생성(샷당 N장) → ④참조가 규칙대로 다 붙었는지 코드 검증(RCV) — 위반이면 재시도. | 주문서+참조 → 씬 스틸 | |
| 100 | outlook_dedup | 글 LLM요청 시 | GPT-5.6 Sol | (요청 시) 옷 카드 중복 정리. | 옷 카드 → 병합 | |