장면이 달라져도 같은 모델과 같은 촬영처럼 보이게 하려면 무엇을 먼저 고정해야 할까요?

장면마다 모델의 얼굴과 의상이 달라지고, 모션이 추가되면 걸음과 표정까지 무너지는 경우가 많았습니다. 정지 이미지 여러 장을 만드는 것과, 그 장면들을 하나의 촬영처럼 연결하는 것은 다른 문제였습니다.

이 작업은 플랫폼의 기능을 순서대로 쓰는 방식보다, 바뀌면 안 되는 기준을 먼저 나누고 각 단계에서 검수하는 방식으로 진행했습니다.

Source1기준 전신 사진
Identity sheet6각도·표정·뷰티 클로즈업
Selected frames9두 번의 검수를 통과한 이미지
Final19.945s2160 × 3644 마스터

실제 경험에서 시작했습니다.

출발점은 흰 탱크톱과 데님을 입은 정면 전신 사진 한 장이었습니다. 먼저 Magnific에서 업스케일한 뒤, 눈매·코·입술·턱선과 헤어 실루엣을 여러 각도에서 확인할 수 있는 모델 시트로 확장했습니다. 다음 생성에서 참고할 기준을 먼저 만든 것입니다.

모델의 정면 무표정 클로즈업
모델의 정면 미소 클로즈업
모델의 밝은 미소 클로즈업
모델의 45도 뷰티 클로즈업
모델의 측면 프로필 클로즈업
모델의 턱을 살짝 든 뷰티 앵글 클로즈업

IDENTITY SHEET — 얼굴이 잘리지 않는 클로즈업 6장으로 각도와 표정이 달라져도 동일한 인물로 보이는지 확인했습니다.

다음은 의상 기준을 분리했습니다. 라임 슬리브리스 탑, 라벤더 가디건, 테라코타 랩 스커트, 빨간 플립플롭, 검은 짜임 백을 색·소재·레이어링·액세서리로 나눠 정리했습니다. 참고 사진의 구도나 포즈를 따라가지 않고, 스타일링을 만드는 관계만 옮겼습니다.

라임 탑, 라벤더 가디건, 테라코타 스커트와 빨간 플립플롭이 보이는 전체 패션 레퍼런스
REFERENCE LOOK
기준 모델에 참고 의상을 적용한 전신 키프레임
GENERATED LOOK

OUTFIT REFERENCE & RESULT — 전체 스타일이 보이는 레퍼런스 1장과, 같은 의상 구성을 기준 모델에 적용한 결과 1장을 비교했습니다.

기준 키프레임이 안정된 뒤에 로우 앵글, 신호 대기, 하이 앵글, 측면 컷, 셀피와 버드아이 뷰로 장면을 늘렸습니다. 장면마다 카메라 높이, 거리, 몸의 방향 중 하나만 바꾸면 어떤 요소 때문에 결과가 흔들렸는지 빠르게 확인할 수 있었습니다.

실제 편집에서는 생성한 결과를 모두 사용하지 않았습니다. 먼저 정지 이미지에서 얼굴·손·발·의상·가방이 변한 후보를 제외했습니다. 이미지가 자연스럽더라도 영상으로 바꾸었을 때 걸음, 표정, 머리카락, 옷자락이 무너지는 컷은 타임라인에서 삭제했습니다.

이 과정에서 확인한 것은 생성 수와 완성도가 같지 않다는 점입니다. 최종본은 많이 만든 결과가 아니라, 이미지와 모션 두 단계의 검수를 통과한 장면만으로 구성했습니다.

AI 룩북의 완성도는 이미지를 많이 만드는 데서가 아니라, 같은 기준으로 선택하고 다시 만드는 순서에서 만들어집니다.

— 박시하, Creative Director

핵심 관점

하나의 촬영처럼 보이게 만드는 것은 얼굴 유사도만의 문제가 아니었습니다. 인물, 스타일링, 장면, 움직임과 소리가 각자의 기준을 유지할 때 여러 컷이 같은 시간과 공간으로 연결됐습니다.

참고 이미지도 하나에 모든 역할을 담지 않았습니다. 모델 시트는 인물을, 패션 레퍼런스는 의상을, 첫 키프레임은 조명과 공간을 판단하는 기준으로 사용했습니다. 기준의 역할이 분명하면 결과가 틀어졌을 때 어디를 다시 만들어야 하는지도 빠르게 알 수 있었습니다.

  • 01
    Identity anchor
    눈·코·입·턱선·헤어 라인을 여러 각도로 고정합니다.
  • 02
    Style anchor
    색조합, 소재, 레이어링과 소품을 별도 참조로 관리합니다.
  • 03
    Scene anchor
    빛, 공간, 렌즈, 카메라 높이를 한 장면씩 정의합니다.
  • 04
    Motion rule
    인물의 미세한 동작과 옷자락의 반응을 먼저 설계합니다.
  • 05
    Sound continuity
    장면이 끊겨도 같은 시간과 공간으로 느껴지도록 소리를 연결합니다.

정지 이미지의 성공과 영상 장면의 성공도 따로 판단했습니다. 좋은 키프레임이라도 모션에서 인물이 무너질 수 있고, 각자 좋은 장면이라도 이어 붙였을 때 리듬이 끊길 수 있기 때문입니다.

마지막으로 음악과 주변 소리를 장면별로 나누지 않고 하나의 시간으로 다시 만들었습니다. 화면은 바뀌어도 걸음 소리, 도시의 공기, 옷 마찰음이 연속되면 컷 사이의 분절이 덜 돋보였습니다.

핵심은 첫 키프레임을 비교 기준으로 쓰는 것이었습니다. 새 장면이 나올 때마다 얼굴, 의상, 빛, 액세서리가 기준에서 얼마나 멀어졌는지 확인했습니다.

AI 룩북 영상을 만드는 6단계

특정 서비스의 기능보다 어떤 기준을 어떤 순서로 만드는지가 중요했습니다. 실제 작업에서 사용한 순서를 다음 6단계로 정리했습니다.

  1. 01
    Source & Upscale

    업스케일 전에 바뀌면 안 되는 것을 정합니다.

    해상도를 높이는 작업에서도 인물의 인상은 달라질 수 있습니다.

    Magnific에서 피부 결, 머리카락 경계, 의상 짜임과 데님 텍스처를 복원했습니다. 다만 얼굴 비율, 체형, 포즈와 헤어 실루엣은 변하지 않도록 설정을 낮게 유지했습니다.

    KEEP얼굴 비율, 체형, 포즈, 헤어, 배경 구조

    AVOID과도한 피부 보정, 눈 확대, 머리 실루엣 변형

    Upscale prompt
    High-fidelity portrait and full-body upscale. Preserve the exact facial identity, body proportions, pose, hairstyle silhouette, clothing construction and background geometry. Recover natural skin texture, individual hair strands, rib-knit fabric and denim weave. Clean studio detail, realistic pores, no beauty filter, no facial redesign, no body reshaping.
  2. 02
    Identity Sheet

    얼굴 기준을 여러 각도와 표정으로 나눕니다.

    정면 사진 한 장은 측면과 표정 변화를 설명하기에 부족했습니다.

    정면 무표정, 부드러운 미소, 밝은 미소, 45도, 사이드 프로필, 뷰티 앵글을 같은 조명과 의상으로 만들었습니다. 이 시트는 프로필 사진 묶음이 아니라, 후속 장면에서 고정할 특징을 확인하는 기준이었습니다.

    Identity prompt
    Create a professional six-image fashion model identity sheet of the exact same young Korean woman from the reference images. Preserve her eye shape and spacing, nose bridge and tip, lip shape, jawline, cheek volume, skin tone, natural asymmetry, long layered black hair and small silver hoop earrings. Minimal clean makeup, realistic skin texture, neutral off-white studio, soft frontal daylight. Produce consistent close-up views: neutral front, soft smile, open smile, three-quarter, side profile and elevated beauty angle. Keep the full head, jawline and shoulders inside every frame. No face redesign, no age change, no glam retouching.
  3. 03
    Styling Transfer

    의상은 사진 전체가 아니라 요소별로 옮깁니다.

    참고 사진을 그대로 복제하지 않고 스타일링을 구성하는 요소만 분리했습니다.

    색, 재질, 실루엣, 레이어링과 소품을 각각 정의한 뒤 기준 모델에 적용했습니다. 그런 다음 의상의 색과 소재뿐 아니라 가방의 크기와 위치, 신발의 형태까지 확인했습니다.

    Styling prompt
    Dress the same identity-preserved model in a lime green asymmetric camisole, a soft lavender cardigan worn loose around the shoulders, a translucent terracotta wrap midi skirt, minimal red flip-flops, and a small black woven shoulder bag. Preserve the exact face, body proportions, hairstyle and natural skin. Contemporary Seoul street-fashion editorial, sunlit concrete architecture, realistic fabric drape and material texture.
  4. 04
    Scene Expansion & Selection

    장면은 한 번에 하나의 변수만 바꾸며 늘립니다.

    모델과 의상을 고정한 채 카메라 높이, 거리, 몸의 방향을 하나씩 바꾸었습니다.

    반복적인 전신 워킹을 피하고 로우 앵글, 하이 앵글, 측면 컷, 셀피와 버드아이 뷰를 나눠 생성했습니다. 각 장면의 역할이 다르면서도 같은 날, 같은 공간으로 보이는지를 확인했습니다.

    Scene variation prompt
    Generate a new shot from the same fashion film while preserving the exact model identity and complete outfit. Change only one cinematic variable at a time: camera height, lens distance, body orientation, gesture, or framing. Maintain the same bright midday Seoul concrete location, direct sunlight, natural hard-edged shadows, realistic skin and fabric. Editorial spontaneity, not a repeated catalog pose.

    1ST GATE · IMAGE얼굴 유사도, 손과 발, 의상·가방·그림자의 일관성을 확인했습니다.

    2ND GATE · MOTION발 미끄러짐, 표정 변형, 부자연스러운 속도, 옷과 배경의 변형이 보이는 컷을 제외했습니다.

    정지 이미지 검수를 통과한 장면만 영상으로 만들었고, 모션에서 다시 무너지는 컷은 편집에서 제외했습니다. 부자연스러운 순간을 짧게 숨기기보다 해당 장면을 더 안정적인 컷으로 교체했습니다.

    카메라 화면 안으로 걸어오는 모델 장면
    키 워킹 장면
    로우 앵글 걸음 장면
    도시에서 기다리는 장면
    모션 블러 장면
    하이 앵글 장면
    측면 음료 장면
    셀피 장면
    버드아이 뷰 장면

    SELECTED IMAGE BOARD — 카메라 화면의 워킹 컷부터 최종 장면까지, 인물·의상·광선·공간의 일관성을 확인한 9개 이미지입니다.

    편집 판단생성한 결과를 모두 사용하기보다 관객이 이상함을 느끼지 않는 장면만 남겼습니다.

  5. 05
    Motion Design

    정지 이미지와 영상 결과를 따로 검수합니다.

    정지 프레임이 자연스럽더라도 과도한 동작을 주면 얼굴, 손, 옷자락이 쉽게 무너졌습니다.

    걸음의 중심 이동, 시선의 짧은 변화, 머리카락과 스커트의 바람 반응, 가방의 작은 흔들림부터 지정했습니다. 카메라는 약하게 추적하되 인물의 얼굴을 새로 재구성할 정도로 크게 움직이지 않도록 제한했습니다.

    Motion prompt
    The model takes two natural, confident steps toward camera. Her weight shifts realistically through hips and shoulders; the terracotta wrap skirt and loose lavender cardigan respond to a light summer breeze; the small woven bag sways gently. Subtle blinking and breathing, calm direct gaze. Smooth handheld tracking with minimal parallax. Preserve her exact face, hands, outfit and body proportions. No morphing, no sudden acceleration, no extra limbs, no camera orbit.
  6. 06
    Sound & 4K Finish

    음악보다 먼저 하나의 시간과 공간을 만듭니다.

    장면마다 다른 소리가 붙으면 화면이 자연스러워도 편집의 경계가 드러났습니다.

    초기 편집본에 남아 있던 음악을 모두 제거하고, Higgsfield에서 영상 길이에 맞는 20초 인스트루멘털을 새로 만들었습니다. 그 위에 걸음 소리, 먼 차량, 도시의 공기와 옷 마찰음을 낮게 쌓아 장면 사이를 연결했습니다.

    Higgsfield music prompt
    20-second seamless instrumental for a sunlit Seoul street-fashion film, contemporary Korean indie electronic with restrained UK garage rhythm, warm bass, crisp two-step drums, airy glass synth plucks and subtle organic percussion; youthful, stylish, editorial, confident; immediate hook, gentle mid-section lift, clean resolved ending; no vocals, no speech, no lyrics, no cinematic trailer effects, no abrupt cuts, no corporate stock-music feeling.
    Final soundtrackHiggsfield 음악 + 도시 앨비언스 + 걸음 소리

    Higgsfield 음원 생성에는 1.25 크레딧을 사용했습니다. 최종 영상은 1080 × 1822 편집본에서 2160 × 3644로 업스케일했습니다.

다음 작업에 적용하는 방법

이 방식은 특정 도구에 묶이지 않습니다. 장면을 생성하거나 영상으로 바꾼 뒤 다음 질문을 순서대로 확인하면, 타임라인에 넣기 전에 문제가 있는 장면을 빠르게 걸러낼 수 있습니다.

  • 01
    정면과 측면에서 눈매·코·입술·턱선의 관계가 같은가요?
  • 02
    헤어 라인과 머리 길이가 카메라 각도 때문에 달라 보일 뿐인가요?
  • 03
    탑·가디건·스커트·신발·가방의 색과 소재가 장면마다 같은가요?
  • 04
    직사광의 방향과 그림자 경계가 한 날의 동일한 시간대로 느껴지나요?
  • 05
    각 장면에 로우·아이·하이 앵글, 클로즈업 중 분명한 역할이 있나요?
  • 06
    움직임이 얼굴·손·신발·옷자락의 형태를 손상시키지 않나요?
  • 07
    음악에 끊김이 없고 걸음·앨비언스가 컷 전환을 숨겨주나요?
  • 08
    사용처에 맞는 AI 생성 고지와 음원 라이선스를 확인했나요?

자주 묻는 질문

여러 장면에서 같은 얼굴을 유지하는 가장 중요한 방법은 무엇인가요?
정면 한 장만 반복해 참조하기보다 정면, 45도, 측면, 표정 클로즈업으로 구성한 아이덴티티 시트를 먼저 만드는 편이 좋습니다. 그런 뒤 새 장면에서는 얼굴이 아니라 카메라·포즈·배경 중 하나만 변경합니다.
얼굴 참고 사진 한 장으로도 시작할 수 있나요?
시작은 가능하지만 그 한 장을 바로 영상에 사용하기보다, 여러 각도의 시트를 만든 뒤 가장 일관된 이미지를 다시 기준으로 쓰는 방식이 안정적입니다.
생성한 이미지와 영상은 모두 최종본에 사용했나요?
아닙니다. 먼저 정지 이미지에서 아이덴티티, 손과 발, 의상과 소품을 검수했습니다. 그런 뒤 영상화한 결과에서 걸음, 표정, 옷 물리, 배경이 무너지는 컷을 다시 제외했습니다. 부자연스러운 순간을 숨기기보다 해당 장면 전체를 삭제하고 다른 컷으로 교체했습니다.
장면 이미지와 모션 중 무엇을 먼저 만들어야 하나요?
장면 이미지가 먼저입니다. 모션은 정지 프레임의 구도와 인물 관계를 확장하므로, 키프레임에서 얼굴·옷·손·신발이 안정된 뒤 움직임을 설계해야 합니다.
음악은 영상 길이에 딱 맞게 생성해야 하나요?
다시 편집하지 않을 것이라면 그렇습니다. 영상의 정확한 길이, 첫 1–2초의 훅, 중간 상승, 끝의 해결 방식을 프롬프트에 넣으면 자른 티가 덜 납니다.
AI 룩북을 브랜드 채널에 공개할 때 주의할 점은 무엇인가요?
인물·의상·배경·음원의 권리와 각 생성 툴의 상업적 이용 조건을 확인해야 합니다. 실제 제품이 아닌 스타일 실험이라면 AI 생성 및 비공식 컨셉임을 명확히 표시하는 편이 좋습니다.