장면이 달라져도 같은 모델과 같은 촬영처럼 보이게 하려면 무엇을 먼저 고정해야 할까요?
장면마다 모델의 얼굴과 의상이 달라지고, 모션이 추가되면 걸음과 표정까지 무너지는 경우가 많았습니다. 정지 이미지 여러 장을 만드는 것과, 그 장면들을 하나의 촬영처럼 연결하는 것은 다른 문제였습니다.
이 작업은 플랫폼의 기능을 순서대로 쓰는 방식보다, 바뀌면 안 되는 기준을 먼저 나누고 각 단계에서 검수하는 방식으로 진행했습니다.
실제 경험에서 시작했습니다.
출발점은 흰 탱크톱과 데님을 입은 정면 전신 사진 한 장이었습니다. 먼저 Magnific에서 업스케일한 뒤, 눈매·코·입술·턱선과 헤어 실루엣을 여러 각도에서 확인할 수 있는 모델 시트로 확장했습니다. 다음 생성에서 참고할 기준을 먼저 만든 것입니다.






IDENTITY SHEET — 얼굴이 잘리지 않는 클로즈업 6장으로 각도와 표정이 달라져도 동일한 인물로 보이는지 확인했습니다.
다음은 의상 기준을 분리했습니다. 라임 슬리브리스 탑, 라벤더 가디건, 테라코타 랩 스커트, 빨간 플립플롭, 검은 짜임 백을 색·소재·레이어링·액세서리로 나눠 정리했습니다. 참고 사진의 구도나 포즈를 따라가지 않고, 스타일링을 만드는 관계만 옮겼습니다.


OUTFIT REFERENCE & RESULT — 전체 스타일이 보이는 레퍼런스 1장과, 같은 의상 구성을 기준 모델에 적용한 결과 1장을 비교했습니다.
기준 키프레임이 안정된 뒤에 로우 앵글, 신호 대기, 하이 앵글, 측면 컷, 셀피와 버드아이 뷰로 장면을 늘렸습니다. 장면마다 카메라 높이, 거리, 몸의 방향 중 하나만 바꾸면 어떤 요소 때문에 결과가 흔들렸는지 빠르게 확인할 수 있었습니다.
실제 편집에서는 생성한 결과를 모두 사용하지 않았습니다. 먼저 정지 이미지에서 얼굴·손·발·의상·가방이 변한 후보를 제외했습니다. 이미지가 자연스럽더라도 영상으로 바꾸었을 때 걸음, 표정, 머리카락, 옷자락이 무너지는 컷은 타임라인에서 삭제했습니다.
AI 룩북의 완성도는 이미지를 많이 만드는 데서가 아니라, 같은 기준으로 선택하고 다시 만드는 순서에서 만들어집니다.
— 박시하, Creative Director
핵심 관점
하나의 촬영처럼 보이게 만드는 것은 얼굴 유사도만의 문제가 아니었습니다. 인물, 스타일링, 장면, 움직임과 소리가 각자의 기준을 유지할 때 여러 컷이 같은 시간과 공간으로 연결됐습니다.
참고 이미지도 하나에 모든 역할을 담지 않았습니다. 모델 시트는 인물을, 패션 레퍼런스는 의상을, 첫 키프레임은 조명과 공간을 판단하는 기준으로 사용했습니다. 기준의 역할이 분명하면 결과가 틀어졌을 때 어디를 다시 만들어야 하는지도 빠르게 알 수 있었습니다.
- 01Identity anchor
눈·코·입·턱선·헤어 라인을 여러 각도로 고정합니다. - 02Style anchor
색조합, 소재, 레이어링과 소품을 별도 참조로 관리합니다. - 03Scene anchor
빛, 공간, 렌즈, 카메라 높이를 한 장면씩 정의합니다. - 04Motion rule
인물의 미세한 동작과 옷자락의 반응을 먼저 설계합니다. - 05Sound continuity
장면이 끊겨도 같은 시간과 공간으로 느껴지도록 소리를 연결합니다.
정지 이미지의 성공과 영상 장면의 성공도 따로 판단했습니다. 좋은 키프레임이라도 모션에서 인물이 무너질 수 있고, 각자 좋은 장면이라도 이어 붙였을 때 리듬이 끊길 수 있기 때문입니다.
마지막으로 음악과 주변 소리를 장면별로 나누지 않고 하나의 시간으로 다시 만들었습니다. 화면은 바뀌어도 걸음 소리, 도시의 공기, 옷 마찰음이 연속되면 컷 사이의 분절이 덜 돋보였습니다.
AI 룩북 영상을 만드는 6단계
특정 서비스의 기능보다 어떤 기준을 어떤 순서로 만드는지가 중요했습니다. 실제 작업에서 사용한 순서를 다음 6단계로 정리했습니다.
- 01Source & Upscale
업스케일 전에 바뀌면 안 되는 것을 정합니다.
해상도를 높이는 작업에서도 인물의 인상은 달라질 수 있습니다.
Magnific에서 피부 결, 머리카락 경계, 의상 짜임과 데님 텍스처를 복원했습니다. 다만 얼굴 비율, 체형, 포즈와 헤어 실루엣은 변하지 않도록 설정을 낮게 유지했습니다.
KEEP얼굴 비율, 체형, 포즈, 헤어, 배경 구조
AVOID과도한 피부 보정, 눈 확대, 머리 실루엣 변형
Upscale promptHigh-fidelity portrait and full-body upscale. Preserve the exact facial identity, body proportions, pose, hairstyle silhouette, clothing construction and background geometry. Recover natural skin texture, individual hair strands, rib-knit fabric and denim weave. Clean studio detail, realistic pores, no beauty filter, no facial redesign, no body reshaping.
- 02Identity Sheet
얼굴 기준을 여러 각도와 표정으로 나눕니다.
정면 사진 한 장은 측면과 표정 변화를 설명하기에 부족했습니다.
정면 무표정, 부드러운 미소, 밝은 미소, 45도, 사이드 프로필, 뷰티 앵글을 같은 조명과 의상으로 만들었습니다. 이 시트는 프로필 사진 묶음이 아니라, 후속 장면에서 고정할 특징을 확인하는 기준이었습니다.
Identity promptCreate a professional six-image fashion model identity sheet of the exact same young Korean woman from the reference images. Preserve her eye shape and spacing, nose bridge and tip, lip shape, jawline, cheek volume, skin tone, natural asymmetry, long layered black hair and small silver hoop earrings. Minimal clean makeup, realistic skin texture, neutral off-white studio, soft frontal daylight. Produce consistent close-up views: neutral front, soft smile, open smile, three-quarter, side profile and elevated beauty angle. Keep the full head, jawline and shoulders inside every frame. No face redesign, no age change, no glam retouching.
- 03Styling Transfer
의상은 사진 전체가 아니라 요소별로 옮깁니다.
참고 사진을 그대로 복제하지 않고 스타일링을 구성하는 요소만 분리했습니다.
색, 재질, 실루엣, 레이어링과 소품을 각각 정의한 뒤 기준 모델에 적용했습니다. 그런 다음 의상의 색과 소재뿐 아니라 가방의 크기와 위치, 신발의 형태까지 확인했습니다.
Styling promptDress the same identity-preserved model in a lime green asymmetric camisole, a soft lavender cardigan worn loose around the shoulders, a translucent terracotta wrap midi skirt, minimal red flip-flops, and a small black woven shoulder bag. Preserve the exact face, body proportions, hairstyle and natural skin. Contemporary Seoul street-fashion editorial, sunlit concrete architecture, realistic fabric drape and material texture.
- 04Scene Expansion & Selection
장면은 한 번에 하나의 변수만 바꾸며 늘립니다.
모델과 의상을 고정한 채 카메라 높이, 거리, 몸의 방향을 하나씩 바꾸었습니다.
반복적인 전신 워킹을 피하고 로우 앵글, 하이 앵글, 측면 컷, 셀피와 버드아이 뷰를 나눠 생성했습니다. 각 장면의 역할이 다르면서도 같은 날, 같은 공간으로 보이는지를 확인했습니다.
Scene variation promptGenerate a new shot from the same fashion film while preserving the exact model identity and complete outfit. Change only one cinematic variable at a time: camera height, lens distance, body orientation, gesture, or framing. Maintain the same bright midday Seoul concrete location, direct sunlight, natural hard-edged shadows, realistic skin and fabric. Editorial spontaneity, not a repeated catalog pose.
1ST GATE · IMAGE얼굴 유사도, 손과 발, 의상·가방·그림자의 일관성을 확인했습니다.
2ND GATE · MOTION발 미끄러짐, 표정 변형, 부자연스러운 속도, 옷과 배경의 변형이 보이는 컷을 제외했습니다.
정지 이미지 검수를 통과한 장면만 영상으로 만들었고, 모션에서 다시 무너지는 컷은 편집에서 제외했습니다. 부자연스러운 순간을 짧게 숨기기보다 해당 장면을 더 안정적인 컷으로 교체했습니다.









SELECTED IMAGE BOARD — 카메라 화면의 워킹 컷부터 최종 장면까지, 인물·의상·광선·공간의 일관성을 확인한 9개 이미지입니다.
편집 판단생성한 결과를 모두 사용하기보다 관객이 이상함을 느끼지 않는 장면만 남겼습니다.
- 05Motion Design
정지 이미지와 영상 결과를 따로 검수합니다.
정지 프레임이 자연스럽더라도 과도한 동작을 주면 얼굴, 손, 옷자락이 쉽게 무너졌습니다.
걸음의 중심 이동, 시선의 짧은 변화, 머리카락과 스커트의 바람 반응, 가방의 작은 흔들림부터 지정했습니다. 카메라는 약하게 추적하되 인물의 얼굴을 새로 재구성할 정도로 크게 움직이지 않도록 제한했습니다.
Motion promptThe model takes two natural, confident steps toward camera. Her weight shifts realistically through hips and shoulders; the terracotta wrap skirt and loose lavender cardigan respond to a light summer breeze; the small woven bag sways gently. Subtle blinking and breathing, calm direct gaze. Smooth handheld tracking with minimal parallax. Preserve her exact face, hands, outfit and body proportions. No morphing, no sudden acceleration, no extra limbs, no camera orbit.
- 06Sound & 4K Finish
음악보다 먼저 하나의 시간과 공간을 만듭니다.
장면마다 다른 소리가 붙으면 화면이 자연스러워도 편집의 경계가 드러났습니다.
초기 편집본에 남아 있던 음악을 모두 제거하고, Higgsfield에서 영상 길이에 맞는 20초 인스트루멘털을 새로 만들었습니다. 그 위에 걸음 소리, 먼 차량, 도시의 공기와 옷 마찰음을 낮게 쌓아 장면 사이를 연결했습니다.
Higgsfield music prompt20-second seamless instrumental for a sunlit Seoul street-fashion film, contemporary Korean indie electronic with restrained UK garage rhythm, warm bass, crisp two-step drums, airy glass synth plucks and subtle organic percussion; youthful, stylish, editorial, confident; immediate hook, gentle mid-section lift, clean resolved ending; no vocals, no speech, no lyrics, no cinematic trailer effects, no abrupt cuts, no corporate stock-music feeling.
Final soundtrackHiggsfield 음악 + 도시 앨비언스 + 걸음 소리Higgsfield 음원 생성에는 1.25 크레딧을 사용했습니다. 최종 영상은 1080 × 1822 편집본에서 2160 × 3644로 업스케일했습니다.
다음 작업에 적용하는 방법
이 방식은 특정 도구에 묶이지 않습니다. 장면을 생성하거나 영상으로 바꾼 뒤 다음 질문을 순서대로 확인하면, 타임라인에 넣기 전에 문제가 있는 장면을 빠르게 걸러낼 수 있습니다.
- 01정면과 측면에서 눈매·코·입술·턱선의 관계가 같은가요?
- 02헤어 라인과 머리 길이가 카메라 각도 때문에 달라 보일 뿐인가요?
- 03탑·가디건·스커트·신발·가방의 색과 소재가 장면마다 같은가요?
- 04직사광의 방향과 그림자 경계가 한 날의 동일한 시간대로 느껴지나요?
- 05각 장면에 로우·아이·하이 앵글, 클로즈업 중 분명한 역할이 있나요?
- 06움직임이 얼굴·손·신발·옷자락의 형태를 손상시키지 않나요?
- 07음악에 끊김이 없고 걸음·앨비언스가 컷 전환을 숨겨주나요?
- 08사용처에 맞는 AI 생성 고지와 음원 라이선스를 확인했나요?
