대본을 장면 수로 쪼갠다
먼저 말할 내용을 확정하고 화면이 바뀌는 지점을 표시한다. 30초 영상이면 “대사 한 덩어리 = 컷 하나”로 기계적으로 나누지 말고 시청자가 실제로 볼 행동을 기준으로 구분한다. 한 컷에서 인물·배경·카메라 움직임을 한꺼번에 바꾸면 뒤 컷과 이어질 확률이 낮다. 사용자 제작 사례에서도 한 장면의 품질보다 여러 장면의 일관성과 최종 편집이 더 큰 병목으로 보고된다.
공통 기준을 잠그고 컷을 만든다
등장인물의 복장, 배경의 시간대, 색감, 화면 비율을 한 장의 기준 이미지로 정한다. 새 컷마다 그 기준을 다시 참조시키고, 이어지는 컷에서 같은 인물로 보이는지 확인한다. 실패 컷은 스토리에 필요한 위치부터 다시 뽑는다. 모든 컷을 무작정 많이 생성한 다음 골라내면 돈은 쓰지만 연결감은 해결되지 않는다.
완성 판정은 소리 켠 상태로 끝까지 재생
나레이션을 넣고 자막의 실제 등장 시간과 음성을 맞춘다. BGM이 말소리를 가리지 않는지 휴대전화 스피커로 듣는다. 컷 사이에서 손·소품·인물 표정이 갑자기 바뀌는지도 전체 길이로 본다. 썸네일이나 생성기 안 미리보기만으로는 이 오류가 잘 안 보인다.
제작 기준
영상 생성기는 컷을 만드는 공정이다. 완성품의 가치는 컷을 골라 붙이고 소리와 리듬을 맞추는 마지막 판단에서 나온다.