정지 이미지 수십 장으로 움직이는 영상을 만들 수 있을까
캐릭터도 어느 정도 안정됐고, 소품 클로즈업 문제도 우회할 방법을 찾았다. 이제 남은 건 이 정지 이미지들을 어떻게 "영상처럼" 보이게 만드느냐였다. 처음엔 당연히 영상 생성 AI로 다 만들면 되는 줄 알았는데, 여기서도 예상 밖의 계산이 필요했다.
영상 생성은 비용이 다르다는 걸 뒤늦게 알았다
Flow는 이미지 생성과 영상 생성을 둘 다 지원하는데, 이미지는 구독 안에서 사실상 무제한으로 뽑을 수 있는 반면 영상은 크레딧 소모가 훨씬 크다. 처음엔 이 차이를 모르고 그냥 다 영상으로 만들면 되겠다 싶었는데, 계산해보니 지금까지 쌓인 컷 수만 해도 영상으로 전부 만들면 감당이 안 되는 수준이었다.
그래서 정지 이미지 + 카메라 워크로 방향을 바꿨다
결국 택한 방법은, 대부분의 장면을 정지 이미지로 만들고 편집 단계에서 팬(카메라를 좌우로 움직이는 것)이나 줌(확대·축소)을 걸어서 "움직이고 있다"는 인상만 주는 방식이었다. 진짜 동작이 필요한 극히 일부 구간만 영상으로 만들고, 나머지는 정지 이미지로 커버하기로 했다.
그런데 팬줌만으로는 부족한 구간이 있었다
문제는 밀당 장면처럼 감정이 빠르게 바뀌는 구간이었다. 예를 들어 "눈을 굴리며 씩 웃는" 표정 하나를 표현하려면, 팬줌 정도로는 그 미묘한 움직임이 안 살았다. 이런 곳엔 아예 프레임을 여러 장(표정이 조금씩 바뀌는 정지 이미지 4~5장) 만들어서, 짧은 간격으로 빠르게 넘기는 방식이 더 어울릴 것 같았다. 흔히 말하는 플립북 방식이다.
모든 구간을 플립북으로 하려니 이미지가 턱없이 부족했다
플립북 방식을 쓰려면 "동작의 여러 순간"이 이산적으로 여러 장 있어야 하는데, 지금까지 만든 컷은 대부분 가사 한 소절당 한 장 정도만 있었다. 즉 시작 자세와 끝 자세만 있고 그 사이 중간 과정이 통째로 비어 있었다. 이걸 다 채우려면 지금까지 만든 것보다 훨씬 많은 이미지를 새로 만들어야 하는 상황이었다.
결국 구간별로 다르게 처리하기로 했다
모든 장면에 같은 방식을 적용하는 대신, 구간의 성격에 따라 나누기로 했다. 밀당처럼 리듬감이 필요한 구간은 플립북(중간 프레임 추가), 평온한 대화나 화해 장면처럼 느린 무드가 필요한 구간은 기존처럼 팬줌, 진짜 동작이 필요한 딱 몇 컷만 영상 생성. 이렇게 나누니 필요한 작업량이 훨씬 현실적인 수준으로 줄었다.
여전히 못 푼 것
- 플립북에 필요한 중간 프레임을 실제로 몇 장 만들어보려고 시도는 했는데, 그 사이 이미지 생성을 너무 많이 해서 하루 생성 한도를 넘겨버렸다. 결국 중간 프레임 테스트는 끝까지 못 해보고 중단했다.
- 정지 이미지 팬줌과 플립북이 한 영상 안에서 섞였을 때 톤이 안 어색할지는 여전히 확인 못 했다.
- 영상 생성이 꼭 필요한 구간을 어떻게 정확히 골라낼지 기준도 아직 명확하지 않다.
- 무엇보다, 이날은 생성 한도도 걸리고 여러 번 시행착오를 겪으면서 체력적으로도 지쳐서 그냥 여기서 멈췄다. 계획대로 다 끝내지 못한 채로 하루를 마감한 셈이다.
정리
영상 하나를 만드는 데도 모든 장면을 같은 방식으로 만들 필요가 없다는 걸 이번에 배웠다. 비용과 필요한 디테일 수준에 따라 이미지, 팬줌, 플립북, 영상 생성을 구간별로 골라 쓰는 게 효율적일 거라는 계획까지는 세웠다. 다만 계획을 실제로 검증하는 단계에서 생성 한도에 걸리고 지쳐서 중단했다는 것도 솔직히 적어둔다. 계획을 세우는 것과 그걸 끝까지 실행하는 건 역시 다른 일이다.