본문 바로가기

편집자동화 등(Vrew.Gas 등)

Vrew가 AI 보컬 가사를 반토막으로 알아들었다

이미지 작업을 어느 정도 마무리하고, 이제 완성된 곡에 자막을 입히는 단계로 넘어갔다. Vrew라는 도구를 쓰면 오디오만 넣어도 자동으로 가사를 인식해서 자막을 만들어주는데, 여기서 또 예상 못 한 문제를 만났다.

 

자동 인식된 자막이 물음표투성이였다

오디오를 넣고 자동 자막 생성을 돌렸더니, 결과물에 [?]로 표시된 구간이 한가득이었다. 특히 후렴구처럼 여러 소리가 겹치는 부분에서 심했다. 처음엔 "몇 군데만 손보면 되겠지" 싶었는데, 실제로 원곡 가사와 하나하나 대조해보니 생각보다 훨씬 많이 틀려 있었다.

 

단순 오타 수준이 아니라 아예 통째로 빠진 줄이 있었다

더 큰 문제는 따로 있었다. 다른 자막 도구(클립챔프)로도 같은 오디오를 돌려봤는데, 여기서도 비슷한 문제가 나왔다. 그런데 이번엔 오타가 아니라, 노래 가사 중 몇 줄이 통째로 인식 자체가 안 되고 건너뛴 구간이 있었다. 예를 들어 후렴구가 반복되는 부분에서 한 세트가 통째로 빠져 있어서, 원곡 가사를 옆에 띄워놓고 시간대별로 대조하지 않았으면 눈치도 못 챌 뻔했다.

 

왜 이런 일이 생기는지 짐작해봤다

이건 사람 목소리가 아니라 AI가 생성한 보컬이라서 그런 것 같다. Suno로 만든 곡은 발음이 사람보다 조금 뭉개지거나, 리버브 같은 이펙트가 걸려 있는 경우가 많은데, 이게 일반적인 음성인식(STT) 엔진 입장에서는 더 어려운 조건이 되는 모양이다. 사람이 부른 노래로 자동 자막을 돌렸을 때보다 훨씬 인식률이 낮았다.

 

결국 자동 인식은 참고용으로만 쓰고, 원본 가사를 직접 손으로 맞췄다

자동 인식 결과를 고쳐가며 쓰는 것보다, 아예 처음부터 정확한 원곡 가사 텍스트를 준비해두고, 자동 인식된 타임스탬프(몇 초에 어떤 말이 나왔는지)만 참고해서 시간을 맞추는 방식으로 바꿨다. 두 개의 자동 인식 결과(Vrew, 클립챔프)를 서로 대조하면서 빠진 부분을 찾아내고, 그 자리에 원곡 가사를 새로 끼워 넣었다. 최종적으로는 SRT 자막 파일 형태로 따로 만들어서, 이걸 Vrew에 다시 불러오는 식으로 정리했다.

 

여전히 못 푼 것

  • 두 도구를 대조해서 빠진 구간을 찾아내긴 했지만, 정확한 초 단위 타이밍은 결국 추정치다. 실제 음원을 들으면서 미세하게 다시 맞춰야 하는 부분이 아직 남아 있다.
  • AI 보컬 곡을 쓸 때마다 매번 이런 대조 작업을 해야 하는 건지, 아니면 애초에 자동 인식이 더 잘 되는 다른 방법(보컬만 분리해서 인식시키는 등)이 있는 건지는 아직 시도해보지 못했다.
  • 자동 인식이 아예 통째로 한 소절을 건너뛸 수 있다는 걸 이번에 알게 됐는데, 이걸 미리 예방할 방법이 있는지, 아니면 매번 원곡 가사와 대조하는 수밖에 없는 건지도 확실하지 않다.

정리

AI로 만든 곡에 자동 자막을 입히는 게 생각보다 손이 많이 가는 작업이라는 걸 알았다. 자동화 도구가 "그냥 알아서 다 해줄 것"이라고 기대했다가, 결국 원본 가사를 옆에 두고 한 줄씩 대조하는 수작업으로 돌아간 셈이다. 자동화가 붙어 있다고 해서 사람이 검수하는 과정을 완전히 생략할 수는 없다는 걸 다시 한번 느꼈다.