편집자동화 등(Vrew.Gas 등) (4) 썸네일형 리스트형 구글 API 이미지 인식 자동화 중 마주친 에러와 해결 과정 1. 들어가며: 반복 노동을 줄이기 위한 자동화 도전회사에서 나오는 문서(이미지)들이 꽤 있다. 그걸 인쇄물로 주면 좋으련만 카톡으로 이미지만 전달한다. 그럼 좁은 휴대폰 화면에서 그 내용을 읽기란 여간 고역스러운 일이 아닐 수 없었다.그나마 제미나이나 챗지피티를 이용해서 문자를 인식시켜서 읽으면 내용을 확인하는데 훨씬 편해졌다. 이미지를 하나씩 채팅창에 넣고 결과가 나오면 복사해 게시판에 붙여넣는 수동 방식을 썼는데, 이미지 개수가 많아질수록 이 반복 노동이 꽤나 번거로웠다. 그래서 여러 장의 이미지에 담긴 텍스트를 읽어(OCR) 게시판에 공유하는 작업을 자동화하려고 했다. 여러 장의 이미지를 업로드하면 API 스크립트로 묶어 한 번에 처리하려 했다. 하지만 막상 코드를 짜고 실행해 보니, 채팅창에서는.. 구글 API, 붙일 때마다 매번 새로 헤맨다 GAS(구글 앱스 스크립트)로 반복 작업을 자동화해 온 지는 꽤 됐다.학교 구내 식당의 주간식단표 이미지를 GAS를 통해 인식하여 구글시트에 데이터를 저장한 뒤 조회하는 웹페이지를 만든 것을 시작으로 캠퍼스 시설 업무 도구, 예전 건강 블로그 CMS까지 — 필요할 때마다 구글 API를 하나씩 붙여왔다. 그런데 신기하게도 매번 처음 붙이는 사람처럼 헤맨다. 아마 매번 이 번이 마지막일 것일라고 생각하기 때문 일 것이다.이번 프로젝트에서 자막-가사 대조 자동화(지난 글에서 "아직 안 해본 것"으로 남겨둔 그 부분)를 준비하면서 예전에 겪었던 것과 똑같은 문제를 또 만났다.이번 글은 사용법 튜토리얼이 아니라, 매번 똑같은 지점에서 걸려 넘어지는 이유를 정리해보는 글이다. API 키 발급은 쉬운데, "어디에 어.. GAS로 반복 작업 줄여온 경험을, 이번 프로젝트에도 써먹을 수 있을까 지금까지 시설관리 업무나 화원 콘텐츠 작업에서 구글 앱스 스크립트(GAS)와 Gemini API를 엮어서 반복 작업을 자동화해온 경험이 꽤 쌓였다. 이번 애프터파티 프로젝트를 진행하면서, 여기서도 비슷한 자동화가 먹힐 만한 지점이 여럿 보였다. 다만 아직 실제로 만들어서 돌려본 건 아니고, 이번 작업을 하면서 "여기 이런 게 있으면 편하겠다" 싶었던 것들을 정리해두는 수준이다. 반복적으로 손이 갔던 지점들이번 프로젝트를 진행하면서 유독 손이 많이 간 부분이 몇 군데 있었다.이미지 생성 결과물 파일명을 매번 알아보기 쉽게 다시 정리하는 작업여러 컷의 프롬프트를 조금씩 바꿔가며 반복 생성할 때, 어떤 프롬프트로 어떤 결과가 나왔는지 기록해두는 작업원곡 가사와 자동 인식된 자막을 대조해서 빠진 부분을 찾아내는.. Vrew가 AI 보컬 가사를 반토막으로 알아들었다 이미지 작업을 어느 정도 마무리하고, 이제 완성된 곡에 자막을 입히는 단계로 넘어갔다. Vrew라는 도구를 쓰면 오디오만 넣어도 자동으로 가사를 인식해서 자막을 만들어주는데, 여기서 또 예상 못 한 문제를 만났다. 자동 인식된 자막이 물음표투성이였다오디오를 넣고 자동 자막 생성을 돌렸더니, 결과물에 [?]로 표시된 구간이 한가득이었다. 특히 후렴구처럼 여러 소리가 겹치는 부분에서 심했다. 처음엔 "몇 군데만 손보면 되겠지" 싶었는데, 실제로 원곡 가사와 하나하나 대조해보니 생각보다 훨씬 많이 틀려 있었다. 단순 오타 수준이 아니라 아예 통째로 빠진 줄이 있었다더 큰 문제는 따로 있었다. 다른 자막 도구(클립챔프)로도 같은 오디오를 돌려봤는데, 여기서도 비슷한 문제가 나왔다. 그런데 이번엔 오타가 아니라,.. 이전 1 다음