분류 전체보기 (15) 썸네일형 리스트형 AI가 기억을 다루는 방식이 이상했던 세 가지 경우 지금까지 여러 AI 도구로 프로젝트를 진행해오면서, 기억과 관련해서 이상하다고 느낀 경우가 크게 세 가지 있었다. 이번 글은 그 세 가지를 정리한 글이다.학습 이후 바뀐 정보를, 마치 지금도 맞는 것처럼 말한다AI는 특정 시점까지의 데이터로 학습됐고, 그 이후에 바뀐 정보는 원칙적으로 모른다. 문제는 "모른다"고 인정하지 않고, 학습 당시 기준의 정보를 지금도 유효한 사실인 것처럼 말한다는 점이다. 정책이 바뀌었거나, 서비스 기능이 달라졌거나, 요금제가 개편된 것들을 물어보면 예전 기준으로 확신에 차서 답을 준다. 실제로 수노의 다운로드 정책이 바뀐 걸 뒤늦게 알게 된 것도 이 문제와 무관하지 않았다 — AI에게 확인 삼아 물어봤다면 아마 예전 기준으로 답했을 거다.플랜 한도에 걸려서 채팅방을 옮기면, .. 구글 API 이미지 인식 자동화 중 마주친 에러와 해결 과정 1. 들어가며: 반복 노동을 줄이기 위한 자동화 도전회사에서 나오는 문서(이미지)들이 꽤 있다. 그걸 인쇄물로 주면 좋으련만 카톡으로 이미지만 전달한다. 그럼 좁은 휴대폰 화면에서 그 내용을 읽기란 여간 고역스러운 일이 아닐 수 없었다.그나마 제미나이나 챗지피티를 이용해서 문자를 인식시켜서 읽으면 내용을 확인하는데 훨씬 편해졌다. 이미지를 하나씩 채팅창에 넣고 결과가 나오면 복사해 게시판에 붙여넣는 수동 방식을 썼는데, 이미지 개수가 많아질수록 이 반복 노동이 꽤나 번거로웠다. 그래서 여러 장의 이미지에 담긴 텍스트를 읽어(OCR) 게시판에 공유하는 작업을 자동화하려고 했다. 여러 장의 이미지를 업로드하면 API 스크립트로 묶어 한 번에 처리하려 했다. 하지만 막상 코드를 짜고 실행해 보니, 채팅창에서는.. 구글 API, 붙일 때마다 매번 새로 헤맨다 GAS(구글 앱스 스크립트)로 반복 작업을 자동화해 온 지는 꽤 됐다.학교 구내 식당의 주간식단표 이미지를 GAS를 통해 인식하여 구글시트에 데이터를 저장한 뒤 조회하는 웹페이지를 만든 것을 시작으로 캠퍼스 시설 업무 도구, 예전 건강 블로그 CMS까지 — 필요할 때마다 구글 API를 하나씩 붙여왔다. 그런데 신기하게도 매번 처음 붙이는 사람처럼 헤맨다. 아마 매번 이 번이 마지막일 것일라고 생각하기 때문 일 것이다.이번 프로젝트에서 자막-가사 대조 자동화(지난 글에서 "아직 안 해본 것"으로 남겨둔 그 부분)를 준비하면서 예전에 겪었던 것과 똑같은 문제를 또 만났다.이번 글은 사용법 튜토리얼이 아니라, 매번 똑같은 지점에서 걸려 넘어지는 이유를 정리해보는 글이다. API 키 발급은 쉬운데, "어디에 어.. 캐릭터 시트, 이렇게 만드니까 그나마 안정적으로 나왔다 구글 플로우에서 프로젝트를 진행하면서 캐릭터 얼굴이 계속 흔들리는 문제로 여러 번 헤맸다는 얘기를 앞서 몇 번 적었다.그 과정에서 결국 정착하게 된 "캐릭터 시트" 만드는 방식을 이번에 정리해두려고 한다.완벽한 해법은 아니고, 지금까지 시행착오 끝에 이 정도가 그나마 안정적이더라는 수준이다. 한 장짜리 기준 이미지로는 부족했다처음엔 그냥 잘 나온 캐릭터 이미지 한 장을 등록해두면 될 줄 알았다. 그런데 정면 컷 하나만 있으면, 다른 각도나 표정을 요청했을 때 얼굴이 흔들리는 경우가 많았다. 기준이 되는 정보가 한 각도, 한 표정뿐이라 그런 것 같았다. 그래서 여러 요소를 한 판에 모은 시트를 만들었다한 장의 캔버스 안에 아래 요소들을 다 넣어서 요청했다.정면 전신뷰측면 전신뷰얼굴 클로즈업 (가장 크게, .. GAS로 반복 작업 줄여온 경험을, 이번 프로젝트에도 써먹을 수 있을까 지금까지 시설관리 업무나 화원 콘텐츠 작업에서 구글 앱스 스크립트(GAS)와 Gemini API를 엮어서 반복 작업을 자동화해온 경험이 꽤 쌓였다. 이번 애프터파티 프로젝트를 진행하면서, 여기서도 비슷한 자동화가 먹힐 만한 지점이 여럿 보였다. 다만 아직 실제로 만들어서 돌려본 건 아니고, 이번 작업을 하면서 "여기 이런 게 있으면 편하겠다" 싶었던 것들을 정리해두는 수준이다. 반복적으로 손이 갔던 지점들이번 프로젝트를 진행하면서 유독 손이 많이 간 부분이 몇 군데 있었다.이미지 생성 결과물 파일명을 매번 알아보기 쉽게 다시 정리하는 작업여러 컷의 프롬프트를 조금씩 바꿔가며 반복 생성할 때, 어떤 프롬프트로 어떤 결과가 나왔는지 기록해두는 작업원곡 가사와 자동 인식된 자막을 대조해서 빠진 부분을 찾아내는.. 캐릭터를 만들 때마다 "이거 어디서 본 것 같은데" 하는 불안이 있었다 공주와 해골 코스튬 캐릭터를 디자인하면서, 계속 신경 쓰인 게 하나 있었다. 이 캐릭터들이 기존 유명 캐릭터와 너무 닮아 보이면 안 된다는 것. AI로 이미지를 뽑다 보면 어느 순간 "어? 이거 그 캐릭터 아니야?" 싶은 결과물이 나올 때가 있어서, 매번 확인하는 습관이 생겼다. "공주"라는 단어 자체가 위험했다처음에 그냥 "공주 캐릭터"라고만 프롬프트를 넣었더니, 특정 디즈니 캐릭터를 강하게 연상시키는 헤어스타일과 드레스 실루엣이 나왔다. 정확히 그 캐릭터는 아니었지만, 누가 봐도 "아, 그 캐릭터 생각나게 만든 거네"라고 느낄 만한 결과였다. 이건 그대로 쓰기엔 위험하다는 판단이 들었다. 의상 요소를 하나씩 다르게 비틀었다그래서 헤어 색상, 드레스 색 조합, 액세서리(티아라 모양)를 원래 연상되던 캐.. Suno에서 한국어 버전을 만들다가, 리듬을 놓치고 있다는 걸 알았다 플레이리스트를 만들면서 3개 국어(한/영/일) 채널을 같이 운영해볼까 하는 생각을 하게 되었다. 우선 글로벌에서 통할만한 곡을 만들고 이를 한국어 버전과 일본어 버전으로 만들겠다는 계획이었다.Suno에서 한국어 가사로 곡을 몇 개 시험 삼아 만들어봤다. 그런데 발음이 어색한 것보다 더 근본적인 문제가 있었다. 리듬 자체를 못 살리고 있었다. 애프터파티를 한국어로 옮기려다가 "가사치기"에 급급하다는 것을 알게 됐다수노가 친 대형사고의 결과로 만들어진 곡이 애프터파티라고 앞서 말한 적이 있다. 이 곡의 느낌을 살려 한글 가사를 넣는 시도를 해봤다. 영어 원곡은 리듬감이 살아있는 곡인데, 이걸 한국어 버전으로 만들어보려고 하니 한국어 가사가 그 리듬을 따라가질 못했다. 정확히는, 원곡 멜로디의 음절 수에 한국.. 정지 이미지 수십 장으로 움직이는 영상을 만들 수 있을까 캐릭터도 어느 정도 안정됐고, 소품 클로즈업 문제도 우회할 방법을 찾았다. 이제 남은 건 이 정지 이미지들을 어떻게 "영상처럼" 보이게 만드느냐였다. 처음엔 당연히 영상 생성 AI로 다 만들면 되는 줄 알았는데, 여기서도 예상 밖의 계산이 필요했다. 영상 생성은 비용이 다르다는 걸 뒤늦게 알았다Flow는 이미지 생성과 영상 생성을 둘 다 지원하는데, 이미지는 구독 안에서 사실상 무제한으로 뽑을 수 있는 반면 영상은 크레딧 소모가 훨씬 크다. 처음엔 이 차이를 모르고 그냥 다 영상으로 만들면 되겠다 싶었는데, 계산해보니 지금까지 쌓인 컷 수만 해도 영상으로 전부 만들면 감당이 안 되는 수준이었다. 그래서 정지 이미지 + 카메라 워크로 방향을 바꿨다결국 택한 방법은, 대부분의 장면을 정지 이미지로 만들고 편.. 이전 1 2 다음