최근 게이커뉴스에 공유된 실험에서는 최신 거대언어모델 두 종에게 동일 곡과 동일 가사, 그리고 웹 검색과 ffmpeg라는 동일한 도구 스택만 부여한 뒤 25달러와 100달러 예산 조건에서 AI 뮤직비디오를 자립적으로 제작하도록 지시했다. 보고된 4회 시도 모두 원곡을 결합한 완전 길이 영상으로 완성되었고, 이 중 3회는 영상 생성 모델과 편집 방식까지 모델이 스스로 선택한 것으로 나타났다. 본 글은 이 실험의 구조와 결과를 정리하고, 에이전트형 AI의 멀티모달 제작 역량과 비용-자율성 트레이드오프에 대해 검토한다.
- 비교 대상은 Claude Sonnet 4와 GPT-5.6(Sol)이며, 입력은 동일 곡·동일 가사, 공통 도구는 웹 검색과 ffmpeg다.
- 실험은 25달러와 100달러 두 가지 예산 조건에서 총 4회 진행되었고, 4회 모두 완전 길이 영상 완주로 보고되었다.
- ‘차이를 보여주었다’는 단정 표현을 근거 섹션의 추론 표현으로 정정
동일 조건 비교 실험에서 두 모델 모두 완주했으며, 예산과 자율 선택 여부가 결과 변수의 핵심으로 부상했다. 다만 본 요약만으로는 정성적 우열을 확정하기 어렵다.
실험 개요: Claude Fable 5 vs. GPT-5.6 Sol, 제목에 ‘100달러’만 단정하는 표현을 예산 비교라는 중립 표현으로 완화
이 실험은 동일 조건 통제 하에 두 거대언어모델의 자율 제작 능력을 비교하기 위해 설계되었다. 예산 구간을 25달러와 100달러로 나눠 비용 변수가 결과에 미치는 영향을 함께 살펴본 점이 특징이다.
비교 조건과 입력 자원
두 모델에는 동일한 원곡 음원과 동일한 가사 텍스트만 제공되었다. 그 외의 연출 요소, 컷 구성, 스타일 선택, 편집 도구 사용 방식은 모델이 스스로 결정하도록 허용되었다. 예산은 총 4회 실험 중 25달러 구간과 100달러 구간으로 나뉘어, 자원이 충분한 경우와 제한된 경우의 의사결정 패턴을 함께 관찰하도록 설계되었다.
사용 도구 스택: 웹 검색과 ffmpeg의 역할
공통 도구는 웹 검색과 ffmpeg 두 가지였다. 웹 검색은 참고 영상, 동기부여 자료, 라이선스 정보 조사 등에 사용되었고, ffmpeg는 클립 자르기, 음원-영상 결합, 포맷 변환 같은 후처리 작업에 동원된 것으로 보인다. 이처럼 검색 도구와 로컬 미디어 처리 도구만 제공함으로써, 모델이 외부 API를 호출하는 방식이 아니라 자원이 제한된 환경에서 문제 해결을 시도하도록 만든 점이 실험의 핵심 통제 장치다.
자율 제작 파이프라인의 실제 작동 방식
실험 보고에서 드러난 제작 흐름은 크게 조사, 생성, 편집의 세 단계로 정리된다. 각 단계에서 두 모델이 어떤 결정을 내렸는지가 자율성의 핵심 지표로 평가되었다.
조사 단계에서 모델이 수행한 웹 검색 전략
두 모델은 웹 검색을 활용해 시각 콘셉트 후보와 참고 영상을 수집한 것으로 보고되었다. 구체적 검색어 구성까지는 공개되지 않았으나, 동일한 원곡과 가사를 놓고 어떤 키워드로 어떤 레퍼런스를 끌어오는지가 영상 톤을 결정하는 출발점이 된다. 이 단계에서의 검색 전략 차이는 후속 단계의 생성 모델 선택과 편집 방식까지 영향을 미친다.
영상 생성 모델 자체 선택과 편집 의사결정
실험 4회 중 3회는 영상 생성 모델과 제작 방식을 모델이 자율적으로 선택했다. 이는 단순히 프롬프트만 작성한 것이 아니라, 어떤 생성형 비디오 모델을 호출할지, 생성된 클립을 어떤 순서로 배치할지, ffmpeg로 어떤 변환을 적용할지까지 스스로 계획했다는 의미다. 보고된 범위 내에서는 특정 모델이 일관되게 우월했다고 단정하기는 어렵고, 선택의 다양성 자체가 자율성의 지표로 읽힌다.
4회 실험 결과와 예산별 차이
결과는 완주율과 자율 선택률 두 축으로 요약된다. 완주율은 4/4, 자율 선택률은 3/4로, 제한된 도구 스택 안에서도 모델이 종단 작업을 마무리할 수 있음을 시사한다.
| 구분 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|
| 총 실험 횟수 | 4회 | 4회 |
| 완전 길이 영상 완주 | 4/4 | 4/4 |
| 생성 모델 자율 선택 | 3/4 | 3/4 |
| 예산 구간 | 25달러 / 100달러 | 25달러 / 100달러 |
| 공통 입력 | 동일 곡·동일 가사 | 동일 곡·동일 가사 |
25달러 vs. 100달러 예산 구간 비교
실험 설계상 25달러 구간과 100달러 구간은 품질과 완성도의 차이를 비교하기 위한 변수로 포함되었다. 다만 원문 분석 요약에서는 예산별 구체적 품질 수치나 순위 평가가 공개되지 않았으므로, 어느 쪽이 절대적으로 우월했다고 단정할 근거는 부족하다. 다만 예산이 커질수록 모델이 더 비싼 생성형 API 옵션을 시도하거나 더 긴 영상을 생성하는 등 자원 활용 패턴이 달라질 가능성은 충분해 보이며, 이는 향후 재실험에서 검증이 필요한 영역으로 남아 있다.
완주율 4/4, 자율 선택률 3/4의 의미
4회 모두 완주했다는 사실은, ffmpeg와 웹 검색만으로 제공된 환경에서 거대언어모델이 종단 작업을 끊김 없이 수행할 수 있음을 보여준다. 동시에 3/4의 자율 선택률은, 모든 시도에서 일관되게 자율 결정이 이뤄진 것은 아니라는 점을 함께 시사한다. 이는 모델의 의사결정이 항상 최선의 자율 경로로 수렴하지는 않으며, 입력 조건이나 예산에 따라 외주 의존도가 달라질 수 있음을 의미한다.
에이전트형 AI의 현주소와 실무 시사점
이번 실험은 에이전트형 AI가 단순 텍스트 생성을 넘어 멀티모달 결과물을 자율적으로 만들어 낼 수 있는지 여부를 점검한 사례로 소개된다. 결과는 제한된 도구 안에서도 종단 완주가 가능하다는 가능성을 보여주었지만, 동시에 품질 일관성과 비용 효율성에서는 여전히 검증할 부분이 남아 있다.
비용 대비 자율성 트레이드오프
실험 설계상 예산은 자율성과 함께 묶여 비교 변수로 포함되었다. 예산이 충분할수록 모델은 더 다양한 생성 옵션과 편집 시도를 펼칠 여지가 생기고, 반대로 예산이 제한되면 단순한 경로로 수렴할 가능성이 커진다. 다만 본 기사 범위에서는 정량적 품질 차이가 직접 보고되지 않았다.. 이처럼 비용과 자율성 사이에는 트레이드오프가 존재하며, 실무에서는 작업의 위험도와 허용 가능한 반복 횟수를 기준으로 예산 구간을 설정하는 것이 합리적인 선택으로 보인다. 다만 본 실험의 공개된 정보만으로는 어느 예산 구간이 더 효율적이었다고 일반화하기는 이른 단계로 판단된다.
향후 멀티모달 제작 자동화 전망
이번 결과는 거대언어모델이 영상 생성 모델과 미디어 처리 도구를 결합해 종단 작업을 수행할 수 있다는 가능성을 확인해 준다. 향후에는 음원 길이, 컷 수, 화질, 스타일 일관성 같은 품질 지표가 함께 공개된다면, 모델 간 비교가 훨씬 정교해질 것으로 기대된다. 또한 검색 도구의 품질과 ffmpeg 같은 로컬 미디어 처리 도구의 활용 능력이 에이전트형 AI의 실무 성과를 좌우할 핵심 역량으로 부상할 것으로 보인다.
핵심 정리
- 동일 곡·가사, 웹 검색과 ffmpeg만 부여된 조건에서 Claude Fable 5와 GPT-5.6 Sol은 4회 모두 완전 길이 영상을 완성한 것으로 보고되었다.
- 4회 중 3회는 영상 생성 모델과 제작 방식을 모델이 자율적으로 선택해, 자율성 수준의 차이가 존재했다.
- 예산은 25달러와 100달러 두 구간으로 설계되었으나, 공개된 정보만으로는 어느 구간이 절대적으로 우월하다고 단정하기는 이르다.
- 실무 적용 시 비용-자율성 트레이드오프를 고려해 예산 구간을 설정하고, 품질 지표 공개 여부를 기준으로 도구를 선택하는 접근이 합리적으로 분석된다.
관련 키워드
참고 자료: 게이커뉴스 원문, Anthropic 공식 페이지, OpenAI 공식 페이지