---
title: "카파시가 본 다음 LLM 테스트: 펠리컨 SVG 말고, 반지의 제왕을 3D 월드로 만들기"
published: 2026-08-02T04:05:56.000Z
canonical: https://jeff.news/article/5384
---
# 카파시가 본 다음 LLM 테스트: 펠리컨 SVG 말고, 반지의 제왕을 3D 월드로 만들기

안드레이 카파시가 Opus 5에 반지의 제왕 첫 문단과 100만 토큰 예산을 주고 Three.js 렌더링을 시켰더니, 약 2시간 동안 5,500줄짜리 코드를 만들어 절차적으로 장면을 구현했다. 결과물은 어설픈 부분이 있지만, LLM이 좌표계에 폴리곤 에셋을 배치하고 애니메이션까지 짜는 단계로 가고 있다는 점이 포인트다. 동시에 모델이 자기 결과물을 영상이나 게임처럼 직접 체험하며 검수하지 못한다는 약점도 드러난다.

- 카파시가 말한 포인트는 “펠리컨이 자전거 타는 SVG 만들어줘” 같은 LLM 테스트가 슬슬 낡아가고 있다는 것임
  - 이번엔 Opus 5에 반지의 제왕 첫 문단을 주고, 100만 토큰 예산으로 Three.js 렌더링을 만들어보라고 시킴
  - 비용은 대략 10달러, 실행 시간은 약 2시간, 결과 코드는 5,500줄 정도였다고 함

- 결과물은 완벽하진 않고 꽤 삐걱거리지만, 그래도 생각해보면 좀 황당한 수준까지 왔음
  - 모델이 폴리곤 에셋을 직접 배치하고, x·y·z 좌표계 안에서 장면을 구성하고, 애니메이션 코드까지 짠 것
  - 사람이 이 정도로 특정한 장면을 위해 커스텀 코드를 쓰는 일은 보통 가성비가 안 맞아서 안 함

> [!IMPORTANT]
> 핵심은 품질이 “상용 게임급”이라는 게 아니라, 예전엔 아무도 안 만들던 초맞춤형 3D 월드를 이제는 몇 달러와 몇 시간짜리 실험으로 만들 수 있다는 점임.

- 카파시는 이걸 “온디맨드 임시 GTA” 같은 방향으로 봄
  - 예를 들면 반지의 제왕 세계에 관전자 NPC로 들어가거나, 특정 캐릭터가 되어 스토리에 참여하는 식
  - 특정 세계관 X를 상상하면 그때그때 플레이 가능한 월드로 뽑아내는 흐름이 가능해질 수 있다는 얘기

- 그런데 게임·월드 생성은 LLM의 약점도 아주 잘 드러내는 분야임
  - 모델은 자기가 만든 결과물을 영상으로 자연스럽게 보고, 게임처럼 직접 플레이하면서 검수하는 능력이 아직 부족함
  - 이번에도 Opus 5는 여러 시점에서 스크린샷을 느리게 확인하는 방식으로 작업했고, 그 과정에서 엉성한 결과가 꽤 나왔다고 함

- 그래서 이 사례는 “LLM이 이제 게임을 다 만들 수 있다”보다 “다음 병목이 어디인지 보인다”에 가까움
  - 코드 생성과 장면 구성의 체력은 말도 안 되게 좋아지고 있음
  - 반대로 영상 이해, 실시간 상호작용, 플레이 기반 자기 검수는 아직 많이 부족한 raw capability로 남아 있음

---

## 기술 맥락

- 여기서 중요한 선택은 이미지 한 장을 만드는 게 아니라 Three.js 코드로 실행 가능한 3D 장면을 만든 거예요. 왜냐하면 3D 월드는 단순 결과물이 아니라 카메라, 좌표, 애니메이션, 오브젝트 상태가 계속 맞물리는 시스템이거든요.

- 100만 토큰 예산을 준 것도 의미가 있어요. 모델이 긴 시간 동안 5,500줄을 쓰며 장면을 절차적으로 구성했다는 건, 짧은 답변 품질보다 장시간 작업 지속성 자체가 테스트 대상이 됐다는 뜻이에요.

- 병목은 생성보다 검수 쪽에 있어요. 웹페이지나 코드라면 테스트를 돌리거나 에러 로그를 보면 되지만, 게임 장면은 “보기에 이상한가”, “움직임이 자연스러운가”를 모델이 직접 효율적으로 판단해야 하거든요.

- 그래서 앞으로 이 영역은 LLM만의 문제가 아니라 멀티모달 인식, 브라우저 제어, 게임 플레이 에이전트가 같이 붙어야 좋아질 가능성이 커요. 코드를 쓰는 모델과 결과물을 체험하며 피드백하는 모델이 함께 돌아가야 품질이 올라가요.

## 핵심 포인트

- LLM 평가가 단순 이미지 생성 프롬프트에서 맞춤형 3D 월드 생성 쪽으로 확장되고 있음
- Opus 5는 100만 토큰 예산, 약 10달러 비용, 약 2시간 실행으로 5,500줄 Three.js 코드를 생성함
- 게임과 월드 생성 영역에서는 모델이 결과물을 직접 플레이하거나 영상으로 인식하며 검수하기 어렵다는 한계가 큼

## 인사이트

이 사례가 재밌는 건 결과물이 완벽해서가 아니라, 예전엔 사람이 절대 안 만들 법한 초맞춤형 콘텐츠를 이제는 “그냥 한번 시켜보지 뭐” 수준으로 만들 수 있다는 점이다. 다만 게임·영상처럼 결과 검수가 실행 경험에 의존하는 영역은 LLM의 다음 병목이 꽤 선명하게 보인다.
