본문 바로가기

인공지능

GPT-5.6, Grok 4.5, Claude, Muse Spark 앱 생성 성능 비교, 어떤 AI 모델을 선택해야 할까?

728x90
반응형
728x170

생성형 AI 모델은 빠르게 발전하고 있지만, "가장 좋은 모델은 무엇인가?"라는 질문에는 하나의 정답이 없습니다. 같은 프롬프트를 입력하더라도 모델마다 결과물의 완성도와 안정성, 비용, 속도가 크게 달라지기 때문입니다.

이번 비교에서는 GPT-5.6, Grok 4.5, Claude, Muse Spark를 비롯한 총 12개의 AI 모델을 대상으로 동일한 조건에서 4가지 애플리케이션을 각각 5회씩 생성하도록 테스트했습니다. Doom 스타일 레이캐스터 미로, 3D 루빅스 큐브, 계산기, Conway's Game of Life를 구현하도록 요청하고 성공률, 비용, 실행 시간 등을 비교했으며, 모든 결과물을 공개하여 모델별 특징을 확인했습니다.

이번 글에서는 테스트 방식과 결과를 정리하고, 과제별로 어떤 모델이 강점을 보였는지 살펴보겠습니다.

반응형

비교 개요

이번 테스트는 이전 비교에서 제기된 피드백을 반영하여 규모를 확대해 진행되었습니다.

비교 대상은 총 12개 모델이며, 동일한 애플리케이션을 각각 5회씩 생성하여 성공 횟수와 결과물의 품질을 함께 확인했습니다.

비교 대상에는 다음과 같은 모델이 포함되었습니다.

  • GPT-5.6 Sol
  • GPT-5.6 Terra
  • GPT-5.6 Luna
  • GPT-5.5
  • Claude Opus 4.8
  • Claude Fable 5
  • Grok 4.5
  • Muse Spark 1.1
  • Qwen 3.7 Plus
  • DeepSeek V4 Pro
  • Kimi K2.6
  • GLM-5.2

이번 비교는 생성된 결과물을 직접 확인하여 평가한 주관적인 비교이며, 과학적이거나 객관적인 벤치마크가 아니라는 점도 함께 명시되었습니다.


테스트 방식

총 4개의 애플리케이션을 동일한 조건으로 생성하도록 요청했습니다.

  • Doom 스타일 레이캐스터 미로
  • 3D 루빅스 큐브
  • 계산기
  • Conway's Game of Life

각 과제는 실제 동작 여부를 기준으로 성공을 판정했습니다.

특히 이전 비교와 달리 한 번의 생성 결과만으로 평가하지 않고, 동일한 작업을 5회 반복하여 모델의 일관성까지 함께 확인했다는 점이 특징입니다.

평가 항목은 다음과 같습니다.

  • 성공 횟수
  • 결과물 품질
  • 생성 비용
  • 생성 시간

Doom 스타일 레이캐스터 미로 비교

첫 번째 과제는 Doom 스타일의 1인칭 미로 게임 구현입니다.

요구사항은 다음과 같았습니다.

  • WASD 이동
  • 회전 기능
  • 충돌 처리
  • 깊이에 따른 벽 음영
  • 바닥 및 천장 렌더링

단순히 화면을 그리는 것이 아니라 실제로 플레이 가능한지를 성공 기준으로 삼았습니다.

GPT-5.6 Sol의 높은 완성도

GPT-5.6 Sol은

  • 성공률 5/5
  • 비용 $1.35
  • 생성 시간 120초

를 기록하며 가장 뛰어난 결과로 평가되었습니다.

GPT-5.5보다 게임 디테일이 풍부했고 결과물의 일관성도 높았습니다.

반면 GPT-5.6 Luna 역시 5/5를 기록했지만 품질은 Sol보다 낮게 평가되었습니다.

GPT-5.6 Terra는 일부 결과에서 이동이 불가능해 3/5를 기록했습니다.

Grok 4.5의 높은 가성비

Grok 4.5는

  • 성공률 5/5
  • 비용 $0.27

이라는 뛰어난 가성비를 보여주었습니다.

비슷한 수준의 완성도를 훨씬 낮은 비용으로 구현해 실용적인 대안으로 평가되었습니다.

Claude 계열

기대와 달리 Claude 계열은 레이캐스터에서는 다소 부진했습니다.

  • Claude Opus 4.8 : 4/5
  • Claude Fable 5 : 3/5

특히 Fable은 결과물 자체는 우수했지만 성공률이 낮았습니다.


3D 루빅스 큐브 비교

이번 과제는 가장 난도가 높았습니다.

구현해야 할 기능은 다음과 같습니다.

  • 3D 큐브
  • 색상 유지
  • Scramble
  • Solve
  • 애니메이션

애니메이션이 자연스럽게 동작하면서 색상이 변경되지 않아야 성공으로 인정했습니다.

Claude Fable 5의 압도적인 성과

이번 테스트에서는 Claude Fable 5가 가장 뛰어난 성능을 보여주었습니다.

기록은 다음과 같습니다.

  • 성공률 5/5
  • 비용 $2.03
  • 생성 시간 92초

유일하게 다섯 번 모두 정상적으로 동작했습니다.

GPT 계열의 아쉬운 결과

GPT-5.6 Sol과 Terra는 각각 4/5를 기록했습니다.

특히 Sol은

  • 검은색으로 렌더링되는 오류
  • 비정상적인 애니메이션

등이 일부 발생했습니다.

Luna는 처음에는 정상처럼 보였지만 Scramble 이후 대부분 오류가 발생하여 0/5를 기록했습니다.

GPT-5.5 역시 4/5였지만 색상 깜빡임과 부드럽지 않은 회전이 확인되었습니다.


계산기 구현 비교

계산기 과제는 비교적 단순한 구현이었습니다.

요구사항은 다음과 같습니다.

  • 숫자 버튼
  • 연산자
  • 초기화
  • 등호
  • 연산 우선순위

대부분의 상위 모델이 높은 성공률

다음 모델들은 모두 5/5를 기록했습니다.

  • Claude Opus 4.8
  • Claude Fable 5
  • Grok 4.5
  • GPT-5.6 Sol
  • GPT-5.6 Luna
  • Muse Spark 1.1

다만 GPT-5.6 Sol은 기능은 완벽했지만 지나치게 화려한 3D 스타일을 적용해 오히려 계산기 사용성이 떨어진다는 평가를 받았습니다.

이번 결과에서는 화려한 UI보다 기본 기능을 안정적으로 구현한 모델이 더 높은 평가를 받았습니다.


Conway's Game of Life 비교

Game of Life는 다음 기능을 구현하는 과제였습니다.

  • Play
  • Pause
  • Step
  • Randomize
  • Clear
  • 셀 클릭
  • 세대 애니메이션

이 과제는 성공률보다 비용과 시간 중심으로 비교되었습니다.

오픈 웨이트 모델의 강세

이번 테스트에서는 의외로 오픈 웨이트 모델들이 좋은 결과를 보였습니다.

대표적으로

  • Qwen 3.7 Plus
    • $0.04
    • 11초
  • GLM-5.2
    • $0.10
    • 121초

낮은 비용으로 우수한 결과를 생성했습니다.

이는 Game of Life가 이미 공개된 예제 코드가 풍부한 과제이기 때문으로 분석되었습니다.

반면 복잡한 신규 과제에서는 동일한 수준의 성능을 보이지 못했습니다.


응답 속도와 비용 비교

짧은 프롬프트에서는 GPT-5.6 계열이 가장 빠른 응답을 시작했습니다.

대표적인 결과는 다음과 같습니다.

모델응답 시작비용

모델 응답 시작 비용
GPT-5.6 Luna 1.0초 $0.001
GPT-5.6 Terra 1.5초 $0.001
GPT-5.6 Sol 1.8초 $0.003
Qwen 3.7 Plus 2.1초 $0.001
Claude Opus 4.8 2.5초 $0.004
Grok 4.5 3.0초 $0.003
Muse Spark 1.1 3.1초 $0.002
Claude Fable 5 6.6초 $0.01

Claude Fable 5는 품질은 우수했지만 응답 속도와 비용 측면에서는 가장 부담이 큰 모델 중 하나였습니다.


SVG 생성 보너스 과제

추가로 SVG를 라이브러리 없이 한 번에 생성하는 과제도 진행되었습니다.

결과는 다음과 같습니다.

  • Claude Fable 5가 가장 뛰어난 품질
  • Grok 4.5도 높은 완성도
  • GPT-5.6 계열은 기대보다 낮은 결과
  • GLM-5.2와 Qwen 3.7도 좋은 SVG를 생성

특히 복잡한 장면에서도 Claude Fable 5는 세부 표현과 완성도가 가장 뛰어난 결과를 보여주었습니다.


과제별 AI 모델 선택 전략

이번 테스트에서 가장 흥미로운 점은 최신이거나 가장 비싼 모델이 항상 최고의 결과를 만들지는 않았다는 것입니다.

과제의 특성에 따라 강점을 보이는 모델이 명확하게 달랐습니다.

  • 복잡한 그래픽과 새로운 구현
    • GPT-5.6 Sol
    • Claude Fable 5
  • 3D 애니메이션
    • Claude Fable 5
  • 기본적인 애플리케이션
    • Grok 4.5
  • 예제 코드가 풍부한 일반적인 구현
    • Qwen 3.7 Plus
    • GLM-5.2
  • 가성비 중심
    • Grok 4.5
    • Qwen 3.7 Plus

즉, 모든 작업에서 하나의 모델만 사용하는 것보다 과제의 성격에 맞춰 모델을 선택하는 전략이 더 효율적이라는 점을 확인할 수 있었습니다.


728x90

이번 비교는 12개의 AI 모델을 동일한 조건에서 반복 테스트하여 성공률, 비용, 생성 시간, 결과물의 완성도를 함께 살펴본 사례입니다.

비록 생성 결과물을 직접 확인한 주관적인 평가라는 한계는 있지만, 단순히 한 번의 생성 결과가 아닌 반복 실행을 통한 일관성까지 비교했다는 점에서 의미 있는 참고 자료라 할 수 있습니다.

특히 레이캐스터와 3D 루빅스 큐브처럼 복잡한 과제에서는 GPT-5.6 Sol과 Claude Fable 5가 높은 성능을 보였으며, 계산기나 Game of Life와 같이 비교적 단순하거나 널리 알려진 구현에서는 Grok 4.5와 오픈 웨이트 모델들이 뛰어난 비용 효율성을 보여주었습니다.

결국 AI 모델 선택의 핵심은 '가장 최신 모델'이나 '가장 비싼 모델'이 아니라 구현하려는 과제의 특성과 요구사항에 가장 적합한 모델을 선택하는 것입니다. 이러한 특성을 이해하고 목적에 맞는 모델을 활용한다면 개발 생산성과 비용 효율성을 모두 높일 수 있을 것입니다.

300x250

https://www.tryai.dev/blog/gpt-5.6-build-off-12-models

 

GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps

GPT-5.6's new Sol, Terra, and Luna tiers go head-to-head with Grok 4.5, Claude, Meta's Muse Spark, and the open-weights crew on a raycaster, a Rubik's cube, a calculator, and Game of Life. Here's every build, with cost and latency.

www.tryai.dev

728x90
반응형
그리드형