본문으로 건너뛰기

Gemini 4·GPT-6·Fable 5.2 비교: 유출 테스트에서 드러난 변화와 한계

7 분 소요AI 모델 비교

Gemini 4와 Fable 5.2로 불리는 모델의 테스트는 이미 나오고 있습니다. 컨트롤러 SVG, 로켓 데모, 자전거를 타는 펠리컨 그림에서 어떤 차이가 보였는지, GPT-6 Astra보다 낫다는 평가를 어디까지 받아들일 수 있는지 살펴봅니다.

Gemini 4, GPT-6 Astra, Claude Fable 5.2를 놓고 공개된 자료를 비교하는 세 서류철 그림

Gemini 4와 Claude Fable 5.2로 불리는 모델에 관한 유출 정보와 사용자 테스트는 이미 나와 있습니다. 지금 눈여겨볼 변화는 화면과 그래픽을 코드로 구현하는 완성도입니다. Gemini 4 추정 모델은 컨트롤러 SVG 사례에서 GPT-6 Astra와 나란히 높은 평가를 받았고, 차기 Fable 추정 모델은 같은 지시문으로 더 좋은 결과를 냈다는 보고가 있습니다. 반면 오래 걸리는 생성, 높아진 비용 체감, 다음 날 같은 결과를 얻기 어려웠다는 경험도 함께 나옵니다. 이런 차이는 Lumina의 컨트롤러 비교JAZII의 차기 Fable 보고에서 확인할 수 있습니다.

이 글은 2026년 9월 20일까지 확인한 원문 게시물과 공개 자료를 바탕으로 세 모델을 비교합니다. 여기서 GPT-6는 공식 모델 문서가 있는 Astra를 뜻합니다. Gemini 4와 Fable 5.2라는 이름은 테스트 작성자의 추정이 포함된 표현입니다. 그렇다고 시연에서 관찰된 차이까지 없는 것으로 볼 필요는 없습니다. 결과에서 보이는 변화와 그 결과를 만든 모델의 신원을 나누어 읽으면, 지금도 도입 판단에 도움이 되는 정보를 얻을 수 있습니다.

먼저 보이는 차이: Gemini의 정교함, Fable의 변화 폭, Astra의 기준점

현재 자료를 업무 선택에 연결하면 Gemini 4 추정 모델은 복잡한 시각 요소를 세밀하게 구현하는 후보, 차기 Fable은 기존 버전 대비 결과물의 변화 폭을 지켜볼 후보입니다. Astra는 이 사례들과 비교할 수 있는 공개 모델인 동시에, 실제 API 사양과 비용을 계산할 수 있는 기준점입니다. 아래 판단은 각 테스트가 보여 준 범위에 한정됩니다.

후보구체적으로 나온 사례그 사례가 시사하는 강점선택을 바꿀 수 있는 조건
Gemini 4 추정 모델Xbox 컨트롤러 SVG, 웹·3D 시연에 관한 보고외형, 조작부, 음영처럼 여러 요소를 함께 구현하는 완성도긴 대기 시간, 다른 날의 재현성, 실제 모델 확인
GPT-6 Astra같은 컨트롤러 비교에서 거의 완벽하다는 평가해당 사례에서는 Gemini 추정 모델과 비슷한 수준의 세부 표현다른 작업에서도 같은 결과가 나오는지, 실제 사용 비용
Fable 5.2로 불리는 차기 Fable같은 지시문 비교, 로켓 데모, 펠리컨 그래픽시각적 풍부함과 기존 Fable 대비 개선 가능성느리고 비싸졌다는 평가, 버전명과 자동 대체 여부

컨트롤러 비교는 Lumina의 게시물, 차기 Fable의 변화 평가는 JAZII의 게시물, 그래픽 사례는 Chetaslua의 비교에 근거합니다. 세 후보를 모두 같은 조건으로 실행한 하나의 테스트를 표로 옮긴 것은 아닙니다. 따라서 표의 강점을 종합 점수나 확정 순위로 읽으면 안 됩니다.

Gemini 4 추정 모델: 컨트롤러 사례에서는 Astra와 접전

Lumina가 공개한 컨트롤러 비교에서 작성자는 자신이 Gemini 4 Pro와 GPT-6 Astra Pro라고 부른 두 결과를 모두 거의 완벽하다고 평가했습니다. Astra 쪽에는 로고가 조금 잘못됐다는 지적을 덧붙였습니다. 실제 첨부 이미지에서도 두 결과 모두 컨트롤러의 몸체, 버튼과 조작부, 입체감을 주는 음영을 세밀하게 표현하고 있습니다.

이 사례에서 끌어낼 만한 결론은 Gemini가 Astra를 전면적으로 압도했다는 것이 아니라, Gemini 4로 추정되는 결과가 이 시각적 코드 작업에서는 Astra와 비슷한 수준에 도달했다는 것입니다. 눈에 보이는 구성 요소가 많은 SVG 작업은 도형의 배치와 비율, 세부 묘사를 한꺼번에 처리해야 합니다. 이런 결과가 반복된다면 아이콘, 제품 시각화, 프런트엔드 시안처럼 구현 결과를 바로 확인할 수 있는 업무에서 유용할 수 있습니다. 이는 사례를 바탕으로 한 해석이며, 큰 프로젝트 유지보수 능력까지 검증한 결론은 아닙니다.

대기 시간과 재현성은 같은 비중으로 봐야 합니다. 연결된 설명에 따르면 당시 Arena에 표시된 이름은 Gemini 3.7 Flash였고, 생성에는 약 20분이 걸렸습니다. 작성자는 다음 날 비슷한 결과를 다시 얻기 어려웠다고도 했습니다. 작업 한 번을 맡겨 놓고 기다릴 수 있는 상황과, 짧은 간격으로 화면을 고치는 상황에서는 이 차이가 중요합니다. 결과가 훌륭하더라도 매 수정에 긴 시간이 필요하면 전체 작업 속도는 떨어질 수 있습니다.

Gemini 관련 다른 시연도 같은 방향의 관심을 보여 줍니다. TMTPost의 9월 19일 보도는 SVG 고양이, 약 8분이 걸린 복셀 탑, 약 10분의 H145 헬리콥터, 약 14분의 흑백 웹사이트 사례를 소개합니다. 이들은 해당 매체가 커뮤니티의 Gemini 4 Pro 추정 사례로 전한 내용입니다. 여러 형식에서 구현 능력이 좋아졌을 가능성을 살펴볼 단서이지만, 각 시간을 동일한 장비·도구·지시문으로 측정한 속도 비교로 사용할 수는 없습니다.

한편 Lumina의 답글에는 Fable 5.2를 사용할 수 없었다는 설명이 있습니다. 컨트롤러 결과를 근거로 Gemini·Astra·Fable의 3자 순위를 만드는 것은 이 사례의 범위를 벗어납니다.

Fable 5.2 추정 테스트: 더 풍부한 결과와 더 큰 작업 부담

차기 Fable을 둘러싼 보고에서는 개선 폭과 사용 부담이 함께 나타납니다. JAZII의 9월 18일 게시물은 같은 지시문과 높은 추론 설정에서 차기 Fable로 추정한 결과가 Astra보다 좋아 보였고, 기존 Fable에서 크게 발전했다고 평가합니다. 동시에 더 느리고 비싸다고 설명합니다. 좋아졌다는 부분만 떼어 읽으면 이 보고가 말하는 핵심적인 절충을 놓칩니다.

여기서 느림과 비용은 작성자의 평가이며, 초당 토큰 수나 정식 요금표가 제시된 것은 아닙니다. 다만 업무 선택에 적용할 만한 가설은 생깁니다. 한 번의 결과 품질이 중요하고 수정 횟수를 줄일 수 있다면 오래 기다리는 모델이 유리할 수 있습니다. 반대로 작은 변경을 여러 번 주고받는 작업에서는 비슷한 완성도의 빠른 모델이 더 편할 수 있습니다. 실제 비용도 한 번의 응답 비용과 검수를 통과할 때까지 든 총비용을 나누어 봐야 합니다.

명칭에 관해서는 작성자 스스로 후속 글에서 5.2라는 이름이 확인된 것이 아니라 자신의 추정이라고 밝혔습니다. 따라서 이 보고는 차기 Fable의 가능성을 분석하는 자료로 사용할 수 있지만, 정확한 제품명이나 출시일을 확정하는 자료로 사용할 수는 없습니다.

로켓 데모에서 높게 평가된 것은 무엇인가

Bhavy의 로켓 테스트는 Fable 5.1과 Opus 5 요청이 새 모델로 연결된다는 주장을 본 뒤 같은 로켓 과제를 실행했다는 내용입니다. 작성자는 결과가 훨씬 좋아졌고 사실적으로 보인다고 평가했습니다. 주변 반응에는 사실성에 동의하지 않거나 Opus 쪽을 선호하는 의견도 있었습니다.

이 사례는 코드로 만든 시각적 결과가 주는 인상을 비교하는 데 의미가 있습니다. 로켓이 그럴듯하게 보이는지, 표현이 풍부한지에 대한 반응을 볼 수 있기 때문입니다. 다만 물리 시뮬레이션의 정확성, 코드의 유지보수성, 실제 프로젝트의 버그 수정 능력을 확인한 실험은 아닙니다. 이 글에서도 영상을 실행하거나 코드를 검증하지 않았습니다.

작성자는 답글에서 Astra보다 낫다고도 말했습니다. 그러나 본문의 직접 비교는 Fable과 Opus입니다. 이 의견을 같은 조건으로 실행한 Astra 결과가 원래 테스트에 포함되어 있었다는 뜻으로 바꾸어 읽어서는 안 됩니다.

펠리컨 그림은 풍부함과 간결함의 차이를 보여 준다

Chetaslua의 최대 추론 설정 비교에 첨부된 것은 자전거를 타는 펠리컨 세 장입니다. 왼쪽과 가운데 결과는 해안 배경을 포함한 넓은 장면을 구성하고, Astra로 표시된 오른쪽 결과는 원형 구도에 집중한 간결한 표현입니다. 왼쪽에는 업데이트된 Fable 5.1이 5.2로 연결된다는 표기가, 가운데에는 차기 Opus라는 표기가 있습니다.

이 차이는 Fable 쪽이 더 인상적이라는 반응을 이해하는 데 도움이 됩니다. 배경과 세부 요소가 많으면 한 장에서 전달하는 정보와 볼거리가 늘어납니다. 하지만 웹페이지의 작은 삽화나 아이콘이 목적이라면 복잡한 장면보다 간결한 구도가 적합할 수도 있습니다. 지시문 전체와 사용 목적을 모르는 상태에서는 그림이 풍부하다는 사실을 곧 지시 이행 능력의 우위로 볼 수 없습니다.

또한 이런 그래픽·코드 시연은 해당 텍스트 모델이 네이티브 이미지 생성 기능을 갖췄다는 증거가 아닙니다. 여기서 비교할 것은 시연된 결과물이지, 확인되지 않은 기능 목록이 아닙니다.

컨트롤러 SVG, 로켓 데모, 펠리컨 그래픽에서 비교할 요소를 정리한 개념도

위 이미지는 사례의 평가 항목을 설명하기 위한 그림이며, 실제 모델의 테스트 출력이 아닙니다.

속도가 느려졌다면 비용도 무조건 늘어날까?

꼭 그렇지는 않습니다. 기다린 시간, 사용한 토큰 수, 토큰 단가는 서로 다른 값입니다. Gemini 3.8 Flash의 변화를 보고한 사용자는 품질이 달라졌고 토큰 생성 속도는 절반 정도로 느려졌지만 토큰 사용량은 줄었다고 설명합니다. 실제 모델 교체나 정확한 속도 차이를 확인한 측정은 아니지만, 속도와 사용량을 따로 봐야 한다는 점을 보여 주는 경험담입니다.

Astra는 비용 비교의 기준을 잡을 수 있습니다. 2026년 9월 20일 OpenAI 직접 API 가격표에서 Standard의 기본 입력·출력 단가는 100만 토큰당 각각 $10·$50입니다. 입력 272,000토큰을 넘는 요청은 전체에 장문맥 요율이 적용되며, 캐시와 도구 등에도 별도 조건이 있습니다. 이 숫자는 ChatGPT 구독료나 차기 Fable의 추정 비용을 뜻하지 않습니다. 자세한 계산은 Astra API 요금 안내에서 확인할 수 있습니다.

따라서 차기 Fable이 비싸졌다는 보고와 Astra 단가만으로 어느 쪽이 경제적인지 결정할 수는 없습니다. 같은 결과를 얻는 데 필요한 시도 수, 검토 시간, 출력 분량이 달라지기 때문입니다. 시각적 시안이라면 처음 마음에 드는 그림이 나왔는지뿐 아니라 수정 지시 후에도 구도를 유지하는지, 최종 파일을 손보는 데 얼마나 걸리는지까지 비교해야 합니다.

유출 자료를 선택에 활용하되, 점수표와 실제 사례는 구분하자

현재 유출 정보 중 우선순위를 높여 볼 만한 것은 결과물을 직접 볼 수 있고 작성자가 작업 조건과 약점을 설명한 사례입니다. 반면 여러 벤치마크를 한꺼번에 압도한다는 숫자표는 원본 실행과 평가 설정을 확인할 수 있는지 먼저 봐야 합니다.

TMTPost가 다룬 유출 점수표에는 코딩·에이전트·지식 평가의 높은 수치가 실려 있지만, 같은 기사에는 점수표와 백엔드 화면의 불일치, 공식 수치와 맞지 않는 Astra 비교값, Google·Arena·평가기관의 확인이 없다는 문제도 함께 적혀 있습니다. 그래서 그 표를 성능 순위의 근거로 쓰기는 어렵습니다. 이는 컨트롤러나 로켓처럼 실제로 공개된 다른 사례까지 모두 거짓이라는 뜻은 아닙니다.

자동 모델 대체에 관한 Chetaslua의 게시물은 Claude Code의 Fable, 웹의 Opus, Arena의 Gemini에 관한 소문을 함께 묶습니다. 여러 제품에서 변화가 느껴졌다는 당시 분위기를 파악하는 자료로는 유용합니다. 하지만 한 계정에서의 체험이나 게시물의 설명으로 모든 계정이 새 모델을 사용하고 있다고 단정할 수는 없습니다.

공식 문서와 버전을 먼저 확인한 뒤 같은 입력과 합격 기준으로 성능을 비교하는 두 단계 안내

공식 자료와의 연결도 남겨 두면 후속 변화를 확인하기 쉽습니다. Google은 7월 21일 발표에서 Gemini 4의 사전 학습 시작을 알렸습니다. 이번에 읽은 Gemini API 목록에는 Gemini 4 항목이 없었고, Anthropic 목록에는 Fable 5.1이 기재되어 있었습니다. 이는 공개 API 사양을 어디까지 확인할 수 있는지 설명하는 정보입니다. 유출 사례를 분석하지 말아야 할 이유는 아닙니다.

지금 어떤 후보를 더 지켜보면 좋을까?

시각적 프로토타입, SVG, 프런트엔드 표현이 주업무라면 Gemini 4 추정 사례와 차기 Fable의 변화를 우선 살펴볼 만합니다. Gemini는 복잡한 물체를 정교하게 구현한 사례가, Fable은 이전 버전보다 풍부해졌다는 비교가 관심을 둘 이유입니다. 다음 확인 항목은 첫 결과의 인상보다 반복 생성과 수정 지시에서도 그 장점이 유지되는지입니다.

짧은 간격으로 수정을 주고받아야 한다면 현재 사용하는 모델과 Astra를 기준으로 대기 시간까지 비교하는 편이 좋습니다. 컨트롤러 사례에서 Astra도 높은 평가를 받았으므로, 최신 추정 모델을 기다리는 것 자체가 더 나은 결과를 보장하지는 않습니다. Astra를 시험할 계획이라면 계정별 API 접근 방법을 확인한 뒤 대표 작업으로 판단하세요.

큰 코드베이스 수정, 문서 검토, 장시간 에이전트 작업이 목적이라면 이번 시각적 시연만으로 이전을 결정하기에는 관찰 범위가 좁습니다. Astra와 Fable 5.1의 업무 비교 가이드처럼 같은 자료·도구·합격 기준을 정하고, 새 후보에 접근할 수 있을 때 그 작업을 추가하는 방식이 적합합니다.

현재 유출 정보가 주는 가장 실용적인 메시지는 새 후보들의 시각적 코드 생성 능력을 실제 업무로 시험해 볼 이유가 생겼다는 것입니다. Gemini 4 추정 모델과 Astra의 접전, 차기 Fable의 개선 주장과 느림·비용의 절충을 함께 보면, 막연히 신형을 기다리거나 단일 승자를 고르는 대신 자신에게 중요한 작업부터 비교할 수 있습니다.

#Gemini 4#GPT-6 Astra#Claude Fable 5.2#AI 모델 비교
Share: