AI 가격 전쟁 2026: Grok 4.5가 불붙인 '토큰 효율' 승부, 이제 성능보다 값이다
AI 가격 전쟁이 2026년 7월 프론티어 모델 시장의 새 승부처로 떠올랐어요. 며칠 사이에 최상위 AI 모델들이 쏟아졌는데, 이번엔 "누가 제일 똑똑한가"가 아니라 "같은 성능이면 누가 더 싸고 토큰을 적게 쓰는가"로 경쟁 축이 바뀌었어요. 방아쇠를 당긴 건 xAI의 Grok 4.5예요. 성능은 4위권이지만 가격을 경쟁사보다 60% 넘게 후려치면서, 업계가 이 상황을 한 단어로 불렀어요. 바로 '가격 전쟁(price war)'이에요.
![]()
무슨 일이 일어난 걸까요?
2026년 7월 둘째 주는 여러 매체가 "AI 모델 역사상 가장 뜨거운 주"라고 부를 만큼 굵직한 모델이 연달아 나온 시기였어요. 누가·무엇을 내놨는지 한눈에 정리하면 이래요.
- xAI가 7월 8일 Grok 4.5를 내놓으며 가격 전쟁의 방아쇠를 당겼어요.
- OpenAI가 7월 9일 GPT-5.6을 정식 공개했어요. Luna·Terra·Sol 3종에 실시간 음성 모델 GPT-Live까지 함께 발표했어요.
- Google DeepMind가 Gemini 3.5 Pro를 7월 17일 일반 공개(GA)하겠다고 예고했어요. 200만 토큰이라는 역대급 컨텍스트 창이 예고됐어요.
- 조금 앞선 6월 30일엔 Anthropic이 Claude Sonnet 5를 내놨어요. "에이전트를 더 싸게 돌리는" 저가·고효율 모델이에요.
이 모델들이 며칠 간격으로 겹치면서, 개발자와 기업 입장에서 "어떤 모델을 골라야 하나"라는 고민이 커졌어요. 그리고 그 고민의 기준이 예전과 달라졌다는 게 이번 이야기의 핵심이에요.

왜 경쟁 축이 '성능'에서 '가격·효율'로 옮겨갔을까요?
2025년부터 2026년 초까지 프론티어 경쟁의 화두는 "벤치마크 최고점"이었어요. 그런데 2026년 중반이 되자 상위 모델들의 지능 격차가 부쩍 좁혀졌어요. 독립 측정 기관인 Artificial Analysis의 Intelligence Index를 보면 상위권이 54~60점에 빽빽하게 몰려 있어요. 점수만으로는 우열을 가리기 어려워진 거예요.
그러다 보니 실사용에서의 차이가 '점수'보다 호출 한 번에 드는 비용·속도·토큰 사용량으로 옮겨갔어요. 여러 주간 랭킹 매체는 이 흐름을 이렇게 요약했어요. "AI is shifting from 'best model wins' to 'best fit wins'." 쉽게 말하면 최고 모델이 이기는 게 아니라 작업에 가장 잘 맞는 모델이 이긴다는 뜻이에요.
이 변화엔 상업적인 배경도 있어요. 시장조사·보도에 따르면 Anthropic이 자가보고 매출 런레이트에서 OpenAI를 앞질렀다고 해요. Anthropic이 약 470억 달러 런레이트(2026년 5월 기준), OpenAI가 약 250억~330억 달러로 추정돼요. 다만 이 수치들은 각 회사가 스스로 밝힌 값이고 감사받은 회계가 아니라는 점은 감안해서 봐야 해요.
숫자 자체보다 중요한 건 매출이 나오는 곳이에요. Anthropic은 매출의 약 85%가 기업·개발자 API에서 나오고, OpenAI는 약 85%가 ChatGPT 소비자 구독에서 나온다고 해요. 즉 API 토큰 매출이 격전지가 됐고, 그 격전지에서는 가격이 곧 무기가 돼요. 그래서 저가·고효율 모델이 API 물량을 빨아들이는 구조 변화가 진행 중이에요.

Grok 4.5는 정확히 무엇이 달랐을까요?
이번 서사의 방아쇠인 Grok 4.5부터 살펴볼게요. xAI가 7월 8일 내놓은 이 모델은 회사의 첫 코딩·에이전트 특화 모델이에요. 눈에 띄는 건 xAI가 내세운 메시지예요. "최고 성능"이 아니라 "intelligence-per-dollar(달러당 지능)"를 앞세웠어요.
일론 머스크는 이 모델을 이렇게 표현했어요. xAI 자체 주장에 따르면 "Opus급이지만 더 빠르고 토큰 효율적이고 저렴하다"고 했고, "내부 평가상 Grok 4.5가 Opus 4.7과 대략 동급이며 다만 훨씬 빠르다"고 덧붙였어요. 여기서 눈여겨볼 점이 있어요. 최신 최상위인 Opus 4.8이 아니라 4.7과 동급이라고 스스로 표현했다는 거예요. '동급'이라는 말을 그대로 받아들이기보다는 이 맥락을 함께 봐야 해요.
가격을 보면 왜 '가격 전쟁'이라는 말이 나왔는지 바로 이해돼요. xAI 공식가 기준으로 100만 토큰당 입력 2달러 / 출력 6달러예요. 캐시에 적중한 입력은 100만 토큰당 0.5달러로 75% 할인이 붙어요. 다만 조건이 하나 있어요. 20만(200k) 토큰을 넘는 요청은 요율이 2배가 돼요.
컨텍스트 창은 50만(500k) 토큰이에요. 흥미롭게도 전작 Grok 4.3의 100만 토큰에서 오히려 줄어든 값이에요. 속도는 xAI가 초당 80토큰이라고 주장했고, Artificial Analysis의 독립 측정치는 초당 약 91.3토큰이었어요.
토큰 효율이 뭐길래 이렇게 강조할까요?
Grok 4.5의 진짜 무기는 '토큰 효율'이에요. 쉽게 말하면 같은 문제를 풀 때 답을 만드는 데 쓰는 출력 토큰을 훨씬 적게 쓴다는 뜻이에요. AI는 출력 토큰만큼 비용을 매기기 때문에, 토큰을 적게 쓰면 그만큼 실비용이 내려가요.
xAI 자체 주장으로는, SWE-Bench Pro라는 코딩 과제에서 과제당 평균 출력 토큰이 15,954개였어요. 같은 과제에서 Opus 4.8(max)이 67,020개를 쓴 것과 비교하면 약 4.2배 적은 셈이에요. 다만 이 '4.2배'라는 정확한 배수는 xAI가 내놓은 값이고, 벤치마크와 설정에 따라 달라질 수 있어요. Artificial Analysis가 독립적으로 확인한 건 정확한 배수가 아니라 방향성이에요. Intelligence Index 과제 기준으로 "Opus 4.8보다 출력 토큰을 60% 넘게 적게 쓴다"는 점, Terminal-Bench 2.1(83.3% 기록)에서 유사 과제 대비 "Opus 4.8의 약 25% 수준 토큰만 쓴다"는 점을 확인했어요.

네 모델을 숫자로 비교하면 어떻게 될까요?
말로만 보면 감이 잘 안 오니, research에서 교차 확인된 수치를 표로 정리해 볼게요. 먼저 지능 점수부터 봐요.
AI 모델 지능 점수 (Artificial Analysis Intelligence Index, 독립 측정)
| 모델 | 점수 | 비고 |
|---|---|---|
| Claude Fable 5 | 60 | 최상위 |
| Gemini 3.1 Pro | 57 | (3.5 Pro는 아직 미측정) |
| Claude Opus 4.8 | 56 | |
| GPT-5.5 | 55 | |
| Gemini 3.5 Flash | 55 | 가격·성능 최적 |
| Grok 4.5 | 54 | 4위권, Opus 4.7과 동급 |
Grok 4.5는 54점으로 4위권이에요. 전작 Grok 4.3이 38점이었으니 한 번에 16점을 끌어올린, 이번 세대에서 가장 큰 도약이에요. 다만 최상위인 Fable 5(60점)나 Opus 4.8(56점)에는 못 미쳐요. 소스마다 상위 3인의 미세한 순서는 조금씩 엇갈리지만, Grok 4.5가 54점 4위권이라는 점은 일관돼요.
이제 가격을 봐요. 100만 토큰당 입력·출력 가격이에요.
AI 모델 API 가격 (100만 토큰당 입력 / 출력)
| 모델 | 입력 | 출력 | 비고 |
|---|---|---|---|
| Grok 4.5 | $2 | $6 | xAI 공식 (20만 토큰 초과 시 2배) |
| Claude Sonnet 5 | $2 → $3 | $10 → $15 | 도입가(8/31까지) → 표준가 |
| Claude Opus 4.8 | $5 | $25 | |
| GPT-5.5 / 5.6 | $5 | $30 | |
| Claude Fable 5 | $10 | $50 | 성능 최고 = 최고가 |
| Gemini 3.5 Pro | ~$1.25~3 | ~$10~18 | 공식 미발표, 추정치 |
한눈에 봐도 Grok 4.5가 프리미엄 프론티어인 Opus 4.8·GPT-5.5보다 입력·출력 모두 60% 넘게 싸요. 반대편 끝엔 Claude Fable 5가 있어요. 성능은 최고지만 가격도 가장 비싼, "성능 최고 = 최고가"의 전형이에요.
한 가지 주의할 게 있어요. Gemini 3.5 Pro 가격은 아직 공식 발표 전이에요. 소스마다 입력 1.25달러 대 3달러, 출력 10달러 대 18달러로 추정이 엇갈려요. 그래서 어느 쪽도 확정된 값이 아니라 추정으로만 봐야 해요. GPT-5.6도 Luna·Terra·Sol 티어별 정확한 공식 단가는 아직 완전히 교차 확인되지 않았으니, 표의 값은 계열 기준 참고치로 보면 돼요.

그럼 '가격 전쟁'의 실체는 뭘까요?
진짜 핵심은 단가만이 아니에요. 실제로 한 과제를 끝내는 데 드는 총비용이에요. 여기서 Grok 4.5의 강점이 확 드러나요. Artificial Analysis의 Coding Agent Index를 보면 이래요.
코딩·에이전트 실사용 비용 (Artificial Analysis, 독립 측정)
| 모델(하네스) | 점수 | 과제당 평균 토큰 | 과제당 비용 |
|---|---|---|---|
| Grok 4.5 (Grok Build) | 76 | 1.9M | $2.49 |
| GPT-5.5 (Codex) | 76 | 6.2M | $5.07 |
| Claude Fable 5 (Claude Code) | 77 | 7.2M | $11.80 |
세 모델의 점수는 76~77로 거의 비슷해요. 그런데 과제당 비용은 크게 벌어져요. Grok 4.5는 과제당 2.49달러로, Fable 5(11.80달러)의 약 5분의 1, GPT-5.5(5.07달러)의 약 2분의 1이에요. 점수는 엇비슷한데 비용은 몇 배씩 차이가 나는 거예요. 이게 바로 "가격 전쟁"이라는 말의 실체예요.
왜 이렇게 벌어질까요? LLM의 실비용은 "1토큰 단가 × 과제당 토큰 수"로 정해져요. Grok 4.5는 단가도 낮추고(입력 2달러·출력 6달러) 과제당 토큰도 줄여서, 두 축을 동시에 공략했어요. 그래서 곱셈의 결과인 실사용 비용이 경쟁사의 2분의 1에서 5분의 1까지 벌어지는 거예요. 개발자 입장에서는 "점수 몇 점"보다 이 총비용(TCO)이 훨씬 체감되는 지점이에요.
이 흐름이 개발자·기업에게 주는 의미는 무엇일까요?
이번 변화를 어떻게 받아들이면 좋을지, 몇 가지로 정리해 볼게요.
먼저 비용 구조가 다시 짜이고 있어요. VentureBeat의 관점을 빌리면, 프론티어 성능의 대부분을 훨씬 낮은 과제당 비용에 제공하면 가격에 민감한 기업 워크로드가 그쪽으로 옮겨가요. 그러면 기존 강자는 가장 수익성 높은 API 트래픽에서 압박을 받게 돼요.
그다음, 이건 중국식 전략을 서구가 복제하는 신호이기도 해요. Zhipu·DeepSeek 같은 회사가 해온 "성능은 충분히 근접시키고 가격으로 이긴다"는 전략을, 이번엔 폐쇄형(closed) 프론티어 모델이 오픈소스화 없이 따라 하는 모습이에요.
그래서 선택 기준도 다양해졌어요. 정리하면 이렇게 나눌 수 있어요.
- 최고 정확도가 필요한 작업(고난도 코딩, 정밀 추론)엔 여전히 Fable 5·Opus 4.8이 유리해요.
- 대량·반복·에이전트 루프처럼 토큰을 많이 먹는 작업엔 Grok 4.5·Sonnet 5 같은 저가·고효율 모델이 합리적이에요.
즉 "무조건 최고 모델"이 아니라 "작업별 최적합 모델"을 고르는 구도로 바뀐 거예요.

저가 모델이면 무조건 이득일까요?
여기서 한 번 짚고 넘어갈 게 있어요. 값이 싸다고 무조건 우위인 건 아니에요. 몇 가지 트레이드오프가 있어요.
일부 매체는 Grok 4.5가 속도와 비용을 얻는 대신 환각(hallucination)률이 다소 높다는 점을 지적했어요. 환각이란 AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상이에요. 또 앞서 봤듯 컨텍스트 창이 500k로 줄어든 점도 함께 언급돼요. 긴 문서를 통째로 다뤄야 하는 작업이라면 이 축소가 걸림돌이 될 수 있어요.
코딩 정확도만 놓고 봐도 절대 점수는 아직 최상위에 못 미쳐요. Grok 4.5의 SWE-Bench Pro 점수는 64.7%인데, Opus 4.8이 69.2%(max), Fable 5가 80%대예요. 그러니 머스크가 말한 '동급'은 지능 지표에 한정된 이야기이고, 코딩 절대 정확도까지 동급이라는 뜻은 아니에요. 결국 저비용이 매력적이더라도 정확도·신뢰성과의 균형을 함께 봐야 해요.
코딩 벤치마크 비교 (하네스·설정별 편차 있음)
| 벤치마크 | Grok 4.5 | Fable 5 | GPT-5.5 | Opus 4.8 |
|---|---|---|---|---|
| SWE-Bench Pro | 64.7% | 80.3~80.4% | 58.6% | 69.2%(max) |
| DeepSWE 1.1 | 53% | 70% | 67% | 59% |
| Terminal-Bench 2.1 | 83.3% | — | — | (Grok가 ~25% 토큰만 사용) |
이 표를 볼 때도 주의할 점이 있어요. 같은 모델이라도 어떤 하네스(Grok Build·Codex·Claude Code)와 설정(max 등)을 쓰느냐에 따라 점수가 달라져요. 그래서 하나의 숫자로 단정하기보다 경향으로 읽는 게 안전해요.
앞으로 시장은 어떻게 흘러갈까요?
마지막으로 이 가격 전쟁이 어디로 향할지 정리해 볼게요.
첫째, 가격 하방 압력이 이어질 가능성이 커요. Grok 4.5의 공세에 Claude Sonnet 5의 도입가 인하까지 겹치면서, 경쟁사도 프리미엄 티어의 가격과 효율을 방어해야 하는 상황이에요. API 단가가 구조적으로 내려갈 수 있어요.
둘째, 토큰 효율이 새로운 경쟁 지표로 자리 잡고 있어요. 이제 단순 벤치마크 점수 옆에 "과제당 토큰"과 "과제당 비용"이 표준 비교 항목으로 붙어요. Artificial Analysis가 이 값을 전면에 배치했고, 흥미롭게도 Gemini 3.5 Pro의 출시 지연 사유에도 '토큰 효율'이 등장했어요. 초기 기업 테스트에서 토큰 효율·코딩 성능·장기 추론이 아직 플래그십 기준에 못 미쳐 품질을 보정하는 중이라는 보도예요.
셋째, 규제와 지정학이 변수로 떠올랐어요. GPT-5.6은 정부 규제 때문에 출시가 지연됐다는 보도가 있었어요. 또 일부 보도에 따르면 Claude Fable 5가 미국 수출통제 명령으로 18일간 중단됐다가 7월 1일 복귀했다고 해요. 이 사례는 단일 매체 서술이라 참고 수준으로 보되, 이제 성능·가격뿐 아니라 '모델이 켜져 있느냐(가용성)'까지 리스크로 봐야 하는 국면이에요.
정리하면, 당분간은 '성능 리더(Fable 5·Opus)'와 '가성비 파괴자(Grok·Sonnet)'가 공존할 거예요. 관전 포인트는 가성비 축이 API 물량을 얼마나 흡수하느냐예요.
마무리 — 핵심만 다시 정리하면
2026년 7월의 AI 가격 전쟁은 한 문장으로 요약돼요. 경쟁의 무게중심이 "누가 제일 똑똑한가"에서 "같은 성능이면 누가 더 싸고 토큰을 적게 쓰는가"로 옮겨갔다는 거예요. Grok 4.5가 성능 4위권을 60% 넘게 싼 가격과 뛰어난 토큰 효율로 치고 들어오면서 그 방아쇠를 당겼어요.
모델을 고를 때는 이렇게 접근하면 편해요. 최고 정확도가 필요한 정밀 작업이라면 Fable 5·Opus 4.8을, 대량·반복 작업이라면 Grok 4.5·Sonnet 5를 먼저 떠올려 보면 돼요. 그리고 저가 모델을 쓸 땐 환각률·컨텍스트 축소 같은 트레이드오프도 함께 챙기면 안전해요.
지금은 "최고 모델"이 아니라 "내 작업에 가장 잘 맞는 모델"을 고르는 시대예요. 처음엔 선택지가 많아 복잡해 보여도, 작업 성격과 총비용만 기준으로 잡으면 생각보다 쉽게 정리될 거예요.
'AI' 카테고리의 다른 글
| AI 오류 하나만 찾아도 3만원 준대!-전국민 AI 경진대회 시즌2 진행 중 (0) | 2026.07.17 |
|---|---|
| 무료 AI 언제 쓸까? 8가지 정리 (0) | 2026.07.13 |
| 김부장 AI 시퀀스, 소지섭 액션 3분이 통째로 AI였다 (2026 풀 AI 드라마 정리) (0) | 2026.07.12 |
| 애플 오픈AI 소송 정리 — "영업비밀 훔쳐 AI 하드웨어 만들었다" 주장과 쟁점 총정리 (1) | 2026.07.11 |
| 클로드코드-핵심기능5가지 (0) | 2026.07.11 |