Kimi K3, GPT-5.6, Grok 4.5, Opus 5 : 2026년 7월, AI가 폭주한 달
7월 초에 휴가를 떠나셨나요? 나쁜 생각입니다. 여러분이 선크림을 바르고 있는 동안, AI 산업은 3주 만에 네 가지 최첨단 모델을 출시하기로 결정했습니다. OpenAI, xAI, Moonshot AI, Anthropic이 모두 동시에 올인하는 포커 게임처럼 보이는 '이거 받아' 축제를 벌였습니다. 자리에 앉으세요, 싸움을 요약해 드리겠습니다 — 검증된 숫자와 완벽한 비교를 지원합니다.

7월 9일 — OpenAI가 GPT-5.6을 세 가지 맛으로 출시
OpenAI가 GPT-5.6으로 시작합니다. 푸드 트럭 메뉴처럼 세 가지 변형으로 출시되었습니다: Sol (고급 추론, 코드 및 과학), Terra (5.5 품질의 절반 가격) 및 Luna (빠르고 저렴한 볼륨). Sol은 특히 에이전트 분야에서 인상적입니다: 91.9 %의 Terminal-Bench 2.0 점수와 81.96의 전체 BenchAlign 점수를 기록했습니다. 105만 토큰의 컨텍스트 창, 입력당 5달러, 출력당 30달러로 청구됩니다. 진지하고, 효율적이며, 출력이 비쌉니다 — 텍스트에서의 OpenAI입니다.
7월 16일 — 더블 출시: Grok 4.5와 괴물 Kimi K3
일주일 후, 같은 날 두 가지 출시가 있었습니다 (이 산업에서는 우연이 존재하지 않습니다). 먼저 xAI의 Grok 4.5: 대부분의 벤치마크에서 Sol보다 약하지만 (BenchAlign 76.72, Terminal-Bench 83.3 %), SWE-Bench Pro에서 선두를 차지하며 특히 2 $/6 $로 청구됩니다 — 토큰당 Sol의 약 4배 저렴합니다. 가격 대비 성능이 뛰어납니다.
그리고 Moonshot AI의 Kimi K3가 있습니다. 여기서는 범주가 바뀝니다. 2800억 개의 파라미터 — 지금까지 발표된 가장 큰 오픈 웨이트 모델입니다. 비용을 GDP처럼 만들지 않기 위한 비결: Mixture-of-Experts 아키텍처로 896명의 전문가 중 16명만 토큰당 활성화됩니다. 필요한 뉴런만 동원하는 거대한 두뇌입니다 (반대로 하는 사람을 모두 알고 있습니다). 하이브리드 주의 메커니즘 KDA (1개의 완전 층에 대해 3개의 선형 주의 층), 100만 개의 토큰 컨텍스트, 텍스트/이미지/비디오의 네이티브 멀티모달, 그리고 모든 것을 ~1.4TB에 담을 수 있는 MXFP4 양자화가 추가됩니다.
쇼의 하이라이트: K3가 프론트엔드 코드 아레나에서 세계 1위를 차지합니다 (1,679점), Claude Fable 5 (1,631점)보다 앞섭니다. 프론트엔드 코드에서 소유자 챔피언을 이긴 모델이 곧 다운로드 가능하다는 것은 역사적인 첫 번째입니다. 그리고 전체 가중치는 7월 27일 수정된 MIT 라이센스 하에 출시됩니다. 기회를 위해 하드 드라이브를 비우기 전에, 아래의 '내가 집에서 실행할 수 있을까?' 섹션을 읽어보세요: 각성이 잔인합니다.
7월 24일 — Anthropic이 Opus 5로 응답하다
이달이 끝났다고 생각했는데, Anthropic이 포격을 시작했습니다: Claude Opus 5, 일상적인 모델로 자리 잡으며 플래그십 Fable 5에 근접합니다... 절반 가격 (토큰당 5 $/25 $, Fable 5의 10 $/50 $와 비교). 그리고 숫자는 장식용이 아닙니다:
- Frontier-Bench: 43.3 % — Opus 4.8 (18.7 %)의 두 배 이상이며 Fable 5 (33.7 %)보다 거의 10포인트 앞섭니다. 네, 큰 형보다 앞섭니다.
- ARC-AGI 3 (유동적 지능): 30.2 %, GPT-5.6 Sol은 7.8 %로 정점에 도달하고 Opus 4.8은 1.5 %입니다. 차이가 큽니다.
- CursorBench 3.2: Fable 5의 최대 점수의 0.5 %로, 작업당 약 두 배 저렴합니다.
100만 개의 토큰 컨텍스트와 각 요청에 대한 비용/회색 물질 비율을 조절할 수 있는 저/중/고 노력 설정을 추가하세요. Anthropic은 문자 그대로 중급 가격에 '거의 플래그십'을 판매하고 있습니다 — 기술 회사의 회계사들은 기쁨의 눈물을 흘렸을 것입니다.
대비표
세 문단보다 한 표가 더 낫습니다:
| Kimi K3 | GPT-5.6 Sol | Grok 4.5 | Claude Opus 5 | |
|---|---|---|---|---|
| 출시자 | Moonshot AI | OpenAI | xAI | Anthropic |
| 출시일 | 7월 16일 | 7월 9일 | 7월 16일 | 7월 24일 |
| 아키텍처 | MoE 2.8T (16/896 전문가) | n.c. | n.c. | n.c. |
| 컨텍스트 | 1M 토큰 | 1.05M 토큰 | 500K 토큰 | 1M 토큰 |
| 가격 (M 토큰당 입/출) | 3 $ / 15 $ | 5 $ / 30 $ | 2 $ / 6 $ | 5 $ / 25 $ |
| 오픈 가중치 | ✅ 7/27 (변경된 MIT) | ❌ | ❌ | ❌ |
| 강점 | 1위 프론트엔드 코드 (Arena 1 679) | 에이전틱 (Terminal-Bench 91.9 %) | 가격 대비 품질 | ARC-AGI 3 (30.2 %), SOTA 코드 |

실제 전문 작업에서 (GDPval-AA v2, 44 직업, 9 산업), 계층 구조는 다음과 같습니다: Claude Fable 5 Max (1,815)가 GPT-5.6 Sol Max (1,747.8)와 Kimi K3 (1,687) 앞서고 있습니다 — 하지만 세계 상위 3위에 오픈 가중치 모델이 있다는 것은 1월에 예측하기 어려웠습니다.
« 나도 내 Mac이나 PC로 실행할 수 있나요? »
이것은 « 오픈 가중치 »라는 단어를 언급할 때마다 나오는 질문입니다. 짧은 대답: 아니요. 긴 대답: 아니요, 하지만 앉아 계세요, 이야기할 것이 많습니다 — 그리고 특히 완전히 존경할 만한 대안 솔루션이 있습니다.
왜 « 단 16명의 활성 전문가 »가 당신의 기계를 구하지 못하는가
고전적인 오해: «Mixture-of-Experts이기 때문에 896명의 전문가 중 단 16명만 작업하므로 내 GPU에 맞는다 ». 아닙니다. 라우팅은 토큰별로 결정되며, 다음 토큰에서 어떤 전문가가 호출될지 미리 아는 사람은 없습니다. 결과: 모든 가중치는 메모리에 있어야 합니다, 항상. MoE는 계산을 절약하지만 메모리는 절약하지 않습니다. 896권의 책이 있는 도서관을 가진 것과 같습니다: 한 번에 16권만 읽지만, 전체 책장을 집에 두어야 합니다.
그리고 책장이 아프게 합니다: MXFP4 네이티브 (4비트)에서 2,800억 개의 매개변수는 가중치만으로 약 1.4TB입니다. KV 캐시를 추가하고 (긴 컨텍스트에 대해 수십 GB) 런타임을 추가합니다. 공격적인 2비트 양자화조차 — 출시되고 사용 가능하다면 — 약 700GB를 남깁니다.

카탈로그에서 가장 비싼 Mac Studio M4 Ultra는 512GB의 통합 메모리로 K3가 4비트에서 요구하는 것보다 약 2.7배 적습니다. 그리고 Apple Silicon에서는 통합 메모리가 macOS, KV 캐시 및 추론 엔진과 공유되므로 청구서에 표시된 숫자를 절대 사용할 수 없습니다. 요약하자면: « 올바른 설정이 필요하다 »는 이야기가 아니라 물리학의 이야기입니다.
그럼 Ollama는?
아직 아니며, 단순히 크기 문제는 아닙니다. K3는 KDA를 사용하며, 이는 자사 하이브리드 주의 메커니즘입니다 (1개의 전체 층에 대해 3개의 선형 주의 층). 이 녀석은 각 추론 엔진에 수작업으로 구현되어야 합니다: llama.cpp, Ollama (이것에 의존함) 및 Mac 쪽의 MLX는 현재 KDA를 지원하지 않습니다. 이 코드가 존재하지 않는 한, GGUF도 없고 ollama run kimi-k3도 없습니다, 당신의 RAM에 관계없이. 오늘 K3를 실행하는 엔진은 vLLM과 SGLang이며, 고속 상호 연결이 있는 다중 GPU 서버에서 실행됩니다 — 전용 차단기가 있는 기계의 종류입니다.
이번 주말에 실제로 할 수 있는 것
| 당신의 기계 | 가능한 것 |
|---|---|
| 노트북 / 일반 PC (8–32GB) | 클라우드에서만 K3 사용 가능: kimi.com, Moonshot API 또는 OpenRouter (moonshotai/kimi-k3, OpenAI 호환 API). 로컬에서는 7에서 32B 모델을 목표로 하세요: 오프라인의 진정한 즐거움이 거기서 시작됩니다. |
| Mac 36–128GB (M4/M5 Pro 또는 Max) | Ollama, LM Studio 또는 MLX를 통해 수량화된 27–70B 모델에 적합한 훌륭한 환경. Qwen3.6-27B는 24–32GB에서 편안하게 실행되며, 현재 손에 쥘 수 있는 최고의 코드 점수를 기록하고 있습니다. K3: 불가능. |
| Mac Studio 256–512GB | 로컬 LLM의 VIP 클럽: Kimi K2.6 in Q4는 MLX 또는 llama.cpp를 통해 20–32 tokens/s로 실행됩니다 (240에서 600GB까지 수량화에 따라 다름). 여전히 K3는 아니지만, 당신이 호스팅할 수 있는 Moonshot 모델 중 가장 가까운 것입니다. |
| 게이밍 PC (RTX 5090, 32GB VRAM) | ~30B까지 4비트에서 강력하며, Mac에서는 도달할 수 없는 속도를 자랑합니다. 그 이상에서는 시스템 RAM에서의 디스차지가 당신의 챗봇을 서신 교환자로 변모시킵니다. |
| 정말로 원하신다면 | 시간당 GPU 대여 (RunPod, Vast.ai, Lambda): vLLM 또는 SGLang와 함께하는 8×H200 노드. 시간당 몇 달러를 예상하세요 — 그리고 모델에 인사하기 전에 다운로드할 데이터는 1.4TB입니다. |
2026년 대부분의 팀이 추천하는 구성은 하이브리드입니다: 민감한 데이터나 반복적인 작업을 위한 소형 로컬 모델과 어려운 작업을 위한 K3 API. 당신은 중요한 곳에서 주권을 유지하며, 사무실을 데이터 센터로 변모시키지 않고 — 그리고 회계사에게 "무언가를 테스트하기 위해" 네 대의 Mac Studio를 구매한 이유를 설명할 필요가 없습니다.
7월 27일, 가중치 발표일에 유용한 알림: 저장소 (1.4TB, USB 드라이브가 아님), 대역폭 (몇 시간, 심지어 며칠이 걸리는 다운로드), 그리고 약간의 인내를 준비하세요 — 커뮤니티 (Unsloth 등)가 동적 수량화를 발표하고 KDA가 llama.cpp에 도착할 때까지 기다려야 합니다. 역사적으로, 이 과정은 며칠에서 몇 주가 걸립니다. 그동안 API는 매우 잘 작동합니다.
그래서, 누가 이길까요?
노르망드의 대답: 당신의 지갑과 사용 사례에 따라 다릅니다. 순수한 논리? Opus 5와 그 ARC-AGI 3 점수는 경쟁을 무너뜨립니다. 산업 에이전트? GPT-5.6 Sol. 예산이 빠듯한가요? Grok 4.5, 가격 대비 무적입니다. 주권과 완전한 통제? 7월 27일에 공개되는 Kimi K3와 그 오픈 가중치. 진정한 승자는 우리입니다: 이 가격 전쟁은 인퍼런스 비용을 눈에 띄게 줄이고, 거대 기업들이 서로 경쟁하는 동안 중국은 아키텍처 효율성을 통해 칩 제한을 우회할 수 있음을 보여줍니다.
5년 전, 이 모델 중 하나만으로도 6개월 동안 헤드라인을 장식했을 것입니다. 지금은 3주 동안 네 개가 나왔고, 우리는 거의 그것을 정상으로 여기고 있습니다. 7월 27일 K3의 가중치 다운로드를 위해 만나요 — 그리고 아마도 8월 1일에 다음 "세기의 발표"를 위해 만나요.
출처
- TechCrunch — Anthropic가 Opus 5를 출시했습니다
- Vellum — Claude Opus 5 벤치마크 설명
- Tom's Hardware — Moonshot가 2.8조 매개변수 Kimi K3를 출시했습니다
- VentureBeat — 중국의 Moonshot AI가 Kimi K3를 출시했습니다
- Simon Willison — Kimi K3와 우리가 펠리컨 벤치마크에서 여전히 배울 수 있는 것
- LLM-Stats — GPT-5.6 Sol vs Grok 4.5
- MindStudio — 2026년 AI 모델 가격
- Modem Guides — Kimi K3를 로컬에서 실행할 수 있나요? 2.8T 하드웨어 현실
- Layer3 Labs — Kimi K3를 로컬에서 실행하는 방법: 하드웨어 및 설정 가이드
- Unsloth — Kimi K2.6: 로컬에서 실행하는 방법 (동적 정량화)
- OpenRouter — moonshotai/kimi-k3
Aucun commentaire pour le moment.