Kimi K3, GPT-5.6, Grok 4.5, Opus 5: Juli 2026, der Monat, in dem die KI durchgedreht ist

Kimi K3, GPT-5.6, Grok 4.5, Opus 5 : Juli 2026, der Monat, in dem die KI durchgedreht ist


Sie sind Anfang Juli in den Urlaub gefahren? Schlechte Idee. Während Sie sich mit Sonnencreme eincremten, hat die KI-Industrie beschlossen, vier Spitzenmodelle in drei Wochen herauszubringen. OpenAI, xAI, Moonshot AI und Anthropic haben ein Festival von „Hier, nimm das“ veranstaltet, das weniger wie ein Tech-Markt und mehr wie eine Pokerrunde aussieht, bei der alle gleichzeitig All-In gehen. Machen Sie es sich bequem, wir fassen den Kampf zusammen, mit überprüften Zahlen und einem umfassenden Vergleich.

Zeitachse der KI-Modellveröffentlichungen im Juli 2026

9. Juli: OpenAI bringt GPT-5.6 in drei Varianten

OpenAI eröffnet den Reigen mit GPT-5.6, das in drei Varianten wie ein Food-Truck-Menü angeboten wird: Sol (das hochwertige Denken, Code und Wissenschaft), Terra (die Qualität von 5.5 zum halben Preis) und Luna (das schnelle und günstige Volumen). Sol beeindruckt vor allem in der Agentik: 91,9 % auf Terminal-Bench 2.0 und ein Gesamt-BenchAlign-Score von 81,96. Kontextfenster von 1,05 Millionen Tokens, berechnet mit 5 $ für Eingaben und 30 $ für Ausgaben pro Million Tokens. Seriös, effizient, teuer in der Ausgabe. Typisch OpenAI.

16. Juli, doppelte Entspannung: Grok 4.5 und das Monster Kimi K3

Eine Woche später, zwei Veröffentlichungen am selben Tag (Zufall gibt es in dieser Branche nicht). Zuerst Grok 4.5 von xAI: schwächer als Sol in den meisten Benchmarks (BenchAlign 76,72, Terminal-Bench 83,3 %), aber führend bei SWE-Bench Pro und vor allem berechnet mit 2 $/6 $, etwa 4-mal günstiger als Sol pro Token. Das Preis-Leistungs-Verhältnis, das schmerzt.

Und dann gibt es Kimi K3 von Moonshot AI, und hier wechseln wir die Kategorie. 2.800 Milliarden Parameter, das größte jemals veröffentlichte Open-Weight-Modell. Der Trick, damit es nicht ein BIP kostet, um es zu betreiben: eine Mixture-of-Experts-Architektur mit 896 Experten, von denen nur 16 pro Token aktiviert werden. Ein riesiges Gehirn, das nur die nützlichen Neuronen mobilisiert, kurz gesagt (wir kennen alle jemanden, der das Gegenteil tut). Fügen Sie den hybriden Aufmerksamkeitsmechanismus KDA hinzu (3 Schichten linearer Aufmerksamkeit für 1 vollständige Schicht), einen Kontext von einer Million Tokens, nativen multimodalen Text-/Bild-/Video-Inhalten und eine MXFP4-Quantifizierung, die alles in ~1,4 To unterbringt.

Der Höhepunkt der Show: K3 erreicht den ersten Platz weltweit in der Frontend Code Arena (1.679 Punkte), vor Claude Fable 5 (1.631). Ein Modell, das bald heruntergeladen werden kann und den proprietären Champion im Frontend-Code schlägt, das ist ein historischer Moment. Und die vollständigen Gewichte kommen am 27. Juli unter einer modifizierten MIT-Lizenz. Bevor Sie Ihre Festplatte für diesen Anlass leeren, lesen Sie trotzdem den Abschnitt „Kann ich es bei mir zu Hause laufen lassen?“ weiter unten: der Aufwachmoment ist brutal.

24. Juli: Anthropic antwortet mit Opus 5

Wir dachten, der Monat sei vorbei, und Anthropic hat die Artillerie ausgepackt: Claude Opus 5, positioniert als das Alltagsmodell, das fast das Flaggschiff Fable 5 erreicht... zum halben Preis (5 $/25 $ pro Million Tokens, im Vergleich zu 10 $/50 $ für Fable 5). Und die Zahlen sind nicht da, um zu dekorieren:

  • Frontier-Bench: 43,3 %, mehr als doppelt so viel wie Opus 4.8 (18,7 %) und fast 10 Punkte vor Fable 5 (33,7 %). Ja, vor dem großen Bruder.
  • ARC-AGI 3 (flüssige Intelligenz): 30,2 %, während GPT-5.6 Sol bei 7,8 % und Opus 4.8 bei 1,5 % stagniert. Der Unterschied ist brutal.
  • CursorBench 3.2: bei 0,5 % des maximalen Scores von Fable 5, für etwa halb so viel pro Aufgabe.

Fügen Sie einen Kontext von 1 Million Tokens und eine Einstellung für den Aufwand niedrig/mittel/hoch hinzu, um das Verhältnis von Kosten zu grauer Materie bei jeder Anfrage zu steuern. Anthropic verkauft buchstäblich „fast-Flagship“ zum Preis von Mittelklasse. Die Buchhalter der Tech-Boxen müssen eine kleine Freudenträne vergossen haben.

Der große Vergleich

Weil eine Tabelle mehr wert ist als drei weitere Absätze:

 Kimi K3GPT-5.6 SolGrok 4.5Claude Opus 5
HerausgeberMoonshot AIOpenAIxAIAnthropic
Veröffentlichung16. Juli9. Juli16. Juli24. Juli
ArchitekturMoE 2,8T (16/896 Experten)n.a.n.a.n.a.
Kontext1M Tokens1,05M Tokens500K Tokens1M Tokens
Preis (in/out pro M Tokens)3 $ / 15 $5 $ / 30 $2 $ / 6 $5 $ / 25 $
Offene GewichteJa, am 27/07 (modifiziertes MIT)NeinNeinNein
StärkeNr. 1 Frontend-Code (Arena 1 679)agentisch (Terminal-Bench 91,9 %)Preis-Leistungs-VerhältnisARC-AGI 3 (30,2 %), SOTA-Code

Preise API Vergleich der KI-Modelle im Juli 2026

Bei realen beruflichen Aufgaben (GDPval-AA v2, 44 Berufe, 9 Branchen) bleibt die Hierarchie: Claude Fable 5 Max (1 815) vor GPT-5.6 Sol Max (1 747,8) und Kimi K3 (1 687). Aber ein Modell mit offenen Gewichten in den Top 3 weltweit, das hätte man im Januar vorhersagen müssen.

« Und ich, kann ich es mit meinem Mac oder PC betreiben? »

Das ist DIE Frage, die immer gestellt wird, sobald man die Worte «offene Gewichte» erwähnt. Kurze Antwort: nein. Lange Antwort: nein, aber setzen Sie sich, denn es gibt viele interessante Dinge zu sagen, und vor allem ganz anständige Alternativen.

Warum «nur 16 aktive Experten» Ihre Maschine nicht rettet

Das klassische Missverständnis: «Es ist Mixture-of-Experts, also arbeiten nur 16 Experten von 896, also passt es auf meine GPU». Falsch. Das Routing wird Token für Token entschieden, und niemand weiß im Voraus, welche Experten für das nächste Token aufgerufen werden. Ergebnis: alle Gewichte müssen im Speicher sein, ständig. MoE spart Rechenleistung, nicht Speicher. Es ist ein bisschen wie eine Bibliothek mit 896 Büchern: Sie lesen nur 16 auf einmal, aber das gesamte Regal muss trotzdem bei Ihnen sein.

Und das Regal ist teuer: 2.800 Milliarden Parameter in MXFP4 nativ (4 Bit), das sind etwa 1,4 TB nur für die Gewichte. Fügen Sie den KV-Cache hinzu (Dutzende von GB, sobald wir von langem Kontext sprechen) und die Laufzeit. Selbst eine aggressive 2-Bit-Quantisierung (wenn sie herauskommt und verwendbar bleibt) lässt Sie bei ~700 GB.

Benötigter Speicher, um Kimi K3 im Vergleich zu handelsüblichen Maschinen auszuführen

Der teuerste Mac Studio M4 Ultra im Katalog, mit seinen 512 GB einheitlichem Speicher, erreicht etwa 2,7-mal weniger als das, was K3 in 4 Bit benötigt. Und bei Apple Silicon wird der einheitliche Speicher geteilt mit macOS, dem KV-Cache und der Inferenz-Engine. Sie haben nie die Zahl, die auf der Rechnung steht. Kurz gesagt: Es ist keine Frage von «man braucht die richtige Einstellung», es ist eine Frage der Physik.

Und Ollama, was ist damit?

Noch nicht, und es ist nicht nur eine Frage der Größe. K3 verwendet KDA, seinen hausinternen hybriden Aufmerksamkeitsmechanismus (3 Schichten linearer Aufmerksamkeit für 1 vollständige Schicht). Dieses Ding muss manuell implementiert werden in jede Inferenz-Engine: llama.cpp, Ollama (das darauf aufbaut) und MLX auf der Mac-Seite haben bis heute keine Unterstützung für KDA. Solange dieser Code nicht existiert, gibt es weder GGUF noch ollama run kimi-k3, egal wie viel RAM Sie haben. Die Engines, die K3 heute ausführen, sind vLLM und SGLang, auf Multi-GPU-Servern mit Hochgeschwindigkeitsvernetzung, die Art von Maschine, die ihren eigenen Leistungsschalter hat.

Was Sie an diesem Wochenende wirklich tun können

Ihr GerätWas möglich ist
Notebook / Standard-PC
(8 bis 32 GB)
K3 nur über die Cloud: kimi.com, die Moonshot-API oder OpenRouter (moonshotai/kimi-k3, OpenAI-kompatible API). Lokal zielen Sie auf ein Modell von 7 bis 32 B: dort spielt sich der wahre Spaß offline ab.
Mac 36 bis 128 GB
(M4/M5 Pro oder Max)
Ausgezeichnetes Terrain für die Modelle 27 bis 70 B, quantifiziert über Ollama, LM Studio oder MLX. Ein Qwen3.6-27B läuft komfortabel auf 24 bis 32 GB und hat bis heute die beste Codebewertung, die man in den Händen halten kann. K3: nein.
Mac Studio 256 bis 512 GBDer VIP-Club der lokalen LLMs: Kimi K2.6 in Q4 läuft zwischen 20 und 32 Tokens/s über MLX oder llama.cpp (240 bis 600 GB je nach Quantifizierung). Immer noch nicht K3, aber es ist das nächstgelegene Moonshot-Modell, das Sie hosten können.
Gaming-PC
(RTX 5090, 32 GB VRAM)
Furchtlos bis ~30 B in 4 Bit, mit Geschwindigkeiten, die Macs nicht erreichen. Darüber hinaus verwandelt das Entladen in den Systemspeicher Ihren Chatbot in einen Briefwechsel.
Sie sind wirklich daran interessiertGPU-Stundenmiete (RunPod, Vast.ai, Lambda): ein Knoten 8×H200 mit vLLM oder SGLang. Rechnen Sie mit mehreren Dollar pro Stunde und 1,4 TB zum Herunterladen, bevor Sie das Modell begrüßen.

Die Konfiguration, die die meisten Teams 2026 empfehlen, ist hybrid: ein kleines lokales Modell für alles, was mit sensiblen Daten oder sich wiederholenden Volumina zu tun hat, und die K3-API für schwierige Aufgaben. Sie behalten die Souveränität dort, wo sie zählt, ohne Ihr Büro in ein Rechenzentrum zu verwandeln, und ohne Ihrem Buchhalter zu erklären, warum Sie vier Mac Studios „zum Testen von etwas“ gekauft haben.

Eine nützliche Erinnerung für den 27. Juli, den Tag der Veröffentlichung der Gewichte: Planen Sie den Speicher (1,4 TB, das ist kein USB-Stick), die Bandbreite (ein Download, der in Stunden oder sogar Tagen gemessen wird), und etwas Geduld. Es wird eine Weile dauern, bis die Community (Unsloth und Konsorten) dynamische Quantifizierungen veröffentlicht und KDA in llama.cpp ankommt. Historisch gesehen dauert das von einigen Tagen bis zu einigen Wochen. In der Zwischenzeit erledigt die API die Arbeit sehr gut.

Also, wer gewinnt?

Antwort von Normand: Es hängt von Ihrem Geldbeutel und Ihrem Anwendungsfall ab. Reines Denken? Opus 5 und sein ARC-AGI 3 Score, der die Konkurrenz demütigt. Die industrielle Agentur? GPT-5.6 Sol. Das knappe Budget? Grok 4.5, unschlagbar im Preis. Souveränität und totale Kontrolle? Kimi K3 und seine offenen Gewichte ab dem 27. Juli. Der wahre Gewinner sind vor allem wir: dieser Preiskampf lässt die Kosten für die Inferenz offensichtlich schmelzen, und während die Giganten sich gegenseitig bekämpfen, zeigt China, dass man die Beschränkungen bei Chips mit architektonischer Effizienz umgehen kann.

Vor fünf Jahren hätte eines dieser Modelle sechs Monate lang Schlagzeilen gemacht. Jetzt hatten wir vier in drei Wochen und finden das fast normal. Treffen Sie sich am 27. Juli zum Herunterladen der Gewichte von K3 und wahrscheinlich am 1. August für die nächste „Ankündigung des Jahrhunderts“.

Quellen

iakimi-k3openaianthropicxaiopen-sourcellm-localbenchmarks

Keine Kommentare im Moment.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙