Magazin

Kimi K3 API: Preise, Kontextfenster und die ersten Schritte für dein Team

Die Preisseite der Kimi-K3-API zeigt drei Zahlen. In der Praxis entscheiden fünf weitere darüber, was am Monatsende auf der Rechnung steht. Dieser Text geht die Schnittstelle von der Anmeldung bis zum ersten Produktivlauf durch, mit den Stellen, an denen deutsche Firmen erfahrungsgemäß hängenbleiben.

Abstrakte Grafik aus rot und blau leuchtenden Würfeln, die wie ein dichtes Datennetz ineinandergreifen

Eine Million Token Kontext klingt abstrakt. Auf der Rechnung wird die Zahl sehr konkret. Foto: Pachon in Motion auf Pexels

Update vom 28. September 2026: Die Token-Preise sind unverändert, gegengeprüft an der Moonshot-Preisseite. Geändert haben sich drei Dinge, die direkt auf die Rechnung wirken. Der Cache kennt jetzt zwei Laufzeiten: fünf Minuten als Voreinstellung, bei der das Schreiben 3 US-Dollar je Million Token kostet, und eine Stunde für 6 US-Dollar. Die Rate-Limits hat Moonshot deutlich gesenkt, Tier 1 erlaubt nur noch 15 parallele Anfragen und 100 pro Minute statt 50 und 200. Und die Konkurrenz ist seit dem 22. September billiger geworden: GPT-6 Sol kostet mit 2 und 10 US-Dollar je Million Token weniger als Kimi K3, Claude Opus 5.5 mit 4 und 20 US-Dollar nur ein Drittel mehr. Artificial Analysis hat den Index zudem neu zusammengesetzt, die Punktwerte im Text tragen deshalb den Stand vom 28. September und sind mit den Augustzahlen darunter nicht vergleichbar. Die beiden neuen Modelle ordnen wir in Claude Opus 5.5 gegen GPT-6 Sol ein.
Update vom 8. August 2026: Die Preise sind unverändert, gegengeprüft an der Moonshot-Preisseite: 3, 0,30 und 15 US-Dollar je Million Token, und Kimi K3 steht weiterhin nicht in der Modell-Liste der Batch-API. Bewegt haben sich die Messwerte. Kimi K3 steht im Intelligence-Index von Artificial Analysis jetzt bei 60 Punkten statt bei 57, der Rückstand auf Claude Opus 5 ist von vier auf drei Punkte geschrumpft. Alle Vergleichszahlen im Text tragen den Stand vom 8. August, dazu ist Claude Fable 5 in den Vergleich aufgenommen, weil es inzwischen über Kimi K3 liegt. Neu ist außerdem der Indexwert der niedrigen Denkstufe, damit du beziffern kannst, was reasoning_effort=low an Qualität kostet.
Die Kimi-K3-API in Kurzform: Moonshot berechnet 3 US-Dollar je Million Eingabe-Token, 0,30 bei einem Treffer im Prefix-Cache und 15 für die Ausgabe, flach über das gesamte Kontextfenster von 1.048.576 Token. Wer den Cache eine Stunde statt fünf Minuten halten will, zahlt beim Schreiben 6 statt 3 US-Dollar. Die Schnittstelle ist OpenAI-kompatibel, die Base-URL lautet https://api.moonshot.ai/v1, der Modellname kimi-k3. Drei Punkte fehlen in den meisten Anleitungen: Der Stapelbetrieb mit 40 Prozent Rabatt unterstützt K3 bei Moonshot gar nicht, Prompt-Teile unterhalb eines vollen Cache-Blocks laufen immer zum vollen Preis, und mit dem Mindestguthaben von einem Dollar bekommst du drei Anfragen pro Minute. Seit dem 22. September ist außerdem GPT-6 Sol je Token billiger. Stand: 28. September 2026.

Was die Kimi-K3-API kostet

Moonshot führt für kimi-k3 eine einzige Preiszeile, ohne Staffel nach Kontextlänge. Ob du 10.000 oder 900.000 Token in eine Anfrage packst, ändert am Satz je Token nichts.

Postenje 1 Mio. Token (USD)in EuroWann er greift
Eingabe, Cache-Miss3,002,63 €Standardfall bei jeder neuen Anfrage, gleichzeitig der Preis fürs Schreiben in den 5-Minuten-Cache
Eingabe, Cache-Treffer0,300,26 €Wiederholter Prompt-Anfang, siehe unten
Cache schreiben, 1 Stunde6,005,26 €Einmalig beim ersten Schreiben, nur wenn du die lange Laufzeit wählst
Ausgabe15,0013,15 €Antwort samt der Token, die das Modell zum Nachdenken erzeugt

Preise laut Moonshot-Preisseite, zuletzt gegengeprüft am 28. September 2026. Umrechnung zum EZB-Referenzkurs vom 25. September 2026 mit 1,1403 US-Dollar je Euro. Die Beträge verstehen sich ohne Steuern, die laut Moonshot „at checkout based on your jurisdiction” berechnet werden.

Um das einzuordnen, hilft der Blick auf unseren KI-Modellvergleich und auf die unabhängigen Messungen von Artificial Analysis. Dort steht Kimi K3 am 28. September 2026 bei einem Intelligence-Index von 44 Punkten. Claude Opus 5.5 führt auf höchster Stufe mit 58, GPT-6 Astra kommt auf 53, GPT-6 Sol auf 48, das ebenfalls offene GLM-5.3 auf 45. Die Werte stammen aus Version 4.3.2 des Index und liegen durchweg niedriger als im August, als Kimi K3 noch bei 60 stand. Grund ist die neu zusammengesetzte Testauswahl, vergleichbar sind nur Werte derselben Version.

Die Lage hat sich damit gedreht. Im August lag Kimi K3 drei Punkte hinter der Spitze und kostete deutlich weniger als die Konkurrenz. Heute liegt es 14 Punkte hinter Opus 5.5, und GPT-6 Sol ist mit 2 US-Dollar Eingabe und 10 US-Dollar Ausgabe je Token ein Drittel günstiger. Im üblichen Mischverhältnis von drei Teilen Eingabe zu einem Teil Ausgabe kommen wir auf 5,26 Euro je Million Token für Kimi K3, 3,51 Euro für GPT-6 Sol und 7,02 Euro für Opus 5.5. Artificial Analysis beziffert außerdem, was eine Aufgabe aus dem eigenen Index im Schnitt kostet: 2,00 US-Dollar bei Kimi K3, 1,06 bei GPT-6 Sol und 5,98 bei Opus 5.5 auf höchster Stufe.

Wer Kimi K3 heute einsetzt, tut das wegen der offenen Gewichte, die sich bei einem europäischen Anbieter oder auf eigener Hardware betreiben lassen. Als reiner Preisbrecher über die Moonshot-API hat das Modell seit dem 22. September ausgedient. Den vollständigen Modellvergleich haben wir in Kimi K3 vs. Claude aufgeschrieben.

Ein Randwert zum Mitnehmen: OpenRouter führt K3 inzwischen zu denselben Sätzen wie Moonshot, also 3 und 15 US-Dollar mit 0,30 für Cache-Treffer. Daneben steht dort eine Variante kimi-k3:batch für 2,28 und 11,40 US-Dollar, rund 24 Prozent unter Liste. Das ist der einzige Mengenrabatt auf K3, den wir gefunden haben. Prüf vorher, bei welchem Anbieter OpenRouter diese Anfragen ausführt, bevor echte Kundendaten durchlaufen.

Der Prefix-Cache ist der größte Hebel, und er hat eine Schwelle

Der Unterschied zwischen 3,00 und 0,30 US-Dollar ist Faktor zehn. Genau hier verdienst oder verbrennst du Geld.

Der Cache arbeitet automatisch. Lässt du den Parameter weg, schreibt das System passende Prompt-Anfänge mit einer Laufzeit von fünf Minuten in den Cache und nutzt sie bei der nächsten Anfrage wieder. Jeder Treffer innerhalb dieser Zeit verlängert die Laufzeit ohne Aufpreis. Neu ist eine zweite Option: Mit prompt_cache_options und “ttl”: “1h” hält der Cache eine Stunde. Das Schreiben kostet dann einmalig 6 statt 3 US-Dollar je Million Token.

Die Bedingung steht in einem Nebensatz der Dokumentation und wird gern überlesen: Der Cache speichert in festen Blöcken, und ein Rest, der kleiner ist als ein voller Block, läuft als Cache-Miss zum vollen Preis. Die Blockgröße nennt die aktuelle Dokumentation nicht, im August stand dort noch eine Schwelle von 256 Prompt-Token. Kurze Anfragen laufen deshalb weiter dauerhaft zum vollen Preis. Ob ein Treffer zustande kam, zeigt das Feld usage.prompt_tokens_details.cached_tokens in jeder Antwort. Für Chat-Oberflächen mit knappen Fragen bringt der Cache wenig, für Anwendungen mit festem Systemkontext sehr viel.

Rechne es einmal mit eigenen Zahlen durch. Angenommen, dein Support-Assistent bekommt bei jeder Anfrage euer Produkthandbuch mit 40.000 Token vorangestellt, und er läuft 200 Mal am Tag. Ohne Cache sind das 8 Millionen Eingabe-Token täglich, also 24 US-Dollar. Landen dieselben 40.000 Token im Cache, fallen 2,40 US-Dollar an. Über zwanzig Arbeitstage stehen sich rund 421 Euro und rund 42 Euro gegenüber, bei identischem Ergebnis.

Welche Laufzeit du wählst, hängt am Takt. 200 Anfragen an einem Achtstundentag kommen im Schnitt alle zweieinhalb Minuten, da reichen fünf Minuten. Kommen die Anfragen nur alle zehn oder zwanzig Minuten, verfällt der kurze Cache dazwischen, und jede Anfrage zahlt den vollen Satz. Dann lohnt die Stunde: Das Handbuch einmal für 24 US-Cent zu schreiben ist billiger, als es dreimal pro Stunde für je 12 US-Cent neu zu laden.

Was das konkret bedeutet: Baue deine Prompts so, dass der unveränderliche Teil ganz vorn steht. Systemanweisung, Handbuch, Preisliste, Beispielfälle: alles, was gleich bleibt, gehört an den Anfang. Die konkrete Kundenfrage kommt ans Ende. Diese Reihenfolge kostet dich zehn Minuten Arbeit und senkt die Eingaberechnung um bis zu 90 Prozent. Liegen zwischen den Anfragen oft mehr als fünf Minuten, stell die Cache-Laufzeit auf eine Stunde.

Der übliche Mengenrabatt greift bei K3 nicht

Bei den meisten Anbietern lautet der erste Spartipp: Wenn es nicht eilig ist, schick die Anfragen als Stapel und zahl die Hälfte. Moonshot hat so ein Angebot, die Batch-API rechnet laut Dokumentation mit 60 Prozent des Standardpreises ab und unterliegt keinen Nebenläufigkeits-Limits.

Nur steht Kimi K3 dort nicht in der Modell-Liste.

Die Batch-API unterstützt die Modelle kimi-k2.7-code und kimi-k2.6.

Moonshot AI, Dokumentation zur Batch-Abrechnung, abgerufen am 28. September 2026, übersetzt

Für die Planung heißt das: Wer 50.000 Dokumente über Nacht durchrechnen lassen will, zahlt bei K3 den vollen Satz. Der saubere Umweg ist eine Zweiteilung. Die Masse läuft über kimi-k2.6 im Stapelbetrieb, und nur die Fälle, an denen das kleinere Modell scheitert, gehen einzeln an K3. Das lohnt sich ab dem Punkt, an dem die Trefferquote des kleineren Modells über etwa 80 Prozent liegt, denn dann sparst du auf vier Fünfteln der Menge 40 Prozent und zahlst nur beim Rest voll. Das ältere kimi-k2.5 ist seit August aus der Stapel-Liste verschwunden. Wer K3 selbst im Stapel braucht, findet die Variante über OpenRouter im Preisabschnitt oben.

Nebenbei: Die Datei-Schnittstellen für Inhaltsextraktion und Speicherung sind laut Preisseite derzeit kostenfrei. Wer Dokumente hochlädt statt sie in jeden Prompt zu kopieren, spart damit zusätzlich.

Eine Million Token: was hineinpasst und was das kostet

1.048.576 Token entsprechen grob 700.000 Wörtern, also etwa 2.500 Buchseiten. Ein vollständiges Bauprojekt-Archiv, die Vertragsakte eines Großkunden oder die komplette Codebasis eines mittleren Produkts passen in eine einzige Anfrage.

Der Preis dafür ist überschaubar: Ein einmal komplett gefülltes Fenster kostet bei Cache-Miss 3,15 US-Dollar, also 2,76 Euro. Liegt derselbe Inhalt im Cache, sind es 31 US-Cent.

Die Falle liegt im Dialog. Jede Folgefrage schickt den gesamten bisherigen Verlauf erneut mit. Ein Gespräch über zehn Runden auf einem 500.000-Token-Dokument kostet ohne Cache rund 15 US-Dollar, mit funktionierendem Cache anderthalb. Wie sich das über ein Jahr summiert, haben wir in unserer Rechnung zu den Token-Kosten im Unternehmen durchgespielt.

Zwei technische Eigenheiten bei Bildern und Video solltest du vorher kennen, weil sie den ersten Integrationsversuch gern scheitern lassen. Öffentliche Bild-URLs akzeptiert die Schnittstelle nicht, die Dokumentation verlangt base64-kodierte Daten oder eine Referenz der Form ms://file-id aus der Datei-Schnittstelle. Und der Inhalt einer Nachricht muss bei multimodalen Anfragen als Array von Objekten übergeben werden, ein einfacher String genügt dann nicht mehr.

Die Denkstufe entscheidet über deine Rechnung

Kimi K3 denkt bei jeder Anfrage nach, der Modus lässt sich nicht abschalten. Steuern kannst du ihn über den Parameter reasoning_effort mit den Werten low, high und max. Voreingestellt ist max.

Der Preis je Token ist in allen drei Stufen identisch. Die Rechnung entsteht über die Menge: Denk-Token zählen als Ausgabe und kosten damit 13,15 Euro je Million. Wie gesprächig das Modell auf der höchsten Stufe ist, zeigt eine Zahl von Artificial Analysis. Für den Durchlauf der aktuellen Index-Version brauchte Kimi K3 rund 160 Millionen Ausgabe-Token, der Median vergleichbarer Modelle liegt bei 140 Millionen.

Wer die Voreinstellung übernimmt, zahlt also für Nachdenken, das viele Aufgaben gar nicht brauchen. Was du beim Herunterschalten aufgibst, hat Artificial Analysis im August beziffert, als beide Stufen noch getrennt gemessen wurden: Auf max erreichte Kimi K3 damals einen Intelligence-Index von 60, auf low 48, beides nach der alten Index-Version. Die aktuelle Version weist nur noch die höchste Stufe aus. Zwölf Punkte klingen nach viel, sie fallen aber vor allem bei Aufgaben mit mehrstufiger Ableitung an. Beim Verschlagworten eines Tickets oder beim Herausziehen von Feldern aus einem vorgegebenen Dokument schlägt der Unterschied kaum durch, bei einer juristischen oder rechnerischen Herleitung sehr wohl.

Setz reasoning_effort für Routinearbeit wie Klassifizierung, Extraktion oder Zusammenfassung also auf low und heb die Stufe nur dort an, wo die Qualität messbar besser wird. In unseren eigenen Läufen war das bei etwa jeder fünften Aufgabe der Fall.

Rate-Limits: ein Dollar Guthaben bremst deinen Test aus

Moonshot koppelt die Limits an die kumulierte Aufladung. Der Einstieg kostet einen US-Dollar, und genau da liegt die Stolperstelle für Piloten.

StufeAufladung kumuliertParallelAnfragen/Min.Token/Min.Token/Tag
Tier 01 USD13500.0001.500.000
Tier 110 USD151002.000.000unbegrenzt
Tier 220 USD401003.000.000unbegrenzt
Tier 3100 USD502003.000.000unbegrenzt
Tier 41.000 USD602004.000.000unbegrenzt
Tier 53.000 USD1003005.000.000unbegrenzt

Rate-Limits laut Moonshot-Dokumentation, abgerufen am 28. September 2026. Im August lagen Tier 1 bei 50 parallelen Anfragen und 200 pro Minute, Tier 5 bei 1.000 und 10.000.

Drei Anfragen pro Minute bedeuten eine Anfrage alle zwanzig Sekunden. Ein Testlauf über 200 Dokumente dauert damit gut eine Stunde, obwohl das Modell in Sekunden antwortet. Das Tageslimit von 1,5 Millionen Token reicht für etwa anderthalb volle Kontextfenster.

Zehn US-Dollar lösen das gröbste Problem: Tier 1 hebt die Nebenläufigkeit auf 15, die Anfragen pro Minute auf 100 und das Tagesvolumen auf unbegrenzt. Für eine Pilotphase ist das der sinnvolle Startpunkt. Nach oben ist die Luft allerdings dünn geworden. Selbst die höchste Stufe ab 3.000 US-Dollar erlaubt nur noch 300 Anfragen pro Minute. Planst du eine Anwendung mit vielen gleichzeitigen Nutzern, rechne die Limits vorher gegen die erwartete Last oder plane gleich einen europäischen Anbieter der offenen Gewichte ein. Wer die 429-Antwort trotzdem sieht, folgt der Empfehlung aus der Dokumentation und wartet zunächst eine Sekunde, dann zwei, dann vier. Bei fünf US-Dollar kumulierter Aufladung schreibt Moonshot einen Gutschein über fünf Dollar gut. Für den Aufstieg in die nächste Stufe zählt der Gutschein allerdings nicht mit.

Die ersten Schritte für dein Team, in einer halben Stunde

Wenn jemand aus deinem Team Python oder JavaScript lesen kann, ist der erste Aufruf in einer halben Stunde erledigt.

  1. Konto auf platform.kimi.ai anlegen und gleich zehn US-Dollar aufladen, damit Tier 1 greift.
  2. In der Konsole unter console/api-keys einen Schlüssel erzeugen. Pro Projekt ein eigener Schlüssel, dann lässt sich der Verbrauch später zuordnen.
  3. Im bestehenden Code die Adresse auf https://api.moonshot.ai/v1 und den Modellnamen auf kimi-k3 umstellen. Das offizielle OpenAI-SDK ab Version 1.0 funktioniert unverändert.
  4. Für den ersten Durchlauf reasoning_effort auf low setzen, sonst verzerrt der Denkmodus deine Kostenmessung.
  5. Den stabilen Teil des Prompts nach vorn ziehen, damit der Cache ab der zweiten Anfrage greift. Kommen die Anfragen seltener als alle fünf Minuten, die Laufzeit auf eine Stunde stellen.
  6. Zwei Zahlen mitschreiben: Token je Vorgang und Trefferquote gegen euer heutiges Modell. Alles andere ist später zu klären.
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

antwort = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "system", "content": HANDBUCH},   # stabiler Teil zuerst
        {"role": "user", "content": frage},        # variabler Teil zuletzt
    ],
    # nur bei Abständen über fünf Minuten nötig:
    extra_body={"prompt_cache_options": {"mode": "implicit", "ttl": "1h"}},
)

Für Werkzeugaufrufe unterstützt die Schnittstelle tool_choice=“required”, für maschinenlesbare Antworten ein json_schema mit strict: true. Im Streaming-Betrieb kommen Denkschritte und finale Antwort getrennt an, als reasoning_content und content. Wer diese Trennung nutzt, kann die Denkschritte im Log behalten und dem Nutzer trotzdem nur das Ergebnis zeigen.

Vor dem Produktivgang: Rechnung, Recht und Daten

Hier wird es für deutsche Unternehmen unbequem, und zwar an einer Stelle, die in Entwickler-Tutorials nie auftaucht.

Vertragspartner der Entwicklerplattform ist laut Nutzungsbedingungen die MOONSHOT AI PTE. LTD. Es gilt das Recht von Singapur, Schiedsort ist Singapur, Verfahrenssprache Englisch. Die Bedingungen erlauben ausdrücklich, Kundeninhalte zur Bereitstellung, Wartung, Entwicklung und Verbesserung der Dienste zu verwenden. Wer das ausschließen will, muss laut demselben Dokument gesondert eine Unternehmensvereinbarung verhandeln.

Auf der Abrechnungsseite passt die Dokumentation nicht recht zu einer deutschen Buchhaltung. Als Online-Zahlwege beschreibt Moonshot WeChat Pay und Alipay per QR-Code, als Rechnungsaussteller nennt die Doku die Beijing Moonshot AI Technology Co., Ltd. mit einem Steuersatz von 6 Prozent. Die Nutzungsbedingungen erwähnen daneben die Belastung einer hinterlegten Kredit- oder Debitkarte. Für eine saubere Vorsteuerbehandlung und ein Reverse-Charge-Verfahren solltest du das mit deiner Steuerberatung klären, bevor die erste größere Aufladung läuft, statt danach.

Beim Datenschutz gilt unverändert, was wir in Kimi K3 und die DSGVO aufgeschrieben haben: Für Singapur gibt es keinen Angemessenheitsbeschluss der EU-Kommission, Standardvertragsklauseln benennt die Datenschutzerklärung der Plattform nicht, ein Auftragsverarbeitungsvertrag ist dort ebenfalls nicht dokumentiert. Für Tests mit unkritischem Material ist der direkte API-Weg brauchbar. Sobald personenbezogene Daten, Bewerbungsunterlagen oder Mandantenakten im Spiel sind, führt der belastbare Weg über die offenen Gewichte bei einem europäischen Anbieter. Preise um 0,40 bis 0,60 Euro je Million Token, Auftragsverarbeitungsvertrag inklusive, die Anbieterlage steht in unserer Anleitung zum Selbst-Hosten.

Was das konkret bedeutet: Behandle die Moonshot-API als Teststrecke und die europäische Variante als Produktionsumgebung. Der Code ist in beiden Fällen derselbe, weil beide Wege OpenAI-kompatibel sind. Du tauschst Adresse und Schlüssel, sonst nichts.

Dein nächster Schritt

Such dir eine wiederkehrende Aufgabe ohne personenbezogene Daten mit hohem Textvolumen, etwa die Vorprüfung eingehender Ausschreibungen oder das Verschlagworten von Support-Tickets. Lad zehn Dollar auf, häng die Aufgabe eine Woche lang parallel an Kimi K3 auf niedriger Denkstufe und protokolliere Token je Vorgang, Trefferquote und Bearbeitungsdauer. Lass dieselbe Aufgabe parallel über GPT-6 Sol laufen, seit dem 22. September ist das der naheliegende Vergleich beim Preis. Danach hast du belastbare Zahlen für deine Entscheidung und weißt, ob sich der Aufwand für einen zweiten Anbieter lohnt. Was bei Moonshot ohne Bezahlung geht, steht in Kimi K3 kostenlos nutzen. Die tagesaktuellen Werte pflegen wir im Kimi-K3-Guide für Unternehmen, die Einordnung des Modells steht in Was ist Kimi K3, passende Arbeitsanweisungen findest du im Kimi-Skills-Katalog.

Das Wichtigste in zwei Sätzen: Die Kimi-K3-API ist technisch in einer halben Stunde angebunden, weil sie OpenAI-kompatibel ist, und sie kostet 3, 0,30 und 15 US-Dollar je Million Token für Eingabe, Cache-Treffer und Ausgabe. Über deine Rechnung entscheiden die Prompt-Reihenfolge samt Cache-Laufzeit, die Denkstufe und die Aufladehöhe, und seit dem 22. September lohnt vor jeder Entscheidung der Preisvergleich mit GPT-6 Sol.

Häufige Fragen

Was kostet die Kimi K3 API pro Million Token?

Moonshot berechnet 3 US-Dollar je Million Eingabe-Token, 0,30 US-Dollar wenn die Eingabe im Prefix-Cache liegt, und 15 US-Dollar je Million Ausgabe-Token. Zum EZB-Referenzkurs vom 25. September 2026 sind das rund 2,63 Euro, 0,26 Euro und 13,15 Euro. Wer den Cache eine Stunde statt fünf Minuten hält, zahlt beim Schreiben einmalig 6 US-Dollar je Million Token. Die Sätze gelten flach über das gesamte Kontextfenster, es gibt keine Staffel nach Kontextlänge. Steuern kommen je nach Jurisdiktion dazu.

Wie groß ist das Kontextfenster von Kimi K3?

1.048.576 Token, also gut eine Million. Das entspricht grob 700.000 Wörtern. Ein einziges volles Fenster zu füllen kostet bei Cache-Miss rund 3,15 US-Dollar oder 2,76 Euro.

Welche Base-URL und welchen Modellnamen braucht die Kimi-K3-API?

Die Base-URL lautet https://api.moonshot.ai/v1, der Modellname kimi-k3. Die Schnittstelle ist OpenAI-kompatibel, du kannst also das offizielle OpenAI-SDK ab Version 1.0 verwenden und tauschst in bestehendem Code nur Adresse, Schlüssel und Modellnamen aus. Den API-Schlüssel legst du in der Konsole unter platform.kimi.ai/console/api-keys an.

Gibt es für Kimi K3 einen Mengenrabatt über die Batch-API?

Nein. Die Batch-API von Moonshot rechnet zwar mit 60 Prozent des Standardpreises ab, also 40 Prozent Rabatt, unterstützt laut Dokumentation aber nur kimi-k2.7-code und kimi-k2.6. Kimi K3 steht dort Stand 28. September 2026 nicht in der Liste. Über OpenRouter gibt es eine Stapel-Variante kimi-k3:batch mit rund 24 Prozent Nachlass. Wer große Stapel günstig verarbeiten will, kombiniert die kleineren Modelle für die Masse mit K3 für die schweren Fälle.

Welche Rate-Limits gelten bei der Kimi-K3-API?

Die Limits hängen an der kumulierten Aufladung. Mit dem Mindestbetrag von einem US-Dollar landest du in Tier 0: eine gleichzeitige Anfrage, drei Anfragen pro Minute und 1,5 Millionen Token pro Tag. Ab zehn US-Dollar gilt Tier 1 mit 15 gleichzeitigen Anfragen, 100 pro Minute und unbegrenztem Tagesvolumen. Die oberste Stufe ab 3.000 US-Dollar erlaubt 300 Anfragen pro Minute, im August waren es noch 10.000.

Wie gut ist Kimi K3 im Vergleich zu Claude Opus 5.5 und GPT-6?

Am 28. September 2026 steht Kimi K3 im Intelligence-Index von Artificial Analysis bei 44 Punkten. Claude Opus 5.5 führt mit 58, GPT-6 Astra liegt bei 53, GPT-6 Sol bei 48. Beim Listenpreis ist GPT-6 Sol mit 2 und 10 US-Dollar je Million Token günstiger als Kimi K3 mit 3 und 15, Opus 5.5 kostet mit 4 und 20 US-Dollar ein Drittel mehr. Die Punktwerte stammen aus Version 4.3.2 des Index und sind mit älteren Angaben wie den 60 Punkten vom August nicht vergleichbar, das Abrufdatum gehört deshalb in jede Entscheidungsvorlage.

Kann ich die Kimi-K3-API DSGVO-konform nutzen?

Über die Moonshot-Plattform direkt ist das schwer abzubilden. Vertragspartner der Entwicklerplattform ist die MOONSHOT AI PTE. LTD. in Singapur, für Singapur gibt es keinen EU-Angemessenheitsbeschluss, und die Nutzungsbedingungen erlauben die Verwendung von Inhalten zur Verbesserung der Dienste, außer du vereinbarst gesondert etwas anderes. Der belastbare Weg für personenbezogene Daten führt über die offenen Gewichte bei einem europäischen Inferenz-Anbieter mit Auftragsverarbeitungsvertrag. Details stehen in unserer Analyse zu Kimi K3 und der DSGVO.

Wie lange hält der Kontext-Cache der Kimi-K3-API?

Fünf Minuten als Voreinstellung, auf Wunsch eine Stunde. Jeder Treffer innerhalb der Laufzeit verlängert sie ohne Aufpreis. Das Schreiben kostet bei fünf Minuten 3 US-Dollar je Million Token, also den normalen Eingabepreis, bei einer Stunde 6 US-Dollar. Die längere Laufzeit stellst du über prompt_cache_options mit ttl auf 1h ein. Sie lohnt sich, wenn zwischen zwei Anfragen mit demselben Prompt-Anfang mehr als fünf Minuten liegen.

Quellen & Referenzen

  • Moonshot AI: Preisseite für kimi-k3 mit Eingabe, Cache-Treffer, Ausgabe und Kontextfenster. platform.kimi.ai
  • Moonshot AI: Schnellstart zu Kimi K3 mit Base-URL, Modellname, Denkstufen und Bild-Eingabe. platform.kimi.ai
  • Moonshot AI: Aufladestufen und Rate-Limits mit Nebenläufigkeit, Anfragen und Token je Minute und Tag, abgerufen am 28. September 2026. platform.kimi.ai
  • Moonshot AI: Abrechnung der Batch-API mit 60 Prozent des Standardpreises und Liste der unterstützten Modelle, abgerufen am 28. September 2026. platform.kimi.ai
  • Moonshot AI: Anleitung zum Kontext-Cache mit Laufzeiten von fünf Minuten und einer Stunde, Schreibpreisen, Blockregel und dem Feld cached_tokens, abgerufen am 28. September 2026. platform.kimi.ai
  • Moonshot AI: Konto und Zahlungen, Aufladewege, Rechnungsaussteller und Steuersatz. platform.kimi.ai
  • Moonshot AI: Nutzungsbedingungen der Kimi OpenPlatform mit Vertragspartner, Zahlungsklausel, Rechtswahl und Verwendung von Inhalten. platform.kimi.ai
  • OpenRouter: Modellseite Kimi K3 mit Preisen je Million Token, Kontextlänge und der Variante kimi-k3:batch, Stand 28. September 2026. openrouter.ai
  • Artificial Analysis: unabhängige Messung von Intelligence-Index, Preis und Ausgabetempo, täglich in unseren KI-Kompass übernommen. artificialanalysis.ai
  • Artificial Analysis: Modellseite Kimi K3 mit Intelligence-Index, Kosten je Index-Aufgabe und dem Verbrauch von 160 Millionen Ausgabe-Token im Benchmark-Durchlauf. artificialanalysis.ai
  • Artificial Analysis: Rangliste mit Intelligence-Index und Kosten je Index-Aufgabe für Claude Opus 5.5, GPT-6 Astra, GPT-6 Sol und GLM-5.3, abgerufen am 28. September 2026. artificialanalysis.ai
  • Artificial Analysis: Methodik des Intelligence Index, Version 4.3.2 mit zehn Tests in vier Gruppen. artificialanalysis.ai
  • Europäische Zentralbank: Euro-Referenzkurs zum US-Dollar vom 25. September 2026. ecb.europa.eu
Florian Wessling, CEO, Collective Brain GmbH · Hamburg
CEO, Collective Brain GmbH · Hamburg

Florian Wessling ist CEO der Collective Brain GmbH in Hamburg und bringt seit über 15 Jahren Marken, Content-Strategie und KI-gestütztes Marketing in Mittelstand und Konzerne. Was Collective Brain verkauft, betreibt er zuerst selbst: Sechs eigene KI-Marken dienen als Testfeld, von der automatisierten Content-Pipeline bis zum täglich aktualisierten AI Leaderboard. Er ist eingetragener BAFA-Berater und führt mit Collective Brain eine Google-Partner-Agentur.