Blog · KI-Kosten · 26.09.2026
Blog
KI-Kosten

KI-Kosten senken:Wann ein Modellwechselsich wirklich lohnt

Ein Spitzenmodell ist im September um ein Fünftel günstiger geworden. Was das für Ihre laufenden Anwendungen bedeutet und mit welcher Kennzahl Sie es nachrechnen.

Direkt zur Anfrage
Anfrage
Nikolai Schöbel und Jeremias Burger, Co-Founder Scalableloops

Sprechen wir über Ihr Projekt.

Erst prüfen wir, ob das Vorhaben zu Ihrem Geschäftsmodell passt. Dann folgt ein Vorschlag mit Phasen und Aufwand.

KI-Kosten prüfen lassen oder anrufen: +49 151 1576 5566
Blog · KI-Kosten

Wer KI-Kosten senken will, rechnet mit der falschen Zahl, solange er nur auf den Preis je Million Token schaut. Belastbar ist der Preis je erledigtem Vorgang, also je Angebot, je Ticket, je ausgewerteter Rechnung. Die beiden Zahlen laufen auseinander: Als Anthropic am 22. September 2026 das Modell Claude Opus 5.5 vorstellte, sank der Tokenpreis um 20 Prozent, die Kosten für eine typische Aufgabe nach Anbieterangaben aber um rund 40 Prozent, weil das Modell für dieselbe Arbeit weniger Token verbraucht. Für Ihren Betrieb heißt das: Messen Sie ein bis zwei Wochen, was ein typischer Vorgang heute kostet, rechnen Sie ihn mit dem neuen Preis nach und wechseln Sie erst, wenn die Ersparnis den Prüfaufwand übersteigt. Bei kleinen Mengen bleibt sie oft darunter.

In Kürze
  • Die belastbare Kennzahl ist der Preis je Vorgang, nicht der Preis je Million Token.
  • Claude Opus 5.5 kostet seit dem 22.09.2026 vier US-Dollar je Million Eingabe-Token und zwanzig US-Dollar je Million Ausgabe-Token, jeweils ein Fünftel unter dem Vorgänger.
  • Wiederverwendete Eingaben aus dem Zwischenspeicher kosten dort 0,20 US-Dollar je Million Token, das ist bei langen Abläufen der größte Hebel.
  • Ein Wechsel rechnet sich erst, wenn die Ersparnis im Monat über dem Aufwand für Umstellung und Qualitätsprüfung liegt.
Veröffentlicht 26.09.2026Nikolai Schöbel und Jeremias BurgerLesezeit 10 min
Nikolai SchöbelJeremias Burger

Nikolai Schöbel und Jeremias Burger

Co-Founder der Scalableloops GmbH. Nikolai Schöbel verantwortet Online-Marketing und KI-Strategie, Jeremias Burger die KI-Architektur. Beide bauen und schulen KI-Systeme im eigenen Agenturalltag.

Auf dieser Seite
  1. Warum der Preis je Million Token in die Irre führt
  2. So rechnen Sie aus, was ein Vorgang bei Ihnen kostet
  3. Welches Modell für welche Aufgabe genügt
  4. Welche Stellschrauben den Preis je Vorgang drücken
  5. Woran Sie erkennen, dass die Ergebnisse nach dem Wechsel halten
  6. Wann sich die Umstellung rechnet und wann Sie sie lassen
  7. Wo die Kostenrechnung in die Irre führt
  8. Häufige Fragen
  9. So prüfen Sie Ihre eigene Rechnung nach
  10. Woher die Angaben auf dieser Seite stammen
Kennzahl

Warum der Preis je Million Token in die Irre führt

Anbieter von Sprachmodellen rechnen in Token ab. Ein Token ist ein Textbaustein, grob ein Dreiviertelwort im Deutschen. Ihre Rechnung hat zwei Posten: den Text, den Sie hineingeben, und den Text, den das Modell ausgibt. Die Ausgabe ist dabei um ein Vielfaches teurer als die Eingabe.

Der Tokenpreis ist ein Einkaufspreis, kein Verbrauchswert. Er sagt nichts darüber, wie viele Token ein Modell braucht, um Ihre Aufgabe zu erledigen. Genau dort entscheidet sich die Rechnung. Anthropic beziffert den Unterschied an der eigenen Neuvorstellung: Der Preis je Token fiel gegenüber dem Vorgängermodell um ein Fünftel, die Kosten für einen typischen Arbeitsablauf nach Anbieterangaben um rund zwei Fünftel. Die Differenz kommt allein daher, dass das neue Modell für dieselbe Aufgabe weniger Schritte und weniger Token benötigt.

Der Effekt funktioniert auch andersherum, und das übersehen Betriebe regelmäßig. In derselben Preisdokumentation steht, dass die neueren Modelle dieser Familie einen anderen Textzerleger verwenden, der für denselben Text etwa 30 Prozent mehr Token erzeugt. Wer nur die Preistabelle vergleicht, hält ein Modell für günstiger, zahlt am Monatsende aber mehr. Deshalb gilt: Vergleichen Sie nie Tokenpreise miteinander, sondern immer fertige Vorgänge.

Faktor 2

liegt zwischen der Senkung des Tokenpreises und der Senkung der Kosten je Aufgabe beim Modellwechsel im September 2026, ein Fünftel gegen rund zwei Fünftel.

Anthropic, Ankündigung vom 22.09.2026
Rechnung

So rechnen Sie aus, was ein Vorgang bei Ihnen kostet

Sie brauchen dafür keine neue Software. Jede Antwort einer Modellschnittstelle meldet den Verbrauch mit: Eingabe-Token, Ausgabe-Token und, falls Sie einen Zwischenspeicher nutzen, getrennt davon die gelesenen und geschriebenen Token. Diese vier Werte protokollieren Sie über ein bis zwei Wochen zusammen mit der Art des Vorgangs. Danach steht die Kennzahl, um die es geht.

Die Formel ist eine Multiplikation. Kosten je Vorgang gleich Eingabe-Token mal Eingabepreis plus Ausgabe-Token mal Ausgabepreis, geteilt durch eine Million. Wichtig ist der Mittelwert über viele echte Vorgänge, nicht ein ausgesuchtes Beispiel. Rechnen Sie zusätzlich den teuersten Zehntel-Anteil aus, denn die Ausreißer bestimmen, ob Ihnen ein Monat aus dem Ruder läuft.

Wie stark die Zusammensetzung wirkt, zeigt eine vom Anbieter veröffentlichte Beispielabrechnung für eine Programmiersitzung. Bei 2,2 Millionen Eingabe-Token, von denen 91 Prozent aus dem Zwischenspeicher kamen, und 60.000 Ausgabe-Token kostete dieselbe Sitzung auf dem Vorgängermodell 3,50 US-Dollar und auf dem neuen Modell 2,40 US-Dollar. Bemerkenswert ist die zweite Zahl darin: Die 60.000 ausgegebenen Token schlagen mit 1,20 US-Dollar zu Buche und damit so hoch wie sechs Millionen gelesene Token aus dem Zwischenspeicher.

Für einfachere Anwendungsfälle liegen die Beträge weit darunter. Die Preisdokumentation rechnet 10.000 Support-Vorgänge mit im Mittel 3.700 Token je Gespräch auf dem kleinsten Modell der Familie durch und kommt auf rund 37 US-Dollar für den gesamten Stapel. Wer für solche Aufgaben das Spitzenmodell einsetzt, zahlt ein Vielfaches ohne erkennbaren Gegenwert.

Posten in einer BeispielsitzungMengeKosten auf dem neuen Modell
Eingaben aus dem Zwischenspeicherrund 2 Millionen Tokenetwa 0,40 US-Dollar
Frische Eingabenrund 0,2 Millionen Tokenetwa 0,80 US-Dollar
Ausgaben des Modells60.000 Token1,20 US-Dollar
Dieselbe Sitzung auf dem Vorgängergleiche Mengen3,50 US-Dollar
Dieselbe Sitzung auf dem neuen Modellgleiche Mengen2,40 US-Dollar
Modellwahl

Welches Modell für welche Aufgabe genügt

Die größte Ersparnis liegt selten im Wechsel auf die neueste Fassung desselben Spitzenmodells, sondern in der Erkenntnis, dass viele Aufgaben gar kein Spitzenmodell brauchen. Innerhalb einer Anbieterfamilie liegen zwischen der kleinsten und der größten Stufe leicht das Zehnfache an Kosten. Eine Anfrage, die eine Rechnung in Felder zerlegt oder eine Mail einer von fünf Kategorien zuordnet, ist auf der kleinsten Stufe oft genauso zuverlässig wie auf der größten.

Der Anbieter empfiehlt in der eigenen Dokumentation genau diese Staffelung: die kleine Stufe für einfache Aufgaben, die mittlere für den Regelbetrieb, die große nur für anspruchsvolles Schlussfolgern. In der Praxis bewährt sich eine gemischte Bauweise, bei der ein günstiges Modell die Vorarbeit übernimmt und nur der schwierige Rest an das teure Modell geht. Wie sich solche Abläufe im Betrieb verankern lassen, beschreiben wir im Beitrag zu KI im Mittelstand.

Für Betriebe, die aus Datenschutzgründen nicht in die Cloud wollen, ändert sich die Rechnung grundlegend, weil dann Hardware und Strom die Posten sind und nicht Token. Die Abwägung dazu steht in unserem Beitrag zu lokaler KI.

StufePreis je Million Token, Eingabe und AusgabeWofür sie genügt
Kleine Stufe1 und 5 US-DollarZuordnen, Zusammenfassen, Felder auslesen, Nachschlagen
Mittlere Stufe2 und 10 US-DollarRegelbetrieb: Antwortentwürfe, Auswertungen, Textarbeit
Große Stufe, neue Fassung4 und 20 US-DollarLange Abläufe, mehrstufiges Schlussfolgern, schwierige Fachfragen
Große Stufe, Vorgänger5 und 25 US-DollarGleicher Einsatzbereich, seit dem 22.09.2026 teurer als die neue Fassung
37 USD

kosten 10.000 Support-Vorgänge mit im Mittel 3.700 Token je Gespräch auf der kleinsten Modellstufe, gerechnet in der Preisdokumentation des Anbieters.

Claude Platform Docs, Pricing
Hebel

Welche Stellschrauben den Preis je Vorgang drücken

Der stärkste Hebel ist der Zwischenspeicher für wiederkehrende Eingaben. Wenn Ihre Anwendung bei jeder Anfrage dieselbe Anleitung, denselben Produktkatalog oder denselben Gesprächsverlauf mitschickt, zahlen Sie diesen Teil ohne Zwischenspeicher jedes Mal voll. Mit Zwischenspeicher kostet er auf dem neuen Modell 0,20 US-Dollar je Million Token statt vier. Eine unabhängige Auswertung rechnet vor, dass 2,8 Millionen Eingabe-Token ohne Zwischenspeicher 11,20 US-Dollar kosten und bei neun von zehn Treffern nur noch 1,62 US-Dollar.

Der Zwischenspeicher ist nicht gratis. Das erste Schreiben kostet mehr als eine normale Eingabe, laut Preisdokumentation das 1,25-Fache beim kurzen und das Doppelte beim einstündigen Speicher. Daraus folgt eine brauchbare Faustregel des Anbieters: Beim kurzen Speicher lohnt sich die Sache ab dem ersten Lesezugriff, beim einstündigen ab dem zweiten. Wer den Speicher für Anfragen einschaltet, die sich nie wiederholen, zahlt drauf.

Zweiter Hebel ist die Stapelverarbeitung. Alles, was nicht in Sekunden fertig sein muss, etwa nächtliche Auswertungen, Produkttexte oder die Anreicherung von Datensätzen, läuft über eine gesonderte Schnittstelle mit der Hälfte des Preises auf Eingabe und Ausgabe. Dieser Nachlass lässt sich mit dem Zwischenspeicher kombinieren.

Dritter Hebel ist die Denkstufe. Neuere Modelle lassen sich anweisen, vor der Antwort länger nachzudenken. Der Anbieter beziffert den Aufschlag der hohen gegenüber der mittleren Stufe auf etwa 20.000 zusätzliche Token und damit rund 0,40 US-Dollar je Aufgabe, was ungefähr einer Wiederholungsschleife entspricht. Die Faustregel lautet deshalb: Die hohe Stufe lohnt sich dann, wenn sie einen zweiten Anlauf erspart, sonst nicht.

HebelWirkungWann er sich lohnt
Zwischenspeicher für EingabenWiederholter Text kostet ein Zwanzigstel des normalen EingabepreisesSobald derselbe Textblock mehrfach mitgeschickt wird
StapelverarbeitungHalber Preis auf Eingabe und AusgabeWenn das Ergebnis Stunden Zeit hat statt Sekunden
Kleinere ModellstufeBis zum Zehnfachen günstiger als die große StufeBei Zuordnen, Auslesen, Zusammenfassen
Niedrigere DenkstufeSpart rund 0,40 US-Dollar je AufgabeWenn die Ergebnisse auch ohne längeres Nachdenken stimmen
Kürzere AnweisungenSenkt die Eingabemenge dauerhaftWenn Anleitungen über Monate gewachsen sind
Qualität

Woran Sie erkennen, dass die Ergebnisse nach dem Wechsel halten

Ein günstigeres Modell spart nur dann, wenn danach niemand nacharbeiten muss. Sobald jemand nachbessert, verschwinden die eingesparten Cent in der ersten Viertelstunde Arbeitszeit. Die Frage nach der Qualität ist deshalb keine Nebensache, sondern der eigentliche Teil der Entscheidung.

Verlassen Sie sich dabei nicht auf veröffentlichte Ranglisten. Der Anbieter schreibt in der eigenen Ankündigung, dass Abstände in solchen Tests bei diesem Leistungsniveau ein weniger verlässlicher Hinweis auf Unterschiede in der Praxis geworden sind, und gibt für einen der genannten Werte eine Schwankungsbreite von plus minus 2,6 Punkten an. Ein Vorsprung von zwei Punkten in einer Tabelle sagt über Ihre Angebote und Ihre Tickets wenig aus.

Was aussagekräftig ist, bauen Sie sich in einem halben Tag selbst: einen Prüfsatz aus zwanzig bis dreißig echten Fällen aus Ihrem Betrieb, bei denen Sie die richtige Antwort kennen, mit Absicht auch schwierigen Fällen. Diesen Satz lassen Sie durch beide Modelle laufen und vergleichen die Ergebnisse nebeneinander. Erst wenn das neue Modell bei gleicher Qualität günstiger ist, ist die Ersparnis echt. Diesen Prüfsatz behalten Sie, denn beim nächsten Modellwechsel ist die Arbeit schon getan.

  1. 01

    Gleiche Qualität, deutlich günstiger

    Wechseln

    Umstellen, den Prüfsatz nach vier Wochen erneut laufen lassen und die Rechnung gegen den alten Monat halten.

  2. 02

    Gleiche Qualität, kaum günstiger

    Später

    Den Prüfsatz aufheben und beim nächsten Preisschritt wieder hervorholen. Der Aufwand lohnt für kleine Beträge nicht.

  3. 03

    Schlechtere Qualität

    Bleiben

    Prüfen, ob eine bessere Anweisung oder ein Zwischenspeicher den Abstand schließt, bevor Sie die Modellstufe senken.

Entscheidung

Wann sich die Umstellung rechnet und wann Sie sie lassen

Stellen Sie den beiden Zahlen eine dritte gegenüber. Auf der einen Seite steht die Ersparnis im Monat, also Ihre heutige Rechnung mal dem gemessenen Unterschied. Auf der anderen Seite steht der einmalige Aufwand: Prüfsatz aufbauen, umstellen, zwei Wochen beobachten. Für eine gut dokumentierte Anwendung sind das erfahrungsgemäß wenige Stunden.

Die veröffentlichte Beispielrechnung des Anbieters macht die Größenordnung greifbar. Bei zehn Aufgaben am Tag sinkt die monatliche Rechnung dort von 770 auf 528 US-Dollar. Eine Ersparnis in dieser Höhe trägt den Aufwand nach wenigen Wochen. Liegt Ihre heutige Rechnung dagegen im zweistelligen Bereich, spart der Wechsel weniger, als die Prüfung kostet. Dann ist die richtige Entscheidung, den Prüfsatz trotzdem anzulegen und die Umstellung beim nächsten Anlass mitzunehmen.

Rechnen Sie auch die Gegenrichtung durch. Wenn dieselbe Arbeit günstiger wird, können Sie entweder Geld sparen oder für dasselbe Geld mehr erledigen lassen, etwa eine Prüfschleife ergänzen oder eine zweite Sprache bedienen. Für Betriebe, die gerade einen Assistenten aufbauen, ist der zweite Weg meist der wertvollere. Welche Bauformen dafür infrage kommen, steht im Beitrag zum KI-Assistenten im Unternehmen.

528 statt 770

US-Dollar im Monat kostet eine Beispielanwendung mit zehn Aufgaben am Tag nach dem Wechsel auf das neue Modell, gerechnet zu Listenpreisen.

Anthropic, Kostenrechnung zum Modellstart
Grenzen

Wo die Kostenrechnung in die Irre führt

Listenpreise sind nicht Ihr Preis. Wer über eine Cloud-Plattform bucht, zahlt für fest zugesicherte Regionen nach Anbieterangaben einen Aufschlag von zehn Prozent, und für die Beschränkung der Verarbeitung auf ein Land kommt bei neueren Modellen das 1,1-Fache auf alle Posten. Das kann sinnvoll sein, gehört aber in die Rechnung. Umgekehrt gibt es ab größeren Mengen Nachlässe, die individuell verhandelt werden.

Zweitens übersehen viele Aufstellungen die Nebenkosten. Werkzeuge, die das Modell selbst aufruft, werden teils gesondert abgerechnet, eine Websuche etwa mit zehn US-Dollar je tausend Suchen. Bei Abläufen, die mehrere Arbeitsschritte parallel starten, steigt der Verbrauch deutlich; der Anbieter nennt für solche Mehrfachabläufe etwa das Siebenfache an Token gegenüber einer gewöhnlichen Sitzung. Wenn Sie in diese Richtung bauen, lohnt der Blick in unseren Beitrag zum KI-Agenten.

Drittens ist die Momentaufnahme kurzlebig. Der Anbieter hat für die kommenden Wochen zwei weitere Modelle derselben Reihe angekündigt, und andere Anbieter ziehen nach. Wer heute eine Tabelle mit Preisen anlegt, hat in einem Quartal eine veraltete Tabelle. Haltbar ist nicht die Preisliste, sondern das Verfahren: die eigene Messung, der eigene Prüfsatz und eine feste Gelegenheit im Quartal, an der Sie beides gegen die aktuellen Preise halten.

Und schließlich entscheidet nicht nur der Preis. Dasselbe neue Modell ist nach Herstellerangaben über dreißig Prozent schneller in der Ausgabe und widerstandsfähiger gegen untergeschobene Anweisungen in fremden Texten. Wenn Ihre Anwendung Dokumente von außen verarbeitet, kann dieser zweite Punkt schwerer wiegen als der Preis.

Häufige Fragen

Häufige Fragen

Was kostet ein Sprachmodell im Monat?

Das hängt allein an Ihrer Menge, nicht am Tarif. Rechnen Sie Kosten je Vorgang mal Vorgänge im Monat. Der Anbieter nennt für eine Beispielanwendung mit zehn umfangreichen Aufgaben am Tag 528 US-Dollar im Monat zu Listenpreisen. Ein Stapel von 10.000 einfachen Support-Vorgängen auf der kleinsten Modellstufe kostet dagegen rund 37 US-Dollar.

Was ist ein Token?

Ein Token ist ein Textbaustein, mit dem Sprachmodelle rechnen, grob ein Dreiviertelwort. Abgerechnet werden die Token Ihrer Eingabe und die Token der Antwort getrennt, wobei die Antwort deutlich teurer ist. Wie viele Token ein Text ergibt, hängt vom Modell ab: Der Anbieter weist darauf hin, dass seine neueren Modelle für denselben Text etwa 30 Prozent mehr Token erzeugen.

Wie messe ich die Kosten je Vorgang?

Jede Antwort der Schnittstelle meldet Eingabe-, Ausgabe- und Zwischenspeicher-Token mit. Protokollieren Sie diese Werte ein bis zwei Wochen zusammen mit der Vorgangsart und bilden Sie den Mittelwert. Rechnen Sie zusätzlich den teuersten Zehntel-Anteil aus, weil Ausreißer die Monatsrechnung bestimmen.

Warum steigen die KI-Kosten im laufenden Betrieb oft unbemerkt?

Weil die Eingabemenge wächst, ohne dass jemand eine Entscheidung trifft. Anleitungen werden über Monate ergänzt, Gesprächsverläufe werden länger, Dokumente kommen dazu. Der Preis je Token bleibt gleich, die Zahl der Token je Vorgang steigt. Ein Zwischenspeicher und eine jährlich gekürzte Anweisung wirken hier stärker als ein Modellwechsel.

Lohnt sich immer das günstigste Modell?

Nein. Ein günstiges Modell, dessen Ergebnisse jemand nachbessern muss, ist teurer als ein teures, das durchläuft. Entscheidend ist das Ergebnis Ihres eigenen Prüfsatzes aus echten Fällen. Bei Zuordnen, Auslesen und Zusammenfassen genügt die kleine Stufe meist, bei langen mehrstufigen Abläufen selten.

Was bringt ein Zwischenspeicher für Eingaben?

Er senkt den Preis für wiederkehrende Textblöcke erheblich. Auf dem neuen Spitzenmodell kostet gespeicherter Text 0,20 statt vier US-Dollar je Million Token. Das erste Speichern kostet allerdings mehr als eine normale Eingabe, weshalb sich der kurze Speicher ab dem ersten und der einstündige ab dem zweiten Lesezugriff rechnet.

Sinken die Preise für KI-Modelle weiter?

Für die Vergangenheit ist die Richtung belegt: Das im September 2026 vorgestellte Spitzenmodell kostet ein Fünftel weniger als sein Vorgänger, bei wiederverwendeten Eingaben drei Fünftel weniger. Für die Zukunft ist das keine Zusage. Planen Sie deshalb mit Ihrer heutigen Rechnung und prüfen Sie einmal im Quartal nach.

Was jetzt

So prüfen Sie Ihre eigene Rechnung nach

  1. 01

    Verbrauch protokollieren

    Schreiben Sie ein bis zwei Wochen lang Eingabe-, Ausgabe- und Zwischenspeicher-Token je Vorgang mit. Die Werte stehen in jeder Antwort der Schnittstelle.

  2. 02

    Kosten je Vorgang bilden

    Rechnen Sie Mittelwert und teuerstes Zehntel aus und multiplizieren Sie mit Ihrer Monatsmenge. Diese Zahl ist Ihr Vergleichsmaßstab, nicht der Tokenpreis.

  3. 03

    Prüfsatz anlegen

    Sammeln Sie zwanzig bis dreißig echte Fälle mit bekannter richtiger Antwort und lassen Sie sie durch beide Modelle laufen, bevor Sie etwas umstellen.

  4. 04

    Hebel vor Wechsel prüfen

    Zwischenspeicher, Stapelverarbeitung und eine kleinere Modellstufe für Teilaufgaben bringen oft mehr als die neue Fassung desselben Modells.

Preise für KI-Modelle ändern sich schneller, als sich Tabellen pflegen lassen. Haltbar ist nur die eigene Messung: was ein Vorgang bei Ihnen kostet und ob das Ergebnis stimmt.

oder anrufen: +49 151 1576 5566

Weiterlesen

Projekt-Detail

    Eigenes Projekt im Kopf?

    Wir antworten persönlich. Erst Use-Case-Prüfung, dann Architektur-Vorschlag.

    Eigene Anfrage starten