Skip to content
Startseite Blog SaaS Economics

Der Tokenpreis ist die einfachste Zahl im Agentenbetrieb und die einzige, die nichts entscheidet.

Anbieter veröffentlichen Preise pro Million Token. Rechnungen entstehen pro Versuch. Bezahlt wird am Ende pro abgeschlossenem Fall. Zwischen diesen drei Größen liegen Faktoren, die keine Preisliste ausweist. Genau dort entscheidet sich, ob ein Agent trägt oder nur beschäftigt ist.

Fabian Weiss, Gründer von FW Delta Fabian Weiss
08. Jul 2026 8 Min Read

Kernaussagen

  • Listenpreise sind öffentlich und nachprüfbar. Anthropic weist für Claude Opus 5 fünf US-Dollar je Million Eingabetoken und 25 US-Dollar je Million Ausgabetoken aus, für Haiku 4.5 einen und fünf.
  • Zwischen Tokenpreis und Fallkosten liegen drei Faktoren, die keine Preisliste enthält: Token je Versuch, Versuche je Abschluss und der Anteil, der trotzdem an einen Menschen geht.
  • Prompt-Caching ist der einzige Hebel mit dokumentiertem Faktor: Ein Cache-Treffer kostet laut Preisdokumentation zehn Prozent des normalen Eingabepreises.

Drei Zahlen, die regelmäßig verwechselt werden

Wenn in einer Runde über die Kosten von KI-Agenten gesprochen wird, laufen fast immer drei verschiedene Größen unter demselben Wort.

Die erste ist der Tokenpreis. Ein Token ist die Abrechnungseinheit der Anbieter, grob ein Wortteil. Der Preis steht in der Preisliste, ist öffentlich, nachprüfbar und ändert sich selten. In der Preisdokumentation von Anthropic stehen für Claude Opus 5 fünf US-Dollar je Million Eingabetoken und 25 US-Dollar je Million Ausgabetoken, für Claude Sonnet 5 zwei und zehn, für Claude Haiku 4.5 einen und fünf. Diese Zahlen sind belastbar, weil man sie nachschlagen kann.

Die zweite ist der Preis je Versuch. Er entsteht aus dem Tokenpreis und dem Tokenverbrauch eines konkreten Durchlaufs. Er steht in keiner Preisliste, weil er von deinem Prompt, deinem Kontext und deinen Werkzeugen abhängt. Er ist messbar, sobald etwas läuft.

Die dritte ist der Preis je abgeschlossenem Fall. Also die Kosten dafür, dass eine Rechnung wirklich gebucht, ein Ticket wirklich gelöst, ein Datensatz wirklich korrekt angelegt ist. Diese Zahl entscheidet, ob sich etwas rechnet. Sie ist die einzige der drei, die kein Anbieter für dich ausrechnen kann.

Der Fehler in den meisten Kalkulationen ist nicht, dass falsch gerechnet wird. Der Fehler ist, dass die erste Zahl als Antwort auf die dritte Frage präsentiert wird.

Der Kern in einem Satz

Kosten je Abschluss sind Kosten je Versuch mal Versuche je Abschluss plus die Kosten der Fälle, die trotzdem an einen Menschen gehen. Nur der erste Faktor steht in der Preisliste.

Was der Anbieter dokumentiert und was nicht

Es lohnt sich, genau zu trennen, welche Größen öffentlich belegt sind und welche du selbst erheben musst. Öffentlich und nachprüfbar ist mehr, als viele annehmen.

Belegt: die Preise je Million Token. Siehe oben, mit Stand der zitierten Dokumentation.

Belegt: der Effekt von Prompt-Caching. Beim Caching merkt sich der Anbieter einen Teil deiner Eingabe und verrechnet ihn beim nächsten Aufruf günstiger. Die Dokumentation weist konkrete Faktoren aus. Ein Cache-Schreibvorgang mit fünf Minuten Gültigkeit kostet das 1,25-fache des Eingabepreises, mit einer Stunde Gültigkeit das Doppelte. Ein Cache-Treffer kostet das 0,1-fache, also zehn Prozent. Daraus folgt eine nachrechenbare Aussage: Bei fünf Minuten Gültigkeit lohnt sich der Cache ab dem ersten Treffer, bei einer Stunde ab dem zweiten.

Belegt: dass die Zählweise nicht konstant ist. Anthropic weist ausdrücklich darauf hin, dass Claude 4.7 und neuere Modelle einen anderen Tokenizer verwenden, also ein anderes Verfahren, Text in Token zu zerlegen. Es erzeugt für denselben Text rund 30 Prozent mehr Token. Wer Modellkosten über Generationen hinweg nur anhand der Preisliste vergleicht, vergleicht zwei verschiedene Einheiten miteinander.

Belegt: dass Laufzeit getrennt abgerechnet werden kann. Für Claude Managed Agents nennt die Dokumentation 0,08 US-Dollar je Sitzungsstunde zusätzlich zu den Token, gemessen nur, solange die Sitzung tatsächlich läuft. Die eingebaute Websuche kostet zehn US-Dollar je 1.000 Suchen.

Nicht belegt und auch nicht belegbar: deine Erfolgsquote. Es kursieren zu diesem Punkt viele Zahlen mit zwei Nachkommastellen. Keine davon lässt sich auf deinen Prozess übertragen. Die Erfolgsquote ist keine Eigenschaft des Modells, sondern eine Eigenschaft der Kombination aus Aufgabe, Datenlage, Werkzeugen und Abbruchkriterium. Wer diese Zahl aus einer fremden Studie übernimmt, hat sie nicht ermittelt, sondern geraten.

Der Faktor, den niemand ausweist

Die Preisliste beschreibt eine Anfrage. Ein Agent ist aber kein Frage-Antwort-Paar, sondern eine Schleife. Er plant, ruft ein Werkzeug auf, liest das Ergebnis, entscheidet neu. Jeder dieser Schritte schleppt den bisherigen Kontext mit und jeder Werkzeugaufruf trägt neuen Kontext ein.

Die Dokumentation macht diesen Effekt an einer Stelle sehr konkret. Sie beziffert, wie viele zusätzliche Eingabetoken allein die Werkzeugbeschreibung kostet, bevor irgendein Werkzeug aufgerufen wurde: Bei Claude Opus 5 sind es 286 Token bei freier Werkzeugwahl und 406 bei erzwungener. Der Kommandozeilen-Zugriff kostet weitere 325, der Texteditor 700. Das sind kleine Zahlen. Sie fallen aber bei jedem Durchlauf der Schleife an, nicht einmal je Aufgabe.

Dazu kommt der Kontext selbst. Ein Agent, der in Durchlauf sieben noch den vollständigen Verlauf der Durchläufe eins bis sechs mitführt, zahlt diesen Verlauf siebenmal. Genau hier setzt Caching an. Deshalb ist es kein Feinschliff, sondern der Unterschied zwischen zwei Größenordnungen.

Die Dokumentation rechnet ein Beispiel vor, das man nachvollziehen kann. Eine einstündige Sitzung mit Claude Opus 5, 50.000 Eingabetoken und 15.000 Ausgabetoken, kostet 0,25 Dollar für die Eingabe, 0,375 Dollar für die Ausgabe und 0,08 Dollar Laufzeit, zusammen 0,705 Dollar. Sind 40.000 der Eingabetoken Cache-Treffer, sinkt dieselbe Sitzung auf 0,525 Dollar. Ein Viertel weniger, ohne dass sich an der Aufgabe etwas geändert hat.

Warum die Erfolgsquote alles dominiert

Nimm die 0,705 Dollar aus dem Beispiel als Kosten je Versuch und spiele durch, was die zweite Größe damit macht.

ErfolgsquoteVersuche je AbschlussKosten je Abschluss
90 Prozent1,11rund 0,78 Dollar
60 Prozent1,67rund 1,18 Dollar
30 Prozent3,33rund 2,35 Dollar

Das ist Faktor drei zwischen der besten und der schlechtesten Variante und dabei ist noch kein Mensch beteiligt. Nimmt man an, dass die fehlgeschlagenen Fälle nicht verschwinden, sondern an eine Person weitergereicht werden, verschiebt sich das Bild nochmals deutlich. Eine Personenstunde kostet in jedem europäischen Markt ein Vielfaches eines Agentendurchlaufs.

Daraus folgt eine unbequeme Rangfolge. Ein Modellwechsel, der den Tokenpreis halbiert, spart die Hälfte des kleineren Faktors. Eine Prozessänderung, die die Erfolgsquote von 60 auf 90 Prozent hebt, spart ein Drittel des größeren. In den meisten Fällen ist das zweite die deutlich lohnendere Arbeit und es ist die Arbeit, die kein Anbieter für dich erledigt.

Rechenweg statt Zahl

Die Zahlen oben sind aus veröffentlichten Listenpreisen und einer offengelegten Annahme gerechnet, nicht gemessen. Sie zeigen die Struktur der Rechnung, nicht dein Ergebnis. Deine Erfolgsquote ersetzt die 90, 60 und 30 Prozent. Erst dann steht eine Zahl da, die etwas über deinen Fall aussagt.

Was du messen musst, damit die Rechnung trägt

Vier Größen reichen. Alle vier lassen sich aus einem normalen Betrieb heraus erheben, wenn man von Anfang an daran denkt.

  1. Token je Versuch, getrennt nach Eingabe, Ausgabe, Cache-Schreiben und Cache-Treffer. Die Schnittstelle weist diese Werte je Antwort aus. Wer sie nicht mitschreibt, kann später nicht rekonstruieren, wohin das Budget gegangen ist.
  2. Abschlussdefinition, bevor der erste Agent startet. Was genau gilt als erledigt? Ohne diese Definition ist jede Erfolgsquote eine Meinung. Sie muss an einem Zustand im Zielsystem hängen, nicht am Selbstbericht des Agenten.
  3. Versuche je Abschluss. Ergibt sich aus Punkt zwei plus einer Kennung, die alle Versuche zu demselben Fall zusammenführt.
  4. Übergabequote an Menschen und die Zeit dahinter. Der Anteil der Fälle, der trotz Agent bei einer Person landet und wie lange die Person dafür braucht.

Punkt zwei ist der, an dem die meisten Projekte scheitern. Er ist zugleich der einzige, der nichts kostet. Ein Agent, der “erledigt” meldet und ein Datensatz, der wirklich korrekt im Zielsystem steht, sind zwei verschiedene Aussagen. Solange die Erfolgsquote auf der ersten beruht, misst man die Zuversicht des Modells, nicht das Ergebnis.

Genau diese Trennung liegt unserem Benchmark zur Automatisierungs-Ökonomie zugrunde. Er übersetzt die Abrechnungseinheiten verschiedener Plattformen in eine gemeinsame Größe, nämlich Kosten je erfolgreichem Abschluss. Die Rohdaten sind offen, damit man das Modell mit eigenen Annahmen nachrechnen kann, statt es zu glauben.

Der Vergleich, der wirklich ansteht

Sobald die vier Größen vorliegen, wird eine Frage beantwortbar, die vorher Geschmackssache war: Lohnt sich für diesen konkreten Schritt überhaupt ein Modellaufruf?

Ein erheblicher Teil dessen, was heute an Agenten gegeben wird, ist eindeutig. Ein Feld aus einem Formular in ein CRM-Feld schreiben, ein Datum umformatieren, eine Bestellnummer nachschlagen. Für solche Schritte ist ein Sprachmodell die teuerste und unzuverlässigste verfügbare Lösung. Nicht weil es schlecht wäre, sondern weil es ein Werkzeug für Mehrdeutigkeit ist, das hier auf Eindeutigkeit angesetzt wird.

Die tragfähige Architektur ist fast immer gemischt. Eindeutige Schritte laufen als gewöhnlicher Code, mit klaren Fehlern und ohne laufende Kosten je Ausführung. Das Modell übernimmt die Stellen, an denen tatsächlich interpretiert werden muss. Wie sich so etwas auf eigener Infrastruktur betreiben lässt, ohne Ausführungslimits und mit vollem Zugriff auf die Protokolle, beschreibt unsere Seite zur Prozessautomatisierung.

Das ist keine Aussage gegen Agenten. Es ist eine Aussage dafür, den Modellaufruf als das zu behandeln, was er kaufmännisch ist: die teuerste Zeile in der Schleife. Man setzt sie nur dort, wo sie etwas leistet, das Code nicht leisten kann.

Was du diese Woche anfangen kannst

Der Tokenpreis fällt seit Jahren und wird weiter fallen. Das ist die verlässlichste Prognose in diesem ganzen Feld und zugleich die am wenigsten hilfreiche, weil sie den kleinsten der drei Faktoren betrifft.

Was nicht von allein fällt, sind die Versuche je Abschluss und der Anteil, der doch an einen Menschen geht. Diese beiden Größen hängen an deiner Datenqualität, deiner Prozessdefinition und deiner Abbruchlogik. Sie verbessern sich nicht dadurch, dass ein Anbieter eine neue Preisliste veröffentlicht.

Konkret: Nimm einen Agenten, der bei dir läuft. Schreib auf, was bei ihm als erledigt gilt. Dann zähl eine Woche lang, wie oft er das erreicht und wie oft ein Mensch nacharbeitet. Wenn du die Tokenwerte aus der Schnittstelle dazulegst, hast du am Ende der Woche zum ersten Mal eine Zahl je Abschluss. Wie gut sie aussieht, hängt von deinem Ausgangszustand ab. Dass du sie hast, ist der Fortschritt.

Wer heute anfängt, sie zu messen, hat in sechs Monaten eine Grundlage für Entscheidungen. Wer weiter Tokenpreise vergleicht, hat in sechs Monaten eine aktuellere Preisliste.

Newsletter

Research für technische Entscheidungen

Neue Reports, Benchmarks und technische Analysen zu SaaS-Ökonomie, AI Engineering und eigener Infrastruktur.

Original Research Öffentliche Quellen Keine Sales-Mails

Mit der Anmeldung erhältst du neue Analysen und Updates von FW Delta per E-Mail. Du kannst deine Einwilligung jederzeit widerrufen. Weitere Informationen in der Datenschutzerklärung.

Newsletter

Research für technische Entscheidungen

Neue Reports, Benchmarks und technische Analysen zu SaaS-Ökonomie, AI Engineering und eigener Infrastruktur.

Original Research Öffentliche Quellen Keine Sales-Mails

Mit der Anmeldung erhältst du neue Analysen und Updates von FW Delta per E-Mail. Du kannst deine Einwilligung jederzeit widerrufen. Weitere Informationen in der Datenschutzerklärung.