Framework

KI-Agenten-Kostenrechner (2026)

Veröffentlicht May 1, 2026 · 15 Min. Lesezeit · Aktualisiert May 7, 2026

„Was wird unser KI-Agent kosten?“ besteht eigentlich aus drei Fragen: was es kostet, etwas zu bauen, das Sie vor Kunden nicht blamiert, was der monatliche Betrieb kostet, wenn der Traffic kommt, und was es kostet, ihn stabil zu halten, wenn sich Modelle und Prompts ändern. In Angeboten gruppieren wir Budgets so, weil CFOs in monatlichem Burn denken, Entwickler in Tokens und die Rechtsabteilung in Aufbewahrungsrichtlinien – und alle haben recht.

Drei Kategorien (nicht auf einer Folie vermischen)

Der Aufbau umfasst Architektur, Prompt-Design, Tool-Anbindung (CRM, Ticketing, interne APIs), Evaluierungs-Harnesses, Guardrails und Human-in-the-Loop-Workflows, wenn die Automatisierung endet.

Die Inferenzkosten ergeben sich aus Tokens × Traffic – plus Retrieval, wenn Antworten auf Ihren Dokumenten basieren sollen.

Betrieb ist alles nach dem Launch: Eval-Suiten, Regressionstests, wenn OpenAI ein neues Mini-Modell veröffentlicht, Incident Response und das Dashboard, das Ihr PM tatsächlich ansieht.

  • Aufbau: einmalige Kosten + begrenzter Retainer bis zur Stabilisierung.
  • Inferenz: variabel mit der Nutzung – die Modellwahl zählt mehr als das Hosting.
  • Betrieb: überraschend gleichbleibend pro Monat, wenn Sie vorausplanen – schmerzhaft, wenn nicht.

Build-Phase – was wir einzeln ausweisen (CAD-Spannen)

Diese Werte setzen voraus, dass Sie bereits eine Produktdefinition dafür haben, wie „gut“ aussieht – kein Forschungsprojekt, um „zu sehen, was GPT kann“. Forschungsprojekte gehören in einen zeitlich begrenzten Spike, nicht in eine Produktions-Roadmap.

WorkstreamBudgetspanne (CAD)Hinweise
Discovery & Erfolgskennzahlen$8k–$18kAufgaben, Fehlermodi und Eskalationspfade definieren.
Tooling & Integrationen$12k–$35kIdempotente Schreibvorgänge, Sandbox- vs. Produktionsschlüssel, Backoff.
Prompt- + Eval-Harness$10k–$28kRegressionssets, Golden Transcripts, Bewertung nach Rubriken.
Sicherheit / Umgang mit PII$8k–$25kSchwärzung, Aufbewahrung, regionale Vorgaben.
UI + Ops-Dashboards$8k–$22kReview-Warteschlangen, Overrides, Analysen zur Deflection-Rate.

Inferenzkosten – durchgerechnetes Beispiel (Richtwert)

Stellen Sie sich einen B2B-SaaS-Support-Agenten vor: vierhundert Gespräche am Tag, durchschnittlich acht Turns, ca. 750 Tokens rein und ca. 450 Tokens raus pro Turn (grob – Ihre Prompts variieren). Das sind etwa 3.200 Turns/Tag × 1.200 Tokens ≈ 3,8 Mio. Tokens/Tag → ca. 115 Mio. Tokens/Monat.

Die Preise ändern sich, sobald Anbieter neue Modelle veröffentlichen – verstehen Sie die Zahlen unten als Größenordnung, nicht als Buchhaltungswahrheit. Bei beispielhaften Mischpreisen von etwa 4 $ pro Million Tokens für ein Frontier-Modell (Mix aus Input/Output) liegen die reinen API-Kosten in dieser Größenordnung bei einigen hundert Dollar pro Monat – vor Retrieval, vor Redundanz und vor menschlicher Prüfung von Grenzfällen.

Verdoppeln Sie Ihre Schätzung nun für Wiederholungen, Evaluierungsläufe und Staging-Umgebungen. Addieren Sie dann 30 % Ego-Marge, weil das Marketing nach dem Launch „intelligentere Antworten“ (längere Ausgaben) verlangen wird.

Retrieval- & Vektor-Infrastruktur

pgvector in Postgres ist attraktiv, wenn Sie bereits Postgres betreiben – der Betrieb bleibt unspektakulär. Pinecone oder Weaviate glänzen, wenn Sie verwaltete Skalierung oder Hybridsuche über Embeddings brauchen – Geld gegen Engineering-Stunden.

Wir haben Teams erlebt, die wochenlang Chunk-Größen optimierten und die Evaluierung ignorierten – seien Sie nicht dieses Team. Bessere Chunks mit schlechteren Embeddings verlieren gegen mittelmäßige Chunks mit einem wöchentlichen Eval-Skript, dem Ihr PM vertraut.

MusterWann es gewinntWorauf Sie achten sollten
pgvector / RDSSingle-Region-B2B, vorhandene DBA-KenntnisseDisziplin bei Backup + Vacuum
Verwaltete Vektordatenbank (Pinecone usw.)Schnelle Iteration, MandantenisolationSchleichende Anbieterkosten
Selbst gehostetes Weaviate / QdrantKostenkontrolle im großen MaßstabPatching und Hochverfügbarkeit liegen bei Ihnen

Observability – der Posten, den jeder streicht

Langfuse, Helicone oder CloudWatch + strukturierte Logs – wählen Sie etwas, das Ihre Ingenieure tatsächlich abfragen, wenn ein Kunde sagt „es hat letzten Dienstag gelogen“. Ohne Traces, die an Prompt-Versionen gebunden sind, debuggen Sie nach Gefühl.

Wir bündeln in jedem Agenten-Angebot ein Minimalpaket für Observability. Es zu streichen ist, als würde man Zahlungen ohne Abstimmung ausliefern – technisch möglich, professionell fahrlässig.

Open-Source-Modell selbst hosten vs. nur API

Reine API-Nutzung gewinnt, bis die Inferenzkosten Schmerzgrenzen überschreiten oder Datenresidenz es verlangt. Das Selbst-Hosten von Modellen der Llama-Klasse bringt GPU-Rechnungen, Fine-Tuning-Pipelines und Bereitschaftsingenieure mit sich, die CUDA-Leid verstehen.

Hybrid ist üblich: API für Entwicklungsgeschwindigkeit, später ein eigenes Modell, sobald Wirtschaftlichkeit und rechtliche Klarheit es erfordern.

Häufig gestellte Fragen

Was ist der größte Fehler bei KI-Budgets?

Evaluation und Betrieb zu knapp zu kalkulieren — Teams budgetieren Tokens, aber nicht die wöchentliche Zeit, um Regressionen bei Modell-Updates zu prüfen.

Wie wählen wir zwischen OpenAI, Anthropic und Open Source?

Gehen Sie von Aufgabeneignung und Safety-Tooling aus, nicht von Benchmarks — führen Sie eigene Golden Transcripts auf Kandidatenmodellen aus und messen Sie Latenz und Kosten bei Ihren Token-Längen.

Sollten wir sofort feinabstimmen?

Selten am ersten Tag — die meisten Teams sollten zuerst RAG + präzise Prompts + Evals ausliefern; feinabstimmen, wenn Sie saubere gelabelte Daten und einen Grund haben, warum günstigere Prompts nicht ausreichen.

Wie vermeiden wir Kostenschocks?

Ratenlimits pro Mandant, Caching für wiederholte Fragen, kleinere Modelle für Triage-Schritte und Alarme bei Tagesausgaben — langweilig und wirksam.

Wem gehört der Agent nach dem Launch?

Das Produkt verantwortet Ergebnisse; Engineering die Zuverlässigkeit; Legal die Aufbewahrung. Wenn diese drei nicht benannt sind, streiten Sie beim ersten Vorfall in Slack.

Möchten Sie das auf Ihre Roadmap zugeschnitten haben?

Erzählen Sie uns, was Sie bauen — wir antworten innerhalb eines Werktags.

Kostenloses Strategiegespräch buchen