Drei Kategorien (nicht auf einer Folie vermischen)
Der Aufbau umfasst Architektur, Prompt-Design, Tool-Anbindung (CRM, Ticketing, interne APIs), Evaluierungs-Harnesses, Guardrails und Human-in-the-Loop-Workflows, wenn die Automatisierung endet.
Die Inferenzkosten ergeben sich aus Tokens × Traffic – plus Retrieval, wenn Antworten auf Ihren Dokumenten basieren sollen.
Betrieb ist alles nach dem Launch: Eval-Suiten, Regressionstests, wenn OpenAI ein neues Mini-Modell veröffentlicht, Incident Response und das Dashboard, das Ihr PM tatsächlich ansieht.
- Aufbau: einmalige Kosten + begrenzter Retainer bis zur Stabilisierung.
- Inferenz: variabel mit der Nutzung – die Modellwahl zählt mehr als das Hosting.
- Betrieb: überraschend gleichbleibend pro Monat, wenn Sie vorausplanen – schmerzhaft, wenn nicht.