Die Herausforderung
Ein Unternehmenskunde aus einer regulierten Branche nutzte über seine internen Tools ein gehostetes LLM, doch jedes Quartal meldete das Security-Review-Team dasselbe Hindernis: Personenbezogene Kundentexte wurden an einen US-Cloud-Endpunkt gesendet. Die Rechtsabteilung hatte den breiteren Rollout pausiert, die OpenAI-Rechnung war mit nur einem Bruchteil der geplanten Nutzerbasis auf über 4.200 $/Monat gestiegen, und dem Produktteam war die unmögliche Frage gestellt worden: „Können wir all diese KI-Fähigkeiten behalten, ohne dass Daten den Laptop des Nutzers verlassen?“
Sie brauchten kein Forschungsprojekt. Sie brauchten einen auslieferbaren Workflow, den ein interner Mitarbeiter an einem Nachmittag installieren konnte, der vollständig auf ihren vorhandenen MacBooks mit M-Serie und Windows-ThinkPads lief und der leistungsfähig genug war, dass sich niemand über das Datenschutz-Upgrade ärgern würde.
Unsere Lösung
Wir haben einen vollständig geräteinternen LLM-Stack entworfen und ausgeliefert: Ollama als Modell-Runtime, llama.cpp im Hintergrund für quantisierte GPU-/CPU-Inferenz, eine kleine FastAPI-Orchestrierungsschicht für Tool-Nutzung und Retrieval sowie eine Next.js-Desktop-Oberfläche, ausgeliefert über einen schlanken Tauri-Wrapper. Jedes Byte Kontext bleibt auf dem Gerät. Es gibt keine entfernte Inferenz, keinen Telemetrie-Callback, keinen Proxy.
Wir haben sieben Open-Weight-Modelle (Llama 3.1 8B, Qwen 2.5 7B/14B, Phi-3, Mistral und zwei domänenspezifisch abgestimmte Varianten) mit den echten Prompts des Kunden verglichen und einen Modell-Router pro Aufgabe ausgeliefert: ein kleines, schnelles Modell für Klassifizierung und Chat, ein größeres Reasoning-Modell auf Abruf. RAG läuft gegen einen lokalen ChromaDB-Index, der aus den eigenen Dokumenten des Nutzers aufgebaut wird, wobei jedes Embedding auf dem Gerät berechnet wird.
Das Ergebnis ist ein Workflow, der beim mittleren Prompt messbar schneller ist als die Cloud-Version (keine Netzwerk-Roundtrips), das Security-Review des Kunden bereits beim ersten Einreichen besteht und ohne Inferenzkosten pro Arbeitsplatz auf jeden Laptop im Unternehmen skaliert.
- Ollama-Runtime mit Modell-Router pro Aufgabe (klein für Chat, groß für Reasoning)
- Quantisierte Inferenz über llama.cpp, optimiert für Apple Silicon und moderne Intel-/AMD-CPUs
- Lokales RAG über die eigenen Dateien des Nutzers mit ChromaDB und geräteinternen Embeddings
- FastAPI-Orchestrierungsschicht mit stabiler HTTP-API für die Next.js-/Tauri-Desktop-Oberfläche
- Nachprüfbare Netzwerk-Allowlist – kein LLM-Datenverkehr verlässt jemals das Gerät
- Integriertes Evaluierungs-Framework, damit jedes Modell-Upgrade vor dem Rollout bewertet wird
- Signierte, notarisierte Installer für macOS (M1/M2/M3) und Windows
- Datenschutz-Panel in der App, das genau anzeigt, was das Modell lesen kann
- Optionaler Kanal für Modell-Updates unter Beachtung von Unternehmens-Proxy und Netzwerkrichtlinien