Custom RAG & Enterprise Search Development — illustrative product visual produced by UnlockLive IT
Kurzantwort

UnlockLive IT entwirft und liefert produktive Retrieval-Augmented-Generation-Systeme — solche, die vor echten Nutzern mit echten Fragen auf echten, unaufgeräumten Unternehmensdaten bestehen. Wir bauen hybride Retrieval-Pipelines (BM25 + Dense Embeddings + Reranking), berechtigungsbewusste Suche über Ihre Daten in Notion, SharePoint, Confluence, S3 und Salesforce sowie Antwortgenerierung mit strikten Zitierpflichten und automatisierten Evals bei jeder Änderung. Standard-Stack: Python/FastAPI + Qdrant oder pgvector + Cohere Rerank + Claude oder GPT-5, deployt auf AWS, Modal oder vollständig On-Premises für regulierte Workloads. Siehe unsere Local-LLM-Fallstudie für ein durchgängiges Beispiel für Air-Gapped-RAG.

Was wir bauen

Suche in der Wissensdatenbank von Unternehmen:Suche und Antworten über die Notion-, Confluence-, Google-Drive-, SharePoint-, Slack-, Zendesk-, Jira- und internen Wikis Ihres Unternehmens – mit berechtigungsbewusstem Retrieval (Nutzer sehen nur Ergebnisse aus Dokumenten, die sie lesen dürfen).
Support-Copilots für Kunden:RAG über Ihr Help Center, Ihre Produktdokumentation, Release Notes und historische Tickets. Streaming-Antworten mit Inline-Quellenangaben, Deflection-Metriken und sauberer Übergabe an einen menschlichen Mitarbeiter, wenn die Sicherheit sinkt.
Domänenspezifische Q&A zu regulierten Inhalten:Rechtsverträge, medizinische Literatur, klinische Leitlinien, Finanzoffenlegungen, Bauvorschriften – mit strengen Zitieranforderungen und vollständigen Audit-Trails für die Compliance-Prüfung.
Copilots für Sales Enablement und Angebote:RAG über Win/Loss-Notizen, frühere Angebote, Preisunterlagen, ICP-Profile und Wettbewerber-Battle-Cards – erzeugt in Sekunden erste Entwürfe für RFP-Antworten und Vorbereitungen für Discovery-Gespräche.
Code-bewusstes RAG über Ihre Repositories:AST-bewusstes Chunking Ihrer Codebasis plus README-, ADR- und Ticket-Kontext – für interne Entwickler-Copilots und Onboarding-Assistenten.
Multimodales RAG (PDFs, Bilder, Tabellen, Video):Layout-bewusstes PDF-Parsing (Unstructured, LlamaParse, Reducto), Tabellenextraktion, Vision-Modelle für Diagramme und Screenshots sowie Indexierung von Video-Transkripten.

Unser RAG-Technologie-Stack

Dokumenten-Parsing: Unstructured, LlamaParse, Reducto, Docling, Azure Document Intelligence, AWS Textract
Chunking-Strategien: Semantisches Chunking, Late Chunking, layoutbewusst, kontextangereichert (Anthropic-Muster für kontextuelles Retrieval)
Embedding-Modelle: OpenAI text-embedding-3-large, Voyage voyage-3, Cohere Embed v3, BGE, Nomic, Jina v3, BM25 hybrid
Vektordatenbanken: Pinecone, Weaviate, Qdrant, Chroma, pgvector, MongoDB Atlas Vector Search, Turbopuffer
Hybrides Retrieval: BM25 + Dense + Reciprocal Rank Fusion, Query Expansion, HyDE, Multi-Query, Parent-Document-Retrieval
Reranker: Cohere Rerank 3, Voyage rerank-2, BGE reranker, Jina reranker, ColBERT v2 für hochpräzises Retrieval
Generierung: OpenAI (GPT-5-Familie), Anthropic Claude (Sonnet 4.5, Opus), Gemini, Open Source über Together / Groq / vLLM
Berechtigungsbewusstes Retrieval: ACL-Filter pro Dokument in der Vektor-DB, Berechtigungsprüfungen nach dem Retrieval, OAuth-basierter Quellenzugriff
Evals und Qualität: Ragas, TruLens, LangSmith, LangFuse, Promptfoo, Phoenix – automatisierte Bewertung von Retrieval- und Antwortqualität
Observability: LangFuse, Helicone, Sentry, OpenTelemetry – vollständiger Prompt- und Retrieval-Trace pro Anfrage
Deployment: AWS, Modal, Vercel, Cloudflare Workers, On-Prem (Air-Gap), Kubernetes

Unser RAG-Entwicklungsprozess

  1. Definition des Anwendungsfalls (1 Woche): Definieren Sie, WER fragt, WAS er erreichen will, wie eine akzeptable Antwort aussieht und welche Fehlerbilder das Vertrauen beschädigen würden. Wir starten kein RAG-Projekt ohne explizite Erfolgsmetrik – meist die Antwortgenauigkeit auf einem gelabelten Evaluationsset.
  2. Datenaufnahme & Bereinigung (1-3 Wochen): Konnektoren zu Quellsystemen (Confluence, Notion, S3, SharePoint, Salesforce, Zendesk), Dokument-Parsing, Deduplizierung, ACL-Extraktion und Metadaten-Anreicherung. Die meisten Retrieval-Probleme sind in Wahrheit Ingestion-Probleme.
  3. Retrieval-Baseline & Eval-Set (1-2 Wochen): Ein Eval-Set mit 100–300 Fragen von Hand kuratieren, das den Long Tail realer Anfragen abdeckt. Eine Baseline-Retrieval-Pipeline aufbauen. Bewerten. Dokumentieren, wo sie versagt.
  4. Retrieval iterativ verbessern (2-4 Wochen): Hybride Suche, Reranking, Query Rewriting, kontextuelles Retrieval, Parent-Document-Retrieval, Metadatenfilter. Jede Iteration wird am Eval-Set gemessen, nicht nach Bauchgefühl.
  5. Generierung & Guardrails (1-2 Wochen): Prompt Engineering für das Antwortmodell, Zitieranforderungen, Umgang mit Ablehnungen bei Fragen außerhalb des Umfangs, Jailbreak-/Prompt-Injection-Abwehr, Output-Klassifikatoren.
  6. Produktions-Deployment & Monitoring (1-2 Wochen): API-Endpunkte, Caching, Rate Limiting, Mandantenisolation, vollständige Observability (LangFuse / Helicone) und Dashboards, die an Ihre Geschäftskennzahl gekoppelt sind – Deflection-Rate, Antwortzeit oder eingesparte Analystenstunden.

Häufig gestellte Fragen

Was ist RAG und warum brauche ich eine individuelle Lösung?

Retrieval-Augmented Generation ist das Muster, bei dem ein LLM relevante Dokumente aus Ihrer Wissensdatenbank erhält und aufgefordert wird, ausschließlich anhand dieser Dokumente zu antworten. Die Standardvarianten nach dem Muster „PDFs zu ChatGPT hochladen“ funktionieren für Demos, scheitern aber in der Produktion, weil echte Unternehmensdaten Zugriffskontrollen, unordentliche Formate, individuelle Chunking-Anforderungen, Zitierpflichten und Qualitätsansprüche haben, die Iteration erfordern. Individuelles RAG bauen Sie, wenn eine falsche Antwort reale geschäftliche Kosten verursacht.

Was kostet der Aufbau eines produktiven RAG-Systems?

Ein fokussiertes Single-Source-RAG (eine Wissensdatenbank, eine Nutzeroberfläche, nur Englisch) liegt typischerweise zwischen 30.000 und 80.000 $. Mehrquellen-Enterprise-RAG mit berechtigungsbewusstem Retrieval und Konnektoren zu 5+ Systemen liegt zwischen 80.000 und 200.000 $. RAG für regulierte Branchen mit Audit Trails, On-Prem-Deployment und strengen Evals beginnt bei 150.000 $. Inferenz- und Embedding-Kosten fallen separat an und hängen von Dokumentenvolumen und Abfragerate ab.

Pinecone, Weaviate, Qdrant oder pgvector?

pgvector ist unser Standard, wenn Sie bereits PostgreSQL einsetzen — bei unter ~10 Mio. Vektoren und moderaten QPS ist es schnell genug und spart eine bewegliche Komponente. Qdrant ist unser Standard für selbst gehostete oder Air-Gapped-Deployments. Pinecone oder Turbopuffer sind unsere Standards für sehr stark skalierte Managed Services, bei denen Sie null Betriebsaufwand wünschen. Weaviate ist eine gute Wahl, wenn Sie Hybrid-Suche sofort einsatzbereit möchten und die operative Kapazität bereits vorhanden ist. Wir entscheiden nach einem Benchmark mit Ihren Daten.

Wie gehen Sie mit Halluzinationen und Genauigkeit um?

Drei Ebenen. (1) Retrieval-Qualität — bei jeder Änderung gegen ein gelabeltes Eval-Set gemessen, mit Reranking, Hybrid-Suche und kontextuellem Retrieval, um den Recall zu steigern. (2) Guardrails bei der Generierung — Prompts, die das Zitieren der abgerufenen Chunks verlangen, die Ablehnung von Fragen außerhalb des Umfangs und einen Human-in-the-Loop-Pfad für Antworten mit geringer Konfidenz. (3) Monitoring in der Produktion — stichprobenartige menschliche Prüfung von Konversationen, automatisierte Faktentreue-Prüfungen und sofortige Alarmierung bei Regressionen in Fehlermodi. Jedes System, das wir ausliefern, hat dokumentierte akzeptable Fehlermodi.

Kann das RAG Nutzerberechtigungen berücksichtigen?

Ja. Wir extrahieren ACLs beim Einlesen aus den Quellsystemen, speichern sie als filterbare Metadaten in der Vektordatenbank und wenden zur Abfragezeit Filter pro Nutzer an. In Umgebungen mit hohem Schutzbedarf führen wir zusätzlich nach dem Retrieval eine Berechtigungsprüfung gegen das Quellsystem durch, als Defense-in-Depth-Kontrolle. Berechtigungsbewusstes Retrieval ist für jedes Deployment, das interne Dokumente berührt, nicht verhandelbar.

Können wir das On-Premises oder in unserer eigenen VPC betreiben?

Ja. Wir deployen routinemäßig vollständig in den AWS-/Azure-/GCP-Konten unserer Kunden, und für regulierte Workloads deployen wir vollständig On-Premises und Air-Gapped mit Open-Source-Modellen (Llama 3.3, Qwen, Mistral), die auf vLLM oder TGI bereitgestellt werden, plus Qdrant für das Retrieval. Siehe unsere Local-LLM-Fallstudie für ein durchgängiges Beispiel.

Worin unterscheidet sich RAG vom Fine-Tuning?

RAG ruft zur Abfragezeit aktuelle Fakten ab und ist die richtige Antwort für sich ändernde Wissensdatenbanken, Zitierpflichten und zugriffsgeschützte Inhalte. Fine-Tuning verankert Muster und Stil im Modell und ist die richtige Antwort, um dem Modell ein domänenspezifisches Format, Terminologie oder Persona beizubringen. Beide ergänzen sich — viele Produktivsysteme nutzen beides. Wir helfen in der Discovery-Phase bei der Wahl des richtigen Werkzeugs.

Haben Sie eine andere Frage? Kostenloses Strategiegespräch buchen.

Bereit für ein RAG, das wirklich richtig antwortet?

Erzählen Sie uns, welche Fragen beantwortet werden sollen und aus welchen Daten. Wir antworten innerhalb eines Werktags. Kostenloses Strategiegespräch buchen mit unserem Team in Toronto.

Eine ehrliche Schätzung für Ihr Projekt erhalten

Antwort am selben Tag während der nordamerikanischen Geschäftszeiten. Unverbindlich.

Kostenloses Strategiegespräch buchen

Kontakt für Services