Analyse de documents: Unstructured, LlamaParse, Reducto, Docling, Azure Document Intelligence, AWS Textract
Stratégies de chunking: Découpage sémantique, late chunking, sensible à la mise en page, enrichi par le contexte (modèle de récupération contextuelle d'Anthropic)
Modèles d'embedding: OpenAI text-embedding-3-large, Voyage voyage-3, Cohere Embed v3, BGE, Nomic, Jina v3, BM25 hybride
Bases de données vectorielles: Pinecone, Weaviate, Qdrant, Chroma, pgvector, MongoDB Atlas Vector Search, Turbopuffer
Recherche hybride: BM25 + dense + fusion de rangs réciproques, expansion de requêtes, HyDE, multi-requêtes, récupération de documents parents
Rerankers: Cohere Rerank 3, Voyage rerank-2, BGE reranker, Jina reranker, ColBERT v2 pour une recherche de haute précision
Génération: OpenAI (famille GPT-5), Anthropic Claude (Sonnet 4.5, Opus), Gemini, open source via Together / Groq / vLLM
Récupération sensible aux permissions: Filtres ACL par document dans la base vectorielle, contrôles de permissions après récupération, accès aux sources via OAuth
Évaluations et qualité: Ragas, TruLens, LangSmith, LangFuse, Promptfoo, Phoenix : notation automatisée de la qualité de la recherche et des réponses
Observabilité: LangFuse, Helicone, Sentry, OpenTelemetry : trace complète du prompt et de la récupération pour chaque requête
Déploiement: AWS, Modal, Vercel, Cloudflare Workers, sur site (air-gapped), Kubernetes