Custom RAG & Enterprise Search Development — illustrative product visual produced by UnlockLive IT
Respuesta rápida

UnlockLive IT diseña y entrega sistemas de generación aumentada por recuperación en producción : de los que resisten ante usuarios reales con preguntas reales sobre datos empresariales reales y desordenados. Creamos pipelines de recuperación híbrida (BM25 + embeddings densos + reranking), búsqueda consciente de permisos sobre sus datos de Notion, SharePoint, Confluence, S3 y Salesforce, y generación de respuestas con requisitos estrictos de citación y evaluaciones automatizadas en cada cambio. Stack por defecto: Python/FastAPI + Qdrant o pgvector + Cohere Rerank + Claude o GPT-5, desplegado en AWS, Modal o totalmente on-premise para cargas de trabajo reguladas. Consulte nuestro caso de éxito de LLM local para ver un ejemplo práctico de RAG en un entorno aislado (air-gapped).

Qué construimos

Búsqueda en bases de conocimiento empresariales:Búsqueda y respuesta sobre Notion, Confluence, Google Drive, SharePoint, Slack, Zendesk, Jira y wikis internas de su empresa, con recuperación que respeta los permisos (cada usuario solo ve resultados de los documentos que tiene permiso para leer).
Copilotos de soporte orientados al cliente:RAG sobre su centro de ayuda, documentación de producto, notas de versión y tickets históricos. Respuestas en streaming con citas en línea, métricas de desvío y traspaso limpio a un agente humano cuando baja la confianza.
Preguntas y respuestas sobre contenido regulado para dominios específicos:Contratos legales, literatura médica, guías clínicas, divulgaciones financieras, códigos de construcción, con requisitos estrictos de citación y registros de auditoría completos para la revisión de cumplimiento.
Copilotos de habilitación de ventas y de propuestas:RAG sobre notas de ganadas/perdidas, propuestas anteriores, presentaciones de precios, perfiles ICP y fichas de competidores, que genera en segundos primeros borradores de respuestas a RFP y preparación de descubrimiento.
RAG con conocimiento del código sobre sus repositorios:Fragmentación de su código basada en AST, más contexto de README, ADR y tickets, para copilotos internos de desarrollo y asistentes de incorporación.
RAG multimodal (PDF, imágenes, tablas, video):Análisis de PDF con reconocimiento de diseño (Unstructured, LlamaParse, Reducto), extracción de tablas, modelos de visión para gráficos y capturas de pantalla, e indexación de transcripciones de video.

Nuestro stack tecnológico de RAG

Análisis de documentos: Unstructured, LlamaParse, Reducto, Docling, Azure Document Intelligence, AWS Textract
Estrategias de chunking: Chunking semántico, late chunking, consciente del layout, enriquecido con contexto (patrón de contextual retrieval de Anthropic)
Modelos de embeddings: OpenAI text-embedding-3-large, Voyage voyage-3, Cohere Embed v3, BGE, Nomic, Jina v3, BM25 híbrido
Bases de datos vectoriales: Pinecone, Weaviate, Qdrant, Chroma, pgvector, MongoDB Atlas Vector Search, Turbopuffer
Recuperación híbrida: BM25 + denso + reciprocal rank fusion, expansión de consultas, HyDE, multi-query, recuperación de documento padre
Rerankers: Cohere Rerank 3, Voyage rerank-2, BGE reranker, Jina reranker, ColBERT v2 para recuperación de alta precisión
Generación: OpenAI (familia GPT-5), Anthropic Claude (Sonnet 4.5, Opus), Gemini, código abierto mediante Together / Groq / vLLM
Recuperación con control de permisos: Filtros ACL por documento en la base de datos vectorial, comprobaciones de permisos posteriores a la recuperación, acceso a fuentes basado en OAuth
Evals y calidad: Ragas, TruLens, LangSmith, LangFuse, Promptfoo, Phoenix: puntuación automatizada de recuperación y calidad de respuestas
Observabilidad: LangFuse, Helicone, Sentry, OpenTelemetry: traza completa de prompt y recuperación por solicitud
Despliegue: AWS, Modal, Vercel, Cloudflare Workers, on-prem (air-gapped), Kubernetes

Nuestro proceso de desarrollo de RAG

  1. Definición del caso de uso (1 semana): Defina QUIÉN pregunta, QUÉ intenta lograr, cómo es una respuesta aceptable y los modos de fallo que dañarían la confianza. Nos negamos a iniciar proyectos de RAG sin una métrica de éxito explícita, normalmente la precisión de las respuestas sobre un conjunto de evaluación etiquetado.
  2. Ingesta y limpieza de datos (1-3 semanas): Conectores a sistemas de origen (Confluence, Notion, S3, SharePoint, Salesforce, Zendesk), análisis de documentos, deduplicación, extracción de ACL y enriquecimiento de metadatos. La mayoría de los problemas de recuperación son en realidad problemas de ingesta.
  3. Línea base de recuperación y conjunto de evaluación (1-2 semanas): Elabore a mano un conjunto de evaluación de 100-300 preguntas que cubra la cola larga de consultas reales. Construya un pipeline de recuperación base. Puntúelo. Documente dónde falla.
  4. Iteración sobre la recuperación (2-4 semanas): Búsqueda híbrida, reranking, reescritura de consultas, recuperación contextual, recuperación de documento padre, filtros de metadatos. Cada iteración se mide con el conjunto de evaluación, no por intuición.
  5. Generación y salvaguardas (1-2 semanas): Ingeniería de prompts para el modelo de respuesta, requisitos de citación, manejo de rechazos para preguntas fuera de alcance, defensa contra jailbreak/inyección de prompts y clasificadores de salida.
  6. Despliegue en producción y monitoreo (1-2 semanas): Endpoints de API, caché, límites de frecuencia, aislamiento por tenant, observabilidad completa (LangFuse / Helicone) y dashboards vinculados a su métrica de negocio: tasa de desvío, tiempo de respuesta u horas de analista ahorradas.

Preguntas frecuentes

¿Qué es RAG y por qué necesito uno a medida?

La generación aumentada por recuperación es el patrón en el que a un LLM se le proporcionan documentos relevantes de su base de conocimiento y se le pide que responda usando únicamente esos documentos. Las versiones listas para usar de «sube PDF a ChatGPT» sirven para demostraciones, pero fallan en producción porque los datos empresariales reales tienen control de acceso, formatos desordenados, necesidades de fragmentación (chunking) a medida, requisitos de citación y estándares de calidad que exigen iteración. El RAG a medida es lo que se construye cuando una respuesta incorrecta tiene un costo real para el negocio.

¿Cuánto cuesta crear un sistema RAG en producción?

Un RAG enfocado de una sola fuente (una base de conocimiento, una superficie de usuario, solo en inglés) suele costar entre $30,000 y $80,000. Un RAG empresarial de múltiples fuentes con recuperación consciente de permisos y conectores a más de 5 sistemas cuesta entre $80,000 y $200,000. Un RAG para industrias reguladas con pistas de auditoría, despliegue on-premise y evaluaciones rigurosas comienza en $150,000. Los costos de inferencia y de embeddings son aparte y dependen del volumen de documentos y de la tasa de consultas.

¿Pinecone, Weaviate, Qdrant o pgvector?

pgvector es nuestra opción por defecto si ya tiene PostgreSQL: para menos de ~10M de vectores y un QPS moderado, es lo bastante rápido y elimina una pieza móvil. Qdrant es nuestra opción por defecto para despliegues autoalojados o aislados (air-gapped). Pinecone o Turbopuffer son nuestras opciones por defecto para servicios administrados de muy alta escala donde se quiere cero operaciones. Weaviate es una buena opción cuando se desea búsqueda híbrida lista para usar y ya se cuenta con la capacidad operativa. Elegimos tras realizar pruebas comparativas con sus datos.

¿Cómo abordan las alucinaciones y la precisión?

Tres capas. (1) Calidad de la recuperación: medida frente a un conjunto de evaluación etiquetado en cada cambio, con reranking, búsqueda híbrida y recuperación contextual para elevar el recall. (2) Salvaguardas de generación: prompts que exigen citar los fragmentos recuperados, rechazo de preguntas fuera de alcance y una vía con intervención humana (human-in-the-loop) para respuestas de baja confianza. (3) Monitoreo en producción: revisión humana por muestreo de las conversaciones, verificaciones automatizadas de veracidad y alertas inmediatas ante regresiones en los modos de fallo. Cada sistema que entregamos tiene modos de fallo aceptables documentados.

¿Puede el RAG respetar los permisos de los usuarios?

Sí. Extraemos las ACL de los sistemas de origen durante la ingesta, las almacenamos como metadatos filtrables en la base de datos vectorial y aplicamos filtros por usuario en el momento de la consulta. En entornos de alta confianza también verificamos los permisos tras la recuperación contra el sistema de origen como comprobación de defensa en profundidad. La recuperación consciente de permisos es innegociable en cualquier despliegue que toque documentos internos.

¿Podemos desplegar esto on-premise o en nuestra propia VPC?

Sí. Desplegamos de forma habitual íntegramente dentro de cuentas de AWS / Azure / GCP de los clientes y, para cargas de trabajo reguladas, desplegamos totalmente on-premise y en entornos aislados (air-gapped) con modelos de código abierto (Llama 3.3, Qwen, Mistral) servidos en vLLM o TGI, además de Qdrant para la recuperación. Consulte nuestro caso de éxito de LLM local para ver un ejemplo práctico.

¿En qué se diferencia RAG del ajuste fino?

RAG recupera datos actualizados en el momento de la consulta y es la respuesta correcta para bases de conocimiento cambiantes, requisitos de citación y contenido con control de acceso. El ajuste fino incorpora patrones y estilo en el modelo y es la respuesta correcta para enseñarle un formato, una terminología o una personalidad específicos de un dominio. Son complementarios: muchos sistemas en producción hacen ambas cosas. Le ayudamos a elegir la herramienta adecuada en la fase de descubrimiento.

¿Tiene otra pregunta? Reserve una llamada estratégica gratuita.

¿Listo para lanzar un RAG que realmente responda bien?

Cuéntenos las preguntas que desea responder y los datos a partir de los cuales quiere obtener las respuestas. Responderemos en un día hábil. Reserve una llamada estratégica gratuita con nuestro equipo de Toronto.

Obtenga una estimación honesta para su proyecto

Respuesta el mismo día durante el horario laboral de Norteamérica. Sin compromiso.

Reserve una llamada estratégica gratuita

Contacto para servicios