El reto
Un cliente empresarial de un sector regulado usaba un LLM alojado a través de sus herramientas internas, pero cada trimestre su equipo de revisión de seguridad señalaba el mismo obstáculo: texto identificable de clientes se enviaba a un endpoint en la nube de EE. UU. Legal había pausado el despliegue más amplio, la factura de OpenAI había superado los $4,200/mes con solo una fracción de la base de usuarios prevista, y al equipo de producto le habían planteado la pregunta imposible: "¿podemos conservar toda esta capacidad de IA sin que ningún dato salga del portátil del usuario?"
No necesitaban un proyecto de investigación. Necesitaban un flujo de trabajo entregable que un empleado interno pudiera instalar en una tarde, que se ejecutara íntegramente en sus MacBooks de la serie M y sus ThinkPads con Windows existentes, y que rindiera lo bastante bien como para que nadie lamentara la mejora de privacidad.
Nuestra solución
Diseñamos y entregamos un stack LLM totalmente local: Ollama como entorno de ejecución del modelo, llama.cpp por debajo para inferencia cuantizada en GPU/CPU, una pequeña capa de orquestación FastAPI para el uso de herramientas y la recuperación, y una interfaz de escritorio Next.js distribuida mediante un ligero contenedor Tauri. Cada byte de contexto permanece en el dispositivo. No hay inferencia remota, ni callback de telemetría, ni proxy.
Evaluamos siete modelos de pesos abiertos (Llama 3.1 8B, Qwen 2.5 7B/14B, Phi-3, Mistral y dos variantes ajustadas a dominios) con los prompts reales del cliente y entregamos un enrutador de modelos por tarea: un modelo pequeño y rápido para clasificación y chat, y un modelo de razonamiento más grande bajo demanda. RAG se ejecuta sobre un índice local de ChromaDB construido a partir de los propios documentos del usuario, con todos los embeddings calculados en el dispositivo.
El resultado es un flujo de trabajo que es medible más rápido que la versión en la nube en el prompt mediano (sin viaje de ida y vuelta por la red), supera la revisión de seguridad del cliente en el primer envío y escala a todos los portátiles de la empresa sin costo de inferencia por puesto.
- Entorno Ollama con enrutador de modelos por tarea (pequeño para chat, grande para razonamiento)
- Inferencia cuantizada con llama.cpp ajustada para Apple Silicon y CPU modernas de Intel/AMD
- RAG local sobre los propios archivos del usuario con ChromaDB y embeddings en el dispositivo
- Capa de orquestación FastAPI con API HTTP estable para la interfaz de escritorio Next.js / Tauri
- Lista de permitidos de red verificable — ningún tráfico LLM sale jamás del dispositivo
- Arnés de evaluación integrado para puntuar cada actualización de modelo antes del despliegue
- Instaladores firmados y notarizados para macOS (M1/M2/M3) y Windows
- Panel de privacidad dentro de la app que muestra exactamente qué puede leer el modelo
- Canal opcional de actualización de modelos que respeta el proxy corporativo y la política de red