Cómo ejecutar un LLM local y privado con Ollama y Open WebUI: Guía completa
Cómo ejecutar un LLM local y privado con Ollama y Open WebUI: Guía completa
Aprende a instalar y configurar un LLM local con Ollama y Open WebUI. Descubre cómo correr modelos abiertos en tu hardware con privacidad total y sin costes de API.
Ejecutar un LLM local en tu propio equipo se ha convertido en la solución estándar para quienes buscan trabajar con modelos de lenguaje avanzados sin enviar datos confidenciales a la nube ni depender de suscripciones recurrentes. Al combinar el motor de inferencia de Ollama con la interfaz gráfica de Open WebUI, cualquier usuario puede disponer de un entorno idéntico a ChatGPT, completamente privado y funcional sin conexión a internet.
Puntos clave sobre la inferencia local
- Privacidad absoluta: Los prompts, documentos y respuestas no salen de tu red local ni alimentan servidores externos.
- Arquitectura desacoplada: Ollama actúa como servidor de backend en el puerto 11434, mientras Open WebUI provee la interfaz web mediante Docker.
- Optimización con Q4_K_M: La cuantización a 4 bits reduce drásticamente los requisitos de memoria conservando una calidad cercana a FP16.
- RAG integrado: Capacidad de procesar y consultar archivos PDF o textos locales mediante modelos de embedding sin conexión.
Por qué migrar a un ecosistema de LLM local
El uso de APIs comerciales y servicios centralizados presenta limitaciones operativas en entornos corporativos o proyectos con requerimientos estrictos de confidencialidad. Adoptar un modelo de lenguaje en local permite garantizar la soberanía de la información: los datos nunca abandonan la memoria del dispositivo.
Además de la protección frente a la telemetría, el despliegue local elimina las restricciones de cuotas de uso y la latencia provocada por congestión en la red externa. Modelos abiertos como Llama 3, Mistral, Qwen 2.5 y Gemma pueden ejecutarse directamente en tu estación de trabajo adaptándose a las necesidades de cada tarea.
Requisitos de hardware y cálculo de VRAM y RAM
La inferencia de modelos de lenguaje depende principalmente del ancho de banda y la capacidad de la memoria (memory-bound). Si el tamaño del modelo y el espacio reservado para el contexto (KV Cache) superan la memoria de vídeo (VRAM) de la tarjeta gráfica, el sistema recurrirá al volcado de capas hacia la RAM del procesador (CPU offloading), lo que reduce la velocidad de generación.
Modelos 7B – 8B (Q4_K_M) | Mínimo 8 GB RAM
Modelos 13B – 14B (Q4_K_M) | Mínimo 16 GB RAM
Modelos 32B – 33B (Q4_K_M) | Mínimo 32 GB RAM
Modelos 70B (Q4_K_M) | Mínimo 64 GB RAM
Paso a paso: Instalación y puesta en marcha de Ollama
Ollama es el motor encargado de descargar, optimizar y servir los modelos mediante una API local accesible en el puerto 11434. Su instalación es directa en las principales plataformas:
En Windows y macOS, descarga y ejecuta el instalador nativo disponible en el repositorio oficial. En entornos Linux, ejecuta el comando oficial en terminal: curl -fsSL https://ollama.com/install.sh | sh.
Comprueba que el servicio está activo abriendo tu navegador en http://localhost:11434. Deberías ver un mensaje confirmando que Ollama está en ejecución.
Abre tu terminal y descarga tu primer modelo con el comando: ollama run llama3 o ollama run mistral. El sistema descargará la versión optimizada en Q4_K_M y abrirá una sesión interactiva.
| Modelo | Formato estándar | VRAM requerida | RAM recomendada (CPU) |
|---|---|---|---|
| 7B – 8B (Llama 3 / Mistral / Gemma) | Q4_K_M | 5 a 6 GB | 8 GB |
| 13B – 14B (Qwen 2.5) | Q4_K_M | 9 a 12 GB | 16 GB |
| 32B – 33B | Q4_K_M | 20 a 24 GB | 32 GB |
| 70B | Q4_K_M | 40 a 48 GB | 64 GB |
Despliegue de Open WebUI con Docker
Para contar con una experiencia interactiva avanzada con gestión de conversaciones, configuración de prompts de sistema y carga de documentos, Open WebUI se integra directamente con la API de Ollama mediante Docker.
El comando estándar para iniciar el contenedor mapea el puerto interno 8080 al puerto 3000 de tu máquina local:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Una vez levantado el contenedor, ingresa desde tu navegador a http://localhost:3000 para crear la cuenta de administrador local y comenzar a utilizar la interfaz.
Funciones avanzadas: RAG y personalización
Open WebUI no se limita a ser un cliente de chat básico. Incluye herramientas profesionales para ampliar las capacidades de cualquier modelo descargado:
- Generación Aumentada por Recuperación (RAG local): Permite adjuntar archivos PDF o documentos de texto. El sistema los fragmenta e indexa mediante modelos de embedding locales sin enviar información fuera del equipo.
- Soporte multimodal: Si ejecutas modelos con capacidades de visión compatibles en Ollama, puedes analizar imágenes directamente desde la interfaz.
- Prompts de sistema y modelos personalizados: Posibilidad de definir instrucciones previas para adaptar el tono, formato de salida o restricciones técnicas de las respuestas.
Preguntas frecuentes
¿Qué ocurre si mi modelo no cabe por completo en la VRAM de la GPU?
Ollama aplicará CPU offloading de forma automática, dividiendo las capas del modelo entre la memoria VRAM y la RAM del sistema. La ejecución continuará, pero con una velocidad de generación sensiblemente menor.
¿Por qué los modelos vienen por defecto en formato Q4_K_M?
La cuantización a 4 bits (Q4_K_M) reduce significativamente el tamaño del archivo y el consumo de memoria respecto a la precisión original (FP16), manteniendo al mismo tiempo un nivel de precisión y coherencia lingüística muy similar.
¿Puedo utilizar Open WebUI y Ollama sin conexión a internet?
Sí. Una vez descargados el motor, el contenedor Docker y los modelos requeridos, todo el procesamiento y la indexación RAG funcionan de manera totalmente offline.
🚀 ¿Quieres estar siempre actualizado en IA?
Únete a nuestra comunidad donde compartimos noticias, herramientas, guías y oportunidades sobre inteligencia artificial.
Fuentes consultadas
🔥 Sigue Eduky Blog para más contenido sobre IA
Noticias, herramientas, automatizaciones y guías prácticas para mantenerte siempre al día.



Publicar comentario