En este artículo
- Por qué alojar tu propia IA
- Calculadora: tu servidor ideal
- Tabla VRAM: qué GPU necesita cada modelo
- Comparativa de GPUs para LLM
- 10 proveedores comparados
- Hetzner: la referencia europea
- Contabo: lo más barato
- OVH: RGPD nativo
- GPU cloud: RunPod, Vast.ai, Lambda
- Stack: Ollama vs vLLM vs llama.cpp
- Interfaces: Open WebUI, Jan, LM Studio
- Cuantización: Q4 vs Q8 vs FP16
- Breakeven: cuándo self-hosted supera a cloud
- Seguridad y RGPD
- 7 errores al montar tu IA
- 3 recetas listas para copiar
Alojar tu propia IA ya no es solo para empresas grandes. Con servidores desde 6 EUR/mes y modelos open-source que rivalizan con GPT-4, cualquier profesional, PYME o centro educativo puede tener su propio ChatGPT privado donde los datos nunca salen de su servidor.
Este artículo te da todo lo que necesitas para decidir: qué servidor, qué GPU, qué modelo, qué software y cuánto va a costar. Con una calculadora interactiva que analiza tu caso (modelo deseado, usuarios, concurrencia, presupuesto) y te recomienda el proveedor y plan exacto.
Para quién es esta guía
Profesionales que quieren privacidad. PYMEs que quieren reducir costes de IA. CTOs evaluando self-hosted vs cloud. Equipos IT montando infraestructura IA. Centros educativos con requisitos RGPD. Si no sabes qué es VRAM, empieza por la tabla de requisitos.
Por qué alojar tu propia IA
Tres razones principales:
1. Privacidad total
Los datos nunca abandonan tu servidor. No hay términos de servicio que cambien, ni incidentes de terceros. Crítico para: datos de clientes, expedientes legales, información médica, datos de alumnos, propiedad intelectual, secretos comerciales.
2. Coste predecible y decreciente
Con ChatGPT Team a 25 USD/usuario/mes, 20 usuarios cuestan 500 USD/mes (6.000 USD/año). Un servidor Hetzner con Ollama cuesta 49-89 EUR/mes para esos mismos 20 usuarios. El ahorro acumulado es de 4.000-5.500 EUR al año.
3. Control total
Eliges el modelo, la versión, el comportamiento, los límites. Sin censura comercial. Sin cambios sorpresa de API. Sin dependencia de un proveedor que puede subir precios o cambiar condiciones.
Cuándo NO hacer self-hosted
Si solo eres 1-2 usuarios sin datos sensibles, ChatGPT Plus a 20 USD/mes es más simple y los modelos comerciales siguen siendo superiores en muchas tareas. Self-hosted tiene sentido a partir de 3-5 usuarios, o con cualquier número de usuarios si manejas datos regulados.
Calculadora: tu servidor ideal
Selecciona el modelo que quieres ejecutar, tus usuarios y tu presupuesto. La calculadora calcula la VRAM necesaria, el tipo de servidor y te recomienda el mejor proveedor.
Configura tu IA privada
Selecciona modelo, usuarios y prioridad. La calculadora estima VRAM, RAM, disco y recomienda servidor.
Tabla VRAM: qué GPU necesita cada modelo
La VRAM (memoria de la GPU) es el factor limitante. Esta tabla muestra cuánta necesitas según el modelo y la cuantización:
| Modelo | Params | Q4_K_M | Q8_0 | FP16 | GPU mínima (Q4) |
|---|---|---|---|---|---|
| Llama 3.1 8B | 8B | 5 GB | 8 GB | 16 GB | RTX 3060 12GB |
| Qwen 2.5 7B | 7B | 4.5 GB | 7.5 GB | 14 GB | RTX 3060 12GB |
| Mistral 7B | 7B | 4.5 GB | 7.5 GB | 14 GB | RTX 3060 12GB |
| Mistral Nemo 12B | 12B | 7 GB | 12 GB | 24 GB | RTX 4060 Ti 16GB |
| Phi-4 14B | 14B | 8 GB | 14 GB | 28 GB | RTX 4070 Ti Super 16GB |
| Codestral 22B | 22B | 13 GB | 22 GB | 44 GB | RTX 4000 SFF 20GB |
| Qwen 2.5 32B | 32B | 18 GB | 32 GB | 64 GB | RTX 3090 24GB |
| Llama 3.1 70B | 70B | 40 GB | 70 GB | 140 GB | 2x RTX 4090 / A6000 |
| Qwen 2.5 72B | 72B | 41 GB | 72 GB | 144 GB | 2x RTX 4090 / L40S |
| DeepSeek R1 70B | 70B | 40 GB | 70 GB | 140 GB | A100 80GB |
| Mixtral 8x22B | 141B (MoE) | 80 GB | 140 GB | 280 GB | 2x A100 / 4x L40S |
Regla rápida para estimar VRAM
Q4: parámetros (B) x 0.5 = GB VRAM.
Q8: parámetros (B) x 1.0 = GB VRAM.
FP16: parámetros (B) x 2.0 = GB VRAM.
Añadir 1-2 GB extra para KV caché y overhead del runtime.
Comparativa de GPUs para LLM
| GPU | VRAM | Modelo max (Q4) | tok/s (7B Q4) | tok/s (70B Q4) | Precio aprox. |
|---|---|---|---|---|---|
| RTX 3060 | 12 GB | 13B | 25-35 | N/A | ~250 EUR (2a mano) |
| RTX 4060 Ti | 16 GB | 14B | 35-50 | N/A | ~400 EUR |
| RTX 4000 SFF Ada | 20 GB | 22B | 40-55 | N/A | Solo Hetzner GEX44 |
| RTX 3090 | 24 GB | 32B | 40-55 | N/A | ~700 EUR (2a mano) |
| RTX 4090 | 24 GB | 32B | 55-80 | N/A | ~1.600 EUR |
| A6000 | 48 GB | 70B | 35-45 | 15-25 | ~3.500 EUR |
| L40S | 48 GB | 70B | 50-65 | 20-30 | Solo cloud |
| A100 80GB | 80 GB | 70B FP16 | 60-80 | 35-50 | ~12.000 EUR / cloud |
| H100 80GB | 80 GB | 70B FP16 | 90-130 | 50-80 | ~25.000 EUR / cloud |
Recomendación práctica: Hetzner GEX44 (RTX 4000 SFF, 20 GB, 184 EUR/mes) es el punto óptimo en Europa para modelos hasta 22B. Para 70B, necesitas GEX130 (RTX 6000 Ada, 48 GB, ~392 EUR/mes) o cloud GPU.
10 proveedores comparados
| Proveedor | Tipo | Desde | GPU? | Ubicación | Ideal para |
|---|---|---|---|---|---|
| Hetzner | Dedicado GPU | 39 EUR/mes | GEX (RTX 4000/6000) | Alemania, Finlandia | Referencia EU, mejor precio/rendimiento |
| Contabo | VPS/Dedicado | 6 EUR/mes | No (GPU solo cloud) | Alemania | Mínimo presupuesto, modelos pequeños |
| OVH | Dedicado Cloud | 59 EUR/mes | L4, A4000, L40S | Francia | RGPD nativo, admin pública |
| Scaleway | GPU Cloud | 79 EUR/mes | L4, L40S, H100 | Francia | Startups, escalabilidad |
| Vultr | Cloud | 6 USD/mes | A100, H100 | Global | Multi-región, API friendly |
| RunPod | GPU Cloud | 0.20 USD/h | 3090, 4090, A100, H100 | EEUU, EU | Uso intermitente, prototipado |
| Vast.ai | GPU Cloud | 0.10 USD/h | Variable | Variable | Lo más barato por hora GPU |
| Lambda Labs | GPU Cloud | 0.50 USD/h | A100, H100, H200 | EEUU | ML teams, clusters |
| Paperspace | GPU Cloud | 0.45 USD/h | A4000, A5000, A100 | EEUU, EU | Notebooks + deploy |
| Local (tu PC) | Local | 0 EUR/mes | Tu GPU | Tu oficina | Prototipado, uso personal |
Hetzner: la referencia europea
Hetzner es el proveedor dominante para self-hosted en Europa. Razones:
| Plan | CPU | RAM | GPU | VRAM | Disco | Precio |
|---|---|---|---|---|---|---|
| AX42 | Ryzen 7 7700 | 64 GB | Sin GPU | 0 | 2x 512 GB NVMe | 44 EUR/mes |
| AX52 | Ryzen 9 7900 | 64 GB | Sin GPU | 0 | 2x 1 TB NVMe | 69 EUR/mes |
| AX102 | Ryzen 9 7950X3D | 128 GB | Sin GPU | 0 | 2x 1.92 TB NVMe | 130 EUR/mes |
| GEX44 | i5-13500 | 64 GB | RTX 4000 SFF Ada | 20 GB | 2x 512 GB NVMe | 184 EUR/mes |
| GEX130 | EPYC 9354P | 128 GB | RTX 6000 Ada | 48 GB | 2x 1.92 TB NVMe | ~392 EUR/mes |
Recomendación: AX42 (44 EUR) para modelos 7-8B en CPU. GEX44 (184 EUR) para modelos hasta 22B con GPU. GEX130 (392 EUR) para 70B en Q4.
Contabo: lo más barato
Contabo ofrece los precios más bajos del mercado. El trade-off: hardware menos potente y sin GPU dedicada en planes básicos.
| Plan | CPU | RAM | Disco | Precio | Modelo max |
|---|---|---|---|---|---|
| VPS S | 4 vCPU | 8 GB | 200 GB SSD | 6 EUR/mes | Phi-3 mini 3.8B |
| VPS M | 6 vCPU | 16 GB | 400 GB SSD | 12 EUR/mes | Llama 3.1 8B (Q4, lento) |
| VPS L | 8 vCPU | 30 GB | 800 GB SSD | 18 EUR/mes | Llama 3.1 8B (Q8) |
| VPS XL | 10 vCPU | 60 GB | 1.6 TB SSD | 35 EUR/mes | Mistral Nemo 12B (Q4) |
| Dedicated S | Xeon E-2388G | 64 GB | 2x 1 TB NVMe | 55 EUR/mes | Phi-4 14B (Q4) |
OVH: RGPD nativo
OVH es la mejor opción cuando necesitas garantía legal de datos en territorio francés. Ideal para administración pública, sanidad y educación.
Planes dedicados desde 65 EUR/mes. GPU instances con L4 (24 GB) desde ~250 EUR/mes. L40S y A100 disponibles bajo demanda.
GPU cloud: RunPod, Vast.ai, Lambda
Si no quieres un servidor 24/7, puedes alquilar GPUs por horas:
| Proveedor | GPU | VRAM | Precio/hora | Coste 24/7 mes | Coste 8h/día mes |
|---|---|---|---|---|---|
| RunPod | RTX 4090 | 24 GB | 0.44 USD | 321 USD | 107 USD |
| RunPod | A100 80GB | 80 GB | 1.64 USD | 1.197 USD | 399 USD |
| Vast.ai | RTX 4090 | 24 GB | ~0.30 USD | ~219 USD | ~73 USD |
| Vast.ai | A6000 | 48 GB | ~0.50 USD | ~365 USD | ~122 USD |
| Lambda | A100 80GB | 80 GB | 1.25 USD | 912 USD | 304 USD |
| Lambda | H100 | 80 GB | 2.49 USD | 1.817 USD | 606 USD |
Cuándo elegir cloud GPU: uso intermitente (menos de 8h/día), prototipado, o necesitas GPU potente (A100/H100) que no puedes conseguir en dedicado.
Cuándo elegir dedicado: uso 24/7, coste predecible, datos en EU.
Stack: Ollama vs vLLM vs llama.cpp
| Herramienta | Ideal para | Multi-usuario | API OpenAI | Throughput | Facilidad |
|---|---|---|---|---|---|
| Ollama | Desarrollo, 1-10 usuarios | Básico | Sí | Medio | ★★★★★ |
| vLLM | Producción, 10+ usuarios | Excelente | Sí | Alto (continuous batching) | ★★★☆☆ |
| llama.cpp server | Minimalista, CPU | Básico | Parcial | Medio-bajo | ★★★★☆ |
| TGI (HuggingFace) | Producción, empresarial | Excelente | Sí | Alto | ★★☆☆☆ |
| LocalAI | Todo-en-uno (texto+imagen+audio) | Sí | Sí | Medio | ★★★☆☆ |
Resumen: empieza con Ollama. Cuando tengas 10+ usuarios o necesites rendimiento, migra a vLLM. Si necesitas imagen + audio + texto, LocalAI.
Interfaces: Open WebUI, Jan, LM Studio
Open WebUI: interfaz web multi-usuario. Login, RAG integrado, gestión de modelos, historial, compartir chats. La mejor opción para equipos. Tutorial de instalación.
Jan: app de escritorio. Descargar, instalar, usar. Sin servidor, sin configuración. Ideal para uso personal en tu Mac/PC.
LM Studio: similar a Jan. Mejor UI, servidor local integrado. Popular entre developers.
LobeChat: alternativa a Open WebUI con soporte multi-proveedor (Ollama + APIs cloud en una interfaz).
Cuantización: Q4 vs Q8 vs FP16
La cuantización reduce el tamaño del modelo comprimiendo los pesos. Menos VRAM, algo menos de calidad:
| Formato | VRAM relativa | Calidad relativa | Velocidad | Cuándo usarlo |
|---|---|---|---|---|
| Q4_K_M | ~25% del FP16 | 90-95% | Más rápido | GPU limitada, muchos usuarios, uso general |
| Q5_K_M | ~30% del FP16 | 93-97% | Rápido | Equilibrio óptimo si la VRAM lo permite |
| Q8_0 | ~50% del FP16 | 97-99% | Medio | Máxima calidad sin FP16, VRAM suficiente |
| FP16 | 100% (referencia) | 100% | Más lento | Evaluación, tareas críticas, VRAM sobrada |
Recomendación práctica: Q4_K_M para la mayoría. Q5_K_M si puedes. FP16 solo si tienes A100/H100 y necesitas máxima precisión.
Breakeven: cuándo self-hosted supera a cloud
| Usuarios | ChatGPT Team/mes | Hetzner AX42 (8B CPU) | Hetzner GEX44 (20B GPU) | Ahorro anual (vs ChatGPT) |
|---|---|---|---|---|
| 1 | 25 USD (23 EUR) | 44 EUR | 184 EUR | Cloud más barato |
| 3 | 75 USD (69 EUR) | 44 EUR | 184 EUR | 300 EUR (AX42) |
| 5 | 125 USD (115 EUR) | 44 EUR | 184 EUR | 852 EUR (AX42) |
| 10 | 250 USD (230 EUR) | 44 EUR | 184 EUR | 2.232 EUR (AX42) / 552 EUR (GEX44) |
| 20 | 500 USD (460 EUR) | 44 EUR | 184 EUR | 4.992 EUR (AX42) / 3.312 EUR (GEX44) |
| 50 | 1.250 USD (1.150 EUR) | 69 EUR | 184 EUR | 12.972 EUR (AX52) / 11.592 EUR (GEX44) |
Punto de breakeven: con 3 usuarios self-hosted ya ahorra dinero (si usas CPU inference). Con GPU, el breakeven está en 8-10 usuarios. A partir de 20 usuarios, el ahorro es enorme.
El trade-off que nadie menciona
Self-hosted ahorra dinero pero requiere tiempo de administración: instalación (2-4 horas la primera vez), actualizaciones (1 hora/mes), troubleshooting ocasional. Si valoras tu hora a 50 EUR, añade ~50 EUR/mes de "coste oculto". Aun así, con 10+ usuarios sigue siendo más barato.
Seguridad y RGPD
Self-hosted no es automáticamente seguro. Necesitas:
- Firewall: solo abrir puertos necesarios (SSH, HTTPS). Nunca exponer Ollama/vLLM directamente a internet.
- Reverse proxy: Caddy o Nginx con TLS. Open WebUI detrás del proxy.
- Autenticación: Open WebUI tiene login integrado. Para APIs, usar API keys o OAuth.
- Cifrado: disco cifrado (LUKS), conexiones TLS, backups cifrados.
- Actualizaciones: sistema operativo, Ollama/vLLM, Open WebUI. Automatizar con unattended-upgrades.
- Acceso remoto: Tailscale o WireGuard. Nunca SSH con password.
- Backups: configuración, modelos, base de datos Open WebUI. Mínimo semanal.
RGPD: con servidor en Alemania (Hetzner, Contabo) o Francia (OVH, Scaleway), los datos están en territorio UE. No necesitas DPA con terceros porque tú eres el responsable. Documenta el tratamiento en tu registro de actividades.
7 errores al montar tu IA
- Elegir modelo demasiado grande. Un 7B bien configurado supera a un 70B mal cuantizado con poca VRAM. Empieza pequeño.
- Ignorar la cuantización. Q4_K_M da 90-95% de la calidad con 25% de la VRAM. No uses FP16 si no tienes A100.
- Exponer Ollama a internet. Puerto 11434 sin autenticación = cualquiera usa tu GPU. Siempre detrás de proxy con auth.
- No medir el throughput real. Benchmarks teóricos mienten. Prueba con tus prompts reales y mide tokens/segundo.
- Comprar GPU consumer para producción 24/7. RTX 4090 funciona pero no está diseñada para uso continuo. Servidores dedicados con garantía son mejores.
- Olvidar los backups. La configuración de Open WebUI, los chats, los modelos custom. Todo puede desaparecer sin backup.
- No planificar la concurrencia. 10 usuarios simultáneos necesitan más VRAM (KV caché) y benefician de vLLM sobre Ollama.
3 recetas listas para copiar
Receta 1: IA personal por 44 EUR/mes
Hetzner AX42 (44 EUR/mes) + Ollama + Open WebUI + Llama 3.1 8B Q4
Para: 1-3 usuarios. CPU inference a 10-15 tok/s. Instalación en 30 minutos. Tutorial de instalación.
# SSH a tu servidor Hetzner
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.1:8b-instruct-q4_K_M
# Open WebUI con Docker
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui --restart always \
ghcr.io/open-webui/open-webui:main
# Reverse proxy con Caddy (TLS automatico)
# Caddyfile: ia.tudominio.com { reverse_proxy localhost:3000 }
Receta 2: IA de equipo por 184 EUR/mes
Hetzner GEX44 (184 EUR/mes) + Ollama + Open WebUI + Qwen 2.5 14B Q8
Para: 5-15 usuarios. GPU inference a 30-50 tok/s. Modelo potente con GPU dedicada.
Receta 3: IA de empresa por 392 EUR/mes
Hetzner GEX130 (~392 EUR/mes) + vLLM + Open WebUI + Llama 3.1 70B Q4
Para: 15-50+ usuarios. Continuous batching con vLLM. Modelo nivel GPT-4 class. Producción seria.
Monto mi propia IA, paso a paso
Recibe tutoriales prácticos para montar y mantener tu IA privada: servidores, modelos, rendimiento, seguridad. Solo contenido técnico útil.
Sin spam. Cancelar cuando quieras.
Tu especialización desde 19 EUR
19 itinerarios prácticos. Founding Members: acceso sin caducidad al contenido adquirido + canal directo con el creador. Solo 50 plazas.
Ver Founding MembersFounding Members: todo por 99 EUR
614 módulos, 23 especializaciones, acceso sin caducidad al contenido adquirido. Precio normal: 199 EUR. Reembolso según Términos.
📚 Aprende más en el curso
Este artículo complementa el Módulo M12: Arquitectura de sistemas. Incluye vídeo, quiz, flashcards con repaso espaciado y proyecto práctico.