Alojar tu propia IA: guía completa de servidores, GPUs, modelos y costes

Por David Moya · · 35 min lectura · Actualizado mensualmente

En este artículo

  1. Por qué alojar tu propia IA
  2. Calculadora: tu servidor ideal
  3. Tabla VRAM: qué GPU necesita cada modelo
  4. Comparativa de GPUs para LLM
  5. 10 proveedores comparados
  6. Hetzner: la referencia europea
  7. Contabo: lo más barato
  8. OVH: RGPD nativo
  9. GPU cloud: RunPod, Vast.ai, Lambda
  10. Stack: Ollama vs vLLM vs llama.cpp
  11. Interfaces: Open WebUI, Jan, LM Studio
  12. Cuantización: Q4 vs Q8 vs FP16
  13. Breakeven: cuándo self-hosted supera a cloud
  14. Seguridad y RGPD
  15. 7 errores al montar tu IA
  16. 3 recetas listas para copiar

Alojar tu propia IA ya no es solo para empresas grandes. Con servidores desde 6 EUR/mes y modelos open-source que rivalizan con GPT-4, cualquier profesional, PYME o centro educativo puede tener su propio ChatGPT privado donde los datos nunca salen de su servidor.

Este artículo te da todo lo que necesitas para decidir: qué servidor, qué GPU, qué modelo, qué software y cuánto va a costar. Con una calculadora interactiva que analiza tu caso (modelo deseado, usuarios, concurrencia, presupuesto) y te recomienda el proveedor y plan exacto.

Para quién es esta guía

Profesionales que quieren privacidad. PYMEs que quieren reducir costes de IA. CTOs evaluando self-hosted vs cloud. Equipos IT montando infraestructura IA. Centros educativos con requisitos RGPD. Si no sabes qué es VRAM, empieza por la tabla de requisitos.

Por qué alojar tu propia IA

Tres razones principales:

1. Privacidad total

Los datos nunca abandonan tu servidor. No hay términos de servicio que cambien, ni incidentes de terceros. Crítico para: datos de clientes, expedientes legales, información médica, datos de alumnos, propiedad intelectual, secretos comerciales.

2. Coste predecible y decreciente

Con ChatGPT Team a 25 USD/usuario/mes, 20 usuarios cuestan 500 USD/mes (6.000 USD/año). Un servidor Hetzner con Ollama cuesta 49-89 EUR/mes para esos mismos 20 usuarios. El ahorro acumulado es de 4.000-5.500 EUR al año.

3. Control total

Eliges el modelo, la versión, el comportamiento, los límites. Sin censura comercial. Sin cambios sorpresa de API. Sin dependencia de un proveedor que puede subir precios o cambiar condiciones.

Cuándo NO hacer self-hosted

Si solo eres 1-2 usuarios sin datos sensibles, ChatGPT Plus a 20 USD/mes es más simple y los modelos comerciales siguen siendo superiores en muchas tareas. Self-hosted tiene sentido a partir de 3-5 usuarios, o con cualquier número de usuarios si manejas datos regulados.

Calculadora: tu servidor ideal

Selecciona el modelo que quieres ejecutar, tus usuarios y tu presupuesto. La calculadora calcula la VRAM necesaria, el tipo de servidor y te recomienda el mejor proveedor.

Configura tu IA privada

Selecciona modelo, usuarios y prioridad. La calculadora estima VRAM, RAM, disco y recomienda servidor.

Tabla VRAM: qué GPU necesita cada modelo

La VRAM (memoria de la GPU) es el factor limitante. Esta tabla muestra cuánta necesitas según el modelo y la cuantización:

ModeloParamsQ4_K_MQ8_0FP16GPU mínima (Q4)
Llama 3.1 8B8B5 GB8 GB16 GBRTX 3060 12GB
Qwen 2.5 7B7B4.5 GB7.5 GB14 GBRTX 3060 12GB
Mistral 7B7B4.5 GB7.5 GB14 GBRTX 3060 12GB
Mistral Nemo 12B12B7 GB12 GB24 GBRTX 4060 Ti 16GB
Phi-4 14B14B8 GB14 GB28 GBRTX 4070 Ti Super 16GB
Codestral 22B22B13 GB22 GB44 GBRTX 4000 SFF 20GB
Qwen 2.5 32B32B18 GB32 GB64 GBRTX 3090 24GB
Llama 3.1 70B70B40 GB70 GB140 GB2x RTX 4090 / A6000
Qwen 2.5 72B72B41 GB72 GB144 GB2x RTX 4090 / L40S
DeepSeek R1 70B70B40 GB70 GB140 GBA100 80GB
Mixtral 8x22B141B (MoE)80 GB140 GB280 GB2x A100 / 4x L40S

Regla rápida para estimar VRAM

Q4: parámetros (B) x 0.5 = GB VRAM.
Q8: parámetros (B) x 1.0 = GB VRAM.
FP16: parámetros (B) x 2.0 = GB VRAM.
Añadir 1-2 GB extra para KV caché y overhead del runtime.

Comparativa de GPUs para LLM

GPUVRAMModelo max (Q4)tok/s (7B Q4)tok/s (70B Q4)Precio aprox.
RTX 306012 GB13B25-35N/A~250 EUR (2a mano)
RTX 4060 Ti16 GB14B35-50N/A~400 EUR
RTX 4000 SFF Ada20 GB22B40-55N/ASolo Hetzner GEX44
RTX 309024 GB32B40-55N/A~700 EUR (2a mano)
RTX 409024 GB32B55-80N/A~1.600 EUR
A600048 GB70B35-4515-25~3.500 EUR
L40S48 GB70B50-6520-30Solo cloud
A100 80GB80 GB70B FP1660-8035-50~12.000 EUR / cloud
H100 80GB80 GB70B FP1690-13050-80~25.000 EUR / cloud

Recomendación práctica: Hetzner GEX44 (RTX 4000 SFF, 20 GB, 184 EUR/mes) es el punto óptimo en Europa para modelos hasta 22B. Para 70B, necesitas GEX130 (RTX 6000 Ada, 48 GB, ~392 EUR/mes) o cloud GPU.

10 proveedores comparados

ProveedorTipoDesdeGPU?UbicaciónIdeal para
HetznerDedicado GPU39 EUR/mesGEX (RTX 4000/6000)Alemania, FinlandiaReferencia EU, mejor precio/rendimiento
ContaboVPS/Dedicado6 EUR/mesNo (GPU solo cloud)AlemaniaMínimo presupuesto, modelos pequeños
OVHDedicado Cloud59 EUR/mesL4, A4000, L40SFranciaRGPD nativo, admin pública
ScalewayGPU Cloud79 EUR/mesL4, L40S, H100FranciaStartups, escalabilidad
VultrCloud6 USD/mesA100, H100GlobalMulti-región, API friendly
RunPodGPU Cloud0.20 USD/h3090, 4090, A100, H100EEUU, EUUso intermitente, prototipado
Vast.aiGPU Cloud0.10 USD/hVariableVariableLo más barato por hora GPU
Lambda LabsGPU Cloud0.50 USD/hA100, H100, H200EEUUML teams, clusters
PaperspaceGPU Cloud0.45 USD/hA4000, A5000, A100EEUU, EUNotebooks + deploy
Local (tu PC)Local0 EUR/mesTu GPUTu oficinaPrototipado, uso personal

Hetzner: la referencia europea

Hetzner es el proveedor dominante para self-hosted en Europa. Razones:

PlanCPURAMGPUVRAMDiscoPrecio
AX42Ryzen 7 770064 GBSin GPU02x 512 GB NVMe44 EUR/mes
AX52Ryzen 9 790064 GBSin GPU02x 1 TB NVMe69 EUR/mes
AX102Ryzen 9 7950X3D128 GBSin GPU02x 1.92 TB NVMe130 EUR/mes
GEX44i5-1350064 GBRTX 4000 SFF Ada20 GB2x 512 GB NVMe184 EUR/mes
GEX130EPYC 9354P128 GBRTX 6000 Ada48 GB2x 1.92 TB NVMe~392 EUR/mes

Recomendación: AX42 (44 EUR) para modelos 7-8B en CPU. GEX44 (184 EUR) para modelos hasta 22B con GPU. GEX130 (392 EUR) para 70B en Q4.

Contabo: lo más barato

Contabo ofrece los precios más bajos del mercado. El trade-off: hardware menos potente y sin GPU dedicada en planes básicos.

PlanCPURAMDiscoPrecioModelo max
VPS S4 vCPU8 GB200 GB SSD6 EUR/mesPhi-3 mini 3.8B
VPS M6 vCPU16 GB400 GB SSD12 EUR/mesLlama 3.1 8B (Q4, lento)
VPS L8 vCPU30 GB800 GB SSD18 EUR/mesLlama 3.1 8B (Q8)
VPS XL10 vCPU60 GB1.6 TB SSD35 EUR/mesMistral Nemo 12B (Q4)
Dedicated SXeon E-2388G64 GB2x 1 TB NVMe55 EUR/mesPhi-4 14B (Q4)

OVH: RGPD nativo

OVH es la mejor opción cuando necesitas garantía legal de datos en territorio francés. Ideal para administración pública, sanidad y educación.

Planes dedicados desde 65 EUR/mes. GPU instances con L4 (24 GB) desde ~250 EUR/mes. L40S y A100 disponibles bajo demanda.

GPU cloud: RunPod, Vast.ai, Lambda

Si no quieres un servidor 24/7, puedes alquilar GPUs por horas:

ProveedorGPUVRAMPrecio/horaCoste 24/7 mesCoste 8h/día mes
RunPodRTX 409024 GB0.44 USD321 USD107 USD
RunPodA100 80GB80 GB1.64 USD1.197 USD399 USD
Vast.aiRTX 409024 GB~0.30 USD~219 USD~73 USD
Vast.aiA600048 GB~0.50 USD~365 USD~122 USD
LambdaA100 80GB80 GB1.25 USD912 USD304 USD
LambdaH10080 GB2.49 USD1.817 USD606 USD

Cuándo elegir cloud GPU: uso intermitente (menos de 8h/día), prototipado, o necesitas GPU potente (A100/H100) que no puedes conseguir en dedicado.

Cuándo elegir dedicado: uso 24/7, coste predecible, datos en EU.

Stack: Ollama vs vLLM vs llama.cpp

HerramientaIdeal paraMulti-usuarioAPI OpenAIThroughputFacilidad
OllamaDesarrollo, 1-10 usuariosBásicoSíMedio★★★★★
vLLMProducción, 10+ usuariosExcelenteSíAlto (continuous batching)★★★☆☆
llama.cpp serverMinimalista, CPUBásicoParcialMedio-bajo★★★★☆
TGI (HuggingFace)Producción, empresarialExcelenteSíAlto★★☆☆☆
LocalAITodo-en-uno (texto+imagen+audio)SíSíMedio★★★☆☆

Resumen: empieza con Ollama. Cuando tengas 10+ usuarios o necesites rendimiento, migra a vLLM. Si necesitas imagen + audio + texto, LocalAI.

Interfaces: Open WebUI, Jan, LM Studio

Open WebUI: interfaz web multi-usuario. Login, RAG integrado, gestión de modelos, historial, compartir chats. La mejor opción para equipos. Tutorial de instalación.

Jan: app de escritorio. Descargar, instalar, usar. Sin servidor, sin configuración. Ideal para uso personal en tu Mac/PC.

LM Studio: similar a Jan. Mejor UI, servidor local integrado. Popular entre developers.

LobeChat: alternativa a Open WebUI con soporte multi-proveedor (Ollama + APIs cloud en una interfaz).

Cuantización: Q4 vs Q8 vs FP16

La cuantización reduce el tamaño del modelo comprimiendo los pesos. Menos VRAM, algo menos de calidad:

FormatoVRAM relativaCalidad relativaVelocidadCuándo usarlo
Q4_K_M~25% del FP1690-95%Más rápidoGPU limitada, muchos usuarios, uso general
Q5_K_M~30% del FP1693-97%RápidoEquilibrio óptimo si la VRAM lo permite
Q8_0~50% del FP1697-99%MedioMáxima calidad sin FP16, VRAM suficiente
FP16100% (referencia)100%Más lentoEvaluación, tareas críticas, VRAM sobrada

Recomendación práctica: Q4_K_M para la mayoría. Q5_K_M si puedes. FP16 solo si tienes A100/H100 y necesitas máxima precisión.

Breakeven: cuándo self-hosted supera a cloud

UsuariosChatGPT Team/mesHetzner AX42 (8B CPU)Hetzner GEX44 (20B GPU)Ahorro anual (vs ChatGPT)
125 USD (23 EUR)44 EUR184 EURCloud más barato
375 USD (69 EUR)44 EUR184 EUR300 EUR (AX42)
5125 USD (115 EUR)44 EUR184 EUR852 EUR (AX42)
10250 USD (230 EUR)44 EUR184 EUR2.232 EUR (AX42) / 552 EUR (GEX44)
20500 USD (460 EUR)44 EUR184 EUR4.992 EUR (AX42) / 3.312 EUR (GEX44)
501.250 USD (1.150 EUR)69 EUR184 EUR12.972 EUR (AX52) / 11.592 EUR (GEX44)

Punto de breakeven: con 3 usuarios self-hosted ya ahorra dinero (si usas CPU inference). Con GPU, el breakeven está en 8-10 usuarios. A partir de 20 usuarios, el ahorro es enorme.

El trade-off que nadie menciona

Self-hosted ahorra dinero pero requiere tiempo de administración: instalación (2-4 horas la primera vez), actualizaciones (1 hora/mes), troubleshooting ocasional. Si valoras tu hora a 50 EUR, añade ~50 EUR/mes de "coste oculto". Aun así, con 10+ usuarios sigue siendo más barato.

Seguridad y RGPD

Self-hosted no es automáticamente seguro. Necesitas:

RGPD: con servidor en Alemania (Hetzner, Contabo) o Francia (OVH, Scaleway), los datos están en territorio UE. No necesitas DPA con terceros porque tú eres el responsable. Documenta el tratamiento en tu registro de actividades.

7 errores al montar tu IA

  1. Elegir modelo demasiado grande. Un 7B bien configurado supera a un 70B mal cuantizado con poca VRAM. Empieza pequeño.
  2. Ignorar la cuantización. Q4_K_M da 90-95% de la calidad con 25% de la VRAM. No uses FP16 si no tienes A100.
  3. Exponer Ollama a internet. Puerto 11434 sin autenticación = cualquiera usa tu GPU. Siempre detrás de proxy con auth.
  4. No medir el throughput real. Benchmarks teóricos mienten. Prueba con tus prompts reales y mide tokens/segundo.
  5. Comprar GPU consumer para producción 24/7. RTX 4090 funciona pero no está diseñada para uso continuo. Servidores dedicados con garantía son mejores.
  6. Olvidar los backups. La configuración de Open WebUI, los chats, los modelos custom. Todo puede desaparecer sin backup.
  7. No planificar la concurrencia. 10 usuarios simultáneos necesitan más VRAM (KV caché) y benefician de vLLM sobre Ollama.

3 recetas listas para copiar

Receta 1: IA personal por 44 EUR/mes

Hetzner AX42 (44 EUR/mes) + Ollama + Open WebUI + Llama 3.1 8B Q4

Para: 1-3 usuarios. CPU inference a 10-15 tok/s. Instalación en 30 minutos. Tutorial de instalación.

# SSH a tu servidor Hetzner
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.1:8b-instruct-q4_K_M

# Open WebUI con Docker
docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

# Reverse proxy con Caddy (TLS automatico)
# Caddyfile: ia.tudominio.com { reverse_proxy localhost:3000 }

Receta 2: IA de equipo por 184 EUR/mes

Hetzner GEX44 (184 EUR/mes) + Ollama + Open WebUI + Qwen 2.5 14B Q8

Para: 5-15 usuarios. GPU inference a 30-50 tok/s. Modelo potente con GPU dedicada.

Receta 3: IA de empresa por 392 EUR/mes

Hetzner GEX130 (~392 EUR/mes) + vLLM + Open WebUI + Llama 3.1 70B Q4

Para: 15-50+ usuarios. Continuous batching con vLLM. Modelo nivel GPT-4 class. Producción seria.

Monto mi propia IA, paso a paso

Recibe tutoriales prácticos para montar y mantener tu IA privada: servidores, modelos, rendimiento, seguridad. Solo contenido técnico útil.

Sin spam. Cancelar cuando quieras.

Tu especialización desde 19 EUR

19 itinerarios prácticos. Founding Members: acceso sin caducidad al contenido adquirido + canal directo con el creador. Solo 50 plazas.

Ver Founding Members

Founding Members: todo por 99 EUR

614 módulos, 23 especializaciones, acceso sin caducidad al contenido adquirido. Precio normal: 199 EUR. Reembolso según Términos.

Ser Founding Member — 99 EUR Ver todos los planes

📚 Aprende más en el curso

Este artículo complementa el Módulo M12: Arquitectura de sistemas. Incluye vídeo, quiz, flashcards con repaso espaciado y proyecto práctico.

Ir al módulo M12 Repasar con FSRS