Can I Run AI: guía completa para saber que modelos de IA corren en tu PC

Por David Moya · · 35 min lectura · Actualizado mensualmente

En este artículo

  1. Qué es CanIRun.ai
  2. En números: 104 modelos, 284 GPUs
  3. Cómo funciona paso a paso
  4. Todas las funcionalidades
  5. Tier List: sistema de puntuación S-F
  6. Tabla VRAM: qué modelo cabe en tu GPU
  7. Los 104 modelos: categorías y recomendaciones
  8. Apple Silicon: memoria unificada explicada
  9. Cuantización: Q4 vs Q8 vs FP16
  10. Playground: IA directa en tu navegador
  11. Comparador de dispositivos
  12. Cómo ejecutar: Ollama, LM Studio, runai
  13. CanIRun.ai vs alternativas
  14. 5 casos de uso reales
  15. Limitaciones y qué no hace
  16. Siguiente paso: de "puede correr" a "está corriendo"

Quieres ejecutar IA en tu equipo, pero no tienes claro si tu hardware aguanta. A lo mejor tienes un portátil con 16 GB de RAM, una RTX 4060 o un Mac M4, y te ronda la misma pregunta de siempre: ¿qué modelos puedo mover? ¿A qué velocidad? ¿Llama 3.3 70B cabe en mi GPU o me quedo corto de VRAM?

Yo he pasado por eso. Antes de probar cada modelo había que buscar specs, calcular VRAM a mano, leer hilos de Reddit para saber si alguien con tu misma GPU lo había conseguido. CanIRun.ai elimina todo ese trabajo: detecta tu hardware desde el navegador, lo cruza contra 104 modelos y 284 dispositivos, y te da una nota de la S a la F. Sin instalar nada, sin registro, completamente gratis.

En esta guía te cuento cómo funciona, cómo leer los resultados, los requisitos reales de VRAM por modelo, el playground que ejecuta IA directamente en tu navegador, y lo más importante: cómo pasar del "puede correr" al "está corriendo" con Ollama o LM Studio.

¿Para quién es esta guía?

Profesionales que quieren probar IA local sin pagar cloud cada mes. Estudiantes con un portátil que quieren experimentar. Equipos IT que necesitan dimensionar hardware. Y cualquiera que se pregunte si su PC da para algo más que ChatGPT. Si no sabes qué es VRAM o cuantización, tranquilo: esta guía lo explica todo desde cero. Empieza gratis con los 3 primeros módulos.

Qué es CanIRun.ai

Piensa en CanIRun.ai como el "Can You Run It" de los videojuegos, pero para modelos de IA. Lo creó midudev y hace una cosa muy bien: detectar tu hardware y decirte qué modelos open-source puedes ejecutar en tu máquina.

Lo mejor es lo que no te pide. No instala nada. No necesita cuenta. No recopila datos. Abres la web, dejas que detecte tu GPU (o la eliges a mano entre 284 opciones), y en segundos tienes un ranking personalizado. Así de simple.

Cubre cuatro categorías de modelos:

Los datos se alimentan de tres fuentes reales: llama.cpp, Ollama y LM Studio, las tres herramientas más usadas para ejecutar IA local.

En números

104
modelos catalogados
284
dispositivos soportados
22
laboratorios de IA
0 EUR
coste total
0.6B-2.8T
rango de parámetros
S a F
sistema de puntuación

Cómo funciona paso a paso

1

Abre canirun.ai en tu navegador de escritorio

Necesitas un navegador moderno (Chrome, Firefox, Edge, Safari). La detección de hardware usa APIs del navegador como WebGL y WebGPU para identificar tu GPU.

2

Permite la detección automática (o selecciona tu dispositivo)

El navegador lee tu GPU, VRAM, CPU y RAM del sistema. Si la detección automática no funciona (VPN, navegadores con anti-fingerprinting), selecciona manualmente tu dispositivo entre las 284 opciones: RTX 4060, RTX 4070, RTX 4090, Apple M4, M4 Pro, M4 Max, RX 7900 XTX, Raspberry Pi 5, etc.

3

Revisa el ranking personalizado

CanIRun.ai cruza tu hardware contra su base de datos y muestra cada modelo con una nota de la S (corre perfecto) a la F (ni lo intentes). La nota se basa en tres factores: velocidad estimada, margen de memoria y calidad del modelo.

4

Elige un modelo y ejecutalo

Cada modelo incluye comandos listos para copiar: un comando runai (CLI propia), comandos Ollama, o instrucciones para LM Studio. Copia, pega en tu terminal, y en minutos tienes tu IA local funcionando.

Todas las funcionalidades

Detección de hardware

Lee GPU, VRAM, CPU y RAM desde el navegador. Soporta NVIDIA (RTX 3000/4000/5000), AMD (RX 7000), Apple Silicon (M1-M5), Intel Arc, e incluso Raspberry Pi. Si falla, selección manual entre 284 dispositivos.

Scoring S-F

Cada modelo recibe nota basada en velocidad estimada, margen de memoria y calidad. S = corre genial. A = corre bien. B = decente. C = va justo. D = apenas corre. F = demasiado pesado.

Tier List

Vista global de los 104 modelos ordenados por tier. Filtra por categoría (chat, código, imagen, vídeo), arquitectura (densa vs MoE), y tamaño. Útil para comparar modelos del mismo rango.

Comparador de dispositivos

Selecciona dos GPUs y compara lado a lado: cuántos modelos gana cada una, dónde empatan, dónde una aplasta a la otra. Ideal para decidir entre RTX 4070 y RTX 4090, o M4 Pro vs M4 Max.

Playground WebGPU

Ejecuta modelos directamente en el navegador usando WebGPU. Sin servidores, sin API keys. El modelo se descarga una vez, se cachea localmente, y funciona offline. Con sistema de prompts, temperatura, top-p y subida de archivos.

runai CLI

Herramienta de línea de comandos que selecciona automáticamente la cuantización óptima para tu hardware y descarga el modelo adecuado. Alternativa rápida a configurar Ollama manualmente.

Tier List: sistema de puntuación S-F

CanIRun.ai usa un sistema de seis niveles basado en cuantización Q4_K_M (la más común para uso local):

TierSignificadoExperiencia prácticaQué esperar
SRuns greatRápido, fluido, sin problemas de memoria20+ tokens/segundo. Puedes usarlo como tu ChatGPT privado diario.
ARuns wellBuena velocidad, algo de margen VRAM10-20 tok/s. Muy usable para trabajo real. Alguna pausa en prompts largos.
BDecentFunciona pero sin holgura5-10 tok/s. Respuestas notablemente más lentas. Usable para experimentar.
CTight fitCabe justo, velocidad baja2-5 tok/s. Se nota la espera. Puede hacer swap a RAM. Solo para pruebas.
DBarely runsFunciona técnicamente pero duele1-2 tok/s. Swap constante, tiempos de carga largos. No práctico.
FToo heavyNo cabe en tu hardwareNo intentes ejecutarlo. Out of memory. Necesitas más VRAM o RAM.

Nota importante

Las puntuaciones son estimaciones basadas en Q4_K_M. Tus resultados reales pueden variar según otros procesos en tu equipo, la versión del driver, el contexto del prompt, y si usas la GPU para otras cosas al mismo tiempo (como un monitor 4K o un juego).

Tabla VRAM: qué modelo cabe en tu GPU

Esta es la tabla de referencia. La VRAM indicada es para cuantización Q4_K_M (la que usa CanIRun.ai por defecto):

VRAM disponibleModelos que caben (Q4)GPUs ejemploCaso de uso
4 GB Qwen 3 0.6B, SmolLM2 1.7B, Gemma 3 1B GTX 1650, Raspberry Pi 5 8GB Aprender, experimentar, chatbot básico
8 GB Llama 3.2 3B, Qwen 3 4B, Phi-4 Mini 3.8B, Gemma 3 4B, Mistral Small 3.2 3B RTX 4060, M1/M2 base Asistente personal, tareas sencillas, resúmenes
12 GB Llama 3.1 8B, Qwen 3.5 9B, Mistral Nemo 12B, Phi-4 14B, Gemma 3 12B RTX 4070, RTX 3060 12GB Programación, análisis, producción ligera
16 GB Qwen 3 14B, Gemma 3 27B, Codestral 25B, FLUX.2 Klein 4B RTX 4060 Ti 16GB, M4 Pro Trabajo profesional diario, generación de imágenes básica
24 GB Qwen 3 32B, Llama 3.3 70B (Q2), Wan 2.1 T2V, FLUX.2 Dev RTX 4090, M4 Max 36GB Modelos potentes, vídeo AI, producción seria
32-48 GB Llama 3.3 70B (Q4), DeepSeek R1 distill 70B, FLUX.2 Dev 32B RTX 5090 32GB, M4 Max 64GB, A6000 Modelos grandes, MoE medianos, imagen alta calidad
64 GB+ DeepSeek V4 (MoE), Qwen 3.8 (MoE), Kimi K3 Multi-GPU, servidores, M4 Ultra 192GB Modelos frontier, investigación, producción enterprise

Regla rápida para estimar VRAM (Q4)

Parámetros en miles de millones x 0.5 = GB de VRAM aproximada. Un modelo de 8B necesita ~4 GB. Uno de 70B necesita ~35-40 GB. Los modelos MoE (Mixture of Experts) cargan todos los expertos en memoria aunque solo activen una fracción, así que no te fies del número de "parámetros activos" para estimar VRAM.

Los 104 modelos: categorías y recomendaciones

Chat y texto (lo que más vas a usar)

La mayoría de la gente busca esto: un modelo de chat que funcione como asistente personal. Aquí van mis recomendaciones por rango de VRAM, basadas en lo que he probado y lo que veo funcionar bien:

Código

Para programación, los modelos especializados superan a los generalistas:

Generación de imagen

Generación de vídeo

Los modelos de vídeo son los más exigentes en VRAM:

Modelos MoE (Mixture of Experts)

Aquí hay que ir con cuidado. Los MoE tienen muchos parámetros totales pero solo activan una fracción en cada inferencia. DeepSeek V4, por ejemplo, tiene 600B+ parámetros pero solo activa ~37B. Suena genial, ¿no? El problema es que todos los expertos se cargan en memoria, activos o no. La VRAM que necesitas es proporcional al tamaño total, no al activo.

Trampa común con MoE

Si ves que un modelo dice "2.4T parámetros, 95B activos", no pienses que necesitas VRAM para 95B. Necesitas VRAM para 2.4T (aunque cuantizados). Los MoE grandes (Qwen 3.8 2.4T, Kimi K3 2.8T) necesitan cientos de GB incluso en Q4. Solo servidores multi-GPU o Apple Silicon con mucha RAM unificada.

Apple Silicon: memoria unificada explicada

Los Mac con Apple Silicon (M1, M2, M3, M4, M5) tienen una ventaja única para IA local: memoria unificada. CPU y GPU comparten la misma RAM, lo que significa que toda la memoria del sistema está disponible como VRAM.

ChipRAM típicaModelos que caben (Q4)Tokens/segundo estimado
M1/M2 base8-16 GBHasta 8-12B8-15 tok/s
M3/M4 base16-24 GBHasta 14-27B10-20 tok/s
M4 Pro24-48 GBHasta 32B cómodamente15-25 tok/s
M4 Max36-128 GBHasta 70B en Q415-30 tok/s
M4 Ultra192 GB+MoE medianos-grandes20-40 tok/s

La limitación de Apple Silicon es el ancho de banda de memoria. Un RTX 4090 tiene ~1 TB/s de ancho de banda. Un M4 Max tiene ~546 GB/s. Un M4 base tiene ~120 GB/s. Más ancho de banda = más tokens por segundo. El modelo cabe, pero la velocidad depende del bandwidth.

CanIRun.ai tiene en cuenta esta diferencia: un mismo modelo puede tener nota S en un RTX 4090 (rápido) y nota B en un M4 base (cabe pero lento).

Cuantización: Q4 vs Q8 vs FP16

Si hay una técnica que ha democratizado la IA local, es esta. La cuantización comprime los pesos de un modelo reduciendo la precisión numérica. Dicho de otra forma: convierte un modelo que necesitaría 140 GB en uno que cabe en 35 GB, con una pérdida de calidad que en la práctica casi no notas.

FormatoBits/pesoVRAM vs FP16Pérdida de calidadCuándo usar
Q2_K2 bits~12%15-25%, notableCuando no hay otra opción. Última frontera.
Q3_K_M3 bits~19%10-15%Modelos grandes en GPUs pequeñas.
Q4_K_M4 bits~25%5-10%El estándar. CanIRun.ai usa este por defecto. Mejor ratio calidad/tamaño.
Q5_K5 bits~31%3-5%Cuando tienes algo más de VRAM y quieres mejor calidad.
Q6_K6 bits~38%1-3%Muy cercano a FP16 en calidad.
Q8_08 bits~50%<1%Indistinguible de FP16 en la mayoría de tareas.
FP1616 bits100%0% (referencia)Máxima calidad. Solo si tienes VRAM de sobra.

Formato GGUF: es el formato estándar para modelos cuantizados. Lo usan llama.cpp, Ollama y LM Studio. CanIRun.ai recomienda modelos en GGUF porque es compatible con las tres herramientas principales.

Recomendación práctica

Si tienes la VRAM justa, usa Q4_K_M. Si te sobra un 20-30% de VRAM, sube a Q6_K o Q8_0. La diferencia entre Q4 y Q8 es sutil en conversación general, pero se nota en tareas de precisión como código o matemáticas. Para el 90% de los usuarios, Q4_K_M es el sweet spot.

Playground: IA directa en tu navegador

Esto me voló la cabeza la primera vez que lo vi: puedes ejecutar modelos de IA directamente en el navegador, sin instalar absolutamente nada. ¿Cómo? WebGPU.

Cómo funciona

Usa WebGPU, la API moderna de los navegadores que da acceso directo a tu GPU. El modelo se descarga una vez, se cachea en el navegador, y después funciona completamente offline. Tus conversaciones se guardan localmente y persisten entre sesiones.

Qué puedes hacer

Limitaciones del Playground

El Playground es genial para una primera toma de contacto. Si te gusta lo que ves, el salto a Ollama o LM Studio merece la pena: más modelos, más velocidad, y puedes integrarlo con otras herramientas.

Comparador de dispositivos

La función /compare te deja enfrentar dos GPUs o dispositivos y ver exactamente en qué modelos gana cada uno.

Casos de uso típicos

Cómo ejecutar: de CanIRun.ai a tu terminal

CanIRun.ai te dice qué puedes ejecutar. Estas tres herramientas lo ejecutan realmente:

Ollama

Lo más fácil
  • Instalación en un comando
  • CLI intuitiva: ollama run llama3.1
  • API compatible con OpenAI
  • Perfecto para 1-10 usuarios
  • Mac, Linux, Windows
  • Gratis, open-source

LM Studio

Lo más visual
  • Interfaz gráfica completa
  • Descarga modelos con un clic
  • Chat integrado con historial
  • Comparación de modelos A/B
  • Servidor local con API
  • Gratis para uso personal

runai (CLI)

Lo más automático
  • CLI del propio CanIRun.ai
  • Detecta tu hardware y elige cuantización
  • Un comando para todo
  • Usa GGUF vía llama.cpp
  • Ideal para terminal-first
  • Gratis, open-source

Ejemplo práctico: de cero a chatear en 5 minutos

Terminal (Mac/Linux) # 1. Instala Ollama curl -fsSL https://ollama.com/install.sh | sh # 2. Ejecuta un modelo (Qwen 3.5 9B, necesita 8 GB VRAM) ollama run qwen3.5:9b # 3. Ya estas chateando. Escribe tu pregunta y pulsa Enter. # Para salir: /bye
Terminal (Windows) # 1. Descarga Ollama desde ollama.com e instala # 2. Abre PowerShell ollama run qwen3.5:9b # 3. Mismo resultado. Chatea y sal con /bye
Con runai # Instala runai (CLI de CanIRun.ai) # Detecta tu hardware y elige el mejor modelo+cuantización automáticamente npx runai

CanIRun.ai vs alternativas

HerramientaQué haceBase de datosCosteDiferencia clave
CanIRun.ai Detecta hardware + recomienda modelos + playground 104 modelos, 284 GPUs Gratis Todo en uno: detección, ranking, playground, comparador, tier list
Can You Run It (CYRI) Requisitos de videojuegos Solo juegos Gratis No soporta modelos de IA
Ollama Model Library Lista modelos disponibles en Ollama ~200 modelos Gratis No detecta tu hardware ni te dice si puedes ejecutarlo
LM Studio Discover Busca modelos GGUF en Hugging Face Miles Gratis Filtra por VRAM pero requiere instalar la app
GPU Benchmark sites Benchmarks de GPU para gaming/workstation GPUs Varios Orientados a gaming, no a inferencia de LLM

En resumen: a día de hoy no conozco otra herramienta que junte detección de hardware, recomendación de modelos IA y ejecución en navegador en un solo sitio gratuito.

5 casos de uso reales

La teoría está bien, pero lo que más ayuda es ver cómo lo usa gente real. Estos son cinco perfiles que veo constantemente en la comunidad:

1. El profesional con portátil de empresa

Situación: Portátil Dell con RTX 4060 8GB, Windows 11. Quiere un asistente privado para redactar emails, resumir documentos, y preparar presentaciones sin que los datos pasen por OpenAI.

CanIRun.ai dice: Qwen 3 4B (tier S), Phi-4 Mini 3.8B (tier S), Llama 3.2 3B (tier S). Modelos de 8B: tier B-C.

Acción: Instala LM Studio, descarga Qwen 3 4B Q4_K_M, y tiene un asistente privado que corre fluido a 20+ tok/s.

2. El estudiante con Mac M4

Situación: MacBook Air M4 con 16 GB. Quiere experimentar con IA para proyectos de la universidad.

CanIRun.ai dice: Modelos hasta 12B son tier A-S. Gemma 3 27B: tier C (cabe pero lento).

Acción: ollama run qwen3.5:9b y tiene un modelo excelente para estudiar, programar, y resolver dudas sin coste mensual.

3. La PYME que quiere IA sin cloud

Situación: Consultora con 15 empleados. Datos sensibles de clientes. No pueden usar ChatGPT por compliance. Presupuesto limitado.

CanIRun.ai dice: Para un servidor con RTX 4090 (24 GB), Qwen 3 32B es tier A. Para 15 usuarios simultáneos necesitan algo más: dos RTX 4090 o un servidor con A6000.

Acción: Compran servidor Hetzner con GPU (~180 EUR/mes), instalan Ollama + Open WebUI, y tienen ChatGPT privado para toda la oficina.

4. El creador de contenido

Situación: Creador de YouTube con RTX 4090. Quiere generar thumbnails con IA y editar vídeo con modelos locales.

CanIRun.ai dice: FLUX.2 Dev 12B (tier A) para imágenes. Wan 2.1 T2V (tier B) para vídeo corto.

Acción: Instala ComfyUI para FLUX.2, genera thumbnails en 30 segundos sin suscripción a Midjourney.

5. El equipo de desarrollo

Situación: 4 desarrolladores que quieren autocompletado de código local (tipo GitHub Copilot pero privado).

CanIRun.ai dice: Codestral 25B en una RTX 4090 (tier A). Qwen 2.5 Coder 7B en RTX 4060 (tier S).

Acción: Montan Ollama en un servidor compartido + extensión Continue.dev en VS Code. Copilot privado sin coste por usuario.

Limitaciones y qué no hace

Sería injusto no mencionar lo que no hace. Ninguna herramienta es perfecta, y conocer los límites te ahorra frustraciones:

Siguiente paso: de "puede correr" a "está corriendo"

Ya sabes qué puedes ejecutar. Ahora toca hacerlo. CanIRun.ai resuelve la primera pregunta, pero montar tu IA local tiene más pasos. Aquí van tres rutas según el tiempo que quieras invertir:

Ruta rápida (10 minutos)

  1. Ve a canirun.ai y detecta tu hardware
  2. Identifica tu mejor modelo (tier S o A)
  3. Instala Ollama o LM Studio
  4. Ejecuta el modelo: ollama run [nombre-modelo]
  5. Chatea. Privacidad total, coste cero.

Ruta profesional (1 hora)

  1. Detecta tu hardware en CanIRun.ai
  2. Compara modelos con la tier list y el comparador de dispositivos
  3. Instala Ollama + Open WebUI para tener interfaz gráfica tipo ChatGPT
  4. Configura un modelo para chat y otro para código
  5. Conecta VS Code con Continue.dev para autocompletado de código

Ruta empresa (medio día)

  1. Usa CanIRun.ai para dimensionar el hardware necesario
  2. Lee nuestra guía de servidores para IA para elegir proveedor
  3. Monta servidor con Ollama/vLLM + Open WebUI
  4. Configura acceso para el equipo (autenticación, logs)
  5. Privacidad total, RGPD nativo, sin dependencia de terceros

Artículos relacionados en IAcademy

Glosario rápido

TérminoQué significa
VRAMVídeo RAM. Memoria de tu GPU. Los modelos se cargan aquí. Más VRAM = modelos más grandes.
GGUFFormato de archivo para modelos cuantizados. El estándar para IA local (llama.cpp, Ollama, LM Studio).
CuantizaciónTécnica para comprimir un modelo reduciendo la precisión de sus pesos. Q4 = 4 bits por peso.
Parámetros (B)Tamaño del modelo en miles de millones de parámetros. 7B = 7 mil millones. Más parámetros = más capaz pero más VRAM.
Tokens/segundoVelocidad de generación de texto. 20+ tok/s = fluido. 5-10 = usable. <5 = lento.
MoEMixture of Experts. Modelo con muchos "expertos" pero solo activa algunos por consulta. Eficiente en compute, costoso en memoria.
DenseModelo clásico que usa todos sus parámetros en cada inferencia. VRAM = proporcional a parámetros totales.
WebGPUAPI del navegador que da acceso directo a tu GPU. Permite ejecutar modelos sin instalar software.
Memoria unificadaArquitectura de Apple Silicon donde CPU y GPU comparten la misma RAM. Toda la RAM sirve como VRAM.
BandwidthAncho de banda de memoria. Determina cuántos datos puede leer la GPU por segundo. Más bandwidth = más tok/s.
Context windowCuánto texto puede procesar el modelo de una vez. 4K, 8K, 32K, 128K tokens. Más contexto = más VRAM necesaria.
InferenciaEl proceso de generar respuestas con un modelo. No es entrenamiento; solo "usar" el modelo.

Tu especialización desde 19 EUR

19 itinerarios prácticos. Founding Members: acceso sin caducidad al contenido adquirido + canal directo con el creador. Solo 50 plazas.

Ver Founding Members

Founding Members: todo por 99 EUR

614 módulos, 23 especializaciones, acceso sin caducidad al contenido adquirido. Precio normal: 199 EUR. Reembolso según Términos.

Ser Founding Member — 99 EUR Ver todos los planes

Aprende más en el curso

Este artículo complementa el Módulo M12: Arquitectura de sistemas. Incluye vídeo, quiz, flashcards con repaso espaciado y proyecto práctico.

Ir al módulo M12 Repasar con FSRS