En este artículo
- Qué es CanIRun.ai
- En números: 104 modelos, 284 GPUs
- Cómo funciona paso a paso
- Todas las funcionalidades
- Tier List: sistema de puntuación S-F
- Tabla VRAM: qué modelo cabe en tu GPU
- Los 104 modelos: categorías y recomendaciones
- Apple Silicon: memoria unificada explicada
- Cuantización: Q4 vs Q8 vs FP16
- Playground: IA directa en tu navegador
- Comparador de dispositivos
- Cómo ejecutar: Ollama, LM Studio, runai
- CanIRun.ai vs alternativas
- 5 casos de uso reales
- Limitaciones y qué no hace
- Siguiente paso: de "puede correr" a "está corriendo"
Quieres ejecutar IA en tu equipo, pero no tienes claro si tu hardware aguanta. A lo mejor tienes un portátil con 16 GB de RAM, una RTX 4060 o un Mac M4, y te ronda la misma pregunta de siempre: ¿qué modelos puedo mover? ¿A qué velocidad? ¿Llama 3.3 70B cabe en mi GPU o me quedo corto de VRAM?
Yo he pasado por eso. Antes de probar cada modelo había que buscar specs, calcular VRAM a mano, leer hilos de Reddit para saber si alguien con tu misma GPU lo había conseguido. CanIRun.ai elimina todo ese trabajo: detecta tu hardware desde el navegador, lo cruza contra 104 modelos y 284 dispositivos, y te da una nota de la S a la F. Sin instalar nada, sin registro, completamente gratis.
En esta guía te cuento cómo funciona, cómo leer los resultados, los requisitos reales de VRAM por modelo, el playground que ejecuta IA directamente en tu navegador, y lo más importante: cómo pasar del "puede correr" al "está corriendo" con Ollama o LM Studio.
¿Para quién es esta guía?
Profesionales que quieren probar IA local sin pagar cloud cada mes. Estudiantes con un portátil que quieren experimentar. Equipos IT que necesitan dimensionar hardware. Y cualquiera que se pregunte si su PC da para algo más que ChatGPT. Si no sabes qué es VRAM o cuantización, tranquilo: esta guía lo explica todo desde cero. Empieza gratis con los 3 primeros módulos.
Qué es CanIRun.ai
Piensa en CanIRun.ai como el "Can You Run It" de los videojuegos, pero para modelos de IA. Lo creó midudev y hace una cosa muy bien: detectar tu hardware y decirte qué modelos open-source puedes ejecutar en tu máquina.
Lo mejor es lo que no te pide. No instala nada. No necesita cuenta. No recopila datos. Abres la web, dejas que detecte tu GPU (o la eliges a mano entre 284 opciones), y en segundos tienes un ranking personalizado. Así de simple.
Cubre cuatro categorías de modelos:
- Chat/texto: Qwen, Llama, Gemma, DeepSeek, Mistral, Phi, GPT-OSS
- Código: modelos especializados en programación
- Generación de imagen: FLUX.2, HunyuanImage, Z-Image
- Generación de vídeo: Wan 2.1/2.2, LTX 2.3, HunyuanVideo
Los datos se alimentan de tres fuentes reales: llama.cpp, Ollama y LM Studio, las tres herramientas más usadas para ejecutar IA local.
En números
Cómo funciona paso a paso
Abre canirun.ai en tu navegador de escritorio
Necesitas un navegador moderno (Chrome, Firefox, Edge, Safari). La detección de hardware usa APIs del navegador como WebGL y WebGPU para identificar tu GPU.
Permite la detección automática (o selecciona tu dispositivo)
El navegador lee tu GPU, VRAM, CPU y RAM del sistema. Si la detección automática no funciona (VPN, navegadores con anti-fingerprinting), selecciona manualmente tu dispositivo entre las 284 opciones: RTX 4060, RTX 4070, RTX 4090, Apple M4, M4 Pro, M4 Max, RX 7900 XTX, Raspberry Pi 5, etc.
Revisa el ranking personalizado
CanIRun.ai cruza tu hardware contra su base de datos y muestra cada modelo con una nota de la S (corre perfecto) a la F (ni lo intentes). La nota se basa en tres factores: velocidad estimada, margen de memoria y calidad del modelo.
Elige un modelo y ejecutalo
Cada modelo incluye comandos listos para copiar: un comando runai (CLI propia), comandos Ollama, o instrucciones para LM Studio. Copia, pega en tu terminal, y en minutos tienes tu IA local funcionando.
Todas las funcionalidades
Detección de hardware
Lee GPU, VRAM, CPU y RAM desde el navegador. Soporta NVIDIA (RTX 3000/4000/5000), AMD (RX 7000), Apple Silicon (M1-M5), Intel Arc, e incluso Raspberry Pi. Si falla, selección manual entre 284 dispositivos.
Scoring S-F
Cada modelo recibe nota basada en velocidad estimada, margen de memoria y calidad. S = corre genial. A = corre bien. B = decente. C = va justo. D = apenas corre. F = demasiado pesado.
Tier List
Vista global de los 104 modelos ordenados por tier. Filtra por categoría (chat, código, imagen, vídeo), arquitectura (densa vs MoE), y tamaño. Útil para comparar modelos del mismo rango.
Comparador de dispositivos
Selecciona dos GPUs y compara lado a lado: cuántos modelos gana cada una, dónde empatan, dónde una aplasta a la otra. Ideal para decidir entre RTX 4070 y RTX 4090, o M4 Pro vs M4 Max.
Playground WebGPU
Ejecuta modelos directamente en el navegador usando WebGPU. Sin servidores, sin API keys. El modelo se descarga una vez, se cachea localmente, y funciona offline. Con sistema de prompts, temperatura, top-p y subida de archivos.
runai CLI
Herramienta de línea de comandos que selecciona automáticamente la cuantización óptima para tu hardware y descarga el modelo adecuado. Alternativa rápida a configurar Ollama manualmente.
Tier List: sistema de puntuación S-F
CanIRun.ai usa un sistema de seis niveles basado en cuantización Q4_K_M (la más común para uso local):
| Tier | Significado | Experiencia práctica | Qué esperar |
|---|---|---|---|
| S | Runs great | Rápido, fluido, sin problemas de memoria | 20+ tokens/segundo. Puedes usarlo como tu ChatGPT privado diario. |
| A | Runs well | Buena velocidad, algo de margen VRAM | 10-20 tok/s. Muy usable para trabajo real. Alguna pausa en prompts largos. |
| B | Decent | Funciona pero sin holgura | 5-10 tok/s. Respuestas notablemente más lentas. Usable para experimentar. |
| C | Tight fit | Cabe justo, velocidad baja | 2-5 tok/s. Se nota la espera. Puede hacer swap a RAM. Solo para pruebas. |
| D | Barely runs | Funciona técnicamente pero duele | 1-2 tok/s. Swap constante, tiempos de carga largos. No práctico. |
| F | Too heavy | No cabe en tu hardware | No intentes ejecutarlo. Out of memory. Necesitas más VRAM o RAM. |
Nota importante
Las puntuaciones son estimaciones basadas en Q4_K_M. Tus resultados reales pueden variar según otros procesos en tu equipo, la versión del driver, el contexto del prompt, y si usas la GPU para otras cosas al mismo tiempo (como un monitor 4K o un juego).
Tabla VRAM: qué modelo cabe en tu GPU
Esta es la tabla de referencia. La VRAM indicada es para cuantización Q4_K_M (la que usa CanIRun.ai por defecto):
| VRAM disponible | Modelos que caben (Q4) | GPUs ejemplo | Caso de uso |
|---|---|---|---|
| 4 GB | Qwen 3 0.6B, SmolLM2 1.7B, Gemma 3 1B | GTX 1650, Raspberry Pi 5 8GB | Aprender, experimentar, chatbot básico |
| 8 GB | Llama 3.2 3B, Qwen 3 4B, Phi-4 Mini 3.8B, Gemma 3 4B, Mistral Small 3.2 3B | RTX 4060, M1/M2 base | Asistente personal, tareas sencillas, resúmenes |
| 12 GB | Llama 3.1 8B, Qwen 3.5 9B, Mistral Nemo 12B, Phi-4 14B, Gemma 3 12B | RTX 4070, RTX 3060 12GB | Programación, análisis, producción ligera |
| 16 GB | Qwen 3 14B, Gemma 3 27B, Codestral 25B, FLUX.2 Klein 4B | RTX 4060 Ti 16GB, M4 Pro | Trabajo profesional diario, generación de imágenes básica |
| 24 GB | Qwen 3 32B, Llama 3.3 70B (Q2), Wan 2.1 T2V, FLUX.2 Dev | RTX 4090, M4 Max 36GB | Modelos potentes, vídeo AI, producción seria |
| 32-48 GB | Llama 3.3 70B (Q4), DeepSeek R1 distill 70B, FLUX.2 Dev 32B | RTX 5090 32GB, M4 Max 64GB, A6000 | Modelos grandes, MoE medianos, imagen alta calidad |
| 64 GB+ | DeepSeek V4 (MoE), Qwen 3.8 (MoE), Kimi K3 | Multi-GPU, servidores, M4 Ultra 192GB | Modelos frontier, investigación, producción enterprise |
Regla rápida para estimar VRAM (Q4)
Parámetros en miles de millones x 0.5 = GB de VRAM aproximada. Un modelo de 8B necesita ~4 GB. Uno de 70B necesita ~35-40 GB. Los modelos MoE (Mixture of Experts) cargan todos los expertos en memoria aunque solo activen una fracción, así que no te fies del número de "parámetros activos" para estimar VRAM.
Los 104 modelos: categorías y recomendaciones
Chat y texto (lo que más vas a usar)
La mayoría de la gente busca esto: un modelo de chat que funcione como asistente personal. Aquí van mis recomendaciones por rango de VRAM, basadas en lo que he probado y lo que veo funcionar bien:
- 8 GB de VRAM: Qwen 3 4B o Phi-4 Mini 3.8B. Para tareas básicas, resúmenes, preguntas del día a día. El Qwen 3 destaca en multilingüe (español incluido).
- 12 GB: Qwen 3.5 9B. Para mí, el mejor modelo de su rango ahora mismo. Alternativa: Llama 3.1 8B (más ecosistema) o Gemma 3 12B (bueno razonando).
- 16 GB: Gemma 3 27B o Qwen 3 14B. Salto importante en calidad respecto a los de 8-12B.
- 24 GB: Qwen 3 32B. Rival serio de modelos comerciales en muchas tareas.
- 48 GB+: Llama 3.3 70B. El modelo open-source denso más capaz. Rival de GPT-4o en varias benchmarks.
Código
Para programación, los modelos especializados superan a los generalistas:
- 12 GB: Codestral Mamba o Qwen 2.5 Coder 7B.
- 16-24 GB: Codestral 25B. Excelente para completar código, refactoring, y generar tests.
Generación de imagen
- 16 GB: FLUX.2 Klein 4B. Calidad decente, bastante rápido.
- 24 GB: FLUX.2 Dev 12B. Calidad notablemente mejor.
- 32 GB+: FLUX.2 Dev 32B. Rival de DALL-E 3 y Midjourney en calidad.
Generación de vídeo
Los modelos de vídeo son los más exigentes en VRAM:
- 24 GB: Wan 2.1 T2V (texto a vídeo), LTX 2.3. Clips cortos (2-5 segundos).
- 32 GB+: HunyuanVideo, MiniMax H3. Videos más largos y mejor calidad.
Modelos MoE (Mixture of Experts)
Aquí hay que ir con cuidado. Los MoE tienen muchos parámetros totales pero solo activan una fracción en cada inferencia. DeepSeek V4, por ejemplo, tiene 600B+ parámetros pero solo activa ~37B. Suena genial, ¿no? El problema es que todos los expertos se cargan en memoria, activos o no. La VRAM que necesitas es proporcional al tamaño total, no al activo.
Trampa común con MoE
Si ves que un modelo dice "2.4T parámetros, 95B activos", no pienses que necesitas VRAM para 95B. Necesitas VRAM para 2.4T (aunque cuantizados). Los MoE grandes (Qwen 3.8 2.4T, Kimi K3 2.8T) necesitan cientos de GB incluso en Q4. Solo servidores multi-GPU o Apple Silicon con mucha RAM unificada.
Apple Silicon: memoria unificada explicada
Los Mac con Apple Silicon (M1, M2, M3, M4, M5) tienen una ventaja única para IA local: memoria unificada. CPU y GPU comparten la misma RAM, lo que significa que toda la memoria del sistema está disponible como VRAM.
| Chip | RAM típica | Modelos que caben (Q4) | Tokens/segundo estimado |
|---|---|---|---|
| M1/M2 base | 8-16 GB | Hasta 8-12B | 8-15 tok/s |
| M3/M4 base | 16-24 GB | Hasta 14-27B | 10-20 tok/s |
| M4 Pro | 24-48 GB | Hasta 32B cómodamente | 15-25 tok/s |
| M4 Max | 36-128 GB | Hasta 70B en Q4 | 15-30 tok/s |
| M4 Ultra | 192 GB+ | MoE medianos-grandes | 20-40 tok/s |
La limitación de Apple Silicon es el ancho de banda de memoria. Un RTX 4090 tiene ~1 TB/s de ancho de banda. Un M4 Max tiene ~546 GB/s. Un M4 base tiene ~120 GB/s. Más ancho de banda = más tokens por segundo. El modelo cabe, pero la velocidad depende del bandwidth.
CanIRun.ai tiene en cuenta esta diferencia: un mismo modelo puede tener nota S en un RTX 4090 (rápido) y nota B en un M4 base (cabe pero lento).
Cuantización: Q4 vs Q8 vs FP16
Si hay una técnica que ha democratizado la IA local, es esta. La cuantización comprime los pesos de un modelo reduciendo la precisión numérica. Dicho de otra forma: convierte un modelo que necesitaría 140 GB en uno que cabe en 35 GB, con una pérdida de calidad que en la práctica casi no notas.
| Formato | Bits/peso | VRAM vs FP16 | Pérdida de calidad | Cuándo usar |
|---|---|---|---|---|
| Q2_K | 2 bits | ~12% | 15-25%, notable | Cuando no hay otra opción. Última frontera. |
| Q3_K_M | 3 bits | ~19% | 10-15% | Modelos grandes en GPUs pequeñas. |
| Q4_K_M | 4 bits | ~25% | 5-10% | El estándar. CanIRun.ai usa este por defecto. Mejor ratio calidad/tamaño. |
| Q5_K | 5 bits | ~31% | 3-5% | Cuando tienes algo más de VRAM y quieres mejor calidad. |
| Q6_K | 6 bits | ~38% | 1-3% | Muy cercano a FP16 en calidad. |
| Q8_0 | 8 bits | ~50% | <1% | Indistinguible de FP16 en la mayoría de tareas. |
| FP16 | 16 bits | 100% | 0% (referencia) | Máxima calidad. Solo si tienes VRAM de sobra. |
Formato GGUF: es el formato estándar para modelos cuantizados. Lo usan llama.cpp, Ollama y LM Studio. CanIRun.ai recomienda modelos en GGUF porque es compatible con las tres herramientas principales.
Recomendación práctica
Si tienes la VRAM justa, usa Q4_K_M. Si te sobra un 20-30% de VRAM, sube a Q6_K o Q8_0. La diferencia entre Q4 y Q8 es sutil en conversación general, pero se nota en tareas de precisión como código o matemáticas. Para el 90% de los usuarios, Q4_K_M es el sweet spot.
Playground: IA directa en tu navegador
Esto me voló la cabeza la primera vez que lo vi: puedes ejecutar modelos de IA directamente en el navegador, sin instalar absolutamente nada. ¿Cómo? WebGPU.
Cómo funciona
Usa WebGPU, la API moderna de los navegadores que da acceso directo a tu GPU. El modelo se descarga una vez, se cachea en el navegador, y después funciona completamente offline. Tus conversaciones se guardan localmente y persisten entre sesiones.
Qué puedes hacer
- Chatear con modelos pequeños (optimizados para navegador)
- Ajustar system prompt, temperatura, max tokens, top-p
- Subir archivos (imágenes, PDFs, texto) para análisis
- Todo 100% privado: nada sale de tu dispositivo
Limitaciones del Playground
- Solo modelos pequeños (optimizados para WebGPU, generalmente 1-4B)
- Necesita navegador compatible con WebGPU (Chrome 113+, Edge 113+)
- Más lento que ejecutar vía Ollama/LM Studio (WebGPU tiene overhead)
- La primera descarga puede ser lenta (varios GB)
El Playground es genial para una primera toma de contacto. Si te gusta lo que ves, el salto a Ollama o LM Studio merece la pena: más modelos, más velocidad, y puedes integrarlo con otras herramientas.
Comparador de dispositivos
La función /compare te deja enfrentar dos GPUs o dispositivos y ver exactamente en qué modelos gana cada uno.
Casos de uso típicos
- "Tengo RTX 4070 12GB y estoy pensando en comprar la RTX 4090 24GB. ¿Cuántos modelos más me desbloquea?" El comparador te lo dice exactamente: X modelos gana la 4090, Y empatan, Z gana la 4070 (cero, pero lo muestra).
- "M4 Pro vs M4 Max, ¿vale los 400 EUR extra?" Depende de si necesitas modelos de 70B o no. El comparador te muestra el corte exacto.
- "Mi RTX 3060 vs una RTX 4060, ¿merece el upgrade?" Misma VRAM (12GB), así que la diferencia es velocidad, no compatibilidad. El comparador lo refleja en los tokens/segundo.
Cómo ejecutar: de CanIRun.ai a tu terminal
CanIRun.ai te dice qué puedes ejecutar. Estas tres herramientas lo ejecutan realmente:
Ollama
- Instalación en un comando
- CLI intuitiva:
ollama run llama3.1 - API compatible con OpenAI
- Perfecto para 1-10 usuarios
- Mac, Linux, Windows
- Gratis, open-source
LM Studio
- Interfaz gráfica completa
- Descarga modelos con un clic
- Chat integrado con historial
- Comparación de modelos A/B
- Servidor local con API
- Gratis para uso personal
runai (CLI)
- CLI del propio CanIRun.ai
- Detecta tu hardware y elige cuantización
- Un comando para todo
- Usa GGUF vía llama.cpp
- Ideal para terminal-first
- Gratis, open-source
Ejemplo práctico: de cero a chatear en 5 minutos
# 1. Instala Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 2. Ejecuta un modelo (Qwen 3.5 9B, necesita 8 GB VRAM)
ollama run qwen3.5:9b
# 3. Ya estas chateando. Escribe tu pregunta y pulsa Enter.
# Para salir: /bye
# 1. Descarga Ollama desde ollama.com e instala
# 2. Abre PowerShell
ollama run qwen3.5:9b
# 3. Mismo resultado. Chatea y sal con /bye
# Instala runai (CLI de CanIRun.ai)
# Detecta tu hardware y elige el mejor modelo+cuantización automáticamente
npx runai
CanIRun.ai vs alternativas
| Herramienta | Qué hace | Base de datos | Coste | Diferencia clave |
|---|---|---|---|---|
| CanIRun.ai | Detecta hardware + recomienda modelos + playground | 104 modelos, 284 GPUs | Gratis | Todo en uno: detección, ranking, playground, comparador, tier list |
| Can You Run It (CYRI) | Requisitos de videojuegos | Solo juegos | Gratis | No soporta modelos de IA |
| Ollama Model Library | Lista modelos disponibles en Ollama | ~200 modelos | Gratis | No detecta tu hardware ni te dice si puedes ejecutarlo |
| LM Studio Discover | Busca modelos GGUF en Hugging Face | Miles | Gratis | Filtra por VRAM pero requiere instalar la app |
| GPU Benchmark sites | Benchmarks de GPU para gaming/workstation | GPUs | Varios | Orientados a gaming, no a inferencia de LLM |
En resumen: a día de hoy no conozco otra herramienta que junte detección de hardware, recomendación de modelos IA y ejecución en navegador en un solo sitio gratuito.
5 casos de uso reales
La teoría está bien, pero lo que más ayuda es ver cómo lo usa gente real. Estos son cinco perfiles que veo constantemente en la comunidad:
1. El profesional con portátil de empresa
Situación: Portátil Dell con RTX 4060 8GB, Windows 11. Quiere un asistente privado para redactar emails, resumir documentos, y preparar presentaciones sin que los datos pasen por OpenAI.
CanIRun.ai dice: Qwen 3 4B (tier S), Phi-4 Mini 3.8B (tier S), Llama 3.2 3B (tier S). Modelos de 8B: tier B-C.
Acción: Instala LM Studio, descarga Qwen 3 4B Q4_K_M, y tiene un asistente privado que corre fluido a 20+ tok/s.
2. El estudiante con Mac M4
Situación: MacBook Air M4 con 16 GB. Quiere experimentar con IA para proyectos de la universidad.
CanIRun.ai dice: Modelos hasta 12B son tier A-S. Gemma 3 27B: tier C (cabe pero lento).
Acción: ollama run qwen3.5:9b y tiene un modelo excelente para estudiar, programar, y resolver dudas sin coste mensual.
3. La PYME que quiere IA sin cloud
Situación: Consultora con 15 empleados. Datos sensibles de clientes. No pueden usar ChatGPT por compliance. Presupuesto limitado.
CanIRun.ai dice: Para un servidor con RTX 4090 (24 GB), Qwen 3 32B es tier A. Para 15 usuarios simultáneos necesitan algo más: dos RTX 4090 o un servidor con A6000.
Acción: Compran servidor Hetzner con GPU (~180 EUR/mes), instalan Ollama + Open WebUI, y tienen ChatGPT privado para toda la oficina.
4. El creador de contenido
Situación: Creador de YouTube con RTX 4090. Quiere generar thumbnails con IA y editar vídeo con modelos locales.
CanIRun.ai dice: FLUX.2 Dev 12B (tier A) para imágenes. Wan 2.1 T2V (tier B) para vídeo corto.
Acción: Instala ComfyUI para FLUX.2, genera thumbnails en 30 segundos sin suscripción a Midjourney.
5. El equipo de desarrollo
Situación: 4 desarrolladores que quieren autocompletado de código local (tipo GitHub Copilot pero privado).
CanIRun.ai dice: Codestral 25B en una RTX 4090 (tier A). Qwen 2.5 Coder 7B en RTX 4060 (tier S).
Acción: Montan Ollama en un servidor compartido + extensión Continue.dev en VS Code. Copilot privado sin coste por usuario.
Limitaciones y qué no hace
Sería injusto no mencionar lo que no hace. Ninguna herramienta es perfecta, y conocer los límites te ahorra frustraciones:
- Estimaciones, no benchmarks: La detección de hardware usa APIs del navegador que no siempre son precisas. Un driver desactualizado, una GPU compartida, o un navegador con anti-fingerprinting pueden dar datos incorrectos.
- Solo modelos open-weight: No cubre GPT-4o, Claude, Gemini Pro ni ningún modelo cerrado. Solo modelos que puedes descargar y ejecutar localmente.
- Solo escritorio: No funciona en móviles. La detección de hardware necesita APIs de escritorio.
- No mide tu red: Para modelos que requieren descarga de decenas de GB, tu conexión importa. CanIRun.ai no la mide.
- MoE = memoria total: Los modelos Mixture of Experts cargan todos los expertos en memoria aunque activen pocos. CanIRun.ai lo tiene en cuenta, pero muchos usuarios se confunden con los "parámetros activos".
- No cubre multi-GPU: Si tienes dos RTX 4090, CanIRun.ai no calcula la VRAM combinada. Solo mide un dispositivo.
- Velocidad real variable: Los tok/s dependen de muchos factores: otros procesos, temperatura de la GPU, contexto del prompt, versión del driver. Las estimaciones son orientativas.
Siguiente paso: de "puede correr" a "está corriendo"
Ya sabes qué puedes ejecutar. Ahora toca hacerlo. CanIRun.ai resuelve la primera pregunta, pero montar tu IA local tiene más pasos. Aquí van tres rutas según el tiempo que quieras invertir:
Ruta rápida (10 minutos)
- Ve a canirun.ai y detecta tu hardware
- Identifica tu mejor modelo (tier S o A)
- Instala Ollama o LM Studio
- Ejecuta el modelo:
ollama run [nombre-modelo] - Chatea. Privacidad total, coste cero.
Ruta profesional (1 hora)
- Detecta tu hardware en CanIRun.ai
- Compara modelos con la tier list y el comparador de dispositivos
- Instala Ollama + Open WebUI para tener interfaz gráfica tipo ChatGPT
- Configura un modelo para chat y otro para código
- Conecta VS Code con Continue.dev para autocompletado de código
Ruta empresa (medio día)
- Usa CanIRun.ai para dimensionar el hardware necesario
- Lee nuestra guía de servidores para IA para elegir proveedor
- Monta servidor con Ollama/vLLM + Open WebUI
- Configura acceso para el equipo (autenticación, logs)
- Privacidad total, RGPD nativo, sin dependencia de terceros
Artículos relacionados en IAcademy
Glosario rápido
| Término | Qué significa |
|---|---|
| VRAM | Vídeo RAM. Memoria de tu GPU. Los modelos se cargan aquí. Más VRAM = modelos más grandes. |
| GGUF | Formato de archivo para modelos cuantizados. El estándar para IA local (llama.cpp, Ollama, LM Studio). |
| Cuantización | Técnica para comprimir un modelo reduciendo la precisión de sus pesos. Q4 = 4 bits por peso. |
| Parámetros (B) | Tamaño del modelo en miles de millones de parámetros. 7B = 7 mil millones. Más parámetros = más capaz pero más VRAM. |
| Tokens/segundo | Velocidad de generación de texto. 20+ tok/s = fluido. 5-10 = usable. <5 = lento. |
| MoE | Mixture of Experts. Modelo con muchos "expertos" pero solo activa algunos por consulta. Eficiente en compute, costoso en memoria. |
| Dense | Modelo clásico que usa todos sus parámetros en cada inferencia. VRAM = proporcional a parámetros totales. |
| WebGPU | API del navegador que da acceso directo a tu GPU. Permite ejecutar modelos sin instalar software. |
| Memoria unificada | Arquitectura de Apple Silicon donde CPU y GPU comparten la misma RAM. Toda la RAM sirve como VRAM. |
| Bandwidth | Ancho de banda de memoria. Determina cuántos datos puede leer la GPU por segundo. Más bandwidth = más tok/s. |
| Context window | Cuánto texto puede procesar el modelo de una vez. 4K, 8K, 32K, 128K tokens. Más contexto = más VRAM necesaria. |
| Inferencia | El proceso de generar respuestas con un modelo. No es entrenamiento; solo "usar" el modelo. |
Tu especialización desde 19 EUR
19 itinerarios prácticos. Founding Members: acceso sin caducidad al contenido adquirido + canal directo con el creador. Solo 50 plazas.
Ver Founding MembersFounding Members: todo por 99 EUR
614 módulos, 23 especializaciones, acceso sin caducidad al contenido adquirido. Precio normal: 199 EUR. Reembolso según Términos.
Aprende más en el curso
Este artículo complementa el Módulo M12: Arquitectura de sistemas. Incluye vídeo, quiz, flashcards con repaso espaciado y proyecto práctico.