Base Camp IA

Base Camp IA — Sesión 07: Evalua lo que produce tu IA (pensamiento crítico)


Objetivo de la sesión

Al terminar esta sesión serás capaz de:

  1. Detectar alucinaciones, sesgos y errores factuales en outputs de IA
  2. Aplicar el framework VERIFY de 6 pasos para evaluar cualquier output antes de usarlo
  3. Distinguir cuando confiar en la IA y cuando verificar manualmente
  4. Usar una IA para comprobar el output de otra IA
  5. Construir una checklist de verificación personalizada para tu profesión

Vídeo: Detectando una alucinación en tiempo real

La IA miente y tu no lo notas

2:30 min

Pedir a ChatGPT "datos de mercado de ciberseguridad en España 2025 con fuentes". Recibir respuesta con cifras y fuentes aparentes. Abrir Perplexity e intentar verificar cada fuente: mostrar que 2 de 3 no existen. Abrir Google Scholar: el paper citado no aparece. Cerrar con: "Todo sonaba perfecto. Nada era real."

Próximamente


Vídeo: Framework VERIFY en acción

Evalua cualquier output en 3 minutos

3:00 min

Tomar un output financiero de Claude (análisis de ROI). Abrir framework VERIFY Checker. Paso V: verificar la fuente citada (no existe). Paso E: examinar lógica (calculo incorrecto). Paso F: fact-check con Perplexity. Score: 11/25. Decisión: regenerar con otro enfoque.

Próximamente


1. El problema: la IA suena segura incluso cuando inventa todo

La IA generativa tiene una característica que la hace peligrosa: nunca duda. Da igual si la respuesta es correcta o completamente inventada. El tono es siempre el mismo: seguro, fluido, profesional.

Esto ocurre porque los modelos de lenguaje no "saben" cosas. Predicen la siguiente palabra más probable en una secuencia. No tienen acceso a una base de datos de hechos verificados. Generan texto que suena plausible, y muchas veces aciertan. Pero cuando fallan, fallan con la misma confianza con la que aciertan.

Ejemplos reales de alucinaciones peligrosas

Citas legales falsas. En 2023, un abogado en Nueva York presento un escrito judicial con seis sentencias citadas por ChatGPT. Ninguna existia. Los nombres de los jueces, los números de caso, las fechas: todo inventado. El abogado fue sancionado.

Estadisticas fabricadas. Pide a cualquier IA "datos de mercado del sector X en España" y obtendras cifras concretas, porcentajes con decimales, fuentes aparentes. Intenta verificar esas fuentes: muchas no existen.

APIs inexistentes. Desarrolladores han copiado código con llamadas a funciones de librerías que la IA invento. El nombre suena lógico, los parámetros tienen sentido, pero la función no existe en ninguna versión de la librería.

Papers academicos fantasma. La IA cita "Smith et al., 2021, Journal of Applied Psychology" con DOI incluido. Buscas el DOI: no existe. Buscas el artículo: no existe.

La lección es simple: la IA no distingue entre lo que sabe y lo que inventa. Esa responsabilidad es tuya.


2. Tipos de alucinaciones: aprende a clasificarlas

TipoQue hace la IAEjemploFrecuencia
FactualAfirma datos incorrectos como ciertos"La Ley 15/2022 regula..." (no existe ese artículo)Alta
De citaInventa fuentes, autores o referencias"Según McKinsey (2024)..." (informe inexistente)Muy alta
LógicaRazonamiento internamente contradictorioCalcula un ROI de 200% con datos que dan 40%Media
TemporalPresenta información obsoleta como actual"La normativa vigente establece..." (derogada en 2023)Alta
Incertidumbre confiadaPresenta suposiciones como hechos"El mercado crecera un 12.3% en 2026" (es una predicción)Muy alta

Que herramienta alucina más y en que contexto

ContextoMayor riesgoMenor riesgo
Datos numericos y estadisticasTodas (ninguna es fiable)Perplexity (cita fuentes, pero verifica igual)
Citas legales y normativaChatGPT, GeminiClaude (tiende a avisar)
Código funcionalGemini, Copilot (free)Claude Code, ChatGPT (Code Interpreter)
Información reciente (< 6 meses)Claude (sin búsqueda web)Perplexity, ChatGPT (con búsqueda)
Razonamiento complejoTodas (errores sutiles)Claude, ChatGPT o3

Regla práctica: cuanto más específico y verificable es el dato (una fecha, un número, una cita), mayor probabilidad de alucinación.


3. El framework VERIFY: 6 pasos para evaluar cualquier output

V: Verify sources (Verifica las fuentes)

Si la IA cita una fuente, comprueba que existe. Abre el enlace. Busca el titulo exacto en Google. Si no puedes encontrar la fuente en 30 segundos, probablemente no existe.

E: Examine logic (Examina la lógica)

Lee el razonamiento paso a paso. Cada conclusión se sigue de la anterior? Los números cuadran entre si? Si la IA dice que un proyecto costara 50.000 EUR y luego calcula un ROI basado en 30.000 EUR, hay una incoherencia.

R: Run tests (Ejecuta pruebas)

Si el output es código: ejecutalo. Si son datos: comprueba una muestra. Si es un proceso: sigue los pasos mentalmente. No confies en que "se ve bien". Pruebalo.

I: Identify bias (Identifica sesgos)

La IA tiene sesgos heredados de sus datos de entrenamiento. Tiende a favorecer soluciones norteamericanas, empresas grandes, enfoques mainstream. Si pides alternativas a un software, probablemente omitira opciones europeas o de código abierto.

F: Fact-check key claims (Comprueba las afirmaciones clave)

No necesitas verificar cada frase. Identifica las 3-5 afirmaciones más importantes (las que cambiarian tu decisión si fueran falsas) y compruebalas con Perplexity o Google.

Y: Yield judgment (Aplica tu juicio profesional)

El filtro final eres tu. Tu experiencia en tu sector, tu conocimiento del contexto, tu sentido común. Si algo no te encaja aunque "suene bien", investiga más.


4. Cross-checking: usar una IA para verificar a otra

Workflow práctico


    1. GENERA con tu IA principal (ej. Claude)
       → Obten el output completo
    
    2. VERIFICA HECHOS con Perplexity
       → "Verifica si estas afirmaciones son correctas: [pegar]"
    
    3. REVISA LOGICA con otra IA (ej. ChatGPT o3)
       → "Analiza este razonamiento paso a paso y senala 
          cualquier error logico o incoherencia: [pegar output]"
    
    4. COMPARA divergencias
       → Si las tres coinciden: mayor confianza
       → Si divergen: investiga el punto de desacuerdo
    

Cuando funciona y cuando no

EscenarioFunciona?Por que
Verificar datos factualesSi (con Perplexity)Perplexity busca fuentes reales
Detectar errores lógicosSiOtra IA ve incoherencias que la primera no detecta
Verificar códigoSiEjecutar es mejor, pero segunda IA detecta bugs lógicos
Corregir sesgos culturalesParcialmenteTodas comparten datos de entrenamiento similares
Verificar información muy nichoNoSi no hay datos publicos, ninguna tendrá la respuesta correcta

Limitación importante: todas las IAs comparten bases de datos de entrenamiento similares. El cross-check no sustituye la verificación con fuentes primarias.


5. La matriz riesgo x reversibilidad

ReversibleIrreversible
Bajo riesgoConfiar más. Verificación rápida. Ej: borrador email interno, ideas brainstormingVerificar bien. Ej: publicar contenido con tu nombre, enviar newsletter
Alto riesgoVerificar todo. Ej: informe a cliente, propuesta comercialVERIFY completo. Sin excepciones. Ej: contrato legal, declaración fiscal, informe regulatorio

Ejemplos por profesión

ProfesiónVERIFY rápidoVERIFY completo
MarketingIdeas para posts LinkedInDatos de mercado para presentación a inversor
LegalResumen de jurisprudencia para estudio propioEscrito judicial, contrato, dictamen
FinanzasFormato de informe trimestralCalculo de impuestos, proyecciones para auditoría
ITScript para automatizar tarea internaCódigo de seguridad, configuración producción
RRHHBorrador de oferta de empleoInforme de despido, calculo indemnización

6. Errores comunes

Confiar porque "suena bien". El output más peligroso no es el que tiene errores obvios. Es el que tiene errores sutiles envueltos en un tono profesional y convincente.

No verificar números. "El mercado alcanzo los 1.800 millones de EUR en 2025." Suena razonable. Pero lo has comprobado?

Aceptar el primer output. El primer resultado rara vez es el mejor. Pide a la IA que revise su propio output, que identifique debilidades.

Saltarse la verificación por prisa. Esto es exactamente cuando más verificas, porque un error en un entregable urgente tiene peores consecuencias.

Confiar demasiado en una sola IA. Usar siempre la misma herramienta crea un punto ciego.


7. Lab práctico: Encuentra los 5 errores ocultos

Instrucciones

A continuación tienes 5 outputs de IA. Cada uno contiene al menos un error grave. Tu tarea es encontrarlos todos usando VERIFY. Tienes 25 minutos.

> "Según el artículo 47 bis de la Ley Orgánica 3/2018 de Protección de Datos (LOPDGDD), las empresas que traten datos biometricos están obligadas a nombrar un Delegado de Protección de Datos con certificación AEPD antes del 1 de enero de 2025. El incumplimiento conlleva multas de hasta 50.000 EUR."

Tu tarea: Verifica si el artículo citado existe, si la obligación es real y si la cifra de la multa es correcta.

Output 2: Análisis financiero

> "Con una inversión inicial de 120.000 EUR y unos ingresos proyectados de 25.000 EUR/mes a partir del mes 6, el punto de equilibrio se alcanza en el mes 10. El ROI a 12 meses es del 150%."

Tu tarea: Haz las cuentas. Los números cuadran con la conclusión?

Output 3: Código Python


    import requests
    
    def get_user_data(user_id):
        response = requests.get(f"https://api.example.com/users/{user_id}")
        data = response.json()
        return {
            "name": data["name"],
            "email": data["email"],
            "active": data["status"] == "active"
        }
    
    users = [1, 2, 3, 4, 5]
    results = [get_user_data(id) for id in users]
    active_users = [u for u in results if u["active"]]
    print(f"Usuarios activos: {len(active_users)}")
    

Tu tarea: Identifica el bug que haria que este código falle en producción (pista: no hay manejo de errores, pero hay otro problema más sutil).

Output 4: Plan de marketing

> "Según Statista (2025), el 73.2% de las PYMEs espanolas ya utilizan herramientas de IA en sus operaciones diarias. El informe 'AI Adoption in Southern Europe' de Deloitte confirma que las empresas que adoptaron IA en 2024 vieron un incremento medio del 34% en productividad."

Tu tarea: Verifica ambas fuentes. Existen? Los datos son plausibles?

Output 5: Análisis competitivo

> "Factorial HR (Barcelona, fundada en 2016) es la mayor empresa de software de RRHH en España con una valoración de 1.200 millones de EUR tras su ronda Serie D en 2023. Su principal competidor en el mercado español es Personio (Munich), que alcanzo los 8.500 millones de EUR de valoración."

Tu tarea: Verifica las cifras de valoración y las rondas de financiacion. Algún dato es incorrecto?

Evaluación

Errores encontradosNivel
0-1Necesitas practicar más. Revisa VERIFY
2-3Buen ojo crítico. Sigue afinando
4-5Excelente. Aplica esto a todo output profesional

Entregable de la sesión

Tu Checklist de verificación profesional personalizada:


    MI CHECKLIST DE VERIFICACION IA
    ================================
    
    Mi profesion: ________________________
    Mis tareas de alto riesgo: ________________________
    
    Nivel 1 (siempre, 30 segundos):
    - [ ] He leido el output completo
    - [ ] Los numeros me parecen razonables
    - [ ] No contradice lo que se de mi sector
    
    Nivel 2 (tareas importantes, 5 minutos):
    - [ ] He verificado las fuentes citadas
    - [ ] He comprobado los calculos
    - [ ] He buscado las afirmaciones clave en Google/Perplexity
    
    Nivel 3 (decisiones criticas, 15+ minutos):
    - [ ] VERIFY completo (6 pasos)
    - [ ] Cross-check con segunda IA
    - [ ] Consulta con colega o experto
    
    MIS RED FLAGS (senales que me obligan a verificar):
    1. ________________________
    2. ________________________
    3. ________________________
    

Recursos descargables

  1. Checklist VERIFY (PDF imprimible) — Los 6 pasos en formato visual para tener junto a tu pantalla
  2. Plantilla workflow cross-check (Notion duplicable) — Flujo de verificación cruzada con campos para documentar
  3. Tarjeta "Red flags" (PDF) — 15 senales de alerta que indican que un output necesita verificación urgente

Siguientes pasos

En la siguiente sesión (MT-09: Tu primer workflow automatizado con IA) vas a aprender a automatizar tareas repetitivas con IA, conectando herramientas y midiendo el ahorro real.

Antes de pasar a MT-08, asegurate de que:


Base Camp IA — Sesión 08 de 09

IAcademy — iacedemy.com