Experimentos propios con IA
Probamos ChatGPT, Claude y Gemini con tareas iguales, una metodología visible y resultados separados por experimento.
PDF-01 · Lectura documental básica
Qué medimos: capacidad para resumir un PDF, extraer cifras, reconocer limitaciones metodológicas y evitar inventar un dato que no aparece.
Resultado: ChatGPT 100/100 · Claude 100/100 · Gemini 95/100.
PDF-02 · Contradicciones, redondeos y metodología
Qué medimos: si el modelo detecta una contradicción interna, usa valores no redondeados, prioriza metodología final frente a provisional y distingue puntos porcentuales de porcentaje relativo.
Resultado: ChatGPT 100/100 · Claude 100/100 · Gemini 100/100.
EXP-03 · Extracción estructurada
Qué medimos: extracción exacta de datos, respeto por valores vigentes, campos ausentes, cálculos simples y seguimiento de un formato obligatorio.
Resultado: ChatGPT 100/100 · Claude 100/100 · Gemini 100/100.
Cómo interpretar estas pruebas
Usamos el mismo documento y las mismas instrucciones dentro de cada experimento.
Los criterios se fijan antes de evaluar las respuestas.
Una prueba concreta no demuestra cuál es la “mejor IA” para todo.