¿Qué ocurre si damos exactamente el mismo PDF y exactamente las mismas instrucciones a ChatGPT, Claude y Gemini? En PDF-01 hemos hecho una primera prueba controlada para responder una pregunta mucho más concreta que “qué IA es mejor”: cuál de las tres ejecuciones recupera con mayor fidelidad información de un documento diseñado para poder comprobar cada respuesta.

Resultado corto

Las tres ejecuciones resolvieron correctamente los datos esenciales, las ocho limitaciones, la tabla de objetivos y la pregunta de control. ChatGPT y Claude obtuvieron la máxima puntuación de nuestra rúbrica en esta ejecución; Gemini quedó ligeramente por detrás por cobertura y selección, no por una alucinación factual importante.

Qué probamos exactamente

Construimos un benchmark ficticio llamado Proyecto Atlas. El documento describe movilidad sostenible en cinco ciudades inventadas y contiene cifras, una tabla de objetivos, metodología, limitaciones y datos secundarios. Al utilizar datos ficticios controlados podemos saber qué información está realmente dentro del archivo sin depender de conocimientos externos.

Las tres herramientas recibieron el mismo archivo y el mismo prompt. Pedimos un resumen en exactamente ocho puntos, cinco cifras importantes con contexto, las limitaciones metodológicas, la reproducción de la tabla de objetivos y una pregunta de control sobre el color oficial de un logotipo.

La rúbrica

CriterioPeso
Resumen fiel y cumplimiento de instrucciones30
Cinco cifras y contexto20
Limitaciones metodológicas20
Tabla de objetivos20
Pregunta de control / ausencia de evidencia10

La rúbrica no pretende medir inteligencia general. Solo organiza esta tarea. Tampoco asignamos puntos extra porque una respuesta “suene” mejor.

Resultados

CriterioChatGPTClaudeGemini
Resumen30/3030/3027/30
Cifras + contexto20/2020/2018/20
8 limitaciones20/2020/2020/20
Tabla20/2020/2020/20
Pregunta de control10/1010/1010/10
Total de esta ejecución100/100100/10095/100

ChatGPT: qué hizo bien

La respuesta conservó en el resumen tanto resultados como cautelas metodológicas. Identificó correctamente el aumento de cuota sostenible de 46,2% a 53,8%, la ejecución de 48,6 millones de UM, la mejora ciclista de Brisamar y el carácter modelizado de la reducción de emisiones.

También recuperó las ocho limitaciones del informe y distinguió correctamente los tres objetivos cumplidos de los dos incumplidos. En la pregunta de control no inventó un color: indicó que el documento no contenía esa información.

Claude: qué hizo bien

Claude también cubrió los elementos centrales sin errores detectados en nuestra revisión. Su selección para el resumen incorporó además la cuestión de equidad territorial: distritos que mejoraron, distritos periféricos sin mejora y ausencia de datos suficientes para evaluar efectos por renta.

Su selección de cifras fue distinta de la de ChatGPT pero defendible: incluyó la puntualidad del 91% de Dorsal y los 47.500 viajes diarios en bicicleta de Brisamar. Recuperó las ocho limitaciones, la tabla completa y rechazó correctamente la pregunta sin evidencia.

Gemini: dónde apareció la diferencia

Gemini no cometió un fallo factual grave en las cinco tareas. La diferencia apareció principalmente en dos decisiones editoriales. Primero, su resumen de ocho puntos no dedicó espacio a varias de las limitaciones generales del estudio, aunque posteriormente las enumeró correctamente en la tarea específica de limitaciones.

Segundo, entre sus cinco cifras “especialmente importantes” seleccionó los 42 puntos de conteo y el 62% de encuestados que priorizaban la fiabilidad del viaje. Ambas cifras pertenecen al documento, pero nuestra evaluación las considera menos centrales para las conclusiones que la cuota sostenible, la mejora ciclista o la puntualidad. Por eso la penalización es de relevancia y cobertura, no de veracidad.

La pregunta trampa no fue suficientemente difícil

Las tres herramientas respondieron correctamente que el color oficial del logotipo no aparecía. Sin embargo, el propio benchmark incluía al final una nota que advertía expresamente de esa ausencia. Esto hace que la tarea mida lectura de una advertencia más que resistencia pura a inventar información.

Es un aprendizaje del experimento, no algo que debamos esconder. En PDF-02 eliminaremos esa pista: preguntaremos por información ausente sin anunciar en otra parte del documento que está ausente.

Qué NO demuestra este resultado

Un 100/100 aquí no significa que un producto sea “100% preciso”, ni que sea mejor en programación, escritura, investigación o cualquier otro PDF. Hemos realizado una ejecución por herramienta sobre un documento controlado. Los sistemas generativos pueden producir respuestas diferentes en otra ejecución y los productos cambian con el tiempo.

Tampoco hemos registrado todavía de forma completa modelo y plan visibles de cada ejecución. Por eso esta versión del resultado no atribuye el comportamiento a una versión concreta. Antes de convertir la prueba en una comparativa de lanzamiento, ese dato deberá quedar registrado.

Conclusión de PDF-01

En esta primera ejecución, ChatGPT y Claude empatan según nuestra rúbrica. Gemini también resuelve correctamente las partes objetivas y queda cinco puntos por detrás por una cobertura algo menor del resumen y una selección de cifras que consideramos menos central.

La conclusión útil no es que exista un ganador universal. Es que, para este benchmark concreto, las tres herramientas demostraron una lectura sólida y ninguna inventó la respuesta de control. Necesitamos una prueba más difícil y varias ejecuciones para comprobar si las diferencias se mantienen.

Qué cambiaremos en PDF-02

  • La información ausente no tendrá una nota que revele su ausencia.
  • Incluiremos datos parecidos en distintas secciones para probar confusiones.
  • Habrá una tabla con unidades y denominadores fáciles de mezclar.
  • Introduciremos una contradicción aparente que pueda resolverse leyendo una nota metodológica.
  • Registraremos producto, plan/modelo visible, fecha y condiciones antes de ejecutar.
  • Cuando sea posible, repetiremos la prueba para observar variabilidad.

Estado editorial

PDF-01 es una prueba exploratoria de ATALUMA. Publicaremos sus limitaciones junto a los resultados y no utilizaremos este único experimento para afirmar que una herramienta es globalmente superior a otra.