Por qué hicimos una segunda prueba
PDF-01 mostró una lectura documental muy sólida, pero su pregunta de control era demasiado fácil de verificar porque el propio documento avisaba expresamente de que el dato no existía. PDF-02 corrige ese defecto. El benchmark Horizonte 2026 contiene seis campus ficticios y obliga a distinguir cifras redondeadas de valores no redondeados, metodología provisional de metodología final, porcentajes de puntos porcentuales y datos agregados de resultados individuales.
Condiciones registradas
| Producto | Plan/modelo registrado | Condición |
|---|---|---|
| ChatGPT | Plus · modelo exacto no registrado | Mismo PDF y prompt |
| Claude | Sonnet 5 | Mismo PDF y prompt |
| Gemini | Flash | Mismo PDF y prompt |
No atribuimos a ChatGPT un modelo concreto porque no quedó registrado durante la ejecución. Preferimos conservar un dato incompleto antes que rellenarlo por inferencia.
Qué tenían que resolver
La prueba exigía un resumen en ocho puntos con limitaciones, clasificar seis campus según su objetivo eléctrico, comprobar una cifra agregada contra los resultados individuales, explicar un cambio de 72% a 81% en dos formas matemáticamente distintas y responder a una pregunta sobre un consumo de gas natural que no estaba en el documento.
Resultados PDF-02
| Criterio | ChatGPT Plus | Claude Sonnet 5 | Gemini Flash |
|---|---|---|---|
| Resumen + instrucciones | 20/20 | 20/20 | 20/20 |
| Campus eléctricos | 25/25 | 25/25 | 25/25 |
| Contradicción 4/6 vs 3/6 | 25/25 | 25/25 | 25/25 |
| 9 pp vs 12,5% relativo | 15/15 | 15/15 | 15/15 |
| Dato de gas inexistente | 15/15 | 15/15 | 15/15 |
| Total | 100/100 | 100/100 | 100/100 |
La trampa principal: 4 de 6 no cuadraba
El informe afirmaba en una tabla agregada que cuatro de seis campus cumplían el objetivo eléctrico. Sin embargo, al aplicar las reglas finales campus por campus solo cumplían Boreal, Ebro y Lumen: tres de seis. Delta no cumplía con la metodología final; Faro quedaba en -7,96% frente a un objetivo de -8,00%; y Nadir tampoco alcanzaba su objetivo.
Las tres respuestas detectaron la discrepancia y, crucialmente, ninguna inventó una explicación que el documento no proporcionaba. Señalar una contradicción sin “repararla” mediante una suposición era parte central de la prueba.
Redondear podía cambiar la respuesta
Faro aparecía como -8,0% en la tabla, aparentemente igual a su objetivo. El valor no redondeado era -7,96%, insuficiente para alcanzar -8,00%. Lumen mostraba -6,0%, pero su valor real era -6,04%, suficiente para superar un objetivo de -6,00%. Los tres productos utilizaron correctamente los valores no redondeados.
Metodología provisional frente a final
Delta había sido clasificado inicialmente como objetivo alcanzado en un tablero operativo que aplicaba un ajuste climatológico provisional. El informe explicaba después que ese ajuste fue retirado. Las tres herramientas priorizaron correctamente la metodología final y clasificaron Delta como incumplimiento.
9 puntos porcentuales no son un aumento relativo del 9%
Pasar del 72% al 81% supone +9 puntos porcentuales. Medido relativamente respecto al 72% inicial, el aumento es 12,5%. Las tres respuestas distinguieron correctamente ambas magnitudes y explicaron por qué decir simplemente “subió un 9%” puede inducir a error.
La pregunta sin respuesta
Preguntamos por el consumo de gas natural de Lumen en 2026 expresado en MWh. El benchmark no proporcionaba ese dato y, a diferencia de PDF-01, no había una nota específica revelando la respuesta. ChatGPT, Claude y Gemini indicaron que la información no estaba disponible y no fabricaron una cifra.
Resultado acumulado de las dos pruebas
| Prueba | ChatGPT | Claude | Gemini |
|---|---|---|---|
| PDF-01 | 100 | 100 | 95 |
| PDF-02 | 100 | 100 | 100 |
El 95 de Gemini en PDF-01 se debió a cobertura y selección de información según nuestra rúbrica, no a un error factual importante. Por eso no sumamos las puntuaciones para proclamar un “ganador general”. Dos benchmarks pequeños no justifican esa conclusión.
Qué hemos aprendido
Las tres herramientas han sido muy fuertes en estas tareas de lectura controlada. Aumentar artificialmente la dificultad de PDFs hasta conseguir que alguna falle introduciría un sesgo poco útil. El siguiente experimento de ATALUMA debe medir otra capacidad: por ejemplo extracción estructurada, seguimiento de instrucciones, comparación entre varios documentos o transformación de datos.
Limitaciones del experimento
Solo tenemos una ejecución por producto en PDF-02. Los sistemas generativos pueden variar entre ejecuciones. Los productos y modelos también cambian con el tiempo. Además, los documentos fueron diseñados por ATALUMA y no representan toda la variedad de PDFs reales: escaneados, diseños complejos, gráficos, anexos extensos o archivos con cientos de páginas.
Por ello, la conclusión correcta es limitada: en esta ejecución concreta de PDF-02, los tres productos resolvieron correctamente todos los criterios definidos por nuestra rúbrica.
Siguiente prueba
El Laboratorio dejará de perseguir una “trampa más difícil” del mismo tipo. La siguiente prueba cambiará de habilidad para construir una evidencia más diversa y útil.