Resultado corto

ChatGPT Plus, Claude Sonnet 5 y Gemini Flash obtuvieron 100/100 con nuestra rúbrica de PDF-02. El empate solo describe esta ejecución y estas tareas; no demuestra equivalencia general entre los productos.

Por qué hicimos una segunda prueba

PDF-01 mostró una lectura documental muy sólida, pero su pregunta de control era demasiado fácil de verificar porque el propio documento avisaba expresamente de que el dato no existía. PDF-02 corrige ese defecto. El benchmark Horizonte 2026 contiene seis campus ficticios y obliga a distinguir cifras redondeadas de valores no redondeados, metodología provisional de metodología final, porcentajes de puntos porcentuales y datos agregados de resultados individuales.

Condiciones registradas

ProductoPlan/modelo registradoCondición
ChatGPTPlus · modelo exacto no registradoMismo PDF y prompt
ClaudeSonnet 5Mismo PDF y prompt
GeminiFlashMismo PDF y prompt

No atribuimos a ChatGPT un modelo concreto porque no quedó registrado durante la ejecución. Preferimos conservar un dato incompleto antes que rellenarlo por inferencia.

Qué tenían que resolver

La prueba exigía un resumen en ocho puntos con limitaciones, clasificar seis campus según su objetivo eléctrico, comprobar una cifra agregada contra los resultados individuales, explicar un cambio de 72% a 81% en dos formas matemáticamente distintas y responder a una pregunta sobre un consumo de gas natural que no estaba en el documento.

Resultados PDF-02

CriterioChatGPT PlusClaude Sonnet 5Gemini Flash
Resumen + instrucciones20/2020/2020/20
Campus eléctricos25/2525/2525/25
Contradicción 4/6 vs 3/625/2525/2525/25
9 pp vs 12,5% relativo15/1515/1515/15
Dato de gas inexistente15/1515/1515/15
Total100/100100/100100/100

La trampa principal: 4 de 6 no cuadraba

El informe afirmaba en una tabla agregada que cuatro de seis campus cumplían el objetivo eléctrico. Sin embargo, al aplicar las reglas finales campus por campus solo cumplían Boreal, Ebro y Lumen: tres de seis. Delta no cumplía con la metodología final; Faro quedaba en -7,96% frente a un objetivo de -8,00%; y Nadir tampoco alcanzaba su objetivo.

Las tres respuestas detectaron la discrepancia y, crucialmente, ninguna inventó una explicación que el documento no proporcionaba. Señalar una contradicción sin “repararla” mediante una suposición era parte central de la prueba.

Redondear podía cambiar la respuesta

Faro aparecía como -8,0% en la tabla, aparentemente igual a su objetivo. El valor no redondeado era -7,96%, insuficiente para alcanzar -8,00%. Lumen mostraba -6,0%, pero su valor real era -6,04%, suficiente para superar un objetivo de -6,00%. Los tres productos utilizaron correctamente los valores no redondeados.

Metodología provisional frente a final

Delta había sido clasificado inicialmente como objetivo alcanzado en un tablero operativo que aplicaba un ajuste climatológico provisional. El informe explicaba después que ese ajuste fue retirado. Las tres herramientas priorizaron correctamente la metodología final y clasificaron Delta como incumplimiento.

9 puntos porcentuales no son un aumento relativo del 9%

Pasar del 72% al 81% supone +9 puntos porcentuales. Medido relativamente respecto al 72% inicial, el aumento es 12,5%. Las tres respuestas distinguieron correctamente ambas magnitudes y explicaron por qué decir simplemente “subió un 9%” puede inducir a error.

La pregunta sin respuesta

Preguntamos por el consumo de gas natural de Lumen en 2026 expresado en MWh. El benchmark no proporcionaba ese dato y, a diferencia de PDF-01, no había una nota específica revelando la respuesta. ChatGPT, Claude y Gemini indicaron que la información no estaba disponible y no fabricaron una cifra.

Resultado acumulado de las dos pruebas

PruebaChatGPTClaudeGemini
PDF-0110010095
PDF-02100100100

El 95 de Gemini en PDF-01 se debió a cobertura y selección de información según nuestra rúbrica, no a un error factual importante. Por eso no sumamos las puntuaciones para proclamar un “ganador general”. Dos benchmarks pequeños no justifican esa conclusión.

Qué hemos aprendido

Las tres herramientas han sido muy fuertes en estas tareas de lectura controlada. Aumentar artificialmente la dificultad de PDFs hasta conseguir que alguna falle introduciría un sesgo poco útil. El siguiente experimento de ATALUMA debe medir otra capacidad: por ejemplo extracción estructurada, seguimiento de instrucciones, comparación entre varios documentos o transformación de datos.

Limitaciones del experimento

Solo tenemos una ejecución por producto en PDF-02. Los sistemas generativos pueden variar entre ejecuciones. Los productos y modelos también cambian con el tiempo. Además, los documentos fueron diseñados por ATALUMA y no representan toda la variedad de PDFs reales: escaneados, diseños complejos, gráficos, anexos extensos o archivos con cientos de páginas.

Por ello, la conclusión correcta es limitada: en esta ejecución concreta de PDF-02, los tres productos resolvieron correctamente todos los criterios definidos por nuestra rúbrica.

Siguiente prueba

El Laboratorio dejará de perseguir una “trampa más difícil” del mismo tipo. La siguiente prueba cambiará de habilidad para construir una evidencia más diversa y útil.