Un benchmark publicado por Vals AI el 29 de septiembre de 2026 puso a distintos modelos de inteligencia artificial a trabajar sobre una tarea concreta del mundo financiero: recibir instrucciones de un analista y construir un modelo financiero funcional en Excel, incluyendo estructura y fórmulas. Los tres primeros puestos correspondieron a versiones de Claude.
Claude Fable 5.1 obtuvo 76,7%, seguido por Claude Opus 5.5 con 75,9% y Claude Sonnet 5.5 con 75,7%. El modelo de OpenAI con la mayor puntuación dentro de la prueba fue GPT-5.6 Sol en configuración max, con 72,3%.
La diferencia máxima fue de 4,4 puntos porcentuales
La distancia entre el modelo mejor ubicado de Claude y la versión de OpenAI con mayor puntuación fue de 4,4 puntos porcentuales. Detrás de GPT-5.6 Sol aparecieron GPT-6 Astra con 71,7%, GPT-6 Sol con 71,5%, GPT-6 Luna con 68,5% y GPT-5.6 Luna con 67,1%.
Los resultados corresponden exclusivamente a las configuraciones incluidas en este benchmark y a la tarea específica de armar modelos financieros dentro de Excel. La comparación no buscó medir quién responde mejor consultas sobre empresas, mercados o conceptos económicos.
La prueba exige entregar una planilla que realmente funcione
El desafío no se limita a contestar preguntas o realizar cálculos aislados. Cada sistema recibe un brief similar al que podría manejar un analista y debe transformar esas instrucciones en una planilla organizada, con fórmulas y una estructura financiera utilizable.
Vals AI también advierte que variables como el acceso a herramientas y la capacidad de trabajar directamente con archivos pueden influir en el resultado final de este tipo de evaluaciones.
Claude también ganó espacio entre estudiantes de Economía
Otra medición incluida en el análisis mostró un cambio en las herramientas utilizadas por estudiantes de quinto año de Economía en una materia de Finanzas Internacionales. El 100% de los encuestados dijo utilizar inteligencia artificial para tareas académicas, mientras que 79% afirmó haberla empleado en casi todos sus trabajos prácticos y en el ensayo final.
Dentro de ese grupo, Claude fue señalado como herramienta preferida por 60%, seguido por Gemini con 23% y ChatGPT con 10%. La encuesta también registró cambios importantes en la utilización de estas plataformas respecto del año anterior.
El resultado se limita a una tarea financiera específica
La comparación no determina cuál sistema es superior para cualquier trabajo relacionado con finanzas. El dato central es que, en esta evaluación particular para crear modelos financieros en Excel, las tres versiones de Claude analizadas obtuvieron puntuaciones mayores que los modelos de OpenAI incluidos en la prueba.

