Por @Alvy — 7 de Agosto de 2026

La lista de los más listos de la clase: el análisis de la «inteligencia» de las IA (y sus precios) en una sola página

Me topé con Artificial Analysis y me pareció interesante; luego por el pinganillo mi asesor en temas de IA me dijo que efectivamente es la mejor herramienta para comparar las capacidades y precios de las inteligencias artificiales hoy en día, así que tras haberla mirado un poco le voy a dar un gran pulgar arriba.

Comparar con criterio

¿Qué hace exactamente Artificial Analysis? Es una especie de laboratorio de pruebas (independiente) para comparar modelos de inteligencia artificial. Y es que con tantos GPT, Claude, Gemini, DeepSeek, Kimi y compañía, midiendo medir con los mismos criterios su inteligencia, velocidad, coste y otras capacidades no es cosa trivial.

Sus análisis se resumen en un Índice de Inteligencia que va por la 4.1.1 y combina 9 aspectos diferentes, desde la programación y el razonamiento científico hasta el conocimiento general y ciertas tareas con herramientas. En total tienen registrados nada menos que 595 modelos IA distintos.

La lista de los más listos de la clase: inteligencia vs. coste

Entre los que aparecen destacados no hay grandes sorpresas. Están Claude Opus 5, Claude Fable 5, GPT-5.6 Sol y Kimi K3. Pero ser «el más listo» no significa necesariamente ser el mejor. Usar la IA tiene un precio, que últimamente está subiendo tanto como la gasolina. Así que esta web compara también cuánto cuesta completar una tarea estándar. Porque casi nada de esto es gratis, así que… ¿cuál de los modelos es más rentable?

En cuestión de precios las diferencias son enormes: entre los modelos destacados, el coste medio va desde 0,03 dólares por tarea de DeepSeek V4 Flash 0731 hasta los 3,14 dólares para Claude Fable 5: literalmente 100 veces más. GPT-5.6 Sol, también popular, anda por los 1,23 dólares y Claude Opus 5, que solía ser mi favorito, unos 2,34 dólares.

Con estos datos la próxima vez que Claude o GPT te pidan que compres más créditos (en plan más vale pidil que robal) y andes con el ansiaviva y vayas a acabar aflojando la tarjeta… a lo mejor te lo piensas. De hecho yo he empezado a probar DeepSeek para código y me parece casi igual de hábil que versiones anteriores de Claude y GPT. Así que, ni tan mal: igual me acabo ahorrando algunos ahorrillos. P’al Netflix.

El que no corre vuela

Otro aspecto de las pruebas, que a mucha gente importa, es la velocidad de funcionamiento en tokens por segundo, así como el tiempo empleado por tarea, además del número de tokens que cada modelo necesita para resolver los problemas. Esto es ya más especializado y depende de si usas agentes de programación, edición de imágenes y vídeo o síntesis y reconocimiento de voz. Pero puede ser importante en tareas de finanzas, derecho, ingeniería o economía, donde se manejen muchos datos.

Hay otra prueba interesante por concepto, llamada AA-Omniscience. Es una prueba diseñada para distinguir entre saber algo y limitarse a inventárselo con seguridad aplastante. Aquí la puntuación va de −100 a +100 y lo que hace es que recompensa las respuestas correctas, penaliza las alucinaciones y no castiga al modelo por reconocer que no sabe algo (buen sistema «educativo»).

Visto en conjunto, Artificial Analysis permite comparar las IA con criterio y con datos prácticos. Puede servir para que resuelvas tareas más rápido, que te cueste menos dinero o que se hagan con más seguridad y garantías. Todo depende de lo que necesites.

Relacionados: