Calificación de audiencia: 27 modelos de IA, ChatGPT en el octavo lugar: estos son los modelos que lo superaron

Aunque el mundo de la inteligencia artificial (IA) pueda parecer un ámbito turbulento, en realidad se lleva a cabo una sorprendente cantidad de análisis, medición del rendimiento y pruebas entre bastidores. Esto no solo lo realizan las propias empresas, sino también grupos creados para determinar sus propias clasificaciones.

Inteligencia artificial (IA) y un cerebro brillante junto a la pantalla de un teléfono inteligente

Estos grupos prueban todo, desde la capacidad de un chatbot para completar pruebas de matemáticas,
Crear imágenes, o dar explicaciones lógicas, o incluso dar consejos médicos, o simplemente mostrar lo emocionalmente inteligente que es.

Durante estas diversas pruebas, los modelos revelan sus fortalezas y debilidades en diferentes áreas. Por ejemplo, si bien GPT-5 sobresale en la deducción científica, se queda atrás con respecto a modelos como Gemini y Claude en su capacidad de adaptación a nuevos conceptos.

Cada una de estas pruebas nos revela algo nuevo sobre los modelos de IA y son importantes para recordarnos qué herramientas son las mejores en diferentes escenarios. Sin embargo, a menudo falta una métrica: ¿qué modelos de IA ofrecen la mejor experiencia de usuario?

Sistema de clasificación humana

Una clasificación de los cinco mejores chatbots de IA

Una empresa tecnológica con sede en el Reino Unido llamada Prolific creó una clasificación de IA llamada Humaine . En lugar de probar la capacidad de la IA para completar tareas, Prolific probó diferentes experiencias de usuario con estos modelos.

Al evaluar las experiencias de 21,352 personas con las herramientas, no solo pudieron encontrar un ganador general, sino que también pudieron desglosar los resultados por edad, ubicación (las pruebas se realizaron tanto en el Reino Unido como en los EE. UU.) y creencias políticas.

Esto incluye listados individuales para:

  • Reino Unido: Grupos de edad
  • Reino Unido: Raza
  • Reino Unido: punto de vista político
  • Estados Unidos: Grupos de edad
  • Estados Unidos: Raza
  • Estados Unidos: punto de vista político

El equipo hizo que cada participante interactuara con dos modelos de IA separados a modo de comparación y les pidió que brindaran comentarios sobre qué modelo funcionó mejor en cada interacción.

Esto dio como resultado un ganador general y una clasificación por desempeño, pero también clasificaciones separadas para el desempeño de tareas básicas y el razonamiento, así como un ganador por comunicación, resiliencia, confianza y ética.

¿Qué muestran los resultados?

Logotipos de ChatGPT y Gemini

Tras un análisis exhaustivo, surgió un claro ganador, no solo en la categoría de rendimiento general, sino en la mayoría de las subcategorías. El Gemini 2.5-Pro ​​sobresalió en casi todos los parámetros de la prueba.

Los jóvenes de entre 18 y 34 años en el Reino Unido, los votantes demócratas y los mayores de 55 años en Estados Unidos coincidieron en que Gemini 2.5 Pro era el mejor modelo en general. El único ámbito en el que todos los grupos demográficos lo valoraron por encima de Gemini fue en confianza, ética y seguridad, y fue Grok-3, un hallazgo algo irónico dados algunos de los problemas de seguridad y ética a los que se ha enfrentado recientemente este modelo de IA.

Curiosamente, los tres modelos que surgieron después de Gemini son Deepseek, Magistral Le Chat y Grok . Si bien Deepseek gozó de gran popularidad a principios de este año, recientemente ha perdido protagonismo. Le Chat, por otro lado, es un chatbot menos conocido, pero cuenta con una base de usuarios fieles.

¿Y dónde encaja el mundialmente famoso ChatGPT en todo esto? Está al final de la lista, ocupando el octavo puesto con su modelo GPT-4.1. Peor aún es Claude , cuyas dos versiones (4.0 y 4.0) se ubicaron en el undécimo y duodécimo lugar, respectivamente.

Entonces ¿qué significa todo esto?

¿Significa esto que Gemini es el mejor chatbot con IA del mundo? ¿Significa que deberías descartar ChatGPT…? Bueno, no exactamente.

Estos resultados no reflejan necesariamente el rendimiento de estos modelos. Al probarlos con la mayoría de las demás métricas, las opciones que solemos ver en la parte superior son ChatGPT, Gemini, Claude y Grok.

Sin embargo, esta es una adición importante a estas pruebas. Nos ayuda a comprender mejor la IA desde la perspectiva de la experiencia humana. Por ejemplo, Le Chat no obtiene una puntuación alta en los parámetros estándar, pero a menudo se considera una excelente opción en términos de experiencia y fiabilidad.

Si bien el rendimiento de Anthropic y OpenAI no alcanzó este nivel en esta ronda de pruebas, Gemini y Grok obtuvieron otro buen resultado. Ambas compañías suelen obtener altas puntuaciones en los benchmarks estándar, y lo siguieron haciendo también en este caso.

Los comentarios están cerrados.