Está hoy bastante viral este vídeo de Tavus donde se muestra una demo de Griffin, su nueva IA conversacional a la que llaman «el primer modelo de interacción humana». Pero no sólo eso: también la califican como «la primera en superar el test de Turing en vídeo en tiempo real». Las cifras: en una videollamada de un minuto, 26 de 54 participantes en las pruebas, creyeron estar hablando con una persona.
La demo, de la que se pueden ver varios fragmentos, es curiosa y a la vez impresionante: el avatar escucha, ve lo que ocurre, interrumpe y reacciona mientras los interlocutores hablan. Supera trampas como la de «enséñame un pulgar» e incluso habla de cosas que no le han preguntado («vaya jersey más feo»).
En la descripción de Griffin la compañía explica que el sistema combina percepción audiovisual, generación de voz e imagen y decisiones sobre cuándo hablar, todo en miniturnos de menos de un segundo. En vez de esperar a que el interlocutor termine cada frase, sigue la conversación y atiende a gestos y objetos. El resultado se parece menos a consultar un asistente y más a una videollamada con alguien realmente pendiente de lo que haces.
Habría que ver la metodología completa, las condiciones exactas y las videollamadas completas para evaluarlas por un equipo neutral (dicen que Nvidia también participó, con un juez de su elección), para ver siquiera si se puede considerar un «experimento» como tal, pero vamos, que da el pego. Al menos casi la mitad de las veces. El sistema anterior que habían desarrollado sólo convenció a una persona de 41, apenas el 2,4%. Así que un avance sí que parece.
Un test básico, pero controvertido
Si parece un pato, anda como un pato y grazna como un pato, probablemente sea un pato.
– proverbio popular
El test de Turing, propuesto por el matemático Alan Turing hacia 1950, plantea si una máquina puede parecer humana en una conversación. En Microsiervos hemos hablando varias veces de sus límites, y de cómo modelos como ChatGPT podría haberlo ya superado. La versión original, el juego de imitación se hacía a través de mensajes y sin siquiera ver al interlocutor, durante 5 minutos de prueba. Básicamente medía una «primera impresión«, no una comprensión general, pero caló entre los expertos en informática.
Pero con el tiempo se observo algo curioso en la industria: cada vez que una máquina está a punto de superar el test, alguien cambia las reglas. Es algo que hasta tiene su propio nombre: se conoce como efecto IA: no, no, no… la prueba debe durar más, incluir vídeo, medir la capacidad de razonamiento, ¡ah! y que la comprensión sea «de verdad»… y así sucesivamente. De ese modo se «mueven los postes» de la portería durante el partido y es más difícil marcar gol; la meta se aleja justo cuando la máquina parece que va a alcanzarla.
Parecer humano y ser inteligente son cosas distintas. Tavus reconoce que ese realismo puede engañar y mantiene esta versión, llamada Griffin-Lite, como un trabajo de investigación mientras prepara medidas para que se pueda identificar como una IA. De momento, el avatar consigue que casi la mitad de la gente olvide durante sesenta segundos que al otro lado hay meramente código, lo cual es, cuando menos, llamativo.
Relacionados:
- Cruce de cables: ¿Puede ChatGPT haber superado ya el Test de Turing?
- GPT-4 y el Test de Turing: la IA supera el 41% de las pruebas
- Los ChatGPT aún no son «inteligentes», según el Test de Turing
- Superar el Test de Turing durante 10 minutos ya es casi normal
- ¿Ser humano o no? El Test de Turing social con bots
- El Efecto IA y las dificultades del progreso tecnológico
- Eugene Goostman no es inteligente aunque pasó el Test de Turing
- El Test de Turing
