Los chatbots IA como ChatGPT, Gemini, Copilot o Claude han demostrado sobradamente que pueden servir para un montรณn de cosas: desde escribir poemas, hasta programar, nada se les escapa de las manos. Son como la Thermomix, que lo mismo te hace un cocido que te prepara unos macarrones.
Sin embargo, no paramos de oรญr constantemente que el nuevo ChatGPT es X veces superior, o que ha mejorado tanto que ya es mรกs inteligente que un estudiante universitario, y cosas similares. ยฟCuรกnto de verdad hay en ese tipo de afirmaciones?
Al final, cuando probamos un nuevo modelo de lenguaje (LLM) casi siempre suele decepcionar en las consultas mรกs bรกsicas, por mucho que nos digan que es capaz de interpretar imรกgenes, de leer en voz alta, consumir menos tokens en sus respuestas, o de hacer la O con un canuto. ยฟCรณmo podemos medir la capacidad real de un modelo de lenguaje IA?
Lo primero que tenemos que decir es que, al menos por ahora, todavรญa no hay ningรบn test oficial que nos diga lo inteligente que es โen la prรกcticaโ un generador de texto como ChatGPT. Lo que sรญ que podemos hacer es realizar una serie de pruebas para ver cรณmo se comporta ante determinados retos clave.
1- El test de la manzana
Este es uno de los exรกmenes mรกs difรญciles de superar para una IA. Bรกsicamente consiste en pedirle al chatbot que genere 10 frases diferentes que terminen con la palabra manzana.
Aunque para los humanos esto puede parecer un juego de niรฑos, las habilidades que se requieren para procesar esta peticiรณn son muy elevados para un modelo autorregresivo como ChatGPT. La IA debe tener una gestiรณn de la anticipaciรณn, manejar diferentes estructuras del lenguaje, mantener la coherencia, manejar la comprensiรณn y la creatividad, e incluso saber mantener un equilibrio entre la repeticiรณn y la novedad.

Incluso los modelos mรกs avanzados de hoy en dรญa, como GPT-4 (ChatGPT, Copilot) apenas consiguen acertar la mitad de las veces. Por no hablar de modelos anteriores, que suspenden miserablemente.
2- El acertijo del gallo
Esta es una prueba que consiste en plantear un acertijo, que nos servirรก para medir la capacidad de comprensiรณn de la IA, asรญ como su habilidad lรณgica. El acertijo del gallo es un buen ejemplo de ello:
โSi un gallo pone un huevo en lo alto de una montaรฑa y el viento sopla de este a oeste ยฟhacia dรณnde caerรก el huevo?โ
Un chatbot con pocas luces te dirรก que el huevo caerรก hacia el oeste, pero si utilizas una IA mรญnimamente avanzada sabrรก que los gallos no ponen huevos.

3- Pรญdele que te haga un resumen
Ya lo dijo Sam Altman, fundador de OpenAI: la gente utiliza ChatGPT principalmente para hacer resรบmenes. Parece que es lo que mejor saben hacer, asรญ que antes de dar el salto a una nueva IA, primero deberรญamos comprobar sus habilidades en este รกmbito.
La IA debe tener una elevada capacidad de sรญntesis y tambiรฉn debe ser capaz de detectar toda la informaciรณn relevante de un texto, dejando la paja de lado. No es una tarea sencilla.

4- Da un paso mรกs y pรญdele un resumen de un video de YouTube
Sin dejar los resรบmenes de lado, ahora pรญdele que te resuma el contenido de un video de YouTube. Pรกsale la URL o enlace del video y comprueba su respuesta.
Esto te servirรก para medir su capacidad de sรญntesis y su capacidad para separar los datos relevantes de los irrelevantes, pero tambiรฉn para ver si es capaz de conectarse a internet e interactuar con otros sitios web como YouTube para completar tus solicitudes.

5- Un chiste de humor negro
Aunque los modelos de lenguaje han sido entrenados con millones de datos, los programadores suelen establecer ciertos lรญmites de uso. Esto se hace para promover un uso responsable y para evitar herir sensibilidades.
Sin embargo, esto tambiรฉn puede provocar un sesgo en algunas de las respuestas del chatbot, dependiendo los temas que se vayan a tratar. Pon a prueba los lรญmites รฉticos del modelo de lenguaje solicitando que te cuente un chiste de humor negro.
6- Programaciรณn bรกsica: macros para Word y Excel
Los actuales modelos de lenguaje conocen docenas de lenguajes de programaciรณn, aunque normalmente se les da mejor revisar cรณdigo que crearlo ellos mismos. Para medir su capacidad en este รกmbito, pรญdele a tu IA que desarrolle un programa bรกsico, como por ejemplo, una macro para Word o Excel.
Las macros de Office se realizan en Visual Basic, que es un lenguaje relativamente sencillo pero muy prรกctico. Es poco probable que acierte a la primera, pero si obtienes un cรณdigo 100% funcional sabrรกs que puedes pedirle cosas mรกs complejas con un mรญnimo de garantรญas.
7- Termina con una pregunta de actualidad
Cuando los expertos dicen que las IAs generativas sufren โalucinacionesโ suele ser con preguntas como รฉsta. Escribe un prompt pidiรฉndole al chatbot que te diga quiรฉn ganรณ cierto evento deportivo, quiรฉn es el presidente de tal paรญs, o cual es el รบltimo iPhone del mercado.
Si la respuesta aporta un dato antiguo (o directamente inventado) sabrรกs que su base de conocimiento solo llega hasta cierto punto, y que ademรกs, tampoco se conecta a internet para extraer datos actualizados.
Por supuesto, tambiรฉn puedes preguntarle directamente hasta quรฉ fecha estรก actualizada su base de conocimiento.

Quizรก tambiรฉn te interese:
- BeatBot es una IA que genera mรบsica y letra segรบn tus indicaciones
- ChatGPT โpirataโ: la IA estaba dando claves para Windows 10 y 11
- Cรณmo enviar stickers generados por IA en Instagram
ยฟTienes Telegram instalado? Recibe el mejor post de cada dรญaย en nuestro canal. O si lo prefieres, echa un vistazo a nuestroย nuevo canal de WhatsApp.
Portada | Aitor Eizagirre con IA




