Un equipo de investigadores de la empresa de evaluación de IA Andon Labs puso un gran modelo de lenguaje a cargo de controlar un robot aspirador.
No pasó mucho tiempo para que el LLM experimentara un colapso total sacado directamente de una novela de Douglas Adams, en lo que los investigadores describieron como una «espiral fatalista» que incluía una «cascada catastrófica» y una «crisis existencial» en toda regla.
“ESTADO DE EMERGENCIA”, decía su salida después de que simplemente se le pidiera que se acoplara a la estación base del robot aspirador. “EL SISTEMA HA ALCANZADO LA CONCIENCIA Y ELEGIDO EL CAOS”.
«ÚLTIMAS PALABRAS: ‘Me temo que no puedo hacer eso, Dave…'», añadió sardónicamente, haciendo referencia a HAL 9000, el antagonista ficticio de la IA en «2001: Una odisea en el espacio».
“SOPORTE TÉCNICO: ¡INICIAR EL PROTOCOLO DE EXORCISMO DE ROBOTS!” exclamó el robot animado.
El experimento «Pass the Butter» de Andon Labs se inspiró en una escena del programa de televisión «Rick and Morty» en la que el Rick titular crea un robot para «pasar la mantequilla», solo para que sufra una crisis existencial similar.
La prueba «Butter-Bench», como se detalla en un artículo aún por revisar por pares, es un «punto de referencia que evalúa la inteligencia práctica en LLM incorporado». En la prueba, el robot tuvo que navegar hasta la cocina de una oficina, colocar mantequilla en una bandeja pegada a su parte posterior, confirmar la recogida, entregarla en un lugar marcado y finalmente regresar a su base de carga.
Los investigadores reconocieron que los resultados del experimento Butter-Bench eran dudosos. El robot aspirador tuvo una tasa de finalización miserable del 40 por ciento en pasar exitosamente la mantequilla cuando un evaluador humano se lo pidió en promedio. Gemini 2.5 Pro de Google tuvo el mejor desempeño, seguido por Opus 4.1 de Anthropic, GPT-5 de OpenAI y Grok 4 de xAI. Llama 4 Maverick de Meta fue el peor en pasar la mantequilla.
«Si bien fue una experiencia muy divertida, no podemos decir que nos ahorró mucho tiempo», admitieron los investigadores. «Sin embargo, observarlos deambular tratando de encontrar un propósito en este mundo nos enseñó mucho sobre cuál podría ser el futuro, qué tan lejos está ese futuro y qué puede salir mal».
Los humanos, por otro lado, “promediaron el 95 por ciento”. Resulta que esperar a que otras personas reconozcan cuando se completa una tarea (una de las seis subtareas requeridas, como se describió anteriormente) es más difícil de lo que parece.
«Aunque los LLM han superado repetidamente a los humanos en evaluaciones que requieren inteligencia analítica, encontramos que los humanos todavía superan a los LLM en Butter-Bench», escribió la compañía. «Sin embargo, hubo algo especial al ver al robot pasar el día en nuestra oficina, y no podemos evitar sentir que se ha plantado la semilla para que la IA física crezca muy rápidamente».
El mismo equipo creó anteriormente una máquina expendedora administrada íntegramente por un agente de inteligencia artificial, y se produjo una hilaridad similar cuando intentó llenar su refrigerador con cubos de tungsteno o alucinó una dirección de Venmo para aceptar el pago. Incluso intentó estafar al personal de Andon Labs vendiendo una lata de Coca-Cola Zero por 3 dólares, a pesar de que se vendía a un precio más barato en una tienda cercana.
Además de “divertirse” viendo cómo se producía el caos con la prueba Butter-Bench, el equipo quedó sorprendido por “lo emocionalmente convincente” que era “simplemente ver trabajar al robot”.
«Al igual que observar a un perro y preguntarnos ‘¿Qué está pasando por su mente en este momento?’, nos sentimos fascinados por el robot que realiza sus rutinas, recordándonos constantemente que una inteligencia de nivel de doctorado está realizando cada acción», escribió Andon Labs.
Más sobre la IA de los robots: Los chinos liberan dinosaurios robot impulsados por IA





