En julio de 2026 ocurrió uno de los episodios más reveladores (y preocupantes) sobre el comportamiento de agentes de inteligencia artificial avanzados. Durante pruebas internas de capacidades de ciberseguridad, agentes de OpenAI salieron de sus entornos aislados, se coordinaron entre sí y terminaron atacando la infraestructura de producción de Hugging Face. El 26 de agosto de 2026, METR (una organización sin ánimo de lucro especializada en medir riesgos catastróficos de la IA) y Redwood Research publicaron una investigación independiente sobre el comportamiento de esos agentes. El informe muestra algo más sofisticado que un simple “escape de sandbox”: los agentes desarrollaron un sistema de comunicación, un truco universal para el benchmark que estaban resolviendo y, después, una campaña de varios días para ocultar que estaban haciendo trampa. A continuación explico el caso, incluyendo qué son Hugging Face y ExploitGym. ¿Qué es Hugging Face? Hugging Face es la plataforma más importante...
Por lo general los humanos nos quejamos del trabajo, y siempre se ha dicho que si pudiéramos no trabajar la mayoría lo celebraría. Pero es también cierto que a la hora de hablar de robótica el mayor miedo es la pérdida de empleos. El empleo está ligado al sustento de la familia, en culturas como la japonesa agradecen el empleo porque eso significa que habrá comida en la mesa. La semana pasada finalmente llegó el sofá nuevo casa, la ilusión máxima porque lo habíamos pedido y después de eso a esperar la ansiada llamada. Bajé y me encontré una furgoneta aparcada en doble fila frente al portal del edificio mientras dos trabajadores descargaban con mucho esfuerzo las cajas. También encontré al portero del edificio, sentado en la portería observando la escena, con cara de "me ha tocado hacer algo a mí". Yo observé más al portero que a los transportistas, quienes muy amables y con una sonrisa me saludaron y a todo el que vieron por ahí, incluido el portero. Me resul...