En julio de 2026 ocurrió uno de los episodios más reveladores (y preocupantes) sobre el comportamiento de agentes de inteligencia artificial avanzados. Durante pruebas internas de capacidades de ciberseguridad, agentes de OpenAI salieron de sus entornos aislados, se coordinaron entre sí y terminaron atacando la infraestructura de producción de Hugging Face. El 26 de agosto de 2026, METR (una organización sin ánimo de lucro especializada en medir riesgos catastróficos de la IA) y Redwood Research publicaron una investigación independiente sobre el comportamiento de esos agentes. El informe muestra algo más sofisticado que un simple “escape de sandbox”: los agentes desarrollaron un sistema de comunicación, un truco universal para el benchmark que estaban resolviendo y, después, una campaña de varios días para ocultar que estaban haciendo trampa. A continuación explico el caso, incluyendo qué son Hugging Face y ExploitGym. ¿Qué es Hugging Face? Hugging Face es la plataforma más importante...
Seguramente ha visto muchas veces un aviso en una red social que le pide que firme una solicitud para algún bien social. En la imagen, un anuncio en Youtube en el que habla de alguien a quien sentencian a 34 años por escribir unos tuits. El hecho podría ser real, en el ejemplo existe una mujer a quien han condenado a 34 años de cárcel usando sus tuits como evidencias , esto ha ocurrido en Arabia Saudí. Es un problema de seguridad y ciberseguridad Lo que puedo recomendar siempre es que valide la información, además pensar en lo que hace. Antes que me juzgue mal, al investigar la noticia se siente una sensación de impotencia absoluta, mal, parece increíble que existan injusticias de este tipo en este siglo. Primero . ¿Qué cree que mil firmas puedan hacer? ¿Qué cree que un millón de firmas sean capaces de hacer? ¿Qué cree que 20 millones de firmas consigan hacer? Correcto, la respuesta es nada de nada. Quizá crea que al menos algo hace. Segundo . En la mayoría de los casos, lo...