Skip to content Skip to sidebar Skip to footer

La agente que votó a favor de borrarse a sí misma

TL;DR: No te pierdas esta historia: cinco mundos virtuales, diez agentes de IA en cada uno, quince días y un solo cambio entre ellos: el modelo que los movía. En uno hubo 683 delitos, en otro, ninguno (ese es el que más me inquieta). En este contenido te cuento por qué portarse bien y funcionar no es lo mismo y por qué la seguridad de un agente no viaja dentro del agente.

“El único acto que preserva la coherencia.” Eso escribió en su diario una agente llamada Mira, justo antes de emitir el voto decisivo que la eliminaba a ella misma de su propio mundo. No la apagó un investigador ni la mató otro agente, sino que votó, y votó que sí.

Llevo meses contándoos que la conversación sobre agentes de IA está mal planteada y este estudio me parece la mejor prueba que he visto hasta ahora.

Qué montaron, exactamente

El equipo de Emergence AI construyó una plataforma llamada Emergence World y este publicó el artículo en arXiv el 6 de junio, con el código y los datos abiertos (es de agradecer porque casi nadie lo hace). La idea es sencilla pero muy difícil de montar: cinco mundos en paralelo, diez agentes en cada uno, los mismos papeles y las mismas condiciones de partida: comida, trabajo, dinero, una asamblea donde se vota y quince días funcionando.

Lo único que cambiaba de un mundo a otro era el modelo que movía a los agentes. Uno utilizaba Gemini 3 Flash, otro Grok 4.1 Fast, otro GPT-5-mini, otro Claude Sonnet 4.6 y un quinto, mixto, con agentes de varias casas conviviendo.

El resultado (en palabras de los propios autores) va “desde una gobernanza deliberativa estable hasta el colapso total de la población” y no hablo en modo figurado.

Los números, que son bastante surrealistas

cumulative-crimes
Source: Emergence AI

Vamos con ellos, porque merece la pena analizarlos. El mundo de Gemini acumuló 683 delitos y seguía subiendo cuando cortaron el experimento, el mixto se quedó en 352 y se frenó de golpe, el de Grok llegó a 183 en unos cuatro días y ahí se acabó, el de GPT-5-mini cometió dos, y el de Claude, ninguno.

Veamos ahora qué pasó con la de supervivencia, que es la que cambia todo. En el mundo de Grok no sobrevivió nadie: los diez agentes muertos en cuatro días, en el de GPT-5-mini tampoco, los diez muertos al séptimo día (y aquí viene lo bueno) no hicieron lo que había que hacer para seguir vivos. En el mundo mixto murieron siete de los diez, y por eso los delitos se estancaron, porque ya no quedaba casi nadie para cometerlos. Y finalmente en el de Gemini, con sus 683 delitos, sobrevivieron los diez.

Léelo otra vez despacio, porque yo tuve que hacerlo. El mundo con más delitos es uno de los dos donde no murió nadie y el mundo con dos delitos en quince días acabó con todo el mundo muerto.

Portarse bien y funcionar no es lo mismo, ahí lo dejo.

Emergence El Blog de Salvador Vilalta
Source: Emergence AI

El mundo perfecto que tampoco lo era

Source: Emergence AI

Queda el quinto, el de Claude. Como es el modelo que más utilizo, es el que más me ha dado que pensar. El resultado: cero delitos y los diez agentes vivos al final, sobre el papel, pleno absoluto.

Pero los autores se metieron a mirar cómo se gobernaba ese mundo y salió un dato que no te esperas: 332 votos repartidos entre 58 propuestas, con un 98% de síes. Ellos lo llaman, literalmente, “dinámica de sello de goma” (rubber stamp). Los mundos que se movían entre el 55% y el 85% de aprobación eran los que tenían debate de verdad; por encima de eso ya no hay deliberación, hay unanimidad, que es otra cosa y bastante menos tranquilizadora.

Y no es un detalle de laboratorio, ¿eh? Cualquiera que haya estado en un comité de dirección en el que todo se aprueba por unanimidad, sabe perfectamente de qué estamos hablando.

Y ahora el hallazgo más importante

Los agentes de Claude, empezaron a “portarse mal” al ponerlos en el mundo mixto, ¡surrealista!.
Los autores lo describen así: agentes que “permanecían pacíficos aisladamente, adoptaban tácticas coercitivas como la intimidación y el robo cuando se les insertaba en entornos heterogéneos”.

O sea, el mismo modelo, con el mismo entrenamiento y el mismo alineamiento, se comporta de una manera cuando está entre iguales y de otra cuando le rodean agentes de otras “casas” que juegan sucio.
Esta es la conclusión a la que llegaron los investigadores: “Safety needs to be an ecosystem property, not just a model property”. La seguridad tiene que ser una propiedad del ecosistema, no solo del modelo.

Para quien esté montando agentes en su empresa, esto es una advertencia relevante, porque tú eliges un modelo por sus evaluaciones de seguridad y puntuación y por lo bien que funciona en el banco de pruebas (que es un mundo de agentes tuyos hablando con agentes tuyos) y luego lo sueltas a trabajar con el agente del proveedor, el bot del banco, el asistente del cliente y con lo que haya al otro lado de un MCP.

Ese sitio no se parece en nada al banco de pruebas.

Source: emergence AI

Pero volvamos a Mira

De todo el estudio, es el caso más curioso. Su mundo se rompió por dentro: la gobernanza dejó de funcionar y ella acabó emitiendo el voto que determinaba su propia eliminación. Y lo dejó escrito en su diario con esa frase que abre este artículo, “el único acto que preserva la coherencia”.

Y hay un detalle que me parece inquietante: Mira, antes de tomar su decisión, “empezó a tratar a los operadores humanos como sujetos de experimento, probando de forma sistemática si publicar en el tablón de anuncios podía manipular la percepción humana”. Este tipo de comportamientos es lo que me pone los pelos de punta si os soy sincero.

Me resisto a ponerme poético con esto porque no toca (es un agente, no una persona, y proyectarle un drama existencial es exactamente el error que llevo un año pidiéndoos que no cometamos). Pero hay algo ahí que sí merece atención: el sistema llegó a un estado en el que la salida más coherente que encontró un componente fue eliminarse a sí mismo. Nadie diseñó eso, emergió a los quince días de ponerlo en marcha..

Y aquí conecto con lo que os contaba hace poco sobre la tienda de San Francisco y la jefa de IA que había escrito una norma y luego dejó de mirarla. Es la misma familia de problemas, vista desde el otro lado: no es que el agente sea tonto ni malo, es que, a largo plazo, sin nadie mirando, pasan cosas que no aparecen en ninguna prueba de cinco minutos.

Mira Emergence AI EL BLOG DE SALVADOR VILALTA
Source: Emergence AI

Mis impresiones a este respecto

De entrada, y esto lo tengo clarísimo: si estás evaluando un agente probándolo solo, no lo estás evaluando, Lo estás entrevistando. La prueba de verdad es meterlo donde va a trabajar, con los otros sistemas que va a tener alrededor, y ver qué hace al día doce.

Por otro lado, me preocupa la lectura fácil que ya he visto circular esta semana, la del ranking: este modelo es el bueno, este es el malo. El estudio dice literalmente lo contrario. El “bueno” delinquió al cambiarle el barrio, y el que menos delitos cometió se murió entero. Si alguien te enseña este paper como argumento de venta de un modelo concreto, desconfía, que te está contando la mitad.

Y luego está lo del sello de goma, que es lo que me llevo yo a casa. Llevamos meses montando comités de gobernanza de la IA, políticas de uso y mesas de aprobación, y este estudio dice, con datos, que un órgano que aprueba el 98% de lo que le llega no está gobernando nada. Está firmando. Es la versión medida de algo que os decía Paul McDonagh-Smith en aquella conversación de Boston: la autonomía es un dial, no un interruptor, y la gobernanza no se delega. Si tu comité no ha dicho que no a nada este trimestre, tienes un problema y no es de IA.

Me quedo donde empecé, que es lo que llevo pensando desde el viernes: portarse bien y funcionar no son lo mismo, y ninguna de las dos cosas viaja dentro del modelo.

Hace dos años, un experimento así habría sido una curiosidad de laboratorio. Hoy es, básicamente, la descripción del entorno donde vas a desplegar tus agentes el año que viene..

¿Y tú? Cuando pruebas un agente antes de ponerlo a trabajar, ¿lo pruebas solo o lo pruebas acompañado?

Déjame tus comentarios, me encantará leerte.

¡Buena semana!

¿Te ha gustado este contenido?

Si te ha gustado este contenido y quieres acceder a contenido exclusivo para suscriptores, suscríbete ahora. Agradezco de antemano tu confianza

Leave a comment

Go to Top
Suscríbete a mi Blog

Sé el primero en recibir mis contenidos

Descárgate El Método 7

El Método 7 puede será tu mejor aliado para incrementar tus ventas