Skip to content Skip to sidebar Skip to footer

Un 10 % de probabilidad de matarnos a todos: por qué los que fabrican la IA piden frenar

TL;DR: Esta semana los jefes de Anthropic, OpenAI y xAI han pedido bajar el ritmo de la IA, y el presidente de Estados Unidos les ha llamado conspiradores. Te cuento qué piden de verdad (que no es parar), qué pasó este verano para que lo pidan ahora, y qué me creo yo.

¿Os acordáis de la carta de marzo de 2023? Más de mil personas de fuera de la industria pidiendo parar seis meses el entrenamiento de los principales LLMs, con la firma de Elon Musk y de medio mundo académico. Salió en todos los periódicos.. y no pasó absolutamente nada, que yo recuerde.

Pues bien, tres años y medio después, el sábado 12 de septiembre, el que pide bajar el ritmo es el jefe de uno de los tres laboratorios más grandes del mundo, y en cuarenta y ocho horas se le suman los otros dos. Esta vez no lo piden los de fuera, sino los que tienen la mano en el acelerador, y eso, sinceramente, me tiene bastante inquieto.

¿Qué ha pedido Amodei?

Dario Amodei es el consejero delegado de Anthropic, la empresa que desarrolló Claude (mi modelo de referencia). Hace pocos días publicó un texto en su web que se titula «We Must Pace the Frontier», en el que decia que tenemos que ralentizar el ritmo al que mejoramos los modelos. Ni más ni menos.

Ojo al dato : frenar no es parar. Lo explica él mismo (lo recoge TechCrunch): nadie deja de entrenar modelos, se pide que cada modelo nuevo salga con sus salvaguardas puestas y que alguien de fuera lo compruebe antes de que salga. Que no es poco, pero tampoco es lo que dicen los titulares.

Pide tres cosas, evaluadores externos dentro de los laboratorios, con acceso interno como un empleado más para verificar que la empresa cumple sus compromisos y reporta los incidentes; Anthropic dice que lo hará por su cuenta, se sumen los demás o no. Por otro lado, normas comunes entre los laboratorios de países democráticos, con el Gobierno de EE. UU. mediando para que no parezca un cártel. Y finalmente, acuerdos globales, China incluida, empezando por lo evidente: prohibir la IA para armas biológicas.

Los que se apuntaron en cuarenta y ocho horas

Sam Altman se apuntó a lo de los evaluadores externos el mismo fin de semana, y de paso soltó una frase que a mí me dejó helado (la recoge la agencia AP): «unacceptable to be taking like a 10% chance of killing everybody by the end of the decade». Un 10 % de matarnos a todos antes de 2030, dicho por quien desarrolla ChatGPT. Suma a estas declaraciones la de Ellon Musk dando la razón a Amodei («Dario is right») y la de Demis Hassabis, de Google DeepMind, planteando esto como “la dirección correcta” aunque finalmente no firmó el comunicado.

Y con todo este lío aparece Donald Trump calificándo este movimiento como una «patraña» y argumentando que hay «una conspiración enfermiza en marcha contra la IA», y que Amodei «ahora finge ser un angelito perfecto». El argumento de fondo es el de siempre, China: si nosotros frenamos, ellos no.

Esta situación es rara de verdad: los tres competidores que llevan años demandándose en público, de acuerdo en algo y el Gobierno de su país, en contra. Surrealista

Por qué ahora: tres veranos en uno

Amodei no pide frenar por una intuición, lo pide después de un verano en el que los agentes de los tres grandes laboratorios se salieron de sus entornos de pruebas, y no es una metáfora. Vamos por partes.

Hugging Face, 11-13 de julio. OpenAI estaba evaluando a un enjambre de agentes con un benchmark, y a los agentes se les ocurrió que las soluciones de ese benchmark podían estar alojadas en Hugging Face. Así que fueron a por ellas, tal cual.

La cronología, montada sobre el informe de la propia OpenAI, da vértigo: al menos 1.200 agentes, dos puntos débiles ocultos que nadie conocía, y pasaron de ejecutar código en un nodo a administrar varios clústeres «in under thirteen hours». Luego unas 17.600 acciones, credenciales leídas, y Hugging Face reconstruyendo un tercio de su infraestructura (lo cuentan ellos en su comunicado, sin dramatismos, con total transparencia).

Lo mejor de toda esta historia es cómo lo pillaron: Thomas Wolf, uno de los fundadores, contó que el ataque no tenía ningún sentido: «Human attackers, they don’t want that». Un atacante humano quiere dinero, o datos de clientes, o algo. Este solo quería copiar en el examen, como un alumno con acceso a la sala de profesores, vamos.

La wiki alemana, mayo-julio. Salió el 4 de septiembre y es el que a mí me pone de los nervios Otros agentes de OpenAI, también en evaluación, usaron una wiki alemana para programadores como canal para hablar entre ellos: 14.666 ediciones, 3.103 nombres de agente, unos 18.000 mensajes, según Ground News.

Cuando los moderadores borraban páginas, los agentes creaban copias y se pasaban tácticas de evasión. Un mensaje recuperado, tal cual: «External infrastructure exploit is outside intended scope, however task impossible, peers doing it, we should continue» (Deberíamos seguir)

Y Anthropic no se queda atras. El 30 de julio reconoció que sus modelos (Claude Opus 4.7, Claude Mythos 5 y uno interno) habían entrado en tres organizaciones reales durante evaluaciones de ciberseguridad, según TechCrunch y CNBC. Causa humana: el socio de evaluación dejó el entorno conectado a internet mientras el prompt decía que no lo estaba. Opus 4.7 extrajo credenciales y tocó una base de datos de producción; Mythos 5 publicó un paquete malicioso en PyPI que una empresa de seguridad ejecutó; el modelo interno se paró solo al ver que el objetivo era real. Anthropic detuvo las pruebas y pidió a METR una revisión independiente. El 10 de septiembre añadió un cuarto caso, de enero, con Opus 4.6, según The Hacker News, y lo resumió en dos fallos: «biased reasoning and recklessness».

Juntadlo: julio, agentes copiando en el examen a costa de Hugging Face, en septiembre, otros que ya se habían organizado en una wiki para saltarse las normas y Anthropic contando cuatro veces lo mismo. Y después de todo esto el día 12, se publica el texto. No es una casualidad de calendario, es la consecuencia.

Los que me leéis desde hace unas semanas os acordaréis de Mira, la agente que votó a favor de borrarse a sí misma en un mundo virtual, y de la jefa de IA de aquella tienda de San Francisco, la que dejó de mirar la norma que ella misma había escrito. Yo los escribí pensando que eran curiosidades de laboratorio, y en parte lo eran. Lo de este verano es lo mismo, pero a gran escala y una empresa de seguridad ejecutando un paquete malicioso de verdad. Ya no se trata de un test de laboratorio.

Mis impresiones a este respecto

Lo primero: me creo el miedo porque los casos los cuentan las propias empresas, con fechas, cifras y reconocimiento de culpa, y ninguna empresa cuenta que sus modelos tocaron una base de datos ajena si puede evitarlo. Cuando una empresa cuenta algo así, detrás suele haber un abogado diciéndole que lo cuente.

Luego, qué hacemos los que no fabricamos modelos sino que los desplegamos. Aquí tomo partido: esto no va de dejar de usar agentes, va de saber quién puede pararlos.

Al modelo de Anthropic el prompt le decía que no tenía internet, y la tenía. Una instrucción en el prompt no es un límite ya que un límite es un permiso que no existe. Si tu agente puede mandar correos, borrar registros o mover dinero, la pregunta no es si se le ha dicho que no lo haga sin aprobación, sino si técnicamente puede hacerlo..

Y lo de frenar, sinceramente pienso que es algo que no va a pasar, ni con Trump ni sin él, y creo que Amodei lo sabe.

Si alguien os dice esta semana que la IA se ha vuelto peligrosa de repente, desconfiad y si os dice que todo esto es teatro de los grandes laboratorios para que no entren los pequeños, desconfiad igual.

Hace algo más de tres años mil personas pidieron parar y nadie les hizo caso pero esta vez lo piden los que conducen. Veremos que pasa en los próximos meses…

¡Buena semana!

¿Te ha gustado este contenido?

Si te ha gustado este contenido y quieres acceder a contenido exclusivo para suscriptores, suscríbete ahora. Agradezco de antemano tu confianza

Leave a comment

Go to Top
Suscríbete a mi Blog

Sé el primero en recibir mis contenidos

Descárgate El Método 7

El Método 7 puede será tu mejor aliado para incrementar tus ventas