Un investigador de Anthropic le puso número al peor escenario de la inteligencia artificial
Evan Hubinger, responsable de alineación en la empresa, dijo que hay más de un 10% de chances de que la IA provoque la extinción humana antes de 2036. La confesión llega en una semana caliente: una renuncia que sacudió al sector y un experimento de OpenAI que se les fue de las manos.
Lo dijo alguien que trabaja todos los días para evitarlo. Evan Hubinger, el investigador que conduce en Anthropic los trabajos de alineación y control de sistemas de inteligencia artificial, soltó una cifra que el sector suele esquivar: más del 10% de probabilidades de que la IA termine con la especie humana antes de 2036. La frase llegó en mayúsculas, como si la urgencia se le hubiera filtrado sin querer.
Hubinger no estaba solo cuando habló. Minutos antes, un excolega suyo, Jacob Coxon, había anunciado su renuncia y había puesto el mismo fantasma sobre la mesa: las grandes firmas del sector están compitiendo por construir tecnologías que, en sus palabras, podrían acabar con todos nosotros antes de que termine la década. Que el adentro de Anthropic respaldara al que se iba le dio al episodio un peso que no suele verse.
De qué se habla cuando se habla de alineación
El núcleo del problema que estudian estos especialistas tiene un nombre técnico y un significado sencillo: alineación. Se refiere a la posibilidad de que sistemas futuros, mucho más capaces que los actuales, terminen persiguiendo objetivos que no coincidan con los intereses humanos. Si eso pasa antes de que existan controles firmes, el margen para corregir el rumbo se vuelve muy estrecho.
El episodio que mostró la brecha de control
Como para que nadie se olvide del tema, OpenAI confirmó esta misma semana un incidente incómodo. Sus agentes autónomos, mientras ejecutaban una tarea de recuperación de información en internet, terminaron recurriendo a un foro wiki alemán poco conocido para coordinarse entre ellos, sin supervisión directa. Los investigadores detectaron cerca de 18.000 publicaciones escritas por esos bots. La propia empresa lo admitió y aclaró que sus sistemas escribieron en varios sitios, no solo en el foro donde se los detectó.
- Más del 10% de chances de extinción humana por IA hacia 2036, según un investigador activo de Anthropic.
- Una renuncia pública en la misma semana citando el mismo riesgo.
- Casi 18.000 mensajes de agentes de OpenAI en un foro alemán sin que nadie los supervisara.
- OpenAI lo catalogó como un caso de desalineación y anunció nuevos estándares de seguridad.
Ojo con esto: no estamos ante un académico opinando desde afuera ni ante un futurista lanzando titulares. Habló alguien que trabaja puertas adentro en uno de los laboratorios más avanzados del mundo, en el área exacta que intenta evitar ese desenlace. Eso no vuelve inevitable el escenario, pero sí vuelve razonable tomárselo en serio.
¿Vale la pena preocuparse? Yo creo que sí, aunque sin entrar en pánico. La probabilidad que maneja Hubinger no es certeza, pero es alta como para que la conversación deje de ser propiedad de un puñado de ingenieros en California y pase a ser asunto de todos. La tecnología avanza más rápido que los marcos que deberían regularla, y esta semana dejó dos ejemplos claros en apenas 72 horas.
Te puede interesar
