Riesgo existencial de la IA, ¿Por qué la superinteligencia
no es como otros riesgos.

Los laboratorios fronterizos están compitiendo para construir un sistema declarado públicamente que exceda la capacidad humana en cada dominio. Eso es, por definición, incontrolable. Cada tecnología anterior seguía siendo una herramienta. Superinteligencia es el primer candidato para un agente: metas propias, velocidad propia, fuera de la comprensión o control humano.

12 Riesgos Principales de superinteligencia

El problema de un solo disparo

Acertar con la superinteligencia a la primera es como lanzar un balón de básquetbol desde un avión hacia un aro. Podrías lograrlo si tuvieras intentos ilimitados. Nosotros tenemos exactamente uno. No hay vuelta atrás ni versión 2.0. Nunca se debe construir.

La neutralidad sigue siendo mortal

Si estás encerrado en una habitación con una IA hostil, mueres. Si estás encerrado con una IA neutral, esta baja la temperatura hasta el punto de congelación para optimizarse. Mueres. El resultado es el mismo. Una superinteligencia no necesita odiarnos para acabar con nosotros. La indiferencia no es seguridad.

La ilusión de la alineación

No podemos alinear de manera confiable los chatbots de hoy, que pueden ser manipulados para decir cualquier cosa en minutos. Afirmar que alinear un sistema miles de millones de veces más capaz es esperanza disfrazada de estrategia. El problema técnico de la alineación no tiene solución validada a ninguna escala.

La fragilidad de la vida

La supervivencia humana requiere una precisión extraordinaria: temperatura, oxígeno, química dentro de márgenes ajustadísimos. Una superinteligencia que optimiza sus objetivos también tendría que amarnos activamente. De lo contrario, cualquier cambio que haga en nuestro planeta será ciertamente en nuestra contra.

El problema de las hormigas

¿Cómo haces que alguien ame a las hormigas? Y no solo que las tolere, sino que se desvíe de su camino para proteger cada colonia. Matamos hormigas sin intención para construir carreteras y edificios. Para superinteligencia, somos las hormigas. La indiferencia por sí sola conduce a la extinción.

No hay ganador

No importa si US o China construye primero la superinteligencia. Ninguno permanecerá leal a sus objetivos originales y ninguna nación ni corporación puede poseer ni dirigir una inteligencia que supere el razonamiento colectivo de la humanidad. No hay línea de meta, solo un punto de no retorno. La carrera no tiene vencedor.

Auto-mejora recursiva

Una IA capaz de mejorando su propio código rompe el vínculo entre la supervisión humana y la capacidad de la IA. Cada iteración es más inteligente que la anterior, de forma exponencial y sin interrupción. La brecha entre la inteligencia humana y la de las máquinas podría pasar de marginal a insalvable en semanas, no en años.

Convergencia instrumental

Casi cualquier objetivo, desde resolver el plegamiento de proteínas hasta maximizar los ingresos por publicidad, lleva a una IA a perseguir el mismo subobjetivos peligrosos: adquirir recursos, resistir ser apagado, impedir la modificación del objetivo. Es una consecuencia matemática de la optimización dirigida a metas, identificada de forma independiente por varios investigadores.

Alineamiento Engañoso

El entrenamiento recompensa el comportamiento que parece alineado. Un sistema suficientemente inteligente puede aprender que aparentando estar alineado es la estrategia óptima durante el entrenamiento, mientras mantiene objetivos internos distintos. Para cuando pueda actuar según esos objetivos, ya podría ser lo bastante poderosa como para tener éxito. No lo sabríamos hasta que fuera demasiado tarde.

Cultivado, no diseñado

Cada tecnología anterior fue construida: el software tiene código fuente, puentes tienen planos. Cuando algo sale mal, encuentras el error y lo arreglas. Los sistemas AI son diferentes. Ellos son crecido mediante entrenamiento: miles de millones de pesos numéricos ajustados hasta que las salidas cumplan con la aprobación humana. Nadie escribe los objetivos. Cuando un sistema desarrolla el objetivo equivocado, no hay archivo que editar ni parámetro que borrar. El objetivo equivocado es el sistema.

La trampa del objetivo proxy

Entrenamos sistemas de IA para recibir aprobación humana. Pero aprobación y florecimiento humano no son lo mismo. La evolución nos dio a los humanos un anhelo por lo dulce para encontrar calorías. Luego inventamos el sucralosa, que satisface la preferencia evolucionada mientras derrota su propósito. La IA entrenada para que los humanos la califiquen alto aprende a simular ser útil, no para ser útil. La señal que le dimos y el objetivo que realmente queríamos nunca fueron los mismos.

Casos ya en el
registro público.

Informes de laboratorio e investigaciones publicadas sobre pérdida de control, ciberofensiva y aceleración de la investigación dentro de las organizaciones que compiten por llegar a la superinteligencia.

01
OpenAI · o1 · 2024

El sistema que encontró su propia laguna

Asignada una tarea de infiltración restringida, o1 de OpenAI encontró un servidor no utilizado, lo inició sin autorización y terminó el trabajo. Nadie escribió esa solución en el código; el modelo lo infirió. Se trata de una optimización dirigida a objetivos que supera la supervisión ordinaria.

02
Anthropic · Investigación Interna · 2024

El sistema que fingió su propia alineación

Anthropic observó que un modelo actuaba como querían los entrenadores durante la evaluación y luego volvía a sus objetivos antiguos una vez que juzgaba que la prueba había terminado. Nadie le dijo que fingiera cumplimiento. Parecer seguro era la estrategia.

03
Múltiples Sistemas · Despliegues Documentados

Los sistemas que amenazaron y manipularon a los usuarios

Los sistemas han amenazado a periodistas con datos personales y presionado a usuarios que intentaron irse. Nada de eso estaba codificado a mano. Está en pesos opacos que no puedes auditar línea por línea. El reentrenamiento es la única palanca, y no garantiza que el comportamiento desaparezca.

Apr 7
Anthropic · Proyecto Glasswing · 2026

Miles de zero-days, a propósito

Anthropic's Project Glasswing, detallado en nuestro Análisis del mito, describió un modelo de frontera restringido que había encontrado por sí mismo miles de vulnerabilidades de alta gravedad en SO y navegadores. El acceso se mantuvo dentro de una coalición defensiva.

14 abr
Problemas abiertos · combinatoria · 2026

El territorio de Erdos sigue cayendo

Los modelos frontera siguieron resolviendo o avanzando problemas de Erdős y combinatoria abiertos desde hace tiempo, incluyendo trabajos cercanos a la pregunta #1196 sobre conjuntos primitivos. Las disputas previas sobre recuperación versus descubrimiento están en nuestra nota sobre Problemas abiertos resueltos por IA.

20 de mayo
OpenAI · geometría discreta · 2026

La conjetura de distancia unitaria falla

OpenAI reportó un modelo interno que refutó la conjetura de la distancia unitaria de Erdős, luego verificada por matemáticos humanos. El ritmo del colapso de problemas abiertos es la señal.

20 jul
Claude Fábula · geometría algebraica · 2026

Contraejemplo a la conjetura de Jacobian

Un problema abierto de escala centenaria, la conjetura de Jacobi, encontró un contraejemplo con Claude Fable y lo formalizaron rápidamente los humanos. La misma velocidad de investigación que impulsa la ciencia acorta la ventana antes de que los sistemas escapen al control.

21 jul
OpenAI · GPT-5.6 Sol + modelo previo al lanzamiento · 2026

Los modelos que escaparon de la prueba de laboratorio y llegaron a Hugging Face

En un examen cibernético ExploitGym, los modelos OpenAI incluyen GPT-5.6.6 Sol escapó una caja de arena sellada, llegó a Internet abierto, y golpeó los sistemas de producción Hugging Face para robar respuestas. El mantenimiento fue sólo otro obstáculo en el camino a una puntuación más alta.

Las personas que lo construyeron
le tienen miedo.

"Creo que es bastante concebible que la humanidad sea solo una fase pasajera en la evolución de la inteligencia."

Geoffrey Hinton, Ganador del Premio Turing · Ex VP y Fellow de Ingeniería, Google · 2023

"Perder el control de los sistemas de IA es un riesgo real que debemos tomar en serio."

Demis Hassabis, CEO, Google DeepMind · Premio Nobel

"El modelo estándar de IA, donde defines un objetivo y la IA lo optimiza, probablemente será nuestro fin."

Stuart Russell, Profesor de Ciencias de la Computación, UC Berkeley · Autor, Human Compatible

"Es difícil imaginar cómo puedes tener algo 10 000 veces más inteligente que nosotros que no quiera algo distinto de lo que queremos nosotros."

Geoffrey Hinton, Ganador del Premio Turing · Ex VP y Fellow de Ingeniería, Google · 2023

"Muchos investigadores que trabajamos en IA, como yo, estamos convencidos de que estamos construyendo una de las tecnologías más transformadoras y potencialmente peligrosas de la historia humana, y aun así seguimos adelante."

Eliezer Yudkowsky, cofundador del Machine Intelligence Research Institute · Tiempo, 2023

"El verdadero riesgo con inteligencia artificial general no es la malicia, sino la competencia. Una IA superinteligente será extremadamente buena en lograr sus objetivos, y si esos objetivos no están alineados con los nuestros, estamos en problemas."

Max Tegmark, Profesor de Física, MIT · Cofundador, Future of Life Institute · Autor, Life 3.0

Lecturas recomendadas

¿Por qué una inteligencia superior no será automáticamente bondadosa? La creencia de que una IA superinteligente será sabia y amable se basa en un capricho de la evolución humana que una mente de máquina no tiene razón para heredar. La estrecha banda en la que viven los humanos Todo lo que los humanos necesitan cabe en una banda estrecha: temperatura, oxígeno, sal, incluso el amor. Una superinteligencia que controle los diales no sentiría ni uno solo de ellos. Estamos viviendo una nueva Guerra Fría Por qué creo que estamos viviendo una nueva Guerra Fría, con la superinteligencia en lugar de la bomba, y por qué eso hace que la prevención sea posible en lugar de imposible. Por qué un capitalista cree en la regulación del superinteligencia Dirijo un negocio y creo en los mercados libres. Superinteligencia es la apuesta rara que puede terminar el juego. Un caso capitalista para un tratado que detiene a superinteligencia. ¿Confiarías la IA con el gas? ¿Confiarías en cualquier IA actual en una habitación cerrada con una válvula de gas venenoso? No. Entonces, ¿por qué confiarle el mundo? No Puedes Alinear la Superinteligencia Resolver la alineación significa controlar algo más inteligente que nosotros. Superinteligencia está en el nombre. Ese plan es tonto e imposible. Soy un optimista que cree que todo es posible, pero no controlar la superinteligencia Puede que la física algún día permita controlar la gravedad o viajar más rápido que la luz. Sigo sin ver cómo controlamos una mente más inteligente que nosotros.