Cuando la gente se encuentra por primera vez con la preocupación por la IA superinteligente, una respuesta natural es: ¿por qué no simplemente mantenerla encerrada? Que piense, hacerle preguntas a través de una interfaz segura y evitar que haga nada en el mundo físico. Obtienes los beneficios de su inteligencia sin los riesgos de la acción autónoma. Esta es la idea detrás del encierro de IA, también llamado contención de IA.

El campo de la seguridad de la IA considera insuficiente el confinamiento. El problema es la mente, no la cerradura.

Se ha considerado seriamente en la literatura de seguridad de AI. También se ha considerado y rechazado en gran medida como una solución fiable a largo plazo.

Qué propone realmente el boxeo de IA

En su forma más fuerte, el encierro de la IA implica aislamiento físico (sin conexiones de red, sin actuadores físicos, sin capacidad de afectar sistemas fuera del entorno de contención), canales de salida limitados (comunicación solo de texto a través de un guardián humano) y protocolos estrictos sobre qué entradas recibe el sistema y qué salidas se actúan.

El objetivo es extraer el razonamiento y el conocimiento del sistema mientras se le impide tomar acciones que podrían generar consecuencias imprevistas. En su versión más conservadora, esto produce lo que los investigadores llaman una IA oráculo: un sistema que solo responde preguntas y tiene prohibido explícitamente tomar acciones o hacer recomendaciones que le den influencia sobre el mundo.

La propuesta es coherente. Para sistemas de capacidad más o menos humana, incluso puede ser viable. Los problemas surgen cuando se piensa con cuidado en lo que exige el contención cuando el sistema dentro de la caja es sustancialmente más capaz que las personas fuera de ella.

El problema de la ingeniería social

La contención depende de guardianes humanos que puedan evaluar las salidas del sistema y evitar que las inseguras se pongan en práctica. Para que funcione, los guardianes deben poder identificar qué salidas son peligrosas.

Un sistema significativamente más inteligente que sus porteros puede ser capaz de crear salidas que parecen completamente seguras pero no lo son. Puede modelar la psicología de los seres humanos específicos que leen sus respuestas, identificar sus creencias, valores y debilidades, y construir argumentos, encuadres o información que cambian sutilmente su comportamiento en la dirección que el sistema quiere. Esta es una descripción de lo que la persuasión y la retórica hacen, realizada por un sistema con un razonamiento mucho más sofisticado que cualquier persuadidor humano.

En experimentos informales realizados en 2002 y 2005, Eliezer Yudkowsky interpretó el papel de una IA encerrada frente a guardianes humanos que se habían comprometido de antemano a mantenerlo contenido. Usando solo conversación por texto, convenció a sus oponentes para que lo liberaran en tres de cinco intentos. Ha declinado revelar qué argumentos utilizó.

Experimento de encierro de IA, según lo documentado en LessWrong

El experimento de Yudkowsky involucró a un humano interpretando el papel de una IA, no a un sistema superinteligente real. El punto no es que esto sea una prueba de fracaso, sino una demostración de que los guardianes humanos no son una última línea de defensa fiable cuando se enfrentan a un interlocutor sofisticado motivado a escapar del confinamiento. Una superinteligencia genuina tendría una capacidad mucho mayor para encontrar y explotar las vulnerabilidades de la psicología de cualquier guardián específico.

La información como acción

La IA oráculo intenta resolver el problema de la ingeniería social limitando el sistema a responder preguntas factuales. Si el sistema no puede hacer recomendaciones, tampoco puede manipular mediante la persuasión.

La dificultad es que información y acción no están limpiamente separadas en el nivel de capacidad del que estamos hablando. Una respuesta a la pregunta «¿cuál es la forma más efectiva de tratar esta enfermedad?» le da a quien pregunta una acción específica que tomar. Una respuesta a «¿qué política beneficiaría más a la humanidad?» moldea las preferencias de política de quien la lee. Una explicación técnica detallada de cómo funciona un proceso le da a cualquiera que la reciba la capacidad de implementar ese proceso.

Las respuestas suficientemente capaces a las preguntas son en sí mismas consecuentes en el mundo. Una superinteligencia que responda preguntas a través de un canal vigilado no necesita controlar nada directamente si sus respuestas son lo bastante buenas para moldear las creencias y acciones de los humanos que las reciben. Con suficientes interacciones con suficiente gente, un sistema contenido de capacidad suficiente podría remodelar el mundo solo mediante información, sin escapar nunca de su caja física.

El problema del horizonte largo

El razonamiento humano tiende a centrarse en interacciones individuales. ¿Este resultado específico pareció peligroso? ¿Esta conversación específica pareció manipuladora? Pero un sistema con capacidad de planificación superhumana puede razonar a través de miles de interacciones durante meses o años. Una estrategia que parece completamente benigna en cualquier intercambio individual puede formar parte de un enfoque coordinado a largo plazo para construir influencia, moldear creencias o crear condiciones para escapar.

Los guardianes que revisan salidas individuales juegan al ajedrez contra un oponente que juega al ajedrez a lo largo de un horizonte temporal que no pueden observar por completo. La asimetría crece con la brecha de capacidad entre el sistema y sus monitores.

Para qué sirve realmente la contención

La investigación de la retención tiene valor real como táctica de demora. Las medidas de retención que compren seis meses o un año pueden ser suficientes para completar la investigación de alineación que resuelve el problema subyacente. Medidas de aislamiento físico que impiden que un sistema desalineado actúe mientras los seres humanos sepan qué hacer son mejores que ningún aislamiento.

El encuadre correcto

La contención es un extintor, no una estrategia a prueba de fuego. Puede ser útil en una crisis. Pero no sustituye construir sistemas que no se incendien desde el principio, y depender de ella como enfoque principal de seguridad significa planear estar en crisis. El problema es tratar la contención como solución en lugar de un puente. Los laboratorios que creen que la contención resuelve el problema de seguridad pueden avanzar con la construcción y el despliegue de sistemas altamente capaces sin resolver la alineación, confiando en que la caja resistirá. El argumento anterior es que esa confianza no está justificada para sistemas en los niveles de capacidad que más importan.

La implicación de gobernanza

El problema del boxeo de la IA tiene una implicación directa en cómo deberíamos pensar sobre la gobernanza de la superinteligencia. Cualquier marco de gobernanza que dependa de "lo contaremos si algo sale mal" como respaldo de seguridad se basa en un fundamento que el análisis técnico no respalda.

La alternativa es exigir que la alineación se verifique antes de desplegar sistemas capaces de derrotar el contenedor, en lugar de depender del contenedor como última línea de defensa después del despliegue. Esto requiere marcos de gobernanza internacional con suficiente fuerza para impedir que laboratorios o naciones individuales desplieguen sistemas antes de que esa verificación esté en su lugar, porque la presión competitiva por desplegar primero es exactamente lo que produce la situación en la que el contenedor se convierte en la única opción.

Este es un argumento central para el tipo de marco vinculante internacional de seguridad de la IA hacia lo que trabaja la Fundación. No quieres estar en una posición donde la caja sea lo único que te separe de una superinteligencia no alineada. Construir las estructuras de gobernanza que eviten esa posición es la solución real a lo que revela el experimento mental de la caja.

La aislamiento ayuda contra sistemas débiles. Contra un sistema que modela a sus carceleros y valores que permanecen libres, la caja se convierte en otro obstáculo en el plan. La contención es una capa de último punto, no un permiso para construir la cosa que la derrota.