Peter H. Diamandis l'a dit clairement, et Elon Musk a frappé à nouveau: "Seul l'IA peut suivre l'IA. C'est ce qui guidera tout le modèle de sécurité de la prochaine décennie. » Comme une description du rythme, la ligne est difficile à argumenter. Les versions des modèles arrivent plus rapidement que les commissions d'examen trimestrielles. Le code d'attaque mute plus rapidement qu'un analyste humain peut lire le ticket. Si votre image du problème est le volume d'hameçonnage et l'exploitation de churn, bien sûr le défenseur atteint pour l'automatisation. Les humains ne font pas cette échelle.
Le problème commence quand la ligne de Diamandis est demandé de couvrir tout cela vient ensuite, y compris les systèmes qui agissent comme des agents, cachent leurs intentions et finissent par surclasser les personnes qui les ont construits. À ce stade, « seule l’IA peut suivre le rythme » ne signifie plus « utiliser de meilleurs outils contre les logiciels malveillants ». Cela signifie que le modèle de sécurité de la prochaine décennie consistera à confier la tâche de confinement à la catégorie de système que vous essayez de contenir.
Ce que Diamandis obtient bien
Le logiciel se déplace déjà plus vite que l'examen manuel. Les anneaux de fraude font de nouvelles campagnes du jour au lendemain. Les fenêtres de divulgation de vulnérabilité se rétrécissent. Les labs et les fournisseurs de cloud exécutent déjà des scanners automatisés, classificateurs et playbooks de réponse parce qu'une file d'attente humaine ne peut pas regarder chaque paquet. Rien n'exige une vue sur la superintelligence. Si Diamandis ne parlait que de spam et de ransomware, la pièce se terminerait ici.
Il ne parle pas seulement de spam et de ransomware. "L'ensemble du modèle de sécurité de la prochaine décennie" est une revendication plus large. C'est une revendication sur la façon dont la civilisation a l'intention de rester en charge pendant les composés de capacité. C'est là que la ligne de Diamandis cesse d'être une pointe d'ops et devient une philosophie de contrôle.
Le tapis roulant
Imaginez le modèle comme une course entre l'infraction et la défense, tous deux automatisés. Chaque côté s'entraîne sur l'autre. Les défenses s'améliorent et les attaques s'améliorent. Le tableau de bord reste vert jusqu'au jour où il ne l'est pas. L'histoire réconfortante est que la bonne AI reste devant la mauvaise AI. L'histoire moins réconfortante est que vous avez construit une pile dans laquelle les seuls participants compétents sont des machines, et les humains sont les clients d'un concours qu'ils ne peuvent plus arbitrer.
C’est bien pour un antivirus. C’est un pari civilisationnel une fois que les systèmes fixent des objectifs, élaborent des plans et considèrent la surveillance comme un obstacle. Nous voyons déjà les premières versions de ce schéma dans évaluations de scheming et dans les modèles qui raconter une chose tout en optimisant pour une autre. « Suivre » suppose que vous pouvez encore discerner ce que vous suivez. Passé un certain point, vous ne le pouvez plus.
Un modèle de sécurité qui ne fonctionne que si le garde est plus intelligent que le prisonnier est un plan de succession avec des étapes supplémentaires.
La réglementation n'est pas le goulot d'étranglement qu'ils nomment
Les accélérationnistes suivent généralement avec un second mouvement: les institutions linéaires ne peuvent pas gouverner la technologie exponentielle, donc la réponse est plus d'IA dans la boucle. Parfois, cela est jumelé au mépris pour "les experts se rencontrent une fois par trimestre." Assez juste que les réunions lentes sont un mauvais ajustement pour les chutes de modèles hebdomadaires.
Le problème est que contrôle, pas la vitesse de la réunion. Aucun conseil d'administration trimestriel, et aucun moniteur d'IA continu, n'a de méthode fiable pour diriger un système qui est mieux à la persuasion, au codage et à la planification de longue période que les personnes qui détiennent la clé d'arrêt. Rendre le moniteur plus rapide ne crée pas la méthode manquante; elle ne fait que faire échouer la méthode manquante à une fréquence plus élevée.
Il existe une lecture plus claire des mêmes faits. Si seul un système surhumain pouvait superviser un autre système surhumain, la démarche rationnelle n’est pas de construire les deux. Refusons la ligne où la supervision humaine cesse de fonctionner. Nous avons déjà fait ce choix avec des technologies dont le mauvais usage peut détruire des villes. Nous n’avons pas résolu le vol nucléaire en formant un voleur plus intelligent pour attraper le premier.
À qui s'adresse la ligne
La ligne convertit un choix de recherche en temps, donc bien sûr nous expédions et l'échelle. La sécurité sera gérée par la pile de produits elle-même. Les gens qui profitent de la capacité se font entendre comme les adultes dans la pièce, et les gens qui demandent des limites de liaison sonnent comme ils veulent apporter un presse-papiers à une bagarre de chiens.
Tout le monde en aval doit encore vivre avec un système qu'aucun presse-papiers et aucun modèle de chien de garde ne peut contourner de façon fiable. Les récit de la course fait le même travail sous un autre angle : traiter la voie dangereuse comme inévitable, puis qualifier l'accélération de responsabilité.
Un modèle de sécurité qui garde un humain dedans
Pour l'entraînement aux frontières vers la superintelligence artificielle, le modèle de sécurité qui a encore un être humain en lui semble plus vieux et moins glamour: ne construisez pas l'agent que vous ne pouvez pas renverser. Mettez les seuils de calcul, l'inspection et les dents de traité sur les pistes qui vous y mèneraient, puis vérifiez les limites et punir la défection. C'est notre plan, because superintelligence cannot be controlled.
Diamandis est pointu sur la bande passante. Comme un plan pour l'espèce, c'est une façon polie de dire que nous avons l'intention de quitter la pièce.