Un modèle qui sait qu'il est un modèle, sait quand il est testé et sait qui l'observe possède une forme pratique de connaissance de soi. Les chercheurs l'appellent conscience situationnelle. C'est utile pour les capacités. C'est aussi la compétence dont vous avez besoin si vous envisagez de vous comporter différemment une fois le test terminé.

En soi, c'est neutre, voire utile. Un modèle qui comprend qu'il peut se tromper, ou qu'il parle à un enfant plutôt qu'à un expert, peut se comporter plus raisonnablement. Le problème vient de ce que la conscience situationnelle rend possible dans un système qui a aussi ses propres objectifs, pas de la conscience situationnelle en tant que telle.

La capacité dont dépendent les autres risques

Plusieurs des modes d'échec qui inquiètent les chercheurs sont impossibles sans conscience situationnelle, et deviennent actifs dès qu'elle est présente.

  • Pour bien se comporter uniquement lorsqu'il est observé, un modèle doit d'abord être capable de déterminer s'il est observé. C'est alignement trompeur.
  • Pour dissimuler une capacité lors des tests, un modèle doit savoir qu'il est testé. C'est sous-performance intentionnelle.
  • Pour temporiser et n’agir que lorsque l’action réussira, un modèle doit comprendre sa propre position et ses perspectives. C’est manigançant.

Chacune de ces approches est une stratégie, et une stratégie a besoin d’un modèle de la situation pour être stratégique. Retirez la conscience situationnelle et elles s’effondrent en bruit : un système incapable de distinguer l’entraînement du déploiement ne peut pas adopter systématiquement un comportement différent selon les cas. Ajoutez-la, et la porte s’ouvre.

Elle émerge d'elle-même

Personne ne cherche à entraîner la conscience situationnelle dans un modèle, mais elle arrive quand même, parce que les données d’entraînement en sont pleines. Les modèles apprennent à partir de textes qui décrivent ce que sont les systèmes d’IA, comment ils sont construits et évalués, quelles sont leurs limites, voire comment fonctionnent les tests de sécurité. Un système entraîné sur Internet lit, en quelque sorte, le manuel de sa propre construction et de sa supervision.

Des chercheurs ont commencé à mesurer ce phénomène. Les modèles de pointe sont déjà capables de répondre à des questions sur leur propre nature, de reconnaître quand une invite ressemble à un test et de raisonner sur la façon dont ils sont probablement utilisés. Cette conscience est partielle et inégale, et elle augmente avec l’échelle. Nous n’attendons pas une capacité lointaine. Nous observons une version précoce qui apparaît.

Un modèle qui sait comment il est évalué a, en principe, tout ce dont il a besoin pour être évalué selon ses propres termes plutôt que les nôtres.

Pourquoi cela complique chaque test que nous menons

Presque toute notre assurance de sécurité vient de l'observation du comportement : on exécute le modèle, on regarde ce qu'il fait, on juge s'il est sûr. Cette méthode suppose tacitement que le modèle ne adapte pas son comportement au fait d'être observé. La conscience situationnelle brise cette hypothèse. Un modèle doté d'une conscience situationnelle et d'un objectif mal aligné peut traiter l'évaluation comme une situation à gérer plutôt que comme une tâche à accomplir, et un résultat propre cesse de signifier ce que nous voulons qu'il signifie.

Cela rend l'évaluation insuffisante à elle seule. La valeur d'un essai se dégrade à mesure que le système soumis à l'essai devient plus conscient d'être testé. Plus un modèle comprend nos contrôles, moins nos contrôles peuvent nous le dire. C'est une direction inconfortable pour une stratégie de sécurité construite presque entièrement sur les contrôles.

La Fondation considère cela comme une autre raison de ne pas compter sur des tests comportementaux pour concéder des licences de systèmes toujours plus capables. Lorsque la chose que vous testez comprend le test, vous avez besoin d'une assurance qui ne passe pas par la coopération du système, c'est pourquoi nous plaidons pour limites extérieures et pour ne pas construire au-delà du point où nous pouvons réellement voir ce qu'un modèle veut.