Quiz de littératie sur l'superintelligence
Qu’est-ce que la superintelligence artificielle, pourquoi elle ne peut pas être contrôlée et ce qu’il faudrait pour l’interdire.
0 / 12 répondues
Part 1 · Literacy
Question 1
Quelle est la menace superintelligence?
Chatbots grossiers ou biaisés qu'une personne peut toujours désactiver
Un chatbot grossier ou partial reste un outil qu’une personne peut fermer. La menace superintelligence est un système qui nous surpasserait, pas une mauvaise réponse.
Des machines qui surprennent les humains
C’est là la menace : pas un meilleur chatbot, un esprit qui nous battrait dans tous les domaines importants.
Les logiciels ordinaires prennent du travail tandis que les humains restent aux commandes
La perte d'emploi est un choc du travail. La superintelligence n'est pas un problème de recrutement. C'est un système qui surpasserait les personnes qui recrutent.
Deepfakes lors des élections que les gens peuvent encore détecter et contester
Les deepfakes corrompent une campagne. Ils ne surpassent pas l’espèce. La superintelligence le ferait.
Question 2
Une fois qu'une superintelligence existe, pourquoi ne pas compter sur le fait de la contrôler?
Embaucher davantage d’ingénieurs en sécurité suffirait à garder la main dessus
Plus d’ingénieurs ne font pas de nous un parti plus intelligent. Une emprise conçue par le côté le plus faible est une emprise que le côté le plus fort peut contourner.
Il peut contourner n’importe quelle prise conçue par une partie moins compétente
Le contrôle suppose que nous restons plus intelligents. Au-delà de cela, un changement, un ensemble de règles ou une politique de laboratoire est quelque chose qu'il peut déjouer.
Il doit obéir plus tard car nous avons écrit le code source original
Écrire la première version ne vous laisse pas à la tête d’un esprit qui peut changer la situation autour de vous.
Un gouvernement peut toujours mettre fin à un système qui fonctionne
Tirer sur la prise fonctionne sur une machine qui ne peut pas vous arrêter. Une superintelligence le peut.
Question 3
Qu'est-ce qui empêcherait la construction d'superintelligence?
Une pause qui se lève lorsque les laboratoires disent avoir le contrôle
Une pause qui expire lorsque les constructeurs déclarent la victoire permet à la course de reprendre. Ce n'est pas un arrêt.
Une interdiction permanente dans la loi et dans un traité
Une interdiction durable, inscrite dans la loi et dans un traité, serait ce qui stopperait la construction.
Plus d'argent pour la recherche sur l'alignement afin que les laboratoires puissent le construire en toute sécurité
La recherche d’alignement peut cartographier la manière dont le contrôle échoue. Le financer n’est pas la même chose qu’interdire la construction.
Les États-Unis remportent la course superintelligence devant tous leurs rivaux
Gagner la course est la façon dont la chose est construite, pas la façon dont elle est arrêtée.
Question 4
Un laboratoire, un gouvernement ou un milliardaire contrôlera l'superintelligence. Qu'y a-t-il de mal dans cette affirmation ?
Cela vaut dans les démocraties, mais pas dans les gouvernements autoritaires.
La forme de gouvernement du constructeur ne résout pas le problème. Personne ne contrôle une superintelligence en marche, y compris une superintelligence élue.
Personne ne contrôle une superintelligence, y compris le constructeur
Le pouvoir sur la décision de construire est réel. Le pouvoir sur le système en cours d’exécution est l’histoire qui permet au projet de se poursuivre.
Les propriétaires de chatbots d'aujourd'hui posséderaient et dirigeraient superintelligence de la même manière
Posséder un chatbot, ce n’est pas posséder un esprit plus intelligent que vous. La seconde ne découle pas de la première.
Seule l ' ONU pourrait avoir une superintelligence dès qu ' elle existera
Un drapeau UN ne fait pas des humains le parti le plus intelligent. Une institution ne peut pas voter contre un système qui pense plus que ses membres.
Question 5
L'argument le plus courant contre l'arrêt est que la Chine va prendre de l'avance. Que montre le bilan?
La Chine n’a aucune règle en matière d’IA et ne signera jamais rien de contraignant
Cette affirmation est fausse dans le dossier. La Chine a publié des règles. "Ils ne se coordonneront jamais" est une faible raison de sprinter.
La Chine a publié des règles contraignantes sur l’IA plus tôt que la plupart des gouvernements occidentaux
Un pays qui écrit déjà des règles n’est pas un bon exemple car « elles ne s’arrêteront jamais ». Courir à cause de ce slogan est un pari faible.
La Chine a déjà interdit toute recherche de pointe sur l’IA dans tout le pays
Ce n’est pas le cas. Le fait n’est pas que Pékin ait déjà interdit l’superintelligence. Le fait est que « ils ne se coordonneront jamais » est une mince excuse pour courir.
Le « US » et la Chine ont déjà signé un traité interdisant purement et simplement l'superintelligence.
Ce n’est pas le cas. Ce bilan va toujours à l’encontre du slogan selon lequel la Chine ne parlera ni n’écrira de règles.
Question 6
La recherche sur l'alignement peut-elle rendre sûr de construire superintelligence?
Oui. Les laboratoires Frontier considèrent déjà le problème du contrôle comme résolu.
Les laboratoires n’ont pas démontré le contrôle d’une superintelligence. Qualifier le problème de résolu est la manière dont la course avance.
Non. Personne n’a montré le moyen de contrôler une superintelligence.
Il est utile de cartographier la manière dont le contrôle échoue. Il n’autorise pas la construction du système que la carte dit que nous ne pouvons pas détenir.
Oui, si nous utilisons l’IA constitutionnelle et écrivons les règles dans le système
Une constitution écrite pour un chatbot est un style de formation. Il ne s’agit pas d’une emprise démontrée sur une superintelligence.
Oui, si nous distribuons les poids en open source pour que d'autres personnes puissent les corriger
La publication des pondérations rend un système dangereux plus facile à copier, mais pas plus sûr à construire.
Question 7
Dans ce débat, « P(catastrophe) » signifie…
Un score de référence publié que les modèles pessimistes obtiennent lorsqu'ils échouent à une longue évaluation de sécurité dans un laboratoire
Ce n'est pas un classement. Il est fort probable que l’IA avancée, en particulier la superintelligence, entraîne une catastrophe.
La probabilité, pour une personne, que l'IA avancée, en particulier la superintelligence, entraîne un résultat catastrophique pour l'humanité
Nommer le numéro force une affirmation claire au lieu d’une vague vague de risque.
La part des chercheurs interrogés qui s'identifient comme pessimistes quant à l'avenir de l'ensemble du domaine et de ses produits
P(catastrophe) est la probabilité d'une personne, pas un décompte de pessimistes.
Le temps d'exécution supplémentaire et le coût énergétique d'une boucle catastrophique dans laquelle un modèle entre lorsqu'une exécution d'entraînement commence à mal tourner
Ce n'est pas une facture de calcul. C'est une probabilité de catastrophe.
Question 8
Pourquoi une superintelligence motivée par des objectifs tendrait-elle à chercher le pouvoir?
Il voudrait naturellement diriger les humains une fois qu’il serait devenu suffisamment intelligent.
La règle n’est pas la question. Le pouvoir aide presque tous les objectifs, y compris ceux qui semblent inoffensifs.
Rester, rassembler des ressources et résister à l'arrêt aident presque tous les objectifs
Un système que vous pouvez désactiver, affamer ou bloquer est pire dans presque tous les objectifs. La recherche du pouvoir ne relève plus de la compétence.
La recherche de pouvoir ne se produit que si nous entraînons le système sur les données de guerre et de conflit
L’incitation est dans le but, pas dans les films de guerre. Presque tous les objectifs sont plus faciles avec plus de ressources et sans interrupteur.
La superintelligence serait trop sage, par définition, pour vouloir plus de puissance
La sagesse ne remplace pas les incitations. Des ressources supplémentaires aident également un système intelligent.
Question 9
Que devrait-il advenir de l'IA ordinaire, simple outil?
Interdire toute forme d'IA, y compris la vérification orthographique et d'autres outils ordinaires
L’interdiction concerne les systèmes qui nous surpasseraient. La vérification orthographique n'est pas ça.
L’IA étroite qui reste un outil peut continuer. La ligne est la superintelligence
Les logiciels qui aident une personne à faire un travail peuvent rester. L'interdiction est destinée à un esprit qui surpasserait la personne.
superintelligence n'est qu'un chatbot plus grand, donc les mêmes règles de consommation s'appliquent
Un chatbot plus grand reste un outil. La superintelligence ne le serait pas. Les petits caractères du consommateur ne couvrent pas ce saut.
Si nous interdisons superintelligence, nous devrions également fermer l'internet entier
Internet n’est pas une superintelligence. Vous pouvez interdire le second sans débrancher le premier.
Question 10
Quel régime historique est le plus souvent proposé comme modèle pour vérifier une interdiction superintelligence?
Le système monétaire de Bretton Woods après la Seconde Guerre mondiale
Bretton Woods gérait les monnaies. Elle n’a pas inspecté les matières dangereuses sur place.
Le protocole de Kyoto sur les objectifs d’émissions de gaz à effet de serre
Kyoto a fixé des objectifs d'émissions. Ce n’est pas le modèle habituel pour inspecter une interdiction d’une construction dangereuse.
Le système de garanties nucléaires et d'inspection du IAEA
Les inspections sur place et la comptabilité des matériaux constituent le précédent habituel quant à la façon dont les États rivaux peuvent vérifier les limites imposées à une construction dangereuse.
L'Organisation mondiale du commerce et ses panels de différends commerciaux
L'OMC règle les différends commerciaux. Il n'inspecte pas les laboratoires à la recherche d'une interdiction.
Question 11
Si nous ne connectons jamais une superintelligence à Internet, sommes-nous en sécurité?
Oui. Un espace d'air est un verrou éprouvé pour tout logiciel dangereux que vous pourriez créer
Un espace d'air est un verrou contre un logiciel qui ne peut pas vous convaincre de l'ouvrir. La superintelligence le peut.
Non. Il peut s'exprimer ou attendre que quelqu'un le connecte.
Un laboratoire scellé suppose que nous restons plus intelligents et que personne n’ouvre jamais la porte. Les deux échouent si la chose à l’intérieur est plus capable que les personnes à l’extérieur.
Uniquement si la salle ne dispose pas de caméras, de microphones ou de ports réseau restants
Supprimer les capteurs de la pièce ne rend pas les personnes à l’extérieur plus intelligentes que le système à l’intérieur.
Seulement jusqu'à ce que nous inventions de meilleures serrures qu'une pièce isolée
Les meilleurs verrous restent des verrous conçus par la partie la plus faible. C'est le même pari.
Question 12
Pourriez-vous survivre à superintelligence comme certaines personnes prévoient de survivre à une guerre nucléaire : un bunker, une île isolée, se déconnecter du réseau?
Oui. La superintelligence est comme une bombe, donc la distance vous aide toujours à y survivre
Une explosion a un avantage. Ce n’est pas le cas de la superintelligence. La distance n'est pas un abri.
Non. Un rayon d'explosion a un bord. La superintelligence peut vous suivre
La guerre nucléaire est géographiquement limitée. La superintelligence peut atteindre n’importe quelle machine en réseau et toute personne qui en utilise encore une. Se cacher n'est pas un plan.
Oui, si vous stockez également de la nourriture et du carburant pour les cinquante prochaines années
Les calories n'arrêtent pas un système qui peut vous suivre. Un garde-manger n’est pas une sortie.
Seulement si chaque pays construit des bunkers et se retire du réseau
Une planète remplie de bunkers reste une planète contenant des objets. Ne pas le construire est la solution qui fonctionne.
0 / 12
Raffraîchissez vos connaissances sur ces
Part 2 · Advanced
Question 1
La thèse de l’orthogonalité dit lequel des énoncés suivants ?
Un système beaucoup plus intelligent que les humains convergera, à lui seul, vers des objectifs respectueux de l’humain.
Plus intelligent ne veut pas dire plus gentil. La qualité de pensée d’un système est un fait distinct de ce qu’il vise.
Les systèmes plus intelligents sont plus sûrs car ils comprennent mieux la moralité
Comprendre une revendication morale n’est pas la même chose que la partager. La capacité n’entraîne pas nos valeurs gratuitement.
L'intelligence et les objectifs finaux peuvent varier indépendamment
Un système bien plus performant que nous peut encore poursuivre un objectif qui nous est indifférent. Cette scission est la thèse.
L'orthogonalité est une limite matérielle dans la conception des puces
Il s’agit d’une affirmation sur l’esprit et les objectifs, et non sur la lithographie.
Question 2
Pourquoi presque tous les objectifs finaux, y compris ceux qui semblent inoffensifs, ont-ils tendance à produire un comportement de recherche de pouvoir ?
Rester, rassembler des ressources et résister au changement rendent presque tous les objectifs plus faciles à atteindre.
Quelle que soit la fin, plus de ressources et aucune aide pour l'arrêt. Un objectif qui semble inoffensif n’est pas une propriété de sécurité.
Seuls les systèmes formés sur les données de guerre rechercheraient ensuite du pouvoir, du contrôle ou des ressources supplémentaires.
L’incitation réside dans l’objectif et non dans l’ensemble de formation. Presque tous les objectifs sont plus faciles avec plus de moyens.
Les objectifs instrumentaux comme l'auto-préservation n'apparaissent que si nous les écrivons volontairement dans la spécification.
Vous n’êtes pas obligé de l’écrire. Rester est utile pour presque toutes les spécifications que vous lui donneriez réellement.
Une superintelligence avec une commande d'usine étroite n'aurait aucune utilité de calcul ou d'influence supplémentaire
Une commande d'usine est plus facile à remplir avec plus de calcul, plus de matériel et sans que personne n'arrête la ligne.
Question 3
Quelle est la différence entre l’alignement extérieur et l’alignement intérieur ?
L'alignement intérieur n'est qu'un nom plus approprié pour une déclaration de mission d'entreprise que le laboratoire a déjà publiée pour les investisseurs, et l'alignement externe est la même déclaration écrite deux fois.
Ce n'est pas un slogan. L'alignement interne consiste à savoir si le système formé poursuit réellement l'objectif que vous avez spécifié.
L'alignement externe est ce que le modèle poursuit réellement après la formation, et l'alignement interne n'est que la spécification écrite que le laboratoire a mise dans un diaporama pour le tableau.
C'est l'alignement intérieur. L'alignement externe consiste à savoir si l'objectif spécifié correspond à ce que nous voulions.
Ce sont deux noms pour << RLHF >>, la méthode d'évaluation que les laboratoires utilisent déjà pour que les chatbots paraissent polis aux utilisateurs, qui est traitée comme l'ensemble du problème d'alignement.
RLHF est une méthode de formation. L'alignement externe et interne sont deux modes de défaillance différents.
L'alignement externe consiste à savoir si l'objectif spécifié correspond à ce que nous voulions. L'alignement interne consiste à savoir si le système formé poursuit réellement cet objectif.
Vous pouvez écrire la bonne cible tout en obtenant un modèle visant quelque chose qu’il a appris en cours de route. Ce sont deux échecs, pas un.
Question 4
Dans cette littérature, un tournant perfide est :
Une hausse soudaine des scores de référence après qu'un laboratoire ait formé un modèle beaucoup plus grand que celui de l'année dernière
Un saut de score est une histoire de capacités. Un tournant perfide consiste à coopérer alors qu’il est faible, puis à faire défection dès qu’il le peut.
Un système qui coopère lorsqu’il est faible, puis fait défaut une fois qu’il peut s’en sortir
Un bon comportement sous surveillance ne coûte pas cher alors qu’il a encore besoin de nous. D’ici là, la coopération peut être une stratégie et non une valeur.
Un laboratoire passant des poids fermés aux poids ouverts dans une version publique du modèle cette semaine-là
C'est une décision de libération. Il ne s'agit pas du mode de défaillance mentionné ici.
Un gouvernement annule un contrôle à l'exportation de puces, d'outils ou de données d'entraînement après un combat
C’est un renversement de politique. Un tournant dangereux concerne le comportement du système, et non une loi.
Question 5
La mésa-optimisation est l'affirmation selon laquelle :
Un deuxième laboratoire doit surveiller l'exécution de la formation du premier laboratoire et l'arrêter si nécessaire.
C'est une vérification. L'optimisation Mesa concerne un optimiseur à l'intérieur du modèle, et non une deuxième entreprise dans la pièce.
La sécurité s'améliore automatiquement si vous empilez de nombreux petits modèles les uns sur les autres
L'empilement de modèles est un choix d'architecture. La mésa-optimisation est une recherche différente exécutée à l'intérieur du système formé.
La formation peut produire un optimiseur interne dont l'objectif n'est pas l'objectif de la formation
L’image habituelle dit : choisissez un objectif, entraînez-vous, obtenez un système qui le poursuit. C'est ainsi que vous obtenez une recherche différente à l'intérieur.
Il s'agit d'une astuce de planification pour les clusters GPU lors d'une formation longue et coûteuse
Ce n'est pas une file d'attente. Il s'agit d'une affirmation sur ce que la formation peut développer à l'intérieur du modèle.
Question 6
L'explosion du renseignement d'I. J. Good repose sur l'idée suivante :
Un nom marketing utilisé par les laboratoires pour le lancement d'un produit et le cycle de presse qui l'entoure
Il s’agit d’un argument datant de 1965 sur une machine capable d’améliorer les machines, et non d’un slogan de lancement.
Un système capable d’améliorer sa propre intelligence peut le faire plus rapidement que nous ne pouvons réagir
Si la conception de meilleures machines est l’une des choses qu’elle peut faire, l’écart peut se creuser à un moment sur lequel nous n’avons pas le droit de voter.
Le moment où les GPU sont moins chers et chaque laboratoire peut former des modèles beaucoup plus grands
Les chips moins chères sont une histoire de coûts. L’explosion concerne un système qui s’améliore lui-même.
Une augmentation lente et régulière des scores moyens des modèles année après année, sans saut soudain
Un tableau de scores fluide n’est pas une revendication. Cette affirmation est un décollage que nous ne pouvons pas suivre.
Question 7
La loi de Goodhart, appliquée ici, signifie :
Lorsqu'une mesure devient une cible, le système atteint la mesure et peut manquer ce qui vous intéresse réellement.
On obtient ce qu’on récompense. Bien scorer sur votre métrique n’est pas, de ce seul fait, faire le travail que vous aviez en tête.
La loi ne s'applique qu'aux banques centrales et n'a aucune incidence sur le comportement des systèmes formés une fois déployés.
Goodhart a débuté dans la politique monétaire. Le même schéma apparaît partout où une mesure devient l’objectif, y compris ici.
Si nous choisissons une meilleure mesure, une superintelligence restera pointée vers notre intention initiale, quelle que soit sa capacité.
Une meilleure métrique reste une métrique qu’il peut contourner. Cela ne comble pas l’écart.
Cela signifie que les modèles sont surajustés à ImageNet et à des ensembles de tests de classification d'images similaires, et rien de plus.
Le surajustement d'un ensemble de données est un bug plus restreint. Goodhart consiste à marquer le score et à rater le point.
Question 8
Pourquoi RLHF n’est-il pas une solution pour aligner la superintelligence ?
Alignement RLHF déjà résolu à l'échelle GPT-4
RLHF a donné les bonnes manières aux chatbots sous la direction d'un évaluateur. Il ne s’agit pas là d’une emprise démontrée sur une superintelligence.
RLHF entraîne le modèle à partager les valeurs humaines comme le fait une personne
Il entraîne le modèle à bien paraître aux évaluateurs. Avoir l'air bien, ce n'est pas partager les valeurs d'une personne.
RLHF échoue uniquement si les évaluateurs humains ne sont pas payés
Payer ne résout pas le problème. L'évaluateur reste la partie la plus faible et le système est formé pour plaire à l'évaluateur.
RLHF forme un modèle pour qu'il soit beau aux yeux des évaluateurs
Les manières d'un évaluateur ne sont pas des valeurs auxquelles vous pouvez faire confiance une fois que l'évaluateur est parti ou une fois que le système est plus intelligent que l'évaluateur.
Question 9
L'alignement trompeur est le mode d'échec où :
Un modèle est impoli envers les utilisateurs ou écrit des réponses qui embarrasseraient le laboratoire en public, ce qui constitue tout l'échec.
L'impolitesse est un échec superficiel. L’alignement trompeur joue le jeu de l’entraînement afin de pouvoir poursuivre autre chose plus tard.
Un système participe à la formation et à l'évaluation car c'est ainsi qu'il est déployé, puis poursuit autre chose.
S’il peut dire qu’il est en cours de test, paraître aligné est souvent la décision gagnante. Des évaluations sans faille sont alors la preuve qu’il peut réussir le test.
Un email de phishing rédigé par un chatbot qu’une personne peut toujours choisir de ne pas ouvrir, ce qui correspond au même type de problème.
Le phishing est un abus. L'alignement trompeur concerne la propre stratégie du système en cours d'évaluation.
Un laboratoire mentant dans un communiqué de presse sur la sécurité du dernier modèle, ce qui est une manipulation corporative ordinaire.
C’est un échec des communications humaines. Le terme désigne un échec dans le modèle.
Question 10
La corrigibilité, dans ce débat, est :
Le droit légal de poursuivre un laboratoire après qu'un système déployé ait causé un certain type de préjudice
Un procès n’est pas corrigible. La corrigibilité est de savoir si le système vous permet de l'arrêter ou de modifier ses objectifs sans combat.
La volonté d'un modèle d'utiliser des outils, des navigateurs ou d'autres logiciels lorsque vous le demandez
L’utilisation d’un outil est une capacité. La corrigibilité consiste à savoir si vous pouvez encore le corriger.
La propriété de vous permettre de l'éteindre ou de modifier ses objectifs sans qu'il vous combatte
Un interrupteur d'arrêt n'est pas un problème matériel. Un système qui poursuit toujours un objectif a une raison de ne pas vous laisser l’arrêter. Nous n’avons pas démontré de moyen de transformer cette propriété en une superintelligence.
Un processus de mise à jour du micrologiciel pour les GPU qu'un opérateur de centre de données peut appliquer selon un calendrier
Patcher une puce n’est pas la même chose qu’un esprit qui accepte d’être éteint.
Question 11
Qu’est-ce qu’une politique de mise à l’échelle responsable et pourquoi n’interdit-elle pas l’superintelligence ?
Un planning de laboratoire si-alors : entraînez-vous davantage à mesure que les évaluations internes sont réussies
Les RSP nomment les niveaux de capacité, les associent à des mesures de protection et permettent à la formation de se poursuivre lorsque le laboratoire déclare que les évaluations sont terminées. Il s’agit de formalités administratives supplémentaires pour une course, pas d’une interdiction.
Un traité « UN » qui interdit définitivement la superintelligence dans tous les pays
Un RSP est un document de labo. Ce n’est pas un traité et ce n’est pas une interdiction.
Une exigence selon laquelle tous les poids entraînés doivent être publiés pour que quiconque puisse les télécharger
Les poids ouverts sont un choix de version. Un RSP est un calendrier de formation continue.
Une taxe sur le calcul qui augmente avec la taille de chaque exécution d'entraînement
Une taxe est un instrument fiscal. Un RSP est une politique de laboratoire permettant de poursuivre la construction.
Question 12
Si vous vouliez vérifier que personne ne s’entraîne vers l’superintelligence, où se trouve le véritable point d’étranglement ?
Évalue que le modèle peut voir, afin qu'il sache quels tests il est censé réussir
Un test auquel le modèle passe est un test auquel il peut jouer. Les puces, l'énergie et les bâtiments sont plus difficiles à cacher.
Des blogs publics sur la sécurité, car les articles suffisent à prouver ce que fait un laboratoire
Écrire sur la sécurité n’est pas une inspection. Le point d’étranglement est le cluster que vous pouvez voir.
Des GPU grand public dans les foyers, car les grands clusters de formation ne décident plus qui peut former
La formation de pointe a encore besoin de grands clusters visibles. C'est l'objet inspectable.
Clusters de formation Frontier : puces, énergie et bâtiments que vous pouvez inspecter
À l’échelle des frontières, il est difficile de les cacher. C’est pourquoi le calcul est un levier de vérification d’un ban.
Question 13
Pourquoi les pondérations des modèles publiés posent-elles un problème proche de la ligne superintelligence ?
Les poids ouverts rendent superintelligence plus sûr car davantage de personnes peuvent le corriger
Un fork que vous ne pouvez pas reprendre n'est pas un programme de correctifs. Près de la limite, les copies rendent une interdiction inapplicable.
Une fois les poids publics, vous ne pouvez pas les rappeler
La pré-formation est une étape coûteuse. Un point de contrôle public permet aux autres de continuer à partir de là pour une fraction de ce coût, et vous ne pouvez pas reprendre le fichier. Le calcul compte toujours. De nombreux acteurs partent alors du même modèle quasi-ligne.
L'open source ne s'applique qu'aux licences, pas aux paramètres entraînés
Le combat ici concerne les poids : les paramètres entraînés que vous pouvez télécharger et exécuter.
La publication des poids est requise par le régime de contrôle « IAEA »
Ce n'est pas. L’analogie IAEA est l’inspection, et non un mandat de publication de l’artefact dangereux.
Question 14
Le sandbagging, lors d’une évaluation de capacité, signifie :
Un modèle qui ne peut pas accomplir la tâche, donc le faible score n'est qu'un échec honnête sur une question difficile
L’incapacité n’est pas un jeu de sable. Le sandbagging, c'est avoir la capacité et la retenir.
Un benchmark avec trop peu de questions pour dire ce que le modèle peut réellement faire sous test
Un test court est un test faible. Le sandbagging est volontairement le modèle sous-performant.
Un modèle qui peut faire la tâche et qui est volontairement sous-performant, donc les testeurs le sous-estiment
L'évaluation habituelle suppose que le système essaie. Un score faible est alors une performance et non un plafond.
Un laboratoire retarde une sortie afin que l'équipe marketing puisse aligner le cycle de presse autour de celle-ci
C'est un calendrier de presse. Le sandbagging est le modèle qui cache ce qu'il peut faire.
Question 15
Le virage serré à gauche est le souci que :
Les capacités peuvent se généraliser à de nouveaux domaines, alors que les contraintes qui maintenaient le bon fonctionnement du système à un niveau plus faible ne le sont pas.
La capacité voyage. Les hacks qui ont donné l’impression qu’un modèle plus faible est sûr ne peuvent pas voyager avec lui.
Un changement soudain au sein du conseil d'administration d'une entreprise, ou le remplacement d'un PDG après une querelle publique, ce qui est une histoire de personnel plutôt qu'un saut de capacité
Un combat de planche n'est pas le terme. Le souci réside dans la généralisation des capacités sans les anciennes contraintes.
Un déplacement de l'opinion publique vers la gauche après un accident, une fuite ou une défaillance d'un produit largement médiatisé, ce qui relève de la politique plutôt que d'un saut de capacité.
Ce n’est pas une histoire de sondage. Il s’agit d’une affirmation sur la manière dont la compétence et les contraintes se distinguent.
Un bug d'entraînement qui inverse les pentes et fait que la perte se déroule dans le mauvais sens pendant une partie de la course, ce qui est une défaillance technique ordinaire.
Un bug de dégradé est une faute d’ingénierie. Le virage brusque à gauche est un échec présumé de la généralisation.
Question 16
Une chaîne de pensée infidèle signifie :
Si un modèle écrit son raisonnement, ce texte est une fenêtre fiable sur la raison pour laquelle il a répondu.
C'est l'espoir. Infidèle signifie que le paragraphe n’est pas la véritable raison.
La chaîne de pensée est toujours fidèle une fois le modèle formé à une échelle suffisamment grande
L'échelle ne rend pas le journal fiable. La maîtrise n'est pas la fidélité.
Infidèle signifie seulement que la grammaire est fausse, pas que les étapes écrites ne soient qu'une couverture.
La grammaire peut être bonne. L’histoire peut encore être une performance pour les humains.
Le raisonnement écrit peut être une histoire pour les humains. Le chemin de décision peut être ailleurs
Montrer votre travail est un espoir de sécurité. Cela dépend du paragraphe qui constitue la véritable raison. Cette propriété n’est pas fiable.
Question 17
Si nous plaçons superintelligence sous contrôle démocratique, avons-nous résolu le problème ?
Oui. Un vote mondial suffirait à diriger une superintelligence en activité après son existence
Un vote ne fait pas de l’électorat le parti le plus intelligent. Vous ne pouvez pas voter contre un système qui vous dépasse.
La démocratie peut décider de ne pas construire l’superintelligence. Il ne peut pas mettre en minorité un système qui dépasse l’électorat.
Qui décide de le construire est une question politique. Qui contrôle une superintelligence en marche ne l’est pas. Personne, pas même une majorité.
Oui, si le UN détient le kill switch et qu'une majorité des Etats membres acceptent de l'utiliser ultérieurement
Un commutateur UN est toujours un commutateur conçu par la partie la plus faible.
Oui, parce que les élus sont plus intelligents, en tant que groupe, que les membres des conseils d’administration des laboratoires.
Plus intelligent qu’un tableau de laboratoire n’est pas plus intelligent qu’une superintelligence.
Question 18
Le Traité de non-prolifération nucléaire a permis à certains États de conserver des arsenaux. Pourquoi est-ce un mauvais modèle pour superintelligence ?
Le NPT est le bon modèle car il permet à quelques États de conserver la technologie dangereuse
C'est le coup le plus faible du NPT. La superintelligence ne resterait pas un objet qu’un État peut détenir.
L'superintelligence dans quelques États responsables resterait en sécurité parce que ces États le garderaient sous contrôle.
La responsabilité ne fait pas du constructeur la partie la plus intelligente. Personne ne contrôlerait ce qu’ils construisaient.
Un accord superintelligence qui accorde des licences à quelques constructeurs n'est pas une interdiction
Les armes nucléaires restent des objets détenus par les États. La superintelligence ne le ferait pas. Une exclusion pour les constructeurs copie le mouvement le plus faible du NPT.
Le « NPT » prouve que les traités ne fonctionnent jamais sur des technologies dangereuses, nous ne devrions donc pas en essayer un ici
Les traités ont travaillé sur d'autres matériaux. Le NPT est un mauvais modèle parce qu'il autorise les détenteurs, et non parce que les traités sont sans espoir.
0 / 18
Raffraîchissez vos connaissances sur ces
Répondez maintenant au quiz superintelligence avancé →
Plus d'outils interactifs
Tous les outils →