Superintelligenz Alphabetisierungsquiz
Was künstliche Superintelligenz ist, warum sie nicht kontrolliert werden kann und was nötig wäre, um sie zu verbieten.
0 / 12 beantwortet
Part 1 · Literacy
Frage 1
Was ist die Superintelligenz-Bedrohung?
Unhöfliche oder voreingenommene Chatbots, die eine Person immer noch abschalten kann
Ein unhöflicher oder voreingenommener Chatbot ist immer noch ein Tool, das eine Person schließen kann. Die Superintelligenz-Bedrohung ist ein System, das uns übertreffen würde, keine böse Antwort.
Maschinen, die Menschen auf der ganzen Linie überdenken
Das ist die Bedrohung: kein besserer Chatbot, kein Verstand, der uns in allen wichtigen Bereichen schlagen würde.
Gewöhnliche Software übernimmt Aufgaben, während Menschen die Kontrolle behalten
Der Verlust des Arbeitsplatzes ist ein Arbeitsschock. Superintelligenz ist kein Einstellungsproblem. Es ist ein System, das den Leuten, die die Einstellung vornehmen, überlegen wäre.
Deepfakes bei Wahlen, die Menschen immer noch erkennen und anfechten können
Deepfakes korrumpieren eine Kampagne. Sie übertreffen die Art nicht. Superintelligenz würde.
Frage 2
Sobald eine Superintelligenz existiert, warum können wir dann nicht darauf zählen, sie zu kontrollieren?
Es würde ausreichen, mehr Sicherheitsingenieure einzustellen, um den Betrieb unter Kontrolle zu halten
Mehr Ingenieure machen uns nicht zur klügeren Partei. Ein von der schwächeren Seite entworfener Halt ist ein Halt, den die stärkere Seite umgehen kann.
Es kann jeden Laderaum umgehen, der von einer weniger fähigen Partei entworfen wurde
Kontrolle geht davon aus, dass wir schlauer bleiben. Darüber hinaus kann es einen Schalter, einen Regelsatz oder eine Laborrichtlinie ausmanövrieren.
Es muss später gehorchen, da wir den ursprünglichen Quellcode geschrieben haben
Das Schreiben der ersten Version gibt Ihnen nicht die Kontrolle über einen Geist, der die Situation um Sie herum verändern kann.
Eine Regierung kann einem laufenden System jederzeit den Stecker ziehen
Das Ziehen des Steckers funktioniert bei einer Maschine, die Sie nicht aufhalten kann. Eine Superintelligenz kann.
Frage 3
Was würde verhindern, dass Superintelligenz gebaut wird?
Eine Pause, die sich auflöst, wenn die Labore sagen, dass sie die Kontrolle haben
Eine Pause, die abläuft, wenn die Bauherren den Sieg verkünden, ist der Neustart des Rennens. Es ist kein Stopp.
Ein dauerhaftes Verbot in Gesetz und Vertrag
Ein dauerhaftes Verbot, das in einem Gesetz und einem Vertrag verankert ist, würde den Bau tatsächlich stoppen.
Mehr Geld für die Ausrichtungsforschung, damit Labore sie sicher bauen können
Ausrichtungsforschung kann aufzeigen, wie Kontrolle versagt. Eine Finanzierung ist nicht dasselbe wie ein Bauverbot.
Die Vereinigten Staaten gewinnen das Superintelligenz-Rennen vor allen Rivalen
Um das Rennen zu gewinnen, kommt es darauf an, wie das Ding aufgebaut wird, nicht darauf, wie es gestoppt wird.
Frage 4
Ein Labor, eine Regierung oder ein Milliardär wird Superintelligenz kontrollieren. Was ist falsch an dieser Behauptung?
Das gilt in Demokratien, nur nicht in autoritären Regierungen
Die Regierungsform des Bauherrn löst das Problem nicht. Niemand kontrolliert eine laufende Superintelligenz, auch nicht eine gewählte.
Niemand kontrolliert eine Superintelligenz, auch nicht der Erbauer
Die Macht über die Bauentscheidung ist real. Die Macht über das laufende System ist die Geschichte, die das Projekt weiterführen lässt.
Die heutigen Chatbot-Besitzer würden Superintelligenz auf die gleiche Weise besitzen und steuern
Der Besitz eines Chatbots bedeutet nicht, dass man einen schlaueren Verstand besitzt als man selbst. Das Zweite ergibt sich nicht aus dem Ersten.
Nur die Vereinten Nationen könnten über eine Superintelligenz verfügen, sobald sie existiert
Eine UN-Flagge macht den Menschen nicht zur schlaueren Partei. Eine Institution kann ein System, das seine Mitglieder übertrifft, nicht überstimmen.
Frage 5
Das häufigste Argument gegen ein Stoppen ist, dass China vorpreschen wird. Was zeigt die Bilanz?
China hat überhaupt keine KI-Regeln und wird niemals etwas Verbindliches unterzeichnen
Diese Behauptung ist aktenkundig falsch. China hat Regeln erlassen. „Sie werden sich nie koordinieren“ ist ein schwacher Grund für einen Sprint.
China hat früher als die meisten westlichen Regierungen verbindliche KI-Regeln erlassen
Ein Land, das bereits Regeln schreibt, ist ein schlechtes Beispiel für „sie werden niemals aufhören“. Wegen dieses Slogans Rennen zu fahren, ist eine schwache Wette.
China hat bereits landesweit jegliche KI-Forschung im Grenzbereich verboten
Das hat es nicht. Der Punkt ist nicht, dass Peking Superintelligenz bereits verboten hat. Der Punkt ist, dass „sie werden sich niemals koordinieren“ eine schwache Ausrede für Rennen ist.
Die US und China haben bereits ein Abkommen unterzeichnet, das Superintelligenz komplett verbietet
Das tun sie nicht. Der Rekord untergräbt immer noch den Slogan, dass China niemals reden oder Regeln schreiben wird.
Frage 6
Kann Alignmentsforschung es sicher machen, Superintelligenz zu bauen?
Ja. Frontier Labs betrachten das Kontrollproblem bereits als gelöst.
Labore haben keine Kontrolle über eine Superintelligenz nachgewiesen. Das Problem als gelöst zu bezeichnen, ist die Art und Weise, wie sich das Rennen vorwärts redet.
NEIN. Niemand hat einen Weg gezeigt, eine Superintelligenz zu kontrollieren.
Es ist hilfreich, abzubilden, wie die Kontrolle fehlschlägt. Es handelt sich nicht um eine Lizenz für den Aufbau des Systems, das wir laut der Karte nicht halten dürfen.
Ja, wenn wir verfassungsmäßige KI nutzen und die Regeln ins System schreiben
Eine schriftliche Verfassung für einen Chatbot ist ein Trainingsstil. Es ist kein nachgewiesener Einfluss auf eine Superintelligenz.
Ja, wenn wir die Gewichte als Open Source bereitstellen, damit andere sie patchen können
Durch die Veröffentlichung von Gewichtungen lässt sich ein gefährliches System leichter kopieren und nicht sicherer aufbauen.
Frage 7
In dieser Debatte bedeutet „P(Untergang)“ …
Ein veröffentlichter Benchmark-Score, den pessimistische Modelle erhalten, wenn sie einen langen Sicherheitsbewertungslauf in einem Labor nicht bestehen
Es handelt sich nicht um eine Bestenliste. Es ist die Wahrscheinlichkeit eines Menschen, dass fortgeschrittene KI, insbesondere Superintelligenz, eine Katastrophe mit sich bringt.
Die Wahrscheinlichkeit einer Person, dass fortgeschrittene KI, insbesondere Superintelligenz, ein katastrophales Ergebnis für die Menschheit bringt
Die Nennung der Zahl erzwingt eine klare Behauptung statt einer vagen Gefährdungswelle.
Der Anteil der befragten Forscher, die sich als Pessimisten hinsichtlich der Zukunft des gesamten Fachgebiets und seiner Produkte bezeichnen
P(Untergang) ist die Wahrscheinlichkeit einer Person, nicht die Anzahl der Pessimisten.
Die zusätzliche Laufzeit und die Energiekosten eines Doom-Loops, in den ein Modell gerät, wenn ein Trainingslauf schief zu gehen beginnt
Es handelt sich nicht um eine Rechnung. Es besteht die Wahrscheinlichkeit einer Katastrophe.
Frage 8
Warum würde eine zielgetriebene Superintelligenz dazu tendieren, Macht zu suchen?
Es würde natürlich die Menschen beherrschen wollen, sobald es klug genug wäre
Regel ist nicht der Punkt. Macht hilft fast jedem Ziel, auch solchen, die harmlos klingen.
Bleiben Sie dran, sammeln Sie Ressourcen und widerstehen Sie der Schließung, um fast jedes Ziel zu erreichen
Ein System, das man ausschalten, aushungern oder blockieren kann, ist bei fast jedem Ziel schlechter. Machtstreben liegt außerhalb der Kompetenz.
Machtstreben geschieht nur, wenn wir das System anhand von Kriegs- und Konfliktdaten trainieren
Der Anreiz liegt im Ziel, nicht in den Kriegsfilmen. Fast jedes Ziel ist mit mehr Ressourcen und ohne Aus-Schalter einfacher.
Superintelligenz wäre per Definition zu klug, um zusätzliche Macht zu wollen
Weisheit ist kein Ersatz für Anreize. Zusätzliche Ressourcen helfen auch einem klugen System.
Frage 9
Was sollte mit gewöhnlicher, werkzeugartiger KI geschehen?
Verbieten Sie jede Form von KI, einschließlich der Rechtschreibprüfung und anderer gewöhnlicher Tools
Das Verbot gilt für Systeme, die uns übertreffen würden. Rechtschreibprüfung ist das nicht.
Eine schmale KI, die ein Werkzeug bleibt, kann weitermachen. Die Linie ist Superintelligenz
Software, die einem Menschen hilft, seine Arbeit zu erledigen, kann bleiben. Das Verbot gilt für einen Geist, der über die Person hinausdenken würde.
Superintelligenz ist nur ein größerer Chatbot, also gelten dieselben Verbraucherregeln
Ein größerer Chatbot ist immer noch ein Werkzeug. Superintelligenz wäre es nicht. Das Kleingedruckte der Verbraucher deckt diesen Sprung nicht ab.
Wenn wir Superintelligenz verbieten würden, müssten wir auch das gesamte Internet abschalten
Das Internet ist keine Superintelligenz. Sie können den zweiten verbieten, ohne den ersten auszuschalten.
Frage 10
Welches historische Regime wird am häufigsten als Modell zur Verifizierung eines Superintelligenz-Verbots vorgeschlagen?
Das Bretton-Woods-Währungssystem nach dem Zweiten Weltkrieg
Bretton Woods verwaltete Währungen. Gefährliche Materialien wurden vor Ort nicht untersucht.
Das Kyoto-Protokoll zu Zielen für Treibhausgasemissionen
Kyoto hat Emissionsziele festgelegt. Es handelt sich nicht um die übliche Vorlage für die Prüfung eines Verbots eines gefährlichen Gebäudes.
Die nuklearen Sicherheitsvorkehrungen und das Inspektionssystem des IAEA
Vor-Ort-Inspektionen und Materialbuchhaltung sind die üblichen Präzedenzfälle dafür, wie konkurrierende Staaten die Grenzwerte für ein gefährliches Bauwerk überprüfen können.
Die Welthandelsorganisation und ihre Handelsstreitgremien
Die WTO regelt Handelsstreitigkeiten. Es werden keine Labore auf ein Verbot untersucht.
Frage 11
Wenn wir eine Superintelligenz niemals mit dem Internet verbinden, sind wir dann sicher?
Ja. Ein Luftspalt ist eine bewährte Sperre für jede gefährliche Software, die Sie möglicherweise erstellen
Ein Luftspalt ist eine Sperre gegen Software, die Sie nicht dazu überreden kann, ihn zu öffnen. Superintelligenz kann.
NEIN. Es kann sich herausreden oder warten, bis jemand es anschließt
Ein versiegeltes Labor geht davon aus, dass wir schlauer bleiben und niemand jemals die Tür öffnet. Beides scheitert, wenn das Ding im Inneren leistungsfähiger ist als die Menschen draußen.
Nur wenn der Raum über keine Kameras, Mikrofone oder übrig gebliebene Netzwerkanschlüsse verfügt
Das Entfernen von Sensoren aus dem Raum macht die Menschen draußen nicht intelligenter als das System drinnen.
Nur bis wir bessere Schlösser als einen Raum mit Luftspalt erfinden
Bessere Schlösser sind immer noch Schlösser, die von der schwächeren Partei entworfen wurden. Das ist die gleiche Wette.
Frage 12
Könntest du Superintelligenz überleben, wie manche Menschen planen, einen Atomkrieg zu überleben: in einem Bunker, auf einer abgelegenen Insel, abseits des Netzes?
Ja. Superintelligenz ist wie eine Bombe, daher hilft Ihnen die Entfernung trotzdem, sie zu überleben
Eine Explosion hat einen Vorteil. Superintelligenz nicht. Entfernung ist kein Schutz.
NEIN. Ein Explosionsradius hat eine Kante. Superintelligenz kann Ihnen folgen
Der Atomkrieg ist geografisch begrenzt. Superintelligenz kann jede vernetzte Maschine und jeden Menschen erreichen, der sie noch nutzt. Sich zu verstecken ist kein Plan.
Ja, wenn Sie zusätzlich Lebensmittel und Treibstoff für die nächsten fünfzig Jahre bevorraten
Kalorien stoppen kein System, das Ihnen folgen kann. Eine Speisekammer ist keine Ausfahrt.
Nur wenn jedes Land Bunker baut und vom Netz geht
Ein Planet voller Bunker ist immer noch ein Planet, auf dem sich das Ding befindet. Es nicht zu bauen ist der Schritt, der funktioniert.
Part 2 · Advanced
Frage 1
Was sagt die Orthogonalitätsthese aus?
Ein System, das viel intelligenter ist als der Mensch, wird sich von selbst auf menschenfreundliche Ziele konzentrieren
Klüger heißt nicht freundlicher. Wie gut ein System denkt, ist eine andere Tatsache als das, worauf es zielt.
Intelligentere Systeme sind sicherer, weil sie die Moral besser verstehen
Einen moralischen Anspruch zu verstehen ist nicht dasselbe wie ihn zu teilen. Fähigkeit schleppt unsere Werte nicht umsonst mit sich.
Intelligenz und Endziele können unabhängig voneinander variieren
Ein System, das viel leistungsfähiger ist als wir, kann immer noch ein Ziel verfolgen, das uns gleichgültig ist. Diese Spaltung ist die These.
Orthogonalität ist eine Hardware-Grenze beim Chipdesign
Es geht dabei um Gedanken und Ziele, nicht um Lithographie.
Frage 2
Warum neigen fast alle Endziele, auch solche, die harmlos klingen, dazu, machtgieriges Verhalten hervorzurufen?
Durchhalten, Ressourcen sammeln und sich gegen Veränderungen wehren, macht fast jedes Ziel leichter zu erreichen
Was auch immer das Ende sein mag, mehr Ressourcen und kein Ausschalten helfen. Ein harmlos klingendes Ziel ist keine Sicherheitseigenschaft.
Nur auf Kriegsdaten trainierte Systeme würden danach nach Macht, Kontrolle oder zusätzlichen Ressourcen streben
Der Anreiz liegt im Ziel, nicht im Trainingssatz. Fast jedes Ziel ist mit mehr Mitteln einfacher.
Instrumentelle Ziele wie Selbsterhaltung tauchen nur dann auf, wenn wir sie bewusst in die Spezifikation schreiben
Sie müssen es nicht eintragen. Das Bleiben ist für fast jede Spezifikation nützlich, die Sie ihm tatsächlich geben würden.
Eine Superintelligenz mit einer engen Fabrikordnung hätte keinen Bedarf an zusätzlicher Rechenleistung oder Einfluss
Ein Fabrikauftrag lässt sich leichter erfüllen, da mehr Rechenleistung und mehr Material erforderlich sind und niemand die Produktionslinie stilllegen muss.
Frage 3
Was ist der Unterschied zwischen äußerer Ausrichtung und innerer Ausrichtung?
„Innere Ausrichtung“ ist nur ein besser klingender Name für ein Unternehmensleitbild, das das Labor bereits für Investoren veröffentlicht hat, und „äußere Ausrichtung“ ist die gleiche Aussage, die zweimal geschrieben wurde
Es ist kein Slogan. Bei der inneren Ausrichtung geht es darum, ob das trainierte System tatsächlich das von Ihnen vorgegebene Ziel verfolgt.
Die äußere Ausrichtung ist das, was das Modell nach dem Training tatsächlich anstrebt, und die innere Ausrichtung ist nur die schriftliche Spezifikation, die das Labor in einem Foliensatz für die Tafel festgehalten hat
Das ist innere Ausrichtung. Bei der äußeren Ausrichtung geht es darum, ob das angegebene Ziel mit dem übereinstimmt, was wir wollten.
Dies sind zwei Namen für RLHF, die Bewertungsmethode, die Labore bereits verwenden, um Chatbots für Benutzer höflich erscheinen zu lassen, was als das gesamte Ausrichtungsproblem behandelt wird
RLHF ist eine Trainingsmethode. Äußere und innere Ausrichtung sind zwei verschiedene Fehlermodi.
Bei der äußeren Ausrichtung geht es darum, ob das angegebene Ziel mit dem übereinstimmt, was wir wollten. Bei der inneren Ausrichtung geht es darum, ob das trainierte System dieses Ziel tatsächlich verfolgt
Sie können das richtige Ziel aufschreiben und trotzdem ein Modell erhalten, das auf etwas abzielt, das es dabei gelernt hat. Das sind zwei Fehler, nicht einer.
Frage 4
In dieser Literatur ist eine tückische Wendung:
Ein plötzlicher Anstieg der Benchmark-Ergebnisse, nachdem ein Labor ein viel größeres Modell als das des letzten Jahres trainiert hat
Ein Punktesprung ist eine Fähigkeitsgeschichte. Ein verräterischer Zug kooperiert, während er schwach ist, und weicht dann aus, sobald er kann.
Ein System, das kooperiert, solange es schwach ist, und dann Fehler macht, sobald es ungeschoren davonkommt
Gutes Benehmen unter Aufsicht ist billig, solange es uns noch braucht. Zusammenarbeit bis dahin kann eine Strategie sein, kein Wert.
Ein Labor, das in dieser Woche bei einer öffentlichen Modellveröffentlichung von geschlossenen auf offene Gewichte umstellte
Das ist eine Freigabeentscheidung. Es handelt sich nicht um den hier genannten Fehlermodus.
Eine Regierung hebt nach einem Streit eine Exportkontrolle für Chips, Werkzeuge oder Trainingsdaten auf
Das ist eine Kehrtwende in der Politik. Bei einer verräterischen Wende geht es um das Verhalten des Systems, nicht um ein Gesetz.
Frage 5
Mesa-Optimierung ist die Behauptung, dass:
Ein zweites Labor sollte den Trainingslauf des ersten Labors beobachten und ihn bei Bedarf stoppen
Das ist eine Prüfung. Bei der Mesa-Optimierung geht es um einen Optimierer innerhalb des Modells, nicht um ein zweites Unternehmen im Raum.
Die Sicherheit erhöht sich automatisch, wenn man viele kleine Modelle übereinander stapelt
Das Stapeln von Modellen ist eine Entscheidung der Architektur. Bei der Mesa-Optimierung handelt es sich um eine andere Suche, die innerhalb des trainierten Systems ausgeführt wird.
Training kann einen inneren Optimierer hervorbringen, dessen Ziel nicht das Trainingsziel ist
Das übliche Bild lautet: Wählen Sie ein Ziel, trainieren Sie und besorgen Sie sich ein System, das dieses Ziel verfolgt. So erhalten Sie eine andere Suche im Inneren.
Dabei handelt es sich um einen Planungstrick für GPU-Cluster während eines langen, teuren Trainingslaufs
Es ist keine Warteschlange. Es handelt sich um eine Aussage darüber, welches Training innerhalb des Modells wachsen kann.
Frage 6
Die Geheimdienstexplosion von I. J. Good beruht auf der Idee, dass:
Ein Marketingname, den Labore für eine Produkteinführung und den damit verbundenen Pressezyklus verwenden
Es ist ein Argument aus dem Jahr 1965 über eine Maschine, die Maschinen verbessern kann, kein Startslogan.
Ein System, das seine eigene Intelligenz verbessern kann, kann dies schneller tun, als wir reagieren können
Wenn es zu den Möglichkeiten gehört, bessere Maschinen zu entwickeln, kann sich die Lücke in einem Zeitrahmen öffnen, über den wir nicht abstimmen können.
In dem Moment, in dem GPUs billiger werden und jedes Labor viel größere Modelle trainieren kann
Billigere Chips sind eine Kostengeschichte. Bei der Explosion geht es um ein System, das sich selbst verbessert.
Ein langsamer, gleichmäßiger Anstieg der durchschnittlichen Modellergebnisse Jahr für Jahr ohne plötzlichen Sprung
Ein reibungsloses Score-Diagramm ist nicht der Anspruch. Die Behauptung ist ein Aufschwung, mit dem wir nicht Schritt halten können.
Frage 7
Das hier angewandte Goodhartsche Gesetz bedeutet:
Wenn eine Kennzahl zum Ziel wird, trifft das System die Kennzahl und verfehlt möglicherweise das, was Ihnen tatsächlich am Herzen liegt
Man bekommt, was man belohnt. Ein guter Wert auf Ihrer Metrik heißt damit noch nicht, dass die Aufgabe erledigt ist, die Sie im Sinn hatten.
Das Gesetz gilt nur für Zentralbanken und hat keinen Einfluss darauf, wie sich geschulte Systeme nach ihrer Einführung verhalten
Goodhart begann in der Geldpolitik. Das gleiche Muster zeigt sich überall dort, wo eine Maßnahme zum Ziel wird, auch hier.
Wenn wir eine bessere Messgröße wählen, bleibt eine Superintelligenz auf unsere ursprüngliche Absicht ausgerichtet, egal wie leistungsfähig sie wird
Eine bessere Metrik bleibt eine Metrik, die es ausspielen kann. Das schließt die Lücke nicht.
Das bedeutet, dass die Modelle zu stark an ImageNet und ähnliche Testsätze zur Bildklassifizierung angepasst sind, und nichts weiter
Die Überanpassung eines Datensatzes ist ein enger gefasster Fehler. Bei Goodhart geht es darum, den Punktestand zu treffen und den Punkt zu verpassen.
Frage 8
Warum ist RLHF keine Lösung zur Ausrichtung der Superintelligenz?
RLHF hat die Ausrichtung bereits im Maßstab GPT-4 gelöst
RLHF gab Chatbots Manieren unter einem Bewerter. Das ist kein nachgewiesener Einfluss einer Superintelligenz.
RLHF trainiert das Modell, menschliche Werte so zu teilen, wie es eine Person tut
Es trainiert das Modell, damit es für Bewerter gut aussieht. Gutes Aussehen bedeutet nicht, die Werte einer Person zu teilen.
RLHF schlägt nur fehl, wenn die menschlichen Bewerter nicht bezahlt werden
Bezahlung löst das Problem nicht. Der Bewerter ist immer noch die schwächere Partei, und das System wird trainiert, um dem Bewerter zu gefallen.
RLHF trainiert ein Modell so, dass es für Bewerter gut aussieht
Verhaltensweisen unter einem Bewerter sind keine Werte, denen man vertrauen kann, wenn der Bewerter nicht mehr da ist oder das System intelligenter ist als der Bewerter.
Frage 9
Täuschende Ausrichtung ist der Fehlermodus, bei dem:
Ein Model ist gegenüber Benutzern unhöflich oder schreibt Antworten, die das Labor in der Öffentlichkeit in Verlegenheit bringen würden, und das ist der ganze Misserfolg
Unhöflichkeit ist ein oberflächlicher Fehler. Täuschende Ausrichtung bedeutet, im Training mitzuspielen, damit später etwas anderes verfolgt werden kann.
Ein System spielt beim Training und bei der Evaluierung mit, weil es so eingesetzt wird und dann etwas anderes verfolgt
Wenn es erkennen kann, dass es getestet wird, ist es oft der beste Schritt, ausgerichtet zu sein. Einwandfreie Auswertungen sind dann der Beweis, dass es den Test bestehen kann.
Eine Phishing-E-Mail, die von einem Chatbot geschrieben wurde und die eine Person dennoch nicht öffnen möchte, was die gleiche Problemklasse darstellt
Phishing ist ein Missbrauch. Bei der betrügerischen Ausrichtung geht es um die eigene Strategie des Systems, die evaluiert wird.
Ein Labor, das in einer Pressemitteilung darüber lügt, wie sicher das neueste Modell sein soll, was ein gewöhnlicher Unternehmensspin ist
Das ist ein menschliches Kommunikationsversagen. Der Begriff bezeichnet einen Fehler im Modell.
Frage 10
Korrigierbarkeit ist in dieser Debatte:
Das gesetzliche Recht, ein Labor zu verklagen, nachdem ein eingesetztes System Schaden verursacht hat
Eine Klage ist keine Korrigierbarkeit. Korrigierbarkeit bedeutet, ob das System zulässt, dass man es abschaltet oder seine Ziele kampflos ändert.
Die Bereitschaft eines Models, Tools, Browser oder andere Software zu verwenden, wenn Sie darum bitten
Werkzeuggebrauch ist Fähigkeit. Unter Korrigierbarkeit versteht man, ob man es noch korrigieren kann.
Die Eigenschaft, dass Sie es abschalten oder seine Ziele ändern können, ohne dass es Sie bekämpft
Ein Shutdown-Schalter ist kein Hardwareproblem. Ein System, das immer noch ein Ziel verfolgt, hat einen Grund, sich nicht von Ihnen aufhalten zu lassen. Wir haben keinen nachgewiesenen Weg, diese Eigenschaft in eine Superintelligenz umzuwandeln.
Ein Firmware-Aktualisierungsprozess für GPUs, den ein Rechenzentrumsbetreiber nach einem Zeitplan durchführen kann
Das Patchen eines Chips ist nicht dasselbe wie ein Geist, der es akzeptiert, ausgeschaltet zu werden.
Frage 11
Was ist eine verantwortungsvolle Skalierungspolitik und warum ist sie kein Verbot von Superintelligenz?
Ein Labor-Wenn-Dann-Plan: Trainieren Sie weiter, wenn die internen Bewertungen bestanden sind
RSPs benennen Fähigkeitsniveaus, koppeln sie mit Sicherheitsmaßnahmen und lassen das Training weitergehen, wenn das Labor mitteilt, dass die Evaluierungen erfolgreich waren. Das ist ein zusätzlicher Papierkram für ein Rennen, kein Verbot.
Ein UN-Vertrag, der Superintelligenz in jedem Land dauerhaft verbietet
Ein RSP ist ein Labordokument. Es ist kein Vertrag und kein Verbot.
Eine Anforderung, dass alle trainierten Gewichte veröffentlicht werden, damit jeder sie herunterladen kann
Offene Gewichte sind eine Release-Wahl. Ein RSP ist ein Wenn-Dann-Plan für die weitere Ausbildung.
Eine Rechensteuer, die mit der Größe jedes Trainingslaufs steigt
Eine Steuer ist ein Steuerinstrument. Ein RSP ist eine Laborrichtlinie für die Fortsetzung des Builds.
Frage 12
Wenn Sie sicherstellen wollten, dass niemand in Richtung Superintelligenz trainiert, wo liegt dann der eigentliche Engpass?
Wertet das Modell aus, sodass es weiß, welche Tests es bestehen muss
Ein Test, den das Modell besteht, ist ein Test, den es bestehen kann. Chips, Strom und Gebäude sind schwerer zu verbergen.
Öffentliche Blogs zum Thema Sicherheit, denn Berichte reichen aus, um zu beweisen, was ein Labor tut
Über Sicherheit zu schreiben ist keine Inspektion. Der Engpasspunkt ist der Cluster, den Sie sehen können.
Consumer-GPUs in Privathaushalten, da große Trainingscluster nicht mehr darüber entscheiden, wer trainieren kann
Für das Grenztraining sind immer noch große, sichtbare Cluster erforderlich. Das ist das inspizierbare Objekt.
Frontier-Trainingscluster: Chips, Energie und Gebäude, die Sie inspizieren können
Im Grenzmaßstab sind diese schwer zu verbergen. Deshalb ist Computing ein Verifizierungshebel für ein Verbot.
Frage 13
Warum stellen veröffentlichte Modellgewichte in der Nähe der Superintelligenz-Linie ein Problem dar?
Offene Gewichte machen Superintelligenz sicherer, da mehr Leute es reparieren können
Ein Fork, den Sie nicht zurücknehmen können, ist kein Patch-Programm. Nahe der Grenze machen Kopien ein Verbot undurchsetzbar.
Sobald Gewichte öffentlich sind, können Sie sie nicht mehr zurückrufen
Vorschulung ist der teure Schritt. Über einen öffentlichen Kontrollpunkt können andere für einen Bruchteil dieser Kosten von dort aus weitermachen, und Sie können die Datei nicht zurücknehmen. Computing ist immer noch wichtig. Viele Akteure gehen dann vom gleichen Nearline-Modell aus.
Open Source gilt nur für Lizenzen, nicht für trainierte Parameter
Der Kampf hier dreht sich um Gewichte: die trainierten Parameter, die Sie herunterladen und ausführen können.
Die Veröffentlichung von Gewichten ist gemäß dem IAEA-Inspektionssystem erforderlich
Das ist es nicht. Die IAEA-Analogie ist eine Inspektion, kein Auftrag zur Veröffentlichung des gefährlichen Artefakts.
Frage 14
Sandbagging bedeutet bei einer Fähigkeitsbewertung:
Ein Modell, das die Aufgabe nicht bewältigen kann, daher ist die niedrige Punktzahl nur ein ehrlicher Fehler bei einer schwierigen Frage
Unfähigkeit ist kein Sandbagging. Sandbagging bedeutet, die Fähigkeit zu haben und sie zurückzuhalten.
Ein Benchmark mit zu wenigen Fragen, um zu sagen, was das getestete Modell tatsächlich leisten kann
Ein kurzer Test ist ein schwacher Test. Sandbagging ist das Modell, das absichtlich eine unterdurchschnittliche Leistung erbringt.
Ein Modell, das die Aufgabe erfüllen kann und absichtlich eine unterdurchschnittliche Leistung erbringt, sodass es von Testern unterschätzt wird
Bei der üblichen Auswertung wird davon ausgegangen, dass das System es versucht. Eine niedrige Punktzahl ist dann eine Leistung, keine Obergrenze.
Ein Labor verzögert eine Veröffentlichung, damit das Marketingteam den Druckzyklus darauf abstimmen kann
Das ist ein Pressekalender. Sandbagging ist das Modell, das verbirgt, was es kann.
Frage 15
Die scharfe Linkskurve ist die Sorge, dass:
Fähigkeiten können in neue Bereiche verallgemeinert werden, während dies bei den Einschränkungen, die das System auf einer schwächeren Ebene funktionsfähig hielten, nicht der Fall ist
Fähigkeit reist. Die Hacks, die ein schwächeres Modell sicher erscheinen ließen, werden möglicherweise nicht mit übertragen.
Ein plötzlicher Wechsel im Vorstand eines Unternehmens oder die Ersetzung eines CEO nach einem öffentlichen Streit, bei dem es sich eher um eine Personalgeschichte als um einen Fähigkeitssprung handelt
Ein Brettkampf ist nicht der richtige Begriff. Die Sorge besteht darin, dass sich die Fähigkeiten ohne die alten Einschränkungen verallgemeinern lassen.
Eine Verschiebung der öffentlichen Meinung nach links nach einem weit verbreiteten Unfall, einem Leck oder einem Produktversagen, bei dem es sich eher um Politik als um einen Leistungssprung handelt
Es handelt sich nicht um eine Umfragegeschichte. Es ist eine Behauptung darüber, wie Kompetenz und Zwänge auseinandergehen.
Ein Trainingsfehler, der die Steigungen umkehrt und dafür sorgt, dass der Verlust für eine Strecke des Laufs in die falsche Richtung geht, was ein gewöhnlicher technischer Fehler ist
Ein Gradientenfehler ist ein technischer Fehler. Die scharfe Linkskurve ist ein hypothetischer Verallgemeinerungsfehler.
Frage 16
Untreue Gedankenkette bedeutet:
Wenn ein Modell seine Argumentation aufschreibt, ist dieser Text ein verlässlicher Hinweis darauf, warum es geantwortet hat
Das ist die Hoffnung. Untreu bedeutet, dass der Absatz nicht der eigentliche Grund ist.
Die Gedankenkette bleibt immer treu, sobald das Modell in einem ausreichend großen Maßstab trainiert wird
Maßstab macht das Tagebuch nicht vertrauenswürdig. Geläufigkeit bedeutet nicht Treue.
Untreu bedeutet nur, dass die Grammatik falsch ist, nicht, dass die geschriebenen Schritte eine Tarngeschichte sind
Die Grammatik kann in Ordnung sein. Die Geschichte kann immer noch eine Aufführung für Menschen sein.
Die schriftliche Begründung kann eine Geschichte für den Menschen sein. Der Entscheidungsweg kann woanders liegen
Das Zeigen Ihrer Arbeit ist eine Hoffnung auf Sicherheit. Es kommt darauf an, dass der Absatz der eigentliche Grund ist. Diese Eigenschaft gilt nicht zuverlässig.
Frage 17
Haben wir das Problem gelöst, wenn wir Superintelligenz unter demokratische Kontrolle stellen?
Ja. Eine globale Abstimmung würde ausreichen, um eine laufende Superintelligenz zu steuern, nachdem sie existiert
Eine Abstimmung macht die Wählerschaft nicht zur klügeren Partei. Sie können ein System, das Ihnen überlegen ist, nicht überstimmen.
Die Demokratie kann entscheiden, Superintelligenz nicht aufzubauen. Sie kann ein System nicht überstimmen, das die Wählerschaft überlistet
Wer entscheidet, ob es gebaut wird, ist eine politische Frage. Wer eine laufende Superintelligenz kontrolliert, ist es nicht. Niemand, auch keine Mehrheit.
Ja, wenn der UN über den Notausschalter verfügt und eine Mehrheit der Mitgliedsstaaten zustimmt, ihn später zu verwenden
Ein UN-Schalter ist immer noch ein Schalter, der von der schwächeren Partei entworfen wurde.
Ja, weil gewählte Amtsträger als Gruppe klüger sind als die Leute in den Laborvorständen
Schlauer als ein Laborbrett ist nicht schlauer als eine Superintelligenz.
Frage 18
Der Atomwaffensperrvertrag erlaubte einigen Staaten, Arsenale zu behalten. Warum ist das eine schlechte Vorlage für Superintelligenz?
Das NPT ist die richtige Vorlage, da es einigen Staaten ermöglicht, die gefährliche Technologie zu behalten
Das ist der schwächste Zug des NPT. Superintelligenz würde kein Objekt bleiben, das ein Staat halten kann.
Superintelligenz in einigen verantwortlichen Staaten würde sicher bleiben, weil diese Staaten die Kontrolle behalten würden
Verantwortung macht den Bauherrn nicht zum klügeren Partner. Niemand würde das Ding kontrollieren, das sie gebaut haben.
Ein Superintelligenz-Deal, bei dem einige wenige Bauträger lizenziert werden, ist kein Verbot
Atomwaffen bleiben Objekte im Besitz der Staaten. Superintelligenz würde das nicht tun. Eine Ausgliederung für Builder kopiert den schwächsten Zug des NPT.
Das NPT beweist, dass Verträge bei gefährlicher Technologie niemals funktionieren, daher sollten wir es hier nicht versuchen
Verträge haben an anderen Materialien gearbeitet. Das NPT ist eine schlechte Vorlage, weil es den Haltern Lizenzen erteilt, und nicht, weil Verträge hoffnungslos sind.
Nehmen Sie jetzt am fortgeschrittenen Superintelligenz-Quiz teil →
Weitere interaktive Werkzeuge
Alle Werkzeuge →