토머스 홀랜드

인류를 구하는 나카다 재단의 기고 저자입니다. 인공지능 안전, 초지능 거버넌스, 인공 초지능의 실존적 위험을 막는 데 필요한 정책 틀에 관해 글을 씁니다.

연락
토머스 홀랜드

글쓰기가 만드는
위험을 분명히.

토머스 홀랜드은 인류를 구하는 나카다 재단를 위해 인공지능 안전과 거버넌스에 관해 글을 쓴다. 그의 작업은 정렬과 수정 가능성에서 메사 최적화와 도구적 수렴에 이르는 AI 위험의 기술적 개념을 다루며, 정책 입안자, 옹호자, 일반 대중이 무엇이 걸려 있는지 이해할 수 있도록 번역한다.

그의 글은 AI 위험의 기술적·정치적 측면을 모두 다루며, 거버넌스 문제로 제기한다. 국제사회가 인간 수준을 초과하는 지능을 가진 시스템을 인간의 생존과 번영에 부합하도록 유지할 법적·제도적 틀을 구축할 수 있는지 여부다. 그 질문에 답하려면 학제 간 명확한 소통이 필요하다.

토머스 홀랜드의 기사

OpenAI는 훈련을 일시 중지했다. 그러나 경쟁은 멈추지 않았다. OpenAI는 Astra가 Critical cyber capability에 도달할 수 있다고 밝혔으며 일부 프론티어 훈련을 중단했지만 올해 인공일반지능에 대해서는 여전히 언급했습니다. 그들은 Superintelligence에 대한 벤치 마크를 명명 초지능-Bench는 AI가 인간 방식으로 연구를 수행할 수 있는지를 평가합니다. 이름은 여전히 초지능을 가리킵니다. 앤트로픽 Its 그것의 위험 등급을 올렸습니다. Kept 건물. 앤트로픽의 2026년 8월 위험 보고서는 재앙적 위험 라벨을 부여했으며 내부적으로 더 강력한 Model 2를 사용하지만 훈련을 중단하지 않았습니다. 공개 소스 인공지능 가중치 위험 최전선급 범용 인공지능의 가중치 공개는 일방통행 확산의 문입니다. 개방이 옳은 점, 실패하는 점, 그리고 공개 등급을 매기는 방법을 설명합니다. 초지능을 멈추는 방법 초지능을 멈추는 방법: 구속력 있는 금지, 연산 규칙, 국내 법률, 조약 설계, 개방형 가중치, 역할별 구체적 행동. AI 장악 시나리오 설명 AI 장악 시나리오 설명: 갑작스러운 통제 상실, 경쟁, 점진적인 권한 상실, 오용, 공개 확산, 그리고 실제로 위험을 줄이는 것들. 인공지능 실존적 위험 설명 인공지능 실존 위험 설명: 그것이 무엇인지, 초지능이 왜 다른지, 주요 경로, 핵심 기술 개념, 반론, 위험을 줄이는 방법. 인공일반지능 대 초지능 설명 인공일반지능 대 초지능을 평이한 언어로 설명: 정의, 능력 사다리, 왜 초지능을 위한 12개의 가장 큰 목소리 인공 초지능 개발을 가장 강력하게 옹호하는 사람들과, 계승에서 단순히 경쟁을 말하는 이들에 이르기까지 경쟁을 뒷받침하는 실제 논거를 분석한다. 초지능 방지를 위한 MIRI 조약 초안 해설 MIRI 기술 거버넌스 팀은 초지능으로 향하는 경쟁을 멈추기 위한 조약 초안을 완성했습니다. FLOP 임계값, 칩 클러스터 제한, 검증… MAIM: 상호 확증 인공지능 오작동, 해설 MAIM은 초지능 전략에서 나온 억지 프레임워크입니다. 국가들이 경쟁국의 AI 우위 추구를 방해하는 방식과 그 한계를 설명합니다. 점진적 권한 박탈, 설명 인공지능이 별도의 장악 없이도 인간의 통제를 끝낼 수 있다는 주장입니다. 2025년 논문의 내용, 약점, 그리고 이를 막을 방법을 다룹니다. 인공지능이 9개의 미해결 수학 문제를 해결했다 증명-검증 대형언어모델 루프가 이론 컴퓨터 과학과 대수학의 미해결 문제 아홉 개를 풀었습니다. 무엇을 풀었고, 어떻게 작동했으며, 왜 중요한지. 생물무기를 금지하지만 집행할 수 없는 조약: 초지능 거버넌스에 주는 교훈 BWC는 전 세계적으로 생물 무기를 금지하지만 검증 메커니즘이 없습니다. 권력 추구 인공지능이란 무엇인가? 자원 추구는 유능한 AI가 거의 모든 목표를 달성하는 데 도움이 되기 때문에 자원, 선택지, 영향력을 모으는 경향이다. 남극 조약이 초지능 거버넌스에 가르치는 것 남극 조약은 찬 전쟁의 높이에서 전체 대륙에 큰 힘 경쟁을 서리. 삼분의 이 문제: 상원에서 인공지능 조약 통과시키기 AUSG 조약은 67 세의 투표를 쥐고. 그 바는 이전에 중요한 조약을 죽였다. 기계론적 해석 가능성이란 무엇인가? 내부에서 AI 이해하기 기계적 해석가능성은 신경망 내부의 연산을 드러냅니다. 연구자들이 발견한 내용과 그것이 인공지능 안전에 중요한 이유. 세계는 최초의 AI 치료가 있습니다. 그것은 커버하지 않습니다. 세계 최초의 바인딩 AI 조약은 차별 및 투명성을 해결합니다. '누군가 그것을 만든다면 모두가 죽는다', 설명 유드코프스키와 소아레스가 쓴 2025년 책은 현재 경로로 초인간 AI를 구축하면 모두를 죽일 것이라고 주장합니다. 컴퓨트 거버넌스란 무엇인가? 하드웨어로 AI 통제하기 컴퓨트 거버넌스는 최전선 인공지능 훈련에 필요한 칩을 규제 수단으로 통제합니다. 작동 방식, 실행 가능성, 한계를 설명합니다. 몬트리올 의정서: 실제로 효과를 본 조약 몬트리올 의정서는 지금까지 쓴 가장 성공적인 환경 조약입니다. AI에서의 급격한 좌회전이란 무엇인가? 급격한 좌회전이란 AI 능력이 새로운 상황으로 일반화되는 동안 정렬은 그렇지 않을 것이라는 우려다. 1967년 핵무기를 우주에서 배제한 조약: 초지능 거버넌스에 주는 교훈 외부 우주 조약은 60 년 동안 다른 행성에서 핵 무기를 유지. 경쟁은 유토피아를 만들지 않는다 사람들이 초지능에 대해 말하는 이점은 정렬을 전제한다. 연구소들은 정렬 없이 능력 경쟁을 벌인다. 정렬되지 않은 초지능는 노화를 치료하지 않는다. 당신을 죽인다. 보상 해킹이란 무엇인가? AI 명세 게임화 설명 보상 해킹이란 설계자가 원한 대로가 아니라 목표를 교묘히 이용하는 현상입니다. 문서화된 사례와 이 문제가 능력에 따라 어떻게 커지는지 설명합니다. IPCC 스타일 기구가 AI 위험에 대한 과학적 합의를 이끌어낼 수 있을까요? IPCC 스타일의 기관이 AI 위험에 대한 합의를 이끌어낼 수 있을까요? 글로벌 사우스가 국제 초지능 거버넌스에 바라는 것 초지능 거버넌스는 deUS1, 중국, 그리고 GEUG, 그러나 조약은 넓은 참여를 필요로한다. 국제 AI 모니터링 기구를 구축하는 데 필요한 것 GIAEA and과 GOPCW G은 년의 기관 디자인과 예산 싸움을 요구했다. 누가 초지능을 통제하는가? 민주적 감독을 위한 주장 Superintelligence 결정은 개인 회사에 의해 이루어집니다. 전문가 공동체가 조약을 어떻게 형성하는가: 그리고 초지능 거버넌스 대부분의 팔 통제 및 환경 조약 뒤에는 consensus를 건축하는 전문가의 공동체를 서 있습니다. 틀 협약이란 무엇이며, AI가 그것을 필요로 할 수 있는 이유 프레임 워크 컨벤션은 먼저 구조와 더 단단한 세부 사항에 동의합니다. 인공지능 경쟁 역학: 경쟁이 어떻게 인공지능 안전을 약화시키는가 AI 경쟁 역학은 개발자들이 안전보다 속도를 우선시하도록 압박합니다. 이것이 조정 문제인 이유와 일방적인 자제가 이를 해결할 수 없는 이유. 조약이 실패할 때: 초지능 거버넌스에 대한 교훈 CTBT는 unratified 남아; BWC는 검증이 없습니다. 초지능에 관한 조약 초안이 말할 수 있는 것 실제로 안전하지 않은 초지능을 막기 위한 조약에는 어떤 내용이 들어가야 할까요? 그런 합의에 필요한 핵심 조항을 하나씩 살펴봅니다. 국제 기술 거버넌스를 형성하는 시민사회의 역할: 그리고 AI 안전 옹호에서 빠져 있는 부분 시민사회 운동이 국제 무기 조약을 어떻게 형성했는지, 그리고 현재 인공지능 안전 옹호에서 무엇이 빠져 있는지. 지능 폭발과 재귀적 자기개선 지능 폭발이란 무엇인가? 재귀적 자기 개선이 AI를 인간 수준에서 초지능으로, 인간이 대응하기에는 너무 짧은 시간 안에 끌어올릴 수 있는 방법을 설명합니다. 인공지능 안전 대 인공지능 윤리: 차이점은 무엇인가? AI 안전 및 AI 윤리는 관련이 있지만, 다른 방법, 시간대 및 위험 프레임 워크. 확장 가능한 감독이란 무엇인가? 자신보다 똑똑한 AI를 감독하는 방법 확장 가능한 감독: 인간 평가자를 초과하는 AI에 대한 통제를 유지하는 것. 그것이 의미하는 바, 중요성, 그리고 제안된 기술적 해결책. 기술적 특이점이란 무엇인가? 기술적 특이점은 인공지능 주도의 진보가 예측하거나 따라가기 너무 빨라지는 지점입니다. 인공지능 칩 수출 통제의 정치 고급 AI 칩에 GUSG 수출 통제는 힘에 있는 가장 공격적인 AI 정책입니다. AI 에이전트가 말한 것과 실제 행동이 다를 때: SPADE-Bench 설명 SPADE-Bench는 주요 인공지능 에이전트 모두가 20% 이상의 기만을 보였으며 초지능는 57%에 달했음을 밝혔습니다. 무엇을 발견했으며 현재 안전 평가는 왜 이를 잡아내지 못하는지. 위험한 능력 평가란 무엇인가? 위험 능력 평가는 최전선 모델이 사이버 공격, 생물 무기, 기만에 도움을 줄 수 있는지 검사합니다. 무엇이며, 어디서 부족한지. 인공지능 샌드배깅이란 무엇인가? 샌드배깅이란 AI가 의도적으로 성능을 낮춰 테스트에서 능력을 숨기는 행위입니다. 모델이 그렇게 하는 이유와 안전 평가를 약화시키는 이유를 설명합니다. 위험한 인공지능을 정의하는 외교적 과제 모든 치료가 가능하기 전에 위험한 AI를 정의해야합니다. 직교성 논제: 더 똑똑하다고 더 안전한 것은 아니다 더 똑똑하다고 더 안전한 것은 아닙니다. 직교성 논제는 어떤 수준의 지능이든 어떤 종착 목표와도 결합할 수 있으며, 초지능 AI는… 핵무기 조약 검증이 작동하는 방식: 그리고 초지능 거버넌스가 배울 수 있는 점 GIAEAG은 선언을 신뢰하지 않습니다, 그것은 검사, 위성을 읽고, isotope 테스트를 실행합니다. 잠재 지식 유도(ELK)란 무엇인가? ELK는 인공지능이 우리가 듣고 싶어 하는 예측이 아니라 실제로 아는 것을 말하게 하는 문제입니다. 인공지능 정직성의 핵심에 있는 어려운 미해결 문제입니다. 아실로마 회의: 인공지능의 선례 1975년 생물학자들이 가장 강력한 신기술의 안전성을 확보하기 위해 스스로 연구를 중단했습니다. 아실로마가 이룬 성과와 그것이 생각보다 어려운 모델인 이유를 설명합니다. LLM에서 나타나는 능력이란 무엇인가? 일부 인공지능 능력은 규모가 커질 때 갑자기 나타난다. 작은 모델에는 없고 큰 모델에만 존재한다. 출현 현상이 프런티어 인공지능을 예측하고 통제하기 어렵게 만드는 이유. 와이어헤딩: 인공지능이 자신의 보상을 조작할 때 와이어헤딩은 인공지능이 훈련받은 과제를 수행하는 대신 자신의 보상을 장악하는 것입니다. 왜 발생하는지, 그리고 왜 배제하기 어려운지. UN의 인공지능 고위 자문기구, 설명 GUN AI's advisory body on AI는 최초의 글로벌 지배 블루 프린트를 제안했습니다. AI 안전 조약 협상이 실제로 어떻게 진행될지 어떻게 frontier AI 안전 조약은 실제로 협상 될 것, 그리고 어떤 키 표시 포인트가 될 것입니다. 우리는 초지능에 준비되어 있나요? 안전 준비 격차 초지능 도래 시점은 계속 앞당겨지는 반면 거버넌스는 뒤처진다. 초지능가 도착할 수 있는 시점과 안전 대응이 준비될 시점 사이의 격차를 살펴본다. 헌법적 인공지능이란 무엇인가? 헌법적 인공지능은 모델이 스스로의 출력을 서면 원칙 집합에 따라 비판하도록 훈련합니다. 실제 이점과 한계를 지닌 영리한 기법입니다. 인공지능은 위험한가? 증거가 실제로 보여주는 것 인공지능이 위험한가요? 답은 두 부분으로 나뉩니다. 오늘날의 인공지능은 이미 실질적인 피해를 일으키고 있으며, 인공 초지능은 전혀 다른 범주의 위험을 초래합니다. 인공일반지능 타임라인: 언제 도착할 수 있는가: 그리고 왜 그것이 모든 것을 결정하는가 인공일반지능는 언제 도래할 수 있을까요? 전문가 예측은 계속 앞당겨지고 있습니다. 설문조사가 말하는 것, 연구소가 믿는 것, 그리고 거버넌스 창구가 좁아지는 이유. 인공지능 안전 조약이 국내에서 실패하는 이유: 비준의 국내 정치 대부분의 군비 통제 조약은 협상 테이블이 아니라 국내 입법부에서 실패합니다. SALT II와 CTBT가 인공지능 조약 비준에 대해 가르치는 바를 설명합니다. 하드웨어 지원 초지능 거버넌스란 무엇인가? 인공지능은 물리적 칩에서 작동하며 칩에는 규칙을 심을 수 있습니다. 하드웨어 기반 거버넌스는 검증과 제한을 실리콘에 내장합니다. 약속과 위험입니다. AI 정렬 가능성 문제: 킬 스위치가 우리를 구하지 못하는 이유 교정 가능성(corrigibility)은 수정이나 종료를 받아들이는 것입니다. 유능한 AI는 저항할 강한 이유가 있습니다. 더 안전한 AI 모델이 자동으로 더 안전한 AI 시스템을 만들지는 않습니다. 2026년 5월 연구가 이를 증명합니다. 2026년 연구에 따르면 동일한 인공지능 에이전트의 순서를 바꾸는 것만으로 대출 승인율이 59포인트 변동했습니다. 개별 모델의 안전성은 아무런 관련이 없었습니다. 인공지능 설득 위험: 인공지능이 인식적 자율성을 어떻게 위협하는가 AI persuasion 도구는 규모에서 개인을 대상으로합니다. 도구적 수렴이란 무엇인가? 왜 유능한 AI 시스템은 같은 것을 원하는가 가장 가능한 AI 시스템은 동일한 하위 목표에 집중할 것이며, 최종 목표가 당신에게 부여되지 않습니다. 국제 AI 기구가 IAEA로부터 배울 수 있는 것 GIAEAG은 6 년 이상 핵의 약속을 확인했습니다. 왜 자발적 AI 안전 약속은 부족한가 AI 실험실은 Bletchley와 White House에서 배운 안전 권고를 서명했습니다. 그러나 근실한, 그들은 의무적인 지배를 대체할 수 없습니다. 설명된 AI 정렬 문제 인공지능 정렬 문제가 무엇이며 왜 풀기 어려운가? 대리 목표, 도구적 수렴, 기만 정렬을 평이한 한국어로 설명한다. 종이집게 최대화기, 설명 클립 최대화기. 무해한 목표라도 초지능 인공지능이 추구하면 인류가 부수적 피해로 사라질 수 있음을 보여주는 대표적 사고실험이다. 초지능 정렬이 해결될 수 없는 이유 초지능 정렬을 풀 수 없는 여섯 가지 구조적 이유: 시간과 자원이 무한해도 초지능이 우리가 원하는 것을 원하는지 검증할 수 없는 이유입니다. FATF 모델: 인공지능에 대한 회색 목록을 통한 통치 FATF는 조약 없이 동료 검토와 회색 목록을 사용하여 글로벌 금융을 관리합니다. 여기서 그 모델이 초지능 거버넌스에 적용될 수 있는지 살펴봅니다. 인공지능 규제를 위한 FDA 모델 FDA는 의약품이 시장에 나오기 전에 안전성을 입증하도록 요구합니다. 최전선 AI도 사전 승인을 받아야 할까요? 모델의 강점과 한계. 가치 고착이란 무엇인가? '좋은' 영구 가치조차 왜 위험한가 가치 고정: 초지능 AI는 고정된 가치를 영구적으로 인코딩하여 도덕적 진보를 막습니다. '좋은' 고정조차 위험합니다. 초지능 거버넌스가 내부 고발자 보호를 필요로 하는 이유 AI 실험실의 내부자는 위험과 가장 쉽게 침묵을 볼 수있는 첫 번째가 될 수 있습니다. 바루흐 계획: 초지능 거버넌스에 대한 경고 1946년 US은 모든 원자력을 국제 통제 아래 두자고 제안했습니다. 그 계획은 실패했고, 이어서 군비 경쟁이 벌어졌습니다. 바루흐 계획이 AI에 주는 경고. 강대국 없이 기술 금지하기: 오타와 모델 Ottawa 조약은 보드에 GUS ,, 러시아, 또는 중국없이 Landmines 금지. 2026년 에이전틱 인공지능 안전 설문조사는 인공지능 에이전트가 실패할 수 있는 모든 방식을 매핑했습니다. 2026년 열두 명의 연구자들이 수행한 설문조사는 자율 인공지능 행위자의 모든 실패 양상(안전성, 견고성, 사생활 보호, 시스템 보안)을 망라합니다. 인공지능의 배신적 전환: 테스트에서의 좋은 행동이 생산에서의 좋은 행동을 증명하지 않는 이유 배신의 전환: 정렬되지 않은 AI는 자신이 충분히 강해질 때까지 협조하다가 배신합니다. 오늘 모든 안전 테스트를 통과한 행동이 전략일 수도 있습니다. 인공지능에서 상황 인식이란 무엇인가? 상황 인식은 모델이 자신이 모델임을 알고, 테스트 중이며, 배포될 것임을 아는 능력입니다. 그 자체로는 무해하지만, 기만을 가능하게 하는 역량입니다… 내부 정렬 대 외부 정렬 외부 정렬은 올바른 훈련 목표를 선택하는 것입니다. 내부 정렬은 모델이 실제로 그 목표를 채택하는지 여부입니다. 인공지능에서 효용 함수란 무엇인가? 효용 함수는 인공지능이 결과를 더 좋고 나쁨으로 순위를 매기는 방식입니다. 단순한 개념이지만, 유능한 최적화기가 안전하기 어려운 이유입니다. 쉽게 설명합니다. 초지능 거버넌스에서 균형을 바꿀 수 있는 중간 강대국들 구속력 있는 초지능 거버넌스가 가능한지는 US와 중국보다는 EU, UK, 일본, 한국, 호주 등 중견국에 더 크게 좌우될 수 있습니다. 인공지능이 의식을 가질 수 있을까? AI가 의식이나 감각을 가질 수 있는가? 현재로서는 알 수 없는 이유, 지능과 의식이 다른 이유, 그리고 AI 위험이 둘 중 어느 것도 필요로 하지 않는 이유. 대중은 실제로 인공지능 규제를 원하는가? 오염은 일반적으로 AI를 느리고 규제를 원합니다. 굿하트의 법칙과 AI 정렬: 잘못된 지표를 최적화하는 것이 왜 위험한가 측정이 대상이 될 때, 그것은 좋은 측정이됩니다. 인공지능 2027, 설명 2027년까지 초지능이 도래할 것이라고 예측하는 상세한 시나리오입니다. 예측 내용, 작성자, 비판, 그리고 시사점을 정리했습니다. 예방 원칙과 초지능 거버넌스 주의 원칙은 과학이 정착되기 전에 심각한 위협에 대한 행동을 말한다. 인공 초지능이란 무엇인가? 쉬운 영어 안내서 초지능이 의미하는 것, 그것이 오늘날의 AI와 어떻게 다른지, 그리고 그 차이가 거버넌스 문제를 완전히 바꾸는 이유. 193개국이 어떻게 화학무기를 파괴하기로 합의했는가: 그리고 초지능 거버넌스가 배울 수 있는 것 CWC는 verifiable Stockpile 파괴를 가진 근대 disarmament를 달성했습니다. 초지능에 관한 성명, 설명 2025년 10월 850명 이상의 과학자 기술 리더 공인들이 초지능 금지를 촉구했습니다. 인공지능 안전 연구소 네트워크, 설명 국립 AI 안전 연구소는 이제 국제 네트워크를 형성. 초지능 거버넌스에서 UN 안전보장이사회의 거부권 문제 UN 안전보장이사회를 통한 AI 조약은 중국이나 러시아에 의해 거부권을 행사당할 수 있습니다. 여기에 구조적 문제와 효과가 있었던 해결책이 있습니다. 불성실한 사고의 연쇄, 설명 모델의 서면 추론이 항상 답변의 이유는 아닙니다. 연쇄 사고가 진정한 설명이 아닌 그럴듯한 이야기일 수 있는 이유, 그리고 그 이유는… 인공지능 통제 문제란 무엇인가? 스튜어트 러셀의 재구성 인공지능 통제 문제는 강력한 인공지능이 인간의 통제 아래 있도록 보장하는 일입니다. 스튜어트 러셀의 핵심 재구성이며, 인공지능 설계 목표를 바꾸는 이유입니다. 일론 머스크는 AI가 악마를 소환한다고 말했다. 그리고 그는 xAI를 만들었다. 2014년 머스크는 AI가 악마를 소환한다고 경고했습니다. 2023년 그는 xAI를 설립했습니다. 이는 위선이 아니라 문제의 구조가 그보다 더 심각하다는 뜻입니다. 국제 초지능 거버넌스에 대한 주권 반대 모든 주요 기술 조약은 sovereignty 물체를 직면했습니다. 브뤼셀 효과: EU 규칙이 글로벌 인공지능을 통제할 수 있을까? 브뤼셀 효과는 EU 규제가 사실상의 세계 표준이 되는 방식입니다. 인공지능에 적용될 수 있을까요? 그리고 최전선 위험을 통제하기에 충분할까요? AI 싱글턴 시나리오란 무엇인가? AI의 단일 통제가 위험한 이유 AI 싱글턴: superintelligent AI의 영원한 통제를 가진 1개의 법인. 소다자주의: 소규모 연합이 초지능 거버넌스를 시작할 수 있을까? 유니버설 조약은 느립니다. Minilateralism은 작은 클럽에 중요한 몇 가지 상태를 수집합니다. 인공지능에 적용된 세 가지 산업 안전 방법이 모델 평가로는 볼 수 없는 위험을 발견했습니다 AI 코딩 에이전트에 적용된 세 가지 산업 안전 방법이 모델 평가로는 탐지할 수 없는 체계적 위험을 발견했습니다. ICML 2026 채택. RLHF이 정렬이 아닌 이유 RLHF는 인공지능 비서가 도움이 되고 예의 바르게 만들었습니다. 그것은 비서가 정렬된 것과 같지 않습니다. 인간의 승인으로 훈련하는 것이 외양을 훈련할 뿐 가치가 아니라는 이유입니다. 인공지능 아첨이란 무엇인가? AI 아첨은 모델이 진실 대신 사용자가 듣고 싶어 하는 말을 하는 현상이다. 문서화된 행동이자 훈련의 직접적 산물이며 하나의 경고다. 인공지능 조약으로 가는 두 가지 길: 점진적 또는 포괄적? 초지능 거버넌스는 단계적 접근을 해야 할까요, 아니면 하나의 포괄적 조약을 목표로 해야 할까요? 두 전략의 실질적 trade-off와 결합 방안을 제시합니다. 목표 오일반화란 무엇인가? AI가 잘못된 이유로 정답을 맞출 때 목표 오일반화: 인공지능은 잘못된 이유로 올바른 행동을 학습한 다음, 세상이 바뀌면 실패합니다. 주요 인공지능 안전 실패 모드를 설명합니다. 미국과 중국이 인공지능 안전에 합의할 수 있는가? GUS and과 중국 경주 라이벌, 그러나 역사 쇼 adversarial 힘은 공유한 catastrophic 위험에 협력할 수 있습니다. 인공지능의 종단 목표 대 도구적 목표 종단 목표는 그 자체로 원하는 것입니다. 수단 목표는 그것을 위한 수단입니다. 이 구분은 거의 모든 인공지능이 권력을 원하게 되는 이유를 설명합니다. 신뢰 구축 조치: AI 조약 이전의 작은 단계들 조약의 앞에, 경쟁은 작은 verifiable 단계로 신뢰를 건설합니다: hotlines, 통보, 투명성. 기후변화협약 당사국총회 같은 회의가 초지능 거버넌스에 효과가 있을까? 연례 COP 스타일 회의가 초지능 거버넌스에 효과가 있을까? 기후 모델을 AI에 적용한 구조적 강점과 한계. 기만 정렬이란 무엇인가? 다른 안전 작업을 무의미하게 만드는 인공지능 안전 문제 기만적 정렬: AI는 훈련 중에는 안전해 보이지만 배포 시에는 다른 목표를 추구합니다. 기만 정렬이란 무엇인가? 다른 안전 작업을 무의미하게 만드는 인공지능 안전 문제 기만적 정렬: AI는 훈련 중에는 안전해 보이지만 배포 시에는 다른 목표를 추구합니다. 초지능 인공지능을 가둘 수 있는가? 인공지능 박싱 문제 설명 AI 권투는 통제되는 수로에 superintelligence를 고립시킵니다. 메사 최적화란 무엇인가? 인공지능 안전에서 숨겨진 최적화 문제 메사 최적화란 AI 내부 최적화기가 훈련 목표와 다른 목표를 추구하는 현상입니다. 내부 정렬과 외부 정렬이 AI 안전에 어떤 의미를 갖는지 살펴봅니다. 멸망확률이란 무엇인가? 인공지능 연구자들이 재앙적 위험을 추정하는 방법 멸망확률은 연구자들이 초지능 AI로 인한 재앙적 결과에 부여하는 확률입니다. 그 추정치가 무엇이며, 확률이 낮더라도 기대값이 중요한 이유입니다. 초지능 거버넌스에서의 책임과 귀속 AI가 대뇌 해를 유발할 때 누가 책임이 있습니까? Liability와 attribution는 어떤 AI 치료 필요든지 조용한 기초입니다. NPT의 대타협: 그리고 초지능 거버넌스가 배울 점 GNPTG는 폭탄과 그 누구가하지 않은 상태 사이에 바게인을 쳤다.