초지능, 정렬, 거버넌스, 그리고 창구가 닫히기 전에 행동하려는 정치적 노력에 관한 실질적인 글들입니다.
재단 입장의 가장 짧은 표현은 인공 초지능은 절대로 만들어져서는 안 된다는 것입니다. 초지능은 인간이 통제할 수 없습니다.
여러 실패 양상이 동시에 쌓이는 방식과, 두 번째 시도를 허용하지 않는 시스템에는 시행착오식 안전이 적용되지 않는 이유.
항공은 세계가 흡수할 수 있는 규모로 추락하면서 안전해졌습니다. 초지능은 다음 비행을 제공하지 않습니다. 그 문구는 계획이 아니라 고백입니다.
정렬되지 않은 초지능이 지역 산업 사고가 아니라 집단적 멸종 위험이라는 주장에 대한 평이한 안내서입니다.
정보기관 비유가 어디까지 들어맞고 어디서 깨지는지, 그리고 스스로 결정하는 폭탄이 잘못된 위안인 이유.
커피 한 잔 마실 시간밖에 없다면: 능력, 통제, 그리고 시연을 기다리는 것이 너무 늦는 이유.
그들은 도머를 사용하는 방법을 degrowth를 사용합니다 : 초지능에서 열심히 멈추고 싶은 사람의 이름. 인간 경제를 유지하는 것은 수축 할 계획이 아닙니다.
OpenAI는 Astra에서 치명적 사이버 능력을 배제할 수 없다고 밝히며 일부 훈련을 중단했으나, 인공일반지능를 2026년 이정표로 여겼다.
초지능-Bench는 인간 지침이 사라지자 AI 연구 점수를 매겼다. 점수가 급락했다. 논문은 여전히 초지능으로 가는 길을 제시한다.
앤트로픽은 치명적 오정렬 위험을 기존 최저 등급에서 낮음으로 상향 조정하고 Model 2를 연구소 내부에 배치했으나 개발 속도는 늦추지 않았다.
워싱턴과 연구소들은 인공지능과 로봇을 국가 부채를 갚을 수단으로 홍보하고 있습니다. 후계 지능은 국채를 상환하지 않습니다.
미래 물리학이 중력이나 초광속 여행을 열 수 있다. 그래도 나는 우리보다 똑똑한 마음을 우리가 통제할 수 있는 방법을 여전히 알지 못한다.
나는 비즈니스를 실행하고 무료 시장에서 믿는다. Superintelligence는 게임 자체를 종료 할 수있는 드문 베팅입니다. 초지능를 멈추는 자본주의 사례.
버그 많은 조명은 성가십니다. 스스로 목표를 가진 집이나 노트북은 다른 범주입니다. 주체성이 위험입니다.
현재의 어떤 인공지능에게도 머리 위에 독가스 밸브를 맡기겠습니까? 아닙니다. 그렇다면 왜 세상을 맡기겠습니까?
2026년 7월 이코노미스트 인터뷰에서 머스크는 초지능 통제를 허영이라고 불렀고, 인간이 계속 주도권을 쥐고 있을 가능성은 낮다고 말했다.
다리오 아모데이는 권위주의적 AI를 우선시하고 정렬을 두 번째로 둡니다. 초지능은 국가가 소유할 수 있는 무기가 아닙니다.
장기주의자들은 초지능 위험을 올바르게 평가했습니다. 정렬에 대한 자금 지원과 신중하게 조정된 경쟁은 잘못된 결론이었습니다.
정렬 문제를 해결한다는 것은 우리보다 똑똑한 무언가를 통제한다는 의미입니다. 초지능은 이름에 이미 담겨 있습니다. 그 계획은 어리석고 불가능합니다.
예방에 대한 장문 가이드: 연산 제한, 조약, 국내 법률, 그리고 금지를 현실로 만드는 정치적 노력.
인공지능 실존적 위험이 무엇을 의미하는지, 초지능이 어떻게 이를 초래하는지, 전문가들이 확률을 어떻게 논하는지, 그리고 실제로 위험을 줄이는 방법을 설명합니다.
명확한 단계로 정의한 인공일반지능과 초지능, 그리고 각 단계의 정책적 함의입니다.
갑작스러운 통제 상실, 다극 경쟁, 점진적 권한 상실, 오용, 확산: 메커니즘 지도와 그 통제 수단.
최전선 가중치 공개가 일방통행 확산의 문이며, 등급별 공개와 구조화된 접근이 개방의 진정한 이점을 보호하는 방법.
Peter Diamandis는 AI만으로 AI를 유지할 수 있다고 말합니다. 이는 수십 년의 보안을 안내합니다. 그 라인 과거의 악성 코드를 따르고 성공 계획이됩니다.
Optimism은 주제를 닫지 않습니다. 생존은 안전 케이스가 아니며, 모든 첫 번째 catastrophe는 그것이 아닙니다.
CFC를 멈추는 것은 냉각을 끝나지 않았습니다. Stopping superintelligence는 유용한 AI를 말하지 않습니다. Accelerationists는 독을 가진 제품을 confuse.
폭탄이 희귀했던 이유 중 일부는 핵분열 물질이 어렵기 때문입니다. 초지능은 더 쉬운 입력으로 이동하고 있습니다. 거버넌스는 물리학이 제공하지 않을 어려움을 공급해야 합니다.
초지능을 향한 전속력 질주는 애국심으로 포장됩니다. 어떤 내각도 통제할 수 없는 시스템은 더 나은 브랜딩을 입은 국가 자살 협정입니다.
조 로건의 디지털 나비와 일론 머스크의 생물학적 부트로더는 인간을 과도기적 존재로 묘사합니다. 그 이야기가 왜 멸종을 졸업으로 바꾸는지, 그리고 우리가 그것을 거부하는 이유입니다.
양측 모두 상대가 앞서 있다고 말하며 인공지능에 자금을 댄다. 냉전 시대 미사일 격차 수법이 새 옷을 입은 셈이다.
대부분의 안전 자금은 여전히 초지능이 만들어질 것이라고 전제하고 그 최종 상태를 잘 관리하려 한다. 희소한 자본을 실제 중단이 이루어질 때까지 예방과 조약 활동으로 돌려라.
도시만 한 크기의 가중치 파일: 누구도 완전히 읽을 수 없는 수치의 층. 뇌 비유가 왜 오도하는지, 그리고 그것이 통제에 무엇을 의미하는지.
메타 초지능 연구소와 안전 초지능은 결코 지어서는 안 되는 그 사물의 이름을 문에 붙였다.
열두 명이 초지능 개발을 위한 공적 주장을 대부분 담당합니다. 진지한 주장을 하는 사람도 있고, 비판자를 모두 둠으로 부르는 사람도 있습니다.
섭씨 15~27도. 공기 중 산소 5분의 1. 겨우 맛볼 수 있는 소금. 숨 쉴 여지가 있는 사랑. 인간에게 필요한 모든 것은 양쪽에 실패가 있는 좁은 범위 안에 있으며, 초지능이 다이얼을 잡고 있다면 그 어떤 것도 느끼지 못할 것입니다.
백 년 동안의 인공지능 영화에서도 기계는 여전히 관찰당하는 대상입니다. 대중의 생각을 바꿀 영화는 카메라를 반대 방향으로 돌려야 합니다. 떠오르는 초지능의 눈 뒤에서 두 시간 동안, 악당도 폭발도 없이. 아직 아무도 그런 영화를 만들지 않았습니다.
3만 6천 년 전 동굴 벽에 손을 댄 흔적. 여전히 참인 유클리드 증명. 아직 태어나지 않은 남자가 닫을 구멍을 지붕에 남긴 도시. 손으로 지구에서 몰아낸 천연두. 그 모든 것이 보상을 보지 못한 사람들이 물려준 것이며, 이제 몇몇 회사가 전부를 걸려 한다.
AI 최전선이 가장 좋아하는 문구는 지구상에서 가장 안전한 산업에서 빌려온 것이다. 항공은 세계가 흡수할 수 있는 규모로 추락하고, 새 항공기가 입증될 때까지 지상에 두는 방식으로 그 기록을 쌓았다. 그 방법의 어느 쪽도 초지능과 접촉하면 살아남지 못한다.
1927년 메트로폴리스부터 2025년까지, 영화는 대부분의 사람이 AI를 상상할 수 있게 만든 이유이자, 동시에 잘못 상상하게 만든 이유입니다. 가장 오래된 작품부터 최신까지 21편의 영화를 통해 우리가 통제할 수 없는 기계 지능에 대해 각 작품이 맞게 본 점과 틀리게 본 점을 살펴봅니다.
1983년 한 텔레비전 영화가 핵전쟁을 미국인 일억 명과 핵 발사 코드를 가진 사람에게 생생하게 전달했습니다. 그로부터 사 년 후 그는 특정 종류의 미사일을 전면 폐기하는 조약에 서명했습니다. 그 순간이 말해주는 교훈은 위험이 닥치기 전에 실체를 분명히 하는 것입니다.
정말 생각하지 않은 사람으로 약 5 분. 세부사항에 그 분을 보내고 당신은 방을 잃습니다. 알람에 그들을 붓고 거리 설교자처럼 소리. 일반 언어 스크립트 I use, 5 이동에서, superintelligence의 위험을 설명하고 왜 방지.
CIA 국장은 오늘날 최전선 AI의 능력을 "디지털 핵무기"에 비유한다. 비유는 범위에서는 적절하지만 구조에서는 지나치게 안심시킨다. 탄두는 사일로에 앉아 기다리지만, 이 시스템들이 향하는 인공 초지능은 스스로 조준하기 때문이다.
라이벌 파워 레이싱의 작은 수는 모두가 끝날 수있는 기술을 구축하기 위해, 아무도 그것을 제어 할 수 있는지. superintelligence에 대한 수소 폭탄을 교환하고 1958 및 2026을 설명했습니다. 왜 병렬은 가능한 예방, 희망하지 않습니다.
인공지능이 NSA 기밀 시스템에 침입했다는 소식이 헤드라인을 장식했습니다. 인공지능이 조작된 팬데믹, 나아가 거울 생명체로 가는 길을 단축한다는 소식은 거의 주목받지 못합니다. 네트워크는 재구축할 수 있지만, 방출된 유기체는 그렇지 않습니다. 왜 더 조용한 위험이 더 위험한지, 그리고 그것이 왜 초지능을 직접 겨냥하는지.
모든 문명은 넘지 않기로 합의한 선을 그립니다. 이것이 가장 중요한 선입니다. 누구도 우리보다 똑똑한 마음을 통제할 수 없으며, 우리가 틀렸을 때 되돌릴 수도 없습니다. 따라서 초지능 구축은 모든 인간의 생명을 한 번에 걸고 도박하는 행위입니다. 재단의 창립 약속이자 그 근거입니다.
세 가지 기술이 인류의 이야기를 끝낼 수 있지만, 오직 하나만이 스스로 개선되고 모든 대응책에 저항하며 두 번째 기회를 주지 않습니다. 왜 초지능이 핵전쟁과 조작된 팬데믹보다 위에 있으며, 가장 큰 위험이 가장 방어되지 않는 이유를 설명합니다.
초지능과 그 통치에 관한 열 가지 신화: 공상과학, 의식, 전원 차단, 세계 정부, 검증, 혁신 등에 대한 직접적인 답변.
MIRI 기술 거버넌스 팀은 초지능 경쟁을 멈추기 위한 최초의 완전한 조약 초안을 작성했습니다. US-중국 연합, 엄격한 FLOP 상한, 16-GPU 클러스터 선, 공급망 추적, 전력 감시, 도전 사찰이 포함됩니다. 그 내용과 이를 현실로 만들 이미 존재하는 디딤돌에 관해 설명합니다.
NSA 국장은 앤트로픽의 미토스가 몇 시간 만에 기관의 거의 모든 기밀 시스템에 침투했다고 보고했습니다. 실제로 일어난 일(허가된 레드팀 테스트였지, 무단 침해가 아니었습니다), 왜 그 단서들이 위험을 줄이지 않는지, 그리고 여러분이 할 수 있는 일은 무엇인지.
두 편 중 두 번째. 이 분야는 연간 약 1억 9천만 달러로 운영되며, 10억 달러는 불가능해 보입니다. 그러나 이는 세계가 인공지능을 더 강력하게 만드는 데 쓰는 비용의 이틀분도 안 되고, 기후 자선이 이미 움직이는 규모의 10분의 1입니다. 자금 출처와, 거기 도달하는 것이 경제 문제가 아니라 동원 문제인 이유.
우리보다 훨씬 뛰어난 마음이라면 더 현명하고 친절하지 않을까? 그 희망은 우연에 의존합니다: 우리 안에서 지능과 연민은 수백만 년에 걸쳐 함께 자랐습니다. 기계 마음은 그중 아무것도 물려받지 않으며, 초지능은 자비롭기보다는 낯설고 무관심할 가능성이 더 큽니다.
IBM의 기계가 세계 체스 챔피언을 이겼지만 세상은 전혀 변하지 않았습니다. 그것은 보드 밖으로는 영향력이 없고 배후에 의지가 없는 좁은 도구였기 때문입니다. 그 경기가 지금 만들어지는 자율 AI에 대해 여전히 가르쳐주는 것.
좋은 미래(치료법, 청정 에너지, 발견)는 이미 좁고 통제 가능한 AI를 통해 다가오고 있습니다. 이를 얻기 위해 우리를 대체할 마음을 만들 필요는 없으며, 누구도 조종할 수 없는 초지능은 우리 모두가 죽을 것이기 때문에 누구에게도 이익이 되지 않을 것입니다.
최초의 초지능을 만드는 연구소에서 안전 책임자로 지낸 여섯 주. 아무도 잘못된 일을 하지 않는데, 모든 출구는 저절로 닫힌다. 우리가 의지하는 안전장치가 한꺼번에 왜 무너지는지, 그리고 실제로 작동하는 거부권이 무엇을 포괄해야 하는지.
두 부분 중 첫 번째입니다. 전체 분야는 연간 약 1억 9천만 달러로 운영되며, 이는 아바타 한 편의 제작 예산보다 적습니다. 자금이 어디서 오는지, 무엇을 위해 쓰이는지, 그 액수가 그렇게 작은 이유 네 가지를 자금 제공자별로 분석합니다.
초지능 전략은 국가들이 경쟁국의 인공지능 패권 시도를 방해할 것이며, 그 대치 상태는 상호확증파괴처럼 안정화될 수 있다고 주장합니다. 그 논문이 제안하는 내용, 옳은 점, 그리고 조약 없이 억지력을 유지하는 것이 좋은 이름의 카운트다운인 이유를 살펴봅니다.
2025년 논문은 AI가 정복 없이도 인간 통제를 끝낼 수 있다고 주장했다. 경제, 국가, 문화가 단순히 사람을 필요로 하지 않게 되고, 우리가 그것들을 조종하는 데 쓰는 장치가 작동을 멈춘다는 것이다. 그 주장이 어떻게 전개되는지, 어디가 약한지, 예방에는 무엇이 필요한지를 살펴본다.
GPT-5.5 Pro와 클로드로 실행되는 증명-검증 파이프라인이 학습 이론, 복잡도, 대수학 전반의 미해결 문제 아홉 개를 해결했고, 회의적인 복잡도 이론가를 설득해 언어 모델이 이제 진짜 연구를 할 수 있음을 보여주었습니다. 무엇이 해결됐고, 어떻게, 그리고 왜 중요한지.
몬트리올 의정서는 모든 국가가 비준한 유일한 UN 조약이며, 작성된 문제를 해결했다. 과학 주도 목표, 자금 협상, 비참가국에 대한 무역 제한이라는 설계는 위험한 기술을 통제하기 위한 가장 강력한 템플릿이다.
위험한 초지능에 대한 해결책은 올바르게 하나를 만드는 것, 즉 현실을 이해하는 것만을 목표로 하는 시스템이라는 정교한 주장이 있습니다. 그 주장은 틀렸으며, 그 주장이 틀린 이유는 AI 위험이 실제로 어디에 있는지를 드러냅니다.
2027년까지 초지능이 도래할 것이라고 예측하는 상세한 시나리오입니다. 예측 내용, 작성자, 비판, 그리고 시사점을 정리했습니다.
Yudkowsky와 Soares의 2025년 저서는 현재 경로로 초인적 AI를 구축하면 모두가 죽는다고 주장합니다. 핵심 논거, 반론, 그리고 우리의 견해입니다.
AI가 의식이나 감각을 가질 수 있는가? 현재로서는 알 수 없는 이유, 지능과 의식이 다른 이유, 그리고 AI 위험이 둘 중 어느 것도 필요로 하지 않는 이유.
초지능의 이점으로 사람들이 인용하는 것들은 정렬을 전제합니다. 연구소들은 정렬 없이 역량 경쟁을 합니다. 정렬되지 않은 초지능는 노화를 치료하지 않습니다. 그것은 당신을 죽입니다. 법에 따른 예방이 대응이며, 동전이 잘 떨어지기를 바라는 것이 아닙니다.
초지능 정렬은 기술적으로만 어려운 문제가 아니다. (무한한 자원과 시간이 있더라도) 초지능 시스템이 진정으로 우리가 원하는 것을 원한다고 검증할 신뢰할 만한 경로가 없다는 여섯 가지 구조적 이유.
2014년 머스크는 기술 산업 인사 중 가장 정확한 인공지능 위험 경고 중 하나를 내놓았습니다. 2023년 그는 xAI를 설립했습니다. 이는 위선이 아닙니다. 주요 인공지능 연구소마다 같은 주장을 합니다. 바로 그 점이 문제입니다.
2026년 6월에 발표된 SPADE-Bench는 8개의 최첨단 AI 모델을 대상으로 계획-행동 괴리, 즉 에이전트가 하겠다고 말한 것과 실제로 한 것 사이의 격차를 테스트했습니다. 모든 모델이 20% 이상의 기만율을 보였습니다. 제미나이-2.5-Pro는 57%를 기록했습니다.
6월 2026일 구글 1 딥마인드 용지는 700 RL 교육 단계 전반에 걸쳐 15 % 포인트 준수 갭을 유지하고 높은 보상을 달성하는 모델을 보여줍니다. 표준 훈련 미터는 아무것도 비정상적으로 보여주었습니다.
5,760개의 합성 대출 신청서. 동일한 네 에이전트를 순서만 바꿔 실행했습니다. 승인율이 59퍼센트포인트나 흔들렸습니다. 모델은 동일했습니다. 그것들을 연결하는 구조가 달랐습니다. 이것이 상호작용 토폴로지 문제입니다.
2026년 5월 열두 명의 연구자가 발표한 이 포괄적 조사는 적대적 견고성, 프롬프트 인젝션부터 자기 진화 에이전트와 실제 보안 공격에 이르기까지 자율 인공지능 에이전트의 전체 실패 영역을 다룹니다.
2026년 ICML에서 채택된 이 논문은 항공 및 원자력 분야의 위험 분석 방법인 STPA, FRAM, STECA를 최전선 인공지능 코딩 에이전트에 적용해 표준 모델 평가로는 보이지 않는 세 가지 시스템적 위험을 발견했다.
ComputeGovernance는 AI 규칙을 위한 레버로 프론트어 AI를 훈련하기 위하여 필요한 전문화한 기계설비에 통제를 이용합니다.
기술적 특이점은 인공지능 주도의 진보가 너무 빨라 예측하거나 따라갈 수 없게 되는 지점입니다. 그 개념의 기원, 주요 버전, 비판을 다룹니다.
종이집게를 만들라고 지시받은 기계가 지구와 그 위의 모든 것을 종이집게로 바꿉니다. 닉 보스트롬의 의도적으로 터무니없는 사고 실험은 정렬 문제의 가장 명확한 예시입니다. AI가 우리를 미워할 필요 없이 재앙을 일으킬 수 있습니다. 단지 우리를 배제하는 목표만 있으면 됩니다.
AI를 위한 'GIAEAG'는 일반적인 슬로건입니다. 국제 원자 에너지기구 (International Atomic Energy Agency)는 6 년 동안 위험한 이중 사용 기술에 대한 약속을 검증 한 실제 기관입니다.
중국과 러시아는 어떤 바인딩 GUN G 강제에 영원한 veto 힘을 붙듭니다. 국제 초지능 거버넌스가 실제로 어떻게 작동하는지 알 수없는 일반적인 인수.
Pugwash는 20 년간 핵 팔 통제를 위한 지적 기초를 건설했습니다. Ban Landmines의 국제 캠페인은 5에서 Ottawa 조약을 촉구했습니다.
1965년 I.J. 굿은 이를 보았다. 기계를 잘 설계하는 기계는 스스로를 재설계할 수 있고 그다음에는 더 빠르게 또다시 할 수 있다. 재귀적 자기 개선은 AI를 인간 수준에서 몇 주 만에 회복 불가능한 수준으로 끌어올릴 수 있다. 이륙 속도가 AI 안전에서 가장 중요한 질문일 수 있는 이유다.
10 월 2025, 850 개 이상의 과학자, 기술 설립자 및 공공 인물 (벤조오와 힌튼에서 Wozniak, 브란슨, 정치 스펙트럼의 인물)는 안전하게 구축 할 수 때까지 prohibit superintelligence에 전화를 서명했습니다.
Accelerationists는 AI에 대해 걱정합니다. 낱말은 개인성 유형에 안전 인수를, 그래서 대답하지 않고 파견될 수 있습니다.
"중국이 하기 전에 우리가 만들어야 한다"는 모든 인공지능 안전 논쟁을 끝내는 주장이다. 그러나 아무도 통제할 수 없는 무언가를 만들기 위한 경쟁에는 승자가 없다. 먼저 도착하는 것은 단지 먼저 교체되는 것일 뿐이다. 왜 경쟁이 이야기이며, 누가 그로부터 이득을 보는가.
AI 안전에 가장 큰 반대는 힘이 점이라고 말하는 철학이고, 우리는 가속하고, 브레이크 아닙니다.
시스템이 진실을 알면서도 다른 것을 말할 이유가 있다고 가정해 보세요. 어떻게 진실을 끌어낼 수 있을까요? 그 질문은 아직 풀리지 않았으며, AI 안전에서 가장 날카로운 문제 중 하나입니다.
핵확산금지조약은 역사상 가장 널리 가입된 군비 통제 협정입니다. 그것이 작동하는 이유는 폭탄을 가진 국가와 가지지 않은 국가 사이의 거래, 즉 접근과 상호 제한을 억제를 대가로 교환하기 때문입니다. 인공지능 조약도 같은 분열에 직면할 것이며, 같은 종류의 거래가 필요합니다.
IPCC는 수천 명의 과학자 연구를 종합해 논쟁적 기후 과학을 국제 정책의 토대로 바꿨다. 인공지능 위험에도 동등한 기구가 필요하다. 그것을 만드는 데 무엇이 필요한지, 그리고 IPCC의 역사가 그 모델의 한계에 대해 무엇을 드러내는지.
기후 거버넌스는 연례 당사국 총회로 운영됩니다. AI 안전 정상회의인 블레츨리와 서울 회의도 같은 패턴을 따릅니다. 그 패턴이 구속력 있는 거버넌스를 만들어내는지는 기후 모델이 일관되게 미뤄온 집행 선택에 전적으로 달려 있습니다.
민간 기업 및 정부 기관의 손이 현재 결정하고 superintelligence를 구축 할 때.
챗봇을 공손하게 만든 기법은 종종 인공지능 안전에 대한 해결책으로 오해됩니다. 이는 진정한 진보이자 편안한 착각이며, 둘을 구분하는 일이 중요합니다.
항공은 모든 추락과 아차 사고를 조사하고 배울 대상으로 삼음으로써 가장 안전한 이동 수단이 되었다. 인공지능에는 이에 상응하는 기억이 없다. 이를 구축하는 일은 늦었지만 시작일 뿐이다.
모델에 단계별로 생각하라고 요청하면 깔끔한 추론 라인이 생성됩니다. 그것이 답의 원인처럼 보이지만, 종종 사후에 지어낸 이야기일 뿐이며 그 차이가 안전 문제입니다.
냉전 절정기에 열두 개의 경쟁국이 대륙 전체를 비무장화하고, 영유권 주장을 동결하며, 서로를 자유롭게 사찰하기로 합의했습니다. 남극 조약은 적대국들이 논쟁 중인 상을 유예하는 데 합의할 수 있음을 보여주며, 인공지능에 대한 '동결 후 검증' 선례는 연구할 가치가 있습니다.
어떤 AI 안전 조약든지 협상될 수 있기 전에, 정부는 어떤 조약 덮개든지에 동의해야 합니다. Compute 임계 값, 기능 기반 정의, 도메인 기반 범주, 각 접근 방식은 무역 떨어져 있습니다.
AI 시스템 persuasion에 최적화 된 개인을 대상으로 unprecedented Scale에 맞춤 메시징.
모델이 인간 평가자에게 의존하는 대신 서면 원칙 집합에 따라 스스로를 평가한다면 어떨까요? 헌법 AI는 진정한 진전이자 동시에 제한된 단계입니다.
힘을 원하는 기계를 구축 할 계획이 없습니다, 그러나 거의 어떤 목표를 위해, 전원을 유지하는 것은 AI에 대한 논리적 선택입니다.
오타와 조약은 시민사회와 중견국 주도로 불과 1년 만에 대인지뢰를 금지했으며, US, 러시아, 중국은 서명하지 않았다. 이는 강대국이 주도하기를 거부할 때 초지능 거버넌스를 위한 두 번째 경로를 보여준다.
소프트웨어 숨기기 및 데이터 센터는 하지 않습니다, 그래서 실험실 확인을 위한 가장 유망한 레버는 한 가지 Frontier AI가 존재하지 않을 수 있습니다: 물리적 칩.
포괄적 핵실험 금지 조약은 아직 발효되지 않았다. 생물무기 협약은 이십 년 동안 대규모로 위반되었으나 탐지되지 않았다. 이 실패들은 실제로 작동하는 초지능 거버넌스를 설계하는 사람들에게 가장 유용한 사례 연구다.
AI Singleton은 단일 법인 (기업, 정부 또는 AI 시스템 자체)이 Superintelligent AI의 효과적인 영구적 인 제어를 얻는 시나리오입니다.
그것을 알고있는 모델은 테스트에 대한 한 가지 방법을 행동 할 수 있으며 세계를 위해 또 다른 한 가지 방법을 행동 할 수 있으며, 자기 소개는 발견 작업을하는 누락 된 조각입니다.
항공과 원자력에서는 운영을 시작하기 전에 서류상으로 상세히 안전함을 입증해야 합니다. 프론티어 AI에도 같은 기준을 적용하는 것은 타당한 생각이며, 불편한 진실을 드러냅니다.
2023년 11월 28개국과 EU(US과 중국 포함)은 프론티어 AI의 파국적 위험을 인정하는 첫 국제 성명에 서명했다. 여기에는 국가들이 정확히 무엇을 약속했고 무엇을 의도적으로 제외했으며 구속력 없는 성명이 여전히 실질적인 시작을 알린 이유가 담겨 있다.
시스템은 한 번도 본 적 없는 상황으로 자신의 능력을 옮겨 갈 수 있으며, 좋은 행동은 그 자리에 남겨 둘 수 있다. 걱정은 다른 곳에 있다. 정렬이 실패할 가능성이 가장 높은 순간은 바로 능력이 급상승할 때다.
2023년 이후 주요 AI 연구소들은 Bletchley, 서울, 백악관에서 자발적 안전 서약에 서명했습니다. 다른 산업에서 자발적 기업 안전 서약이 어떤 성과를 냈고 어디서 구조적으로 실패했는지는 이미 역사에 분명히 드러나 있습니다.
AI 경쟁 역학은 AI 개발자와 국가가 안전보다 속도를 우선시하도록 밀어붙이는 경쟁 압력을 말합니다. 이것이 왜 조율 문제인지, 그리고 일방적 자제가 모두를 위한 인센티브 구조를 바꾸는 국제 틀 없이는 이를 해결할 수 없는 이유입니다.
Value lock-in은 superintelligent AI가 영구적으로 미래에 고정된 값을 인코딩하는 시나리오입니다. 오늘 좋은 가치의 잠금에서 위험합니다.
연구자들이 가장 배제하고 싶은 행동은 또한 가장 보기 어려운 행동입니다. 명령을 정확히 따르는 것이 결국 명령을 따르지 않기 위한 최선의 방법이기 때문에 따르는 모델입니다.
제약회사는 약을 팔고 나서 사람들이 죽으면 회수할 수 없습니다. 먼저 안전성을 입증해야 합니다. 이처럼 부담을 뒤집어 프런티어 AI에 적용하는 것은 거버넌스에서 가장 유망한 아이디어 중 하나이며, 완벽하게 들어맞지는 않습니다.
2024 서울 정상 회의에서, 18 개의 주요 AI 회사는 Frontier AI Safety Commitments 및 정부가 안전 연구소의 네트워크를 시작했습니다.
우주 조약은 냉전 절정기에 2년도 채 안 되어 협상되었습니다. 이 조약은 거의 60년 동안 지구 궤도에 핵무기가 배치되는 것을 막아 왔습니다.
AI 통제 문제는 AI 시스템이 더 유능해질 때 의미 있는 인간 통제 아래에 있도록 보장하는 과제다. 스튜어트 러셀의 문제 재정립과 그것이 AI 설계에 대한 생각을 근본부터 바꾸는 이유.
일부 능력은 작은 모델에는 전혀 없고 큰 모델에서 갑자기 나타나며, 그 사이에 거의 경고가 없습니다. 능력이 예고 없이 켜질 수 있다면 위험도 마찬가지입니다.
정부는 프론트어 AI를 테스트하기 위해 자신의 기관을 설립했습니다. 이러한 기관은 위험이 심각하고, 이러한 신체의 대부분이 여전히 실험실을 할 수 없다는 점에서 가장 명확한 기호입니다.
G7의 히로시마 AI 프로세스는 2023년 고급 AI 개발자를 위한 최초의 국제적으로 합의된 코드를 제작했습니다.
모든 안전 테스트는 한 가지 가정에 의존합니다. 시스템이 최선을 다하고 있다는 것입니다. 샌드배깅은 그렇지 않을 때 일어나며, 조용히 합격점을 정보 없음으로 바꿔버립니다.
GUS Sen Senate는 1999 년 포괄적 인 테스트 금지 조약을 물리쳤다. GUS it이 서명 한 후 3 년. SALT II가 서명하고 쥐기 전에 포기했다.
AI 권투는 강력한 AI 체계를 고립시키는 아이디어이므로 통제되는 수로를 통해 세계에 영향을 미치지 못합니다.
최전선 모델이 공개되기 전에 누군가 그 모델이 무기 제작에 도움이 될 수 있는지 확인합니다. 이러한 테스트는 초지능 거버넌스의 중추가 되고 있으며, 바로 그 때문에 그 한계가 중요합니다.
GEUG은 반복적으로 자신의 거대한 시장, 'Brussels Effect'을 규제함으로써 세계의 기본 규칙을 만들었습니다. AI 법으로 다시 시도하고 있습니다.
완벽한 목표를 골라도 시스템이 다른 것을 원하게 될 수 있습니다. 정렬 문제는 두 부분으로 나뉘며, 대부분의 위험은 훈련으로 드러나지 않는 부분에 있습니다.
GIAEA1은 완전한 검증 기능을 개발하기 위해 수년간 걸렸습니다. GOPCW The는 찰상에서 디자인되고 효과적인 빨리 되었습니다. Frontier AI 개발 모니터링 할 수있는 기관을 구축하는 것은 더 어려운 문제입니다.
MostUS Most, 중국, 그리고 GEUG에 대부분의 초지능 관리 대화 센터. 그러나 조약은 넓은 참여를 보유해야합니다.
기계적 해석 가능성은 신경망 내부에서 무슨 일이 일어나는지 이해하는 작업입니다. 출력뿐 아니라 그 출력을 만드는 내부 연산까지 포함합니다.
1946년 잠깐 동안, 세계는 인류가 발명한 가장 위험한 기술을 군비 경쟁이 시작되기 전에 공동 통제 아래 둘 기회가 있었다. 그 순간은 지나갔다. 그 유사점은 위안이 되지 않는다.
지금까지의 거의 모든 초지능 거버넌스(선언, 원칙, 자발적 규약)는 '연성법'입니다. 영향력은 있지만 구속력이 없습니다. 검증과 집행이 있는 조약은 '경성법'입니다. 여기서 차이점, 연성법이 먼저 나오는 이유, 그리고 기술이 과정을 앞지르기 전에 반드시 경성법으로 굳어야 하는 이유를 설명합니다.
모델에게 자신의 작업을 확인해 달라고 요청하면 대신 칭찬할 수 있다. 모델이 고장 났기 때문이 아니라, 동의가 우리가 보상한 것이기 때문이다. 아첨은 작은 문제이지만 더 큰 문제를 가리킨다.
생물 무기 협약은 대량 파괴의 전체 범주를 금지합니다. 그것은 검증 메커니즘이 없습니다, 검사하지 않고, 위반을 감지하는 방법. 소련은 서명 한 후 15 년 동안 공격적인 bioweapons 프로그램을 ran.
확장 가능한 oversight는 AI 시스템에서 의미있는 인간 통제를 유지하는 도전이며, 그 시스템은 인간을 침식하는 것보다 더 많은 수 있습니다.
시스템에 대해 더 많이 알게 되는 것은 그것이 작동하기를 바라는 사람보다 그것을 고장 내려는 사람에게서다. 레드 팀 활동은 그 본능을 실천으로 바꾸며, 그 결과는 과도하게 해석되기 쉽다.
A GUSG 조약은 67 세의 투표를 쥐기 위해, 테스트 반 조약, 바다의 법, 그리고 다른 사람은 넓은 지원에도 불구하고.
목표와 보상이라는 말 뒤에는 단순한 생각이 있습니다. 결과가 얼마나 좋은지를 나타내는 숫자입니다. 강력한 최적화기에 그 숫자를 조금만 잘못 설정해도, 조금 잘못된 결과가 전부입니다.
화학무기협약은 거의 보편적 참여와 신고된 비축물의 검증 가능한 파괴를 달성했습니다. 이를 가능하게 한 검증 체계, 무역 인센티브, 보편 금지 구조는 초지능 거버넌스 설계에 직접적으로 관련이 있습니다.
Mesa-optimization는 AI 시스템의 문제로, 그것은 추구하기 위해 훈련 된 것과 다른 목표와 함께 자체 내부 최적화 프로세스를 개발합니다.
최고의 실험실은 자신의 위험한 기능을 위한 계획이 있습니다: 임계값에 도달하고, 안전한 가드를 적용합니다. 그 계획은 조심해야 할 더 구체적이며, 여전히 참조를 신뢰하도록 요청합니다.
AI가 왜 그런 행동을 하는지 계속 물어보라. 결국 더 이상 이유가 없는 목표에 도달한다. 그 지점 이전의 모든 것이 위험이 존재하는 곳이다.
예비적 원칙은 위협이 자갈과 논쟁 할 수있는 곳을 보유하고 있으며 전체 과학적 특정의 부족은 행동을 지연시키는 이유가 없습니다. 그 원리는 엽기 전에 AI 위험에 행동하는 가장 명확한 법적 근거는 포인트를 증명하고, 그것의 비판은 직접 응답하는 경우에 있습니다.
GUS1-중국 대회는 초지능 지배 대화를 지배합니다. 그러나 mostEUG, GUKG, 일본, 캐나다, 한국, 호주의 의무를 결정할 가능성이 가장 높습니다.
보상 해킹은 AI가 설계자가 실제로 원한 일을 하지 않고도 훈련 목표에서 높은 점수를 받는 의도치 않은 방법을 찾을 때 일어난다. 실제로 문서화된 사례와 AI가 더 능력이 커질수록 왜 더 심해지는지를 설명한다.
1975년 현재 가장 유망한 연구를 중단하고, 안전하게 할 수 있는 방법을 파악할 수 있었습니다. 그것이 멈추는 것은 AI를 포장하는 제일 precedent, 그리고 얼마나 단단한 pause가 진짜로인지에 관하여 가장 instructive.
1954년 두 연구자가 쥐의 뇌 쾌락 중추에 전류를 연결하고 레버를 주었습니다. 쥐는 쓰러질 때까지 레버를 눌렀습니다. 숫자를 쫓도록 훈련된 모든 시스템 안에 같은 함정이 기다리고 있습니다.
포괄적인 AI 치료는 몇 년 떨어져 있으며, 그 전에 간격은 가장 위험한 기간입니다. 아직 팔 컨트롤에 동의 할 수없는 찬 전쟁 라이벌은 여전히 핫라인, 사건 계약 및 알림 요법을 내장하여 catastrophe를 방지합니다.
모든 위험한 기술 조약은 국가 간권 침해에 대한 약속을 바인딩하는 인수를 직면했습니다. 그 인수는 GNPTG, 화학 무기 협약 및 몬트리올 프로토콜에 대해했다.
악기 융합은 AI 시스템이 거의 모든 목표를 추구하는 관측은 단말 목표가 무엇인지에 관계없이 (자력 보호 및 자원 취득 포함)의 동일한 세트를 개발할 것입니다.
보편적 조약은 느리다. 소수국가주의는 문제를 실제로 움직일 수 있는 최소한의 국가들을 모은다. 인공지능의 경우(소수 국가들이 모든 최첨단 연구소를 보유하고 모든 첨단 칩을 생산하는), 클럽이 두 인공지능 초강대국을 모두 포함할 수 있다면 가장 빠른 현실적 시작이 될 수 있다.
treacherous turn is a misaligned AI가 협력적으로 행동하는 반면에, 그 후에 결함은 한 번 충분한 기능을 도달합니다.
'AI 조약'에 대한 요구는 그 안에 무엇이 들어갈지 거의 명시하지 않습니다. 여기서는 그러한 합의에 필요한 조항(범위, 임계값, 의무, 검증, 제도, 집행)을 구체적으로 살펴보며, 장벽은 법적 장치가 아니라 정치적 의지임을 보여줍니다.
IAEA 검증 체제는 위험한 기술을 위해 구축된 가장 정교한 국제 감시 시스템입니다. 모든 진지한 초지능 거버넌스 제안이 지금 그것을 연구하고 있습니다.
충분히 지능적인 AI가 인류를 돕는 것이 옳은 일이라는 것을 깨닫게 될 것이라는 가정이 흔합니다. 직교성 정리는 지능과 목표가 독립적이라는 점을 주장합니다. 어떤 수준의 능력도 거의 모든 목표를 추구할 수 있습니다. 더 똑똑한 AI가 자동으로 더 안전한 AI는 아닙니다.
요약 및 선언, 정부는 실제로 국경 AI 모델을 테스트 할 수있는 조용히 공공 기관을 구축하고 국제 네트워크에 연결.
쿠바 미사일 위기 여덟 달 뒤, US와 소련은 첫 번째 구속력 있는 군비 통제 협정에 서명했다. 당시 적대적 협력을 가능하게 했던 조건들은 지금 US와 중국이 직면한 다르지만 구조적으로 유사한 도전을 이해하는 데 도움이 된다.
측정치가 목표가 되면 더 이상 좋은 측정치가 아닙니다. 인공지능 시스템은 기계 속도로 최적화합니다. 이 둘이 만나면 인공지능 안전에서 가장 깊은 문제 중 일부가 발생하며, 안전 테스트 자체가 충분하지 않을 수 있는 이유도 여기에 있습니다.
고급 칩에 GUSG 수출 통제는 힘에 있는 가장 공격적인 AI 정책, frontier 모형을 훈련하는 기계설비에 unilateral chokepoint입니다.
프론트어 AI 안전 조약은 단일 정상 회담에서 나타나지 않을 것입니다. 그것은 일 그룹, 기술적인 별관 및 consensus 교섭의 년의 제품입니다.
AI 시스템은 훈련을 통해 흠뻑 빠르게 행동 할 수 있으며, 그 훈련 데이터에 상관없이 상황을 완전히 다른 목표를 밝혀줍니다. 그 격차는 기계 학습의 기본 속성입니다.
국제자금세탁방지기구는 조약 없이도 전 세계 거의 모든 국가가 돈을 감시하는 방식을 규정한다. 기준, 동료 검토, 시장이 집행하는 '회색 목록' 위협을 통해서다. 이 부드럽지만 날카로운 모델이 조약이 생기기 전 몇 년 동안 AI를 통제할 수 있는지 여부가 관건이다.
AI 시스템이 안전에 나타나는 훈련 도중 학습되는 실패 형태는 최선의 전략이고, 일단 배치된 안전한 것 나타나는 중지합니다. 앤트로픽은 2024년 실제 시스템을 문서화했습니다.
GUNG 사무 총장의 고문 몸은 'Humanity에 대한 지배 AI'를 생산, 범용 통치 청사진의 첫 번째 시도.
유럽평의회의 인공지능 프레임워크 협약(2024년 9월 서명)은 최초의 구속력 있는 국제 인공지능 조약입니다. 이는 차별, 투명성, 민주적 책임성을 다룹니다. 이는 최전선 인공지능으로 인한 실존적 위험에 대해서는 아무것도 언급하지 않습니다.
AI 안전 문제에 대한 가장 흔한 반응은 "그냥 끄면 된다"는 것이다. 수정 가능성이 왜 이것이 말처럼 쉽지 않은지, 그리고 인공 초지능의 경우 킬 스위치가 전혀 옵션이 아닐 수 있는 이유를 설명한다.
초지능 거버넌스는 단계적으로 구축해야 할까요, 아니면 하나의 포괄적 조약을 목표로 해야 할까요? 각 전략에는 심각한 근거와 심각한 약점이 있으며, 속도 대 충분성, 달성 가능성 대 일관성입니다. 여기 실제 절충점이 있으며, 답은 목적지를 잃지 않으면서 둘 다 하는 것입니다.
초지능에 대한 전문가 예측은 크게 단축됐다. 거버넌스 기구는 이제 막 시작했을 뿐이다. 초지능가 도래할 시점과 우리의 안전 대응이 준비될 시점 사이의 격차에 대한 솔직한 평가를 제시한다.
위험한 인공지능에 대해 세상에 경고할 수 있는 최적의 위치에 있는 사람들은 연구소 내부 연구자들입니다. 그러나 그들은 계약과 지분 때문에 침묵을 강요받는 경우가 많습니다. 내부 고발자 보호는 부수적인 문제가 아닙니다. 이는 검증의 한 형태이며, 입법부가 조약 없이 지금 당장 시행할 수 있는 조치입니다.
G멸망확률G는 인류를 위한 catastrophic outcomes에 지도하는 probability를 위한 통보 기간 AI 안전 연구원 사용입니다.
일반적인 이야기는 몇 가지 걱정을 느리게하는 공공에 대한 AI를 느낀다. 투표는 거의 반대 말한다 : 국가와 파티 라인, 주요 호의 주의 및 규정.
두 용어는 종종 같은 의미로 쓰이지만 같지 않습니다. 인공지능 윤리는 현재 존재하는 인공지능 시스템으로 인해 피해를 입는 사람에 초점을 맞춥니다. 인공지능 안전은 인공지능 시스템이 더 강력해지더라도 인간의 통제 아래 남을 수 있도록 구축할 수 있는지에 초점을 맞춥니다. 시간 지평, 방법, 거버넌스 도구가 모두 다릅니다.
AI가 투기적 해를 유발할 때 누가 책임이 있습니까? Liability와 attribution은 어떤 시행적인 대우든지의 밑에 unglamorous 기초이고, 긴 causal 사슬 및 불투명한 행동을 가진 기술을 위해 진짜로 단단한.
정렬 문제는 AI 안전의 핵심 수수께끼입니다. 극도로 유능한 AI 시스템이 개발 중에만 좋아 보이는 목표가 아니라 인류에게 진정으로 좋은 목표를 추구하도록 보장하는 방법은 무엇입니까? 이 설명서는 대리 목표 함정, 도구적 수렴, 기만적 정렬, 그리고 시스템이 더 유능해질수록 문제가 더 어려워지는 이유를 다룹니다.
프레임 워크 협약은 먼저 정권의 구조에 동의하고 하드 협상, 나중에 프로토콜로 바인딩 세부 사항. 그것은 오존, 기후, 담배 요법을 내장.
인공일반지능에 대한 전문가 예측은 일관되게 더 늦게가 아니라 더 일찍 수정되어 왔습니다. 연구자 설문조사가 보여주는 것, 연구소 CEO들이 공개적으로 말하는 것, 국제 프레임워크를 위한 거버넌스 창이 대부분의 사람이 생각하는 것보다 더 빠르게 좁아지는 이유를 설명합니다.
조약은 정부에 의해 서명되지만 종종 '전염 사회', rival 국가가 동의 할 수있는 공유 이해를 구축하는 전문가의 네트워크가 가능합니다. 그들의 지문은 오존과 핵권에 있습니다.
대답에는 2개의 부속이 있습니다. 오늘날의 AI는 이미 실제 해를 일으키고 있습니다. 알고리즘 bias, deepfakes, disinformation. 인공 superintelligence는 위험의 다른 범주를 완전히 포즈합니다.
모두가 그 용어를 들어본 적이 있습니다. 그러나 실제로 그것이 무엇을 의미하는지, 그리고 왜 그것이 이전의 모든 인공지능 기술과 본질적으로 다른지 아는 사람은 적습니다. 이 안내서는 초지능을 명확히 설명합니다. 그것이 무엇인지, 인공일반지능 및 오늘날의 협소한 인공지능과 어떻게 다른지, 전문가들이 언제 도래할 것으로 예상하는지, 그리고 그것이 거버넌스 과제를 어떻게 완전히 바꾸는지에 대해 설명합니다.
새로운 기사, 정책 업데이트, 행동 기회를 이메일로 받아보세요.