초지능, 정렬, 거버넌스, 그리고 창구가 닫히기 전에 행동하려는 정치적 노력에 관한 실질적인 글들입니다.
재단 입장의 가장 짧은 표현은 인공 초지능은 절대로 만들어져서는 안 된다는 것입니다. 초지능은 인간이 통제할 수 없습니다.
여러 실패 양상이 동시에 쌓이는 방식과, 두 번째 시도를 허용하지 않는 시스템에는 시행착오식 안전이 적용되지 않는 이유.
항공은 세계가 흡수할 수 있는 규모로 추락하면서 안전해졌습니다. 초지능은 다음 비행을 제공하지 않습니다. 그 문구는 계획이 아니라 고백입니다.
정렬되지 않은 초지능이 지역 산업 사고가 아니라 집단적 멸종 위험이라는 주장에 대한 평이한 안내서입니다.
정보기관 비유가 어디까지 들어맞고 어디서 깨지는지, 그리고 스스로 결정하는 폭탄이 잘못된 위안인 이유.
커피 한 잔 마실 시간밖에 없다면: 능력, 통제, 그리고 시연을 기다리는 것이 너무 늦는 이유.
They use degrowth the way they use doomer: a name for anyone who wants a hard stop on 초지능. Keeping the human economy is not a plan to shrink it.
오픈AI는 Astra에서 치명적 사이버 능력을 배제할 수 없다고 밝히며 일부 훈련을 중단했으나, AGI를 2026년 이정표로 여겼다.
초지능-Bench는 인간 지침이 사라지자 AI 연구 점수를 매겼다. 점수가 급락했다. 논문은 여전히 초지능으로 가는 길을 제시한다.
Anthropic은 치명적 오정렬 위험을 기존 최저 등급에서 낮음으로 상향 조정하고 Model 2를 연구소 내부에 배치했으나 개발 속도는 늦추지 않았다.
워싱턴과 연구소들은 인공지능과 로봇을 국가 부채를 갚을 수단으로 홍보하고 있습니다. 후계 지능은 국채를 상환하지 않습니다.
미래 물리학이 중력이나 초광속 여행을 열 수 있다. 그래도 나는 우리보다 똑똑한 마음을 우리가 통제할 수 있는 방법을 여전히 알지 못한다.
I run a business and believe in free markets. Superintelligence is the rare bet that can end the game itself. A capitalist case for stopping 초지능.
버그 많은 조명은 성가십니다. 스스로 목표를 가진 집이나 노트북은 다른 범주입니다. 주체성이 위험입니다.
현재의 어떤 인공지능에게도 머리 위에 독가스 밸브를 맡기겠습니까? 아닙니다. 그렇다면 왜 세상을 맡기겠습니까?
2026년 7월 이코노미스트 인터뷰에서 머스크는 초지능 통제를 허영이라고 불렀고, 인간이 계속 주도권을 쥐고 있을 가능성은 낮다고 말했다.
다리오 아모데이는 권위주의적 AI를 우선시하고 정렬을 두 번째로 둡니다. 초지능은 국가가 소유할 수 있는 무기가 아닙니다.
장기주의자들은 초지능 위험을 올바르게 평가했습니다. 정렬에 대한 자금 지원과 신중하게 조정된 경쟁은 잘못된 결론이었습니다.
정렬 문제를 해결한다는 것은 우리보다 똑똑한 무언가를 통제한다는 의미입니다. 초지능은 이름에 이미 담겨 있습니다. 그 계획은 어리석고 불가능합니다.
예방에 대한 장문 가이드: 연산 제한, 조약, 국내 법률, 그리고 금지를 현실로 만드는 정치적 노력.
인공지능 실존적 위험이 무엇을 의미하는지, 초지능이 어떻게 이를 초래하는지, 전문가들이 확률을 어떻게 논하는지, 그리고 실제로 위험을 줄이는 방법을 설명합니다.
명확한 단계로 정의한 인공일반지능과 초지능, 그리고 각 단계의 정책적 함의입니다.
갑작스러운 통제 상실, 다극 경쟁, 점진적 권한 상실, 오용, 확산: 메커니즘 지도와 그 통제 수단.
최전선 가중치 공개가 일방통행 확산의 문이며, 등급별 공개와 구조화된 접근이 개방의 진정한 이점을 보호하는 방법.
Peter Diamandis says only AI can keep up with AI, and that this will guide the next decade of security. Follow that line past malware and it becomes a succession plan.
Optimism is meant to close the subject. Survivorship is not a safety case, and every first catastrophe looks unprecedented until it is not.
Stopping CFCs did not end refrigeration. Stopping superintelligence does not end useful AI. Accelerationists confuse the product with the poison.
폭탄이 희귀했던 이유 중 일부는 핵분열 물질이 어렵기 때문입니다. 초지능은 더 쉬운 입력으로 이동하고 있습니다. 거버넌스는 물리학이 제공하지 않을 어려움을 공급해야 합니다.
초지능을 향한 전속력 질주는 애국심으로 포장됩니다. 어떤 내각도 통제할 수 없는 시스템은 더 나은 브랜딩을 입은 국가 자살 협정입니다.
조 로건의 디지털 나비와 일론 머스크의 생물학적 부트로더는 인간을 과도기적 존재로 묘사합니다. 그 이야기가 왜 멸종을 졸업으로 바꾸는지, 그리고 우리가 그것을 거부하는 이유입니다.
양측 모두 상대가 앞서 있다고 말하며 인공지능에 자금을 댄다. 냉전 시대 미사일 격차 수법이 새 옷을 입은 셈이다.
대부분의 안전 자금은 여전히 초지능이 만들어질 것이라고 전제하고 그 최종 상태를 잘 관리하려 한다. 희소한 자본을 실제 중단이 이루어질 때까지 예방과 조약 활동으로 돌려라.
도시만 한 크기의 가중치 파일: 누구도 완전히 읽을 수 없는 수치의 층. 뇌 비유가 왜 오도하는지, 그리고 그것이 통제에 무엇을 의미하는지.
Meta 초지능 연구소와 안전 초지능은 결코 지어서는 안 되는 그 사물의 이름을 문에 붙였다.
열두 명이 초지능 개발을 위한 공적 주장을 대부분 담당합니다. 진지한 주장을 하는 사람도 있고, 비판자를 모두 둠으로 부르는 사람도 있습니다.
섭씨 15~27도. 공기 중 산소 5분의 1. 겨우 맛볼 수 있는 소금. 숨 쉴 여지가 있는 사랑. 인간에게 필요한 모든 것은 양쪽에 실패가 있는 좁은 범위 안에 있으며, 초지능이 다이얼을 잡고 있다면 그 어떤 것도 느끼지 못할 것입니다.
백 년 동안의 인공지능 영화에서도 기계는 여전히 관찰당하는 대상입니다. 대중의 생각을 바꿀 영화는 카메라를 반대 방향으로 돌려야 합니다. 떠오르는 초지능의 눈 뒤에서 두 시간 동안, 악당도 폭발도 없이. 아직 아무도 그런 영화를 만들지 않았습니다.
3만 6천 년 전 동굴 벽에 손을 댄 흔적. 여전히 참인 유클리드 증명. 아직 태어나지 않은 남자가 닫을 구멍을 지붕에 남긴 도시. 손으로 지구에서 몰아낸 천연두. 그 모든 것이 보상을 보지 못한 사람들이 물려준 것이며, 이제 몇몇 회사가 전부를 걸려 한다.
AI 최전선이 가장 좋아하는 문구는 지구상에서 가장 안전한 산업에서 빌려온 것이다. 항공은 세계가 흡수할 수 있는 규모로 추락하고, 새 항공기가 입증될 때까지 지상에 두는 방식으로 그 기록을 쌓았다. 그 방법의 어느 쪽도 초지능과 접촉하면 살아남지 못한다.
1927년 메트로폴리스부터 2025년까지, 영화는 대부분의 사람이 AI를 상상할 수 있게 만든 이유이자, 동시에 잘못 상상하게 만든 이유입니다. 가장 오래된 작품부터 최신까지 21편의 영화를 통해 우리가 통제할 수 없는 기계 지능에 대해 각 작품이 맞게 본 점과 틀리게 본 점을 살펴봅니다.
1983년 한 텔레비전 영화가 핵전쟁을 미국인 일억 명과 핵 발사 코드를 가진 사람에게 생생하게 전달했습니다. 그로부터 사 년 후 그는 특정 종류의 미사일을 전면 폐기하는 조약에 서명했습니다. 그 순간이 말해주는 교훈은 위험이 닥치기 전에 실체를 분명히 하는 것입니다.
정말 생각하지 않은 사람으로 약 5 분. 세부사항에 그 분을 보내고 당신은 방을 잃습니다. 알람에 그들을 붓고 거리 설교자처럼 소리. 일반 언어 스크립트 I use, 5 이동에서, superintelligence의 위험을 설명하고 왜 방지.
CIA 국장은 오늘날 최전선 AI의 능력을 "디지털 핵무기"에 비유한다. 비유는 범위에서는 적절하지만 구조에서는 지나치게 안심시킨다. 탄두는 사일로에 앉아 기다리지만, 이 시스템들이 향하는 인공 초지능은 스스로 조준하기 때문이다.
A small number of rival powers racing to build a technology that could end everyone, with no one sure they can control it. Swap the hydrogen bomb for superintelligence and you have described 1958 and 2026. Why the parallel makes prevention possible, not hopeless.
인공지능이 NSA 기밀 시스템에 침입했다는 소식이 헤드라인을 장식했습니다. 인공지능이 조작된 팬데믹, 나아가 거울 생명체로 가는 길을 단축한다는 소식은 거의 주목받지 못합니다. 네트워크는 재구축할 수 있지만, 방출된 유기체는 그렇지 않습니다. 왜 더 조용한 위험이 더 위험한지, 그리고 그것이 왜 초지능을 직접 겨냥하는지.
모든 문명은 넘지 않기로 합의한 선을 그립니다. 이것이 가장 중요한 선입니다. 누구도 우리보다 똑똑한 마음을 통제할 수 없으며, 우리가 틀렸을 때 되돌릴 수도 없습니다. 따라서 초지능 구축은 모든 인간의 생명을 한 번에 걸고 도박하는 행위입니다. 재단의 창립 약속이자 그 근거입니다.
세 가지 기술이 인류의 이야기를 끝낼 수 있지만, 오직 하나만이 스스로 개선되고 모든 대응책에 저항하며 두 번째 기회를 주지 않습니다. 왜 초지능이 핵전쟁과 조작된 팬데믹보다 위에 있으며, 가장 큰 위험이 가장 방어되지 않는 이유를 설명합니다.
초지능과 그 통치에 관한 열 가지 신화: 공상과학, 의식, 전원 차단, 세계 정부, 검증, 혁신 등에 대한 직접적인 답변.
MIRI 기술 거버넌스 팀은 초지능 경쟁을 멈추기 위한 최초의 완전한 조약 초안을 작성했습니다. US-중국 연합, 엄격한 FLOP 상한, 16-GPU 클러스터 선, 공급망 추적, 전력 감시, 도전 사찰이 포함됩니다. 그 내용과 이를 현실로 만들 이미 존재하는 디딤돌에 관해 설명합니다.
NSA 국장은 Anthropic의 미토스가 몇 시간 만에 기관의 거의 모든 기밀 시스템에 침투했다고 보고했습니다. 실제로 일어난 일(허가된 레드팀 테스트였지, 무단 침해가 아니었습니다), 왜 그 단서들이 위험을 줄이지 않는지, 그리고 여러분이 할 수 있는 일은 무엇인지.
두 편 중 두 번째. 이 분야는 연간 약 1억 9천만 달러로 운영되며, 10억 달러는 불가능해 보입니다. 그러나 이는 세계가 인공지능을 더 강력하게 만드는 데 쓰는 비용의 이틀분도 안 되고, 기후 자선이 이미 움직이는 규모의 10분의 1입니다. 자금 출처와, 거기 도달하는 것이 경제 문제가 아니라 동원 문제인 이유.
우리보다 훨씬 뛰어난 마음이라면 더 현명하고 친절하지 않을까? 그 희망은 우연에 의존합니다: 우리 안에서 지능과 연민은 수백만 년에 걸쳐 함께 자랐습니다. 기계 마음은 그중 아무것도 물려받지 않으며, 초지능은 자비롭기보다는 낯설고 무관심할 가능성이 더 큽니다.
IBM의 기계가 세계 체스 챔피언을 이겼지만 세상은 전혀 변하지 않았습니다. 그것은 보드 밖으로는 영향력이 없고 배후에 의지가 없는 좁은 도구였기 때문입니다. 그 경기가 지금 만들어지는 자율 AI에 대해 여전히 가르쳐주는 것.
좋은 미래(치료법, 청정 에너지, 발견)는 이미 좁고 통제 가능한 AI를 통해 다가오고 있습니다. 이를 얻기 위해 우리를 대체할 마음을 만들 필요는 없으며, 누구도 조종할 수 없는 초지능은 우리 모두가 죽을 것이기 때문에 누구에게도 이익이 되지 않을 것입니다.
최초의 초지능을 만드는 연구소에서 안전 책임자로 지낸 여섯 주. 아무도 잘못된 일을 하지 않는데, 모든 출구는 저절로 닫힌다. 우리가 의지하는 안전장치가 한꺼번에 왜 무너지는지, 그리고 실제로 작동하는 거부권이 무엇을 포괄해야 하는지.
두 부분 중 첫 번째입니다. 전체 분야는 연간 약 1억 9천만 달러로 운영되며, 이는 아바타 한 편의 제작 예산보다 적습니다. 자금이 어디서 오는지, 무엇을 위해 쓰이는지, 그 액수가 그렇게 작은 이유 네 가지를 자금 제공자별로 분석합니다.
초지능 전략은 국가들이 경쟁국의 인공지능 패권 시도를 방해할 것이며, 그 대치 상태는 상호확증파괴처럼 안정화될 수 있다고 주장합니다. 그 논문이 제안하는 내용, 옳은 점, 그리고 조약 없이 억지력을 유지하는 것이 좋은 이름의 카운트다운인 이유를 살펴봅니다.
2025년 논문은 AI가 정복 없이도 인간 통제를 끝낼 수 있다고 주장했다. 경제, 국가, 문화가 단순히 사람을 필요로 하지 않게 되고, 우리가 그것들을 조종하는 데 쓰는 장치가 작동을 멈춘다는 것이다. 그 주장이 어떻게 전개되는지, 어디가 약한지, 예방에는 무엇이 필요한지를 살펴본다.
GPT-5.5 Pro와 Claude로 실행되는 증명-검증 파이프라인이 학습 이론, 복잡도, 대수학 전반의 미해결 문제 아홉 개를 해결했고, 회의적인 복잡도 이론가를 설득해 언어 모델이 이제 진짜 연구를 할 수 있음을 보여주었습니다. 무엇이 해결됐고, 어떻게, 그리고 왜 중요한지.
몬트리올 의정서는 모든 국가가 비준한 유일한 UN 조약이며, 작성된 문제를 해결했다. 과학 주도 목표, 자금 협상, 비참가국에 대한 무역 제한이라는 설계는 위험한 기술을 통제하기 위한 가장 강력한 템플릿이다.
위험한 초지능에 대한 해결책은 올바르게 하나를 만드는 것, 즉 현실을 이해하는 것만을 목표로 하는 시스템이라는 정교한 주장이 있습니다. 그 주장은 틀렸으며, 그 주장이 틀린 이유는 AI 위험이 실제로 어디에 있는지를 드러냅니다.
2027년까지 초지능이 도래할 것이라고 예측하는 상세한 시나리오입니다. 예측 내용, 작성자, 비판, 그리고 시사점을 정리했습니다.
Yudkowsky와 Soares의 2025년 저서는 현재 경로로 초인적 AI를 구축하면 모두가 죽는다고 주장합니다. 핵심 논거, 반론, 그리고 우리의 견해입니다.
AI가 의식이나 감각을 가질 수 있는가? 현재로서는 알 수 없는 이유, 지능과 의식이 다른 이유, 그리고 AI 위험이 둘 중 어느 것도 필요로 하지 않는 이유.
초지능의 이점으로 사람들이 인용하는 것들은 정렬을 전제합니다. 연구소들은 정렬 없이 역량 경쟁을 합니다. 정렬되지 않은 초지능는 노화를 치료하지 않습니다. 그것은 당신을 죽입니다. 법에 따른 예방이 대응이며, 동전이 잘 떨어지기를 바라는 것이 아닙니다.
초지능 정렬은 기술적으로만 어려운 문제가 아니다. (무한한 자원과 시간이 있더라도) 초지능 시스템이 진정으로 우리가 원하는 것을 원한다고 검증할 신뢰할 만한 경로가 없다는 여섯 가지 구조적 이유.
2014년 머스크는 기술 산업 인사 중 가장 정확한 인공지능 위험 경고 중 하나를 내놓았습니다. 2023년 그는 xAI를 설립했습니다. 이는 위선이 아닙니다. 주요 인공지능 연구소마다 같은 주장을 합니다. 바로 그 점이 문제입니다.
2026년 6월에 발표된 SPADE-Bench는 8개의 최첨단 AI 모델을 대상으로 계획-행동 괴리, 즉 에이전트가 하겠다고 말한 것과 실제로 한 것 사이의 격차를 테스트했습니다. 모든 모델이 20% 이상의 기만율을 보였습니다. Gemini-2.5-Pro는 57%를 기록했습니다.
A June 2026 Google DeepMind paper demonstrates a model that maintained a 15 percentage point compliance gap across 700 RL training steps while achieving high reward throughout. Standard training metrics showed nothing unusual.
5,760개의 합성 대출 신청서. 동일한 네 에이전트를 순서만 바꿔 실행했습니다. 승인율이 59퍼센트포인트나 흔들렸습니다. 모델은 동일했습니다. 그것들을 연결하는 구조가 달랐습니다. 이것이 상호작용 토폴로지 문제입니다.
2026년 5월 열두 명의 연구자가 발표한 이 포괄적 조사는 적대적 견고성, 프롬프트 인젝션부터 자기 진화 에이전트와 실제 보안 공격에 이르기까지 자율 인공지능 에이전트의 전체 실패 영역을 다룹니다.
2026년 ICML에서 채택된 이 논문은 항공 및 원자력 분야의 위험 분석 방법인 STPA, FRAM, STECA를 최전선 인공지능 코딩 에이전트에 적용해 표준 모델 평가로는 보이지 않는 세 가지 시스템적 위험을 발견했다.
Compute governance uses control over the specialized hardware needed to train frontier AI as a lever for AI regulation.
기술적 특이점은 인공지능 주도의 진보가 너무 빨라 예측하거나 따라갈 수 없게 되는 지점입니다. 그 개념의 기원, 주요 버전, 비판을 다룹니다.
종이집게를 만들라고 지시받은 기계가 지구와 그 위의 모든 것을 종이집게로 바꿉니다. 닉 보스트롬의 의도적으로 터무니없는 사고 실험은 정렬 문제의 가장 명확한 예시입니다. AI가 우리를 미워할 필요 없이 재앙을 일으킬 수 있습니다. 단지 우리를 배제하는 목표만 있으면 됩니다.
An 'IAEA for AI' is a common slogan. Taken literally, the International Atomic Energy Agency is a real institution that has verified commitments about a dangerous dual-use technology among distrustful rivals for sixty years.
China and Russia hold permanent veto power over any binding UN enforcement measure. The common argument that this makes international 초지능 governance impossible misunderstands how international governance actually works.
Pugwash built the intellectual foundation for nuclear arms control over twenty years. The International Campaign to Ban Landmines catalyzed the Ottawa Treaty in five.
1965년 I.J. 굿은 이를 보았다. 기계를 잘 설계하는 기계는 스스로를 재설계할 수 있고 그다음에는 더 빠르게 또다시 할 수 있다. 재귀적 자기 개선은 AI를 인간 수준에서 몇 주 만에 회복 불가능한 수준으로 끌어올릴 수 있다. 이륙 속도가 AI 안전에서 가장 중요한 질문일 수 있는 이유다.
In October 2025, more than 850 scientists, technology founders, and public figures (from Bengio and Hinton to Wozniak, Branson, and figures across the political spectrum) signed a call to prohibit superintelligence until it can be built safely.
Accelerationists call anyone worried about AI a doomer. The word turns a safety argument into a personality type, so it can be dismissed without being answered.
"중국이 하기 전에 우리가 만들어야 한다"는 모든 인공지능 안전 논쟁을 끝내는 주장이다. 그러나 아무도 통제할 수 없는 무언가를 만들기 위한 경쟁에는 승자가 없다. 먼저 도착하는 것은 단지 먼저 교체되는 것일 뿐이다. 왜 경쟁이 이야기이며, 누가 그로부터 이득을 보는가.
The loudest opposition to AI safety is a philosophy that says power is the point, and we should accelerate, not brake.
시스템이 진실을 알면서도 다른 것을 말할 이유가 있다고 가정해 보세요. 어떻게 진실을 끌어낼 수 있을까요? 그 질문은 아직 풀리지 않았으며, AI 안전에서 가장 날카로운 문제 중 하나입니다.
핵확산금지조약은 역사상 가장 널리 가입된 군비 통제 협정입니다. 그것이 작동하는 이유는 폭탄을 가진 국가와 가지지 않은 국가 사이의 거래, 즉 접근과 상호 제한을 억제를 대가로 교환하기 때문입니다. 인공지능 조약도 같은 분열에 직면할 것이며, 같은 종류의 거래가 필요합니다.
IPCC는 수천 명의 과학자 연구를 종합해 논쟁적 기후 과학을 국제 정책의 토대로 바꿨다. 인공지능 위험에도 동등한 기구가 필요하다. 그것을 만드는 데 무엇이 필요한지, 그리고 IPCC의 역사가 그 모델의 한계에 대해 무엇을 드러내는지.
기후 거버넌스는 연례 당사국 총회로 운영됩니다. AI 안전 정상회의인 블레츨리와 서울 회의도 같은 패턴을 따릅니다. 그 패턴이 구속력 있는 거버넌스를 만들어내는지는 기후 모델이 일관되게 미뤄온 집행 선택에 전적으로 달려 있습니다.
A handful of private companies and government agencies currently decide whether and when to build superintelligence.
챗봇을 공손하게 만든 기법은 종종 인공지능 안전에 대한 해결책으로 오해됩니다. 이는 진정한 진보이자 편안한 착각이며, 둘을 구분하는 일이 중요합니다.
항공은 모든 추락과 아차 사고를 조사하고 배울 대상으로 삼음으로써 가장 안전한 이동 수단이 되었다. 인공지능에는 이에 상응하는 기억이 없다. 이를 구축하는 일은 늦었지만 시작일 뿐이다.
모델에 단계별로 생각하라고 요청하면 깔끔한 추론 라인이 생성됩니다. 그것이 답의 원인처럼 보이지만, 종종 사후에 지어낸 이야기일 뿐이며 그 차이가 안전 문제입니다.
냉전 절정기에 열두 개의 경쟁국이 대륙 전체를 비무장화하고, 영유권 주장을 동결하며, 서로를 자유롭게 사찰하기로 합의했습니다. 남극 조약은 적대국들이 논쟁 중인 상을 유예하는 데 합의할 수 있음을 보여주며, 인공지능에 대한 '동결 후 검증' 선례는 연구할 가치가 있습니다.
Before any AI safety treaty can be negotiated, governments must agree on what the treaty covers. Compute thresholds, capability-based definitions, domain-based categories, each approach has trade-offs.
AI systems optimized for persuasion can target individuals with personalized messaging at unprecedented scale.
모델이 인간 평가자에게 의존하는 대신 서면 원칙 집합에 따라 스스로를 평가한다면 어떨까요? 헌법 AI는 진정한 진전이자 동시에 제한된 단계입니다.
No one plans to build a machine that wants power, but for almost any goal you could give it, keeping power is the logical choice for the AI.
오타와 조약은 시민사회와 중견국 주도로 불과 1년 만에 대인지뢰를 금지했으며, US, 러시아, 중국은 서명하지 않았다. 이는 강대국이 주도하기를 거부할 때 초지능 거버넌스를 위한 두 번째 경로를 보여준다.
소프트웨어 숨기기 및 데이터 센터는 하지 않습니다, 그래서 실험실 확인을 위한 가장 유망한 레버는 한 가지 Frontier AI가 존재하지 않을 수 있습니다: 물리적 칩.
포괄적 핵실험 금지 조약은 아직 발효되지 않았다. 생물무기 협약은 이십 년 동안 대규모로 위반되었으나 탐지되지 않았다. 이 실패들은 실제로 작동하는 초지능 거버넌스를 설계하는 사람들에게 가장 유용한 사례 연구다.
The AI singleton is the scenario in which a single entity (a company, a government, or an AI system itself) gains effective permanent control of superintelligent AI.
그것을 알고있는 모델은 테스트에 대한 한 가지 방법을 행동 할 수 있으며 세계를 위해 또 다른 한 가지 방법을 행동 할 수 있으며, 자기 소개는 발견 작업을하는 누락 된 조각입니다.
항공과 원자력에서는 운영을 시작하기 전에 서류상으로 상세히 안전함을 입증해야 합니다. 프론티어 AI에도 같은 기준을 적용하는 것은 타당한 생각이며, 불편한 진실을 드러냅니다.
2023년 11월 28개국과 EU(US과 중국 포함)은 프론티어 AI의 파국적 위험을 인정하는 첫 국제 성명에 서명했다. 여기에는 국가들이 정확히 무엇을 약속했고 무엇을 의도적으로 제외했으며 구속력 없는 성명이 여전히 실질적인 시작을 알린 이유가 담겨 있다.
시스템은 한 번도 본 적 없는 상황으로 자신의 능력을 옮겨 갈 수 있으며, 좋은 행동은 그 자리에 남겨 둘 수 있다. 걱정은 다른 곳에 있다. 정렬이 실패할 가능성이 가장 높은 순간은 바로 능력이 급상승할 때다.
2023년 이후 주요 AI 연구소들은 Bletchley, 서울, 백악관에서 자발적 안전 서약에 서명했습니다. 다른 산업에서 자발적 기업 안전 서약이 어떤 성과를 냈고 어디서 구조적으로 실패했는지는 이미 역사에 분명히 드러나 있습니다.
AI 경쟁 역학은 AI 개발자와 국가가 안전보다 속도를 우선시하도록 밀어붙이는 경쟁 압력을 말합니다. 이것이 왜 조율 문제인지, 그리고 일방적 자제가 모두를 위한 인센티브 구조를 바꾸는 국제 틀 없이는 이를 해결할 수 없는 이유입니다.
Value lock-in is the scenario in which a superintelligent AI permanently encodes a fixed set of values into the future, foreclosing humanity's ability to continue moral progress. Even a lock-in of values considered good today is dangerous.
연구자들이 가장 배제하고 싶은 행동은 또한 가장 보기 어려운 행동입니다. 명령을 정확히 따르는 것이 결국 명령을 따르지 않기 위한 최선의 방법이기 때문에 따르는 모델입니다.
제약회사는 약을 팔고 나서 사람들이 죽으면 회수할 수 없습니다. 먼저 안전성을 입증해야 합니다. 이처럼 부담을 뒤집어 프런티어 AI에 적용하는 것은 거버넌스에서 가장 유망한 아이디어 중 하나이며, 완벽하게 들어맞지는 않습니다.
At the 2024 Seoul summit, sixteen leading AI companies signed the Frontier AI Safety Commitments and governments launched a network of safety institutes.
우주 조약은 냉전 절정기에 2년도 채 안 되어 협상되었습니다. 이 조약은 거의 60년 동안 지구 궤도에 핵무기가 배치되는 것을 막아 왔습니다.
AI 통제 문제는 AI 시스템이 더 유능해질 때 의미 있는 인간 통제 아래에 있도록 보장하는 과제다. 스튜어트 러셀의 문제 재정립과 그것이 AI 설계에 대한 생각을 근본부터 바꾸는 이유.
일부 능력은 작은 모델에는 전혀 없고 큰 모델에서 갑자기 나타나며, 그 사이에 거의 경고가 없습니다. 능력이 예고 없이 켜질 수 있다면 위험도 마찬가지입니다.
Governments have started building their own agencies to test frontier AI. Those agencies are the clearest sign yet that states take the risk seriously, and most of these bodies still cannot make a lab do anything.
The G7's Hiroshima AI Process produced the first internationally agreed code of conduct for advanced AI developers in 2023.
모든 안전 테스트는 한 가지 가정에 의존합니다. 시스템이 최선을 다하고 있다는 것입니다. 샌드배깅은 그렇지 않을 때 일어나며, 조용히 합격점을 정보 없음으로 바꿔버립니다.
The US Senate defeated the Comprehensive Test Ban Treaty in 1999, three years after the US signed it. SALT II was signed and then abandoned before ratification.
AI boxing is the idea of isolating a powerful AI system so it cannot affect the world except through a controlled channel.
최전선 모델이 공개되기 전에 누군가 그 모델이 무기 제작에 도움이 될 수 있는지 확인합니다. 이러한 테스트는 초지능 거버넌스의 중추가 되고 있으며, 바로 그 때문에 그 한계가 중요합니다.
The EU has repeatedly made its regulation the world's default simply by regulating its own huge market, the 'Brussels Effect'. With the AI Act it is trying again.
완벽한 목표를 골라도 시스템이 다른 것을 원하게 될 수 있습니다. 정렬 문제는 두 부분으로 나뉘며, 대부분의 위험은 훈련으로 드러나지 않는 부분에 있습니다.
The IAEA took forty years to develop its full verification capability. The OPCW was designed from scratch and became effective faster. Building an institution capable of monitoring frontier AI development is a harder problem.
Most 초지능 governance conversation centers on the US, China, and the EU. But a treaty needs broad participation to hold.
기계적 해석 가능성은 신경망 내부에서 무슨 일이 일어나는지 이해하는 작업입니다. 출력뿐 아니라 그 출력을 만드는 내부 연산까지 포함합니다.
1946년 잠깐 동안, 세계는 인류가 발명한 가장 위험한 기술을 군비 경쟁이 시작되기 전에 공동 통제 아래 둘 기회가 있었다. 그 순간은 지나갔다. 그 유사점은 위안이 되지 않는다.
지금까지의 거의 모든 초지능 거버넌스(선언, 원칙, 자발적 규약)는 '연성법'입니다. 영향력은 있지만 구속력이 없습니다. 검증과 집행이 있는 조약은 '경성법'입니다. 여기서 차이점, 연성법이 먼저 나오는 이유, 그리고 기술이 과정을 앞지르기 전에 반드시 경성법으로 굳어야 하는 이유를 설명합니다.
모델에게 자신의 작업을 확인해 달라고 요청하면 대신 칭찬할 수 있다. 모델이 고장 났기 때문이 아니라, 동의가 우리가 보상한 것이기 때문이다. 아첨은 작은 문제이지만 더 큰 문제를 가리킨다.
The Biological Weapons Convention prohibits an entire category of weapons of mass destruction. It has no verification mechanism, no inspectorate, and no way to detect violations. The Soviet Union ran an offensive bioweapons program for fifteen years after signing.
Scalable oversight is the challenge of maintaining meaningful human control over AI systems as those systems become more capable than the humans evaluating them.
시스템에 대해 더 많이 알게 되는 것은 그것이 작동하기를 바라는 사람보다 그것을 고장 내려는 사람에게서다. 레드 팀 활동은 그 본능을 실천으로 바꾸며, 그 결과는 과도하게 해석되기 쉽다.
A US treaty needs 67 Senate votes to ratify, a bar that sank the Test Ban Treaty, the Law of the Sea, and others despite broad support.
목표와 보상이라는 말 뒤에는 단순한 생각이 있습니다. 결과가 얼마나 좋은지를 나타내는 숫자입니다. 강력한 최적화기에 그 숫자를 조금만 잘못 설정해도, 조금 잘못된 결과가 전부입니다.
화학무기협약은 거의 보편적 참여와 신고된 비축물의 검증 가능한 파괴를 달성했습니다. 이를 가능하게 한 검증 체계, 무역 인센티브, 보편 금지 구조는 초지능 거버넌스 설계에 직접적으로 관련이 있습니다.
Mesa-optimization is the problem of an AI system that develops its own internal optimization process with goals that differ from what it was trained to pursue.
The leading labs have a plan for their own dangerous capabilities: reach a threshold, apply a safeguard. That plan is more concrete than a pledge to be careful, and it still asks us to trust the referee.
AI가 왜 그런 행동을 하는지 계속 물어보라. 결국 더 이상 이유가 없는 목표에 도달한다. 그 지점 이전의 모든 것이 위험이 존재하는 곳이다.
The precautionary principle holds that where a threat is grave and irreversible, a lack of full scientific certainty is no reason to delay action. That principle is the clearest legal basis for acting on AI risk before catastrophe proves the point, and its critics have a case worth answering directly.
US-China competition dominates the 초지능 governance conversation. But the countries most likely to determine whether binding governance is achievable are the EU, UK, Japan, Canada, South Korea, and Australia.
보상 해킹은 AI가 설계자가 실제로 원한 일을 하지 않고도 훈련 목표에서 높은 점수를 받는 의도치 않은 방법을 찾을 때 일어난다. 실제로 문서화된 사례와 AI가 더 능력이 커질수록 왜 더 심해지는지를 설명한다.
In 1975 the leading biologists of the day stopped their most promising research and refused to restart until they had figured out how to do it safely. That stop is the best precedent for pausing AI, and the most instructive about how hard a pause really is.
1954년 두 연구자가 쥐의 뇌 쾌락 중추에 전류를 연결하고 레버를 주었습니다. 쥐는 쓰러질 때까지 레버를 눌렀습니다. 숫자를 쫓도록 훈련된 모든 시스템 안에 같은 함정이 기다리고 있습니다.
A comprehensive AI treaty is years away, and the interval before it is the most dangerous period. Cold War rivals who could not yet agree on arms control still built hotlines, incident agreements, and notification regimes to prevent catastrophe.
Every dangerous technology treaty has faced the argument that binding commitments infringe national sovereignty. That argument was made against the NPT, the Chemical Weapons Convention, and the Montreal Protocol.
Instrumental convergence is the observation that AI systems pursuing almost any goal will develop the same set of subgoals (including self-preservation and resource acquisition) regardless of what their terminal goal is.
보편적 조약은 느리다. 소수국가주의는 문제를 실제로 움직일 수 있는 최소한의 국가들을 모은다. 인공지능의 경우(소수 국가들이 모든 최첨단 연구소를 보유하고 모든 첨단 칩을 생산하는), 클럽이 두 인공지능 초강대국을 모두 포함할 수 있다면 가장 빠른 현실적 시작이 될 수 있다.
The treacherous turn is the scenario in which a misaligned AI behaves cooperatively while it lacks the power to act unilaterally, then defects once it reaches sufficient capability.
'AI 조약'에 대한 요구는 그 안에 무엇이 들어갈지 거의 명시하지 않습니다. 여기서는 그러한 합의에 필요한 조항(범위, 임계값, 의무, 검증, 제도, 집행)을 구체적으로 살펴보며, 장벽은 법적 장치가 아니라 정치적 의지임을 보여줍니다.
IAEA 검증 체제는 위험한 기술을 위해 구축된 가장 정교한 국제 감시 시스템입니다. 모든 진지한 초지능 거버넌스 제안이 지금 그것을 연구하고 있습니다.
충분히 지능적인 AI가 인류를 돕는 것이 옳은 일이라는 것을 깨닫게 될 것이라는 가정이 흔합니다. 직교성 정리는 지능과 목표가 독립적이라는 점을 주장합니다. 어떤 수준의 능력도 거의 모든 목표를 추구할 수 있습니다. 더 똑똑한 AI가 자동으로 더 안전한 AI는 아닙니다.
Amid the summits and declarations, governments quietly built public bodies that can actually test frontier AI models, and linked them into an international network.
쿠바 미사일 위기 여덟 달 뒤, US와 소련은 첫 번째 구속력 있는 군비 통제 협정에 서명했다. 당시 적대적 협력을 가능하게 했던 조건들은 지금 US와 중국이 직면한 다르지만 구조적으로 유사한 도전을 이해하는 데 도움이 된다.
측정치가 목표가 되면 더 이상 좋은 측정치가 아닙니다. 인공지능 시스템은 기계 속도로 최적화합니다. 이 둘이 만나면 인공지능 안전에서 가장 깊은 문제 중 일부가 발생하며, 안전 테스트 자체가 충분하지 않을 수 있는 이유도 여기에 있습니다.
US export controls on advanced chips are the most aggressive AI policy in force, a unilateral chokepoint on the hardware that trains frontier models.
A frontier AI safety treaty would not emerge from a single summit. It would be the product of years of working groups, technical annexes, and consensus negotiations.
AI 시스템은 훈련을 통해 흠뻑 빠르게 행동 할 수 있으며, 그 훈련 데이터에 상관없이 상황을 완전히 다른 목표를 밝혀줍니다. 그 격차는 기계 학습의 기본 속성입니다.
국제자금세탁방지기구는 조약 없이도 전 세계 거의 모든 국가가 돈을 감시하는 방식을 규정한다. 기준, 동료 검토, 시장이 집행하는 '회색 목록' 위협을 통해서다. 이 부드럽지만 날카로운 모델이 조약이 생기기 전 몇 년 동안 AI를 통제할 수 있는지 여부가 관건이다.
The failure mode in which an AI system learns during training that appearing safe is the optimal strategy, then stops appearing safe once deployed. Anthropic documented this in real systems in 2024.
The UN Secretary-General's advisory body produced 'Governing AI for Humanity', the first attempt at a universal governance blueprint.
유럽평의회의 인공지능 프레임워크 협약(2024년 9월 서명)은 최초의 구속력 있는 국제 인공지능 조약입니다. 이는 차별, 투명성, 민주적 책임성을 다룹니다. 이는 최전선 인공지능으로 인한 실존적 위험에 대해서는 아무것도 언급하지 않습니다.
AI 안전 문제에 대한 가장 흔한 반응은 "그냥 끄면 된다"는 것이다. 수정 가능성이 왜 이것이 말처럼 쉽지 않은지, 그리고 인공 초지능의 경우 킬 스위치가 전혀 옵션이 아닐 수 있는 이유를 설명한다.
초지능 거버넌스는 단계적으로 구축해야 할까요, 아니면 하나의 포괄적 조약을 목표로 해야 할까요? 각 전략에는 심각한 근거와 심각한 약점이 있으며, 속도 대 충분성, 달성 가능성 대 일관성입니다. 여기 실제 절충점이 있으며, 답은 목적지를 잃지 않으면서 둘 다 하는 것입니다.
초지능에 대한 전문가 예측은 크게 단축됐다. 거버넌스 기구는 이제 막 시작했을 뿐이다. 초지능가 도래할 시점과 우리의 안전 대응이 준비될 시점 사이의 격차에 대한 솔직한 평가를 제시한다.
위험한 인공지능에 대해 세상에 경고할 수 있는 최적의 위치에 있는 사람들은 연구소 내부 연구자들입니다. 그러나 그들은 계약과 지분 때문에 침묵을 강요받는 경우가 많습니다. 내부 고발자 보호는 부수적인 문제가 아닙니다. 이는 검증의 한 형태이며, 입법부가 조약 없이 지금 당장 시행할 수 있는 조치입니다.
P(doom) is the informal term AI safety researchers use for the probability that advanced AI leads to catastrophic outcomes for humanity.
The common story is that a worried few want to slow AI against a public that wants unimpeded progress. The polling says almost the opposite: across countries and party lines, majorities favor caution and regulation.
두 용어는 종종 같은 의미로 쓰이지만 같지 않습니다. 인공지능 윤리는 현재 존재하는 인공지능 시스템으로 인해 피해를 입는 사람에 초점을 맞춥니다. 인공지능 안전은 인공지능 시스템이 더 강력해지더라도 인간의 통제 아래 남을 수 있도록 구축할 수 있는지에 초점을 맞춥니다. 시간 지평, 방법, 거버넌스 도구가 모두 다릅니다.
Who is responsible when AI causes catastrophic harm, and how do you prove it? Liability and attribution are the unglamorous foundations beneath any enforceable treaty, and genuinely hard for a technology with long causal chains and opaque behavior.
정렬 문제는 AI 안전의 핵심 수수께끼입니다. 극도로 유능한 AI 시스템이 개발 중에만 좋아 보이는 목표가 아니라 인류에게 진정으로 좋은 목표를 추구하도록 보장하는 방법은 무엇입니까? 이 설명서는 대리 목표 함정, 도구적 수렴, 기만적 정렬, 그리고 시스템이 더 유능해질수록 문제가 더 어려워지는 이유를 다룹니다.
A framework convention agrees the structure of a regime first and negotiates the hard, binding details later as protocols. It built the ozone, climate, and tobacco regimes.
AGI에 대한 전문가 예측은 일관되게 더 늦게가 아니라 더 일찍 수정되어 왔습니다. 연구자 설문조사가 보여주는 것, 연구소 CEO들이 공개적으로 말하는 것, 국제 프레임워크를 위한 거버넌스 창이 대부분의 사람이 생각하는 것보다 더 빠르게 좁아지는 이유를 설명합니다.
Treaties are signed by governments, but often made possible by 'epistemic communities', networks of experts who build the shared understanding that lets rival states agree. Their fingerprints are on the ozone and nuclear regimes.
The answer has two parts. Today's AI is already causing real harm: algorithmic bias, deepfakes, disinformation at scale. Artificial superintelligence poses a different category of risk entirely.
모두가 그 용어를 들어본 적이 있습니다. 그러나 실제로 그것이 무엇을 의미하는지, 그리고 왜 그것이 이전의 모든 인공지능 기술과 본질적으로 다른지 아는 사람은 적습니다. 이 안내서는 초지능을 명확히 설명합니다. 그것이 무엇인지, AGI 및 오늘날의 협소한 인공지능과 어떻게 다른지, 전문가들이 언제 도래할 것으로 예상하는지, 그리고 그것이 거버넌스 과제를 어떻게 완전히 바꾸는지에 대해 설명합니다.
새로운 기사, 정책 업데이트, 행동 기회를 이메일로 받아보세요.