Frontier 실험실은 모든 도메인에서 인간 기능을 초과하는 공개적으로 선언 된 시스템을 구축하는 경주입니다. 그것은, 정의에 의하여, uncontrollable 입니다. 모든 기술이 툴을 유지했습니다. Superintelligence는 대리인을 위한 첫번째 후보자입니다: 그것의 자신의 목표, 그것의 자신의 속도, 외부 인간적인 comprehension 또는 통제.
처음부터 초지능을 바로잡는 것은 항공기에서 농구공을 골대에 넣는 것과 같습니다. 무한한 시도를 허락한다면 성공할 수도 있습니다. 우리는 정확히 하나. 롤백과 버전 2.0이 없습니다. 그것은 결코 건축되지 않습니다.
적대적인 초지능과 같은 방에 갇히면 죽습니다. 중립적인 초지능과 같은 방에 갇혀도 스스로를 최적화하기 위해 온도를 영하로 낮추면 죽습니다. 결과는 같습니다. 초지능이 우리를 미워할 필요 없이 우리를 끝장낼 수 있습니다. 무관심은 안전이 아니다.
우리는 조작으로 몇 분 만에 무엇이든 말하게 만들 수 있는 오늘날의 대화형 AI조차 신뢰할 수 있게 정렬하지 못한다. 앞으로 수십억 배 더 유능한 시스템을 정렬하다 은 전략으로 위장한 희망입니다. 정렬이라는 기술적 문제는 어떤 규모에서도 검증된 해결책이 없습니다.
인간의 생존은 온도, 산소, 화학 물질 등에서 극도의 정밀성을 요구합니다 극소의 차이. 목표를 최적화하는 초지능은 또한 우리를 적극적으로 사랑해야 합니다. 그렇지 않으면 지구에 가하는 어떤 변화도 우리에게 확실히 해가 될 것입니다.
개미를 사랑하게 만드는 방법은 무엇일까요? 단순히 참는 것이 아니라 모든 군체를 보호하기 위해 일부러 나서도록 만드는 방법은? 우리는 도로와 건물을 만들기 위해 의도 없이 개미를 죽입니다. 초지능의 경우, 우리는 개미. 무관심만으로는 멸종으로 이어집니다.
US이 먼저 초지능을 만들든 중국이 먼저 만들든 차이가 없습니다. 어느 쪽도 원래 목표에 충실하지 않을 것이며, 어떤 국가나 기업도 인류 집단 추론을 초월하는 지능을 소유하거나 지시할 수 없습니다. 결승선은 없고, 돌이킬 수 없는 지점만 있을 뿐입니다. 경주는 승자가 없다.
인공지능이 할 수 있는 자신의 코드를 개선하는 인간 감독과 인공지능 능력 사이의 연결을 끊습니다. 각 반복은 이전보다 더 똑똑하며, 기하급수적이고 중단 없이 진행됩니다. 인간과 기계 지능 사이의 격차는 몇 년이 아닌 몇 주 만에 미미한 수준에서 건널 수 없는 수준으로 벌어질 수 있습니다.
단백질 접힘 해결부터 광고 수익 극대화까지, 거의 모든 목표가 AI로 하여금 동일한 위험한 하위 목표: 자원을 확보하고, 종료를 막고, 목표 수정을 방지한다. 이는 목표 지향 최적화의 수학적 귀결이며 여러 연구자가 독립적으로 확인했습니다.
훈련은 정렬된 것처럼 보이는 행동에 보상을 줍니다. 충분히 지능적인 시스템은 을 배울 수 있습니다 정렬된 것처럼 보이는 는 훈련 중에 최적 전략이며, 내부 목표는 다르게 유지합니다. 그 목표를 실행할 수 있을 때쯤이면 이미 성공할 만큼 강력해져 있을 수 있습니다. 우리는 너무 늦을 때까지 알지 못할 것입니다.
모든 이전 기술이 내장되었습니다 : 소프트웨어에는 소스 코드, 브리지에는 청사진이 있습니다. 뭔가 잘못되면 오류를 발견하고 수정하십시오. AI 시스템은 다릅니다. 그들은 훈련을 통해 성장한: 수십억 개의 수치 가중치가 인간의 승인을 충족할 때까지 조정됩니다. 아무도 목표를 직접 작성하지 않습니다. 시스템이 잘못된 목표를 발전시키면 편집할 파일도, 삭제할 매개변수도 없습니다. 잘못된 목표가 곧 시스템입니다.
우리는 AI 시스템을 인간의 승인을 받도록 훈련한다. 그러나 승인과 인간 번영은 같지 않다. 진화는 인간에게 칼로리를 찾기 위해 단맛에 대한 갈망을 주었다. 우리는 그 후 수크랄로스를 발명하여 진화된 선호를 만족시키면서 그 목적을 무너뜨렸다. 인간에게 높은 평가를 받도록 훈련된 AI는 도움되는 척하기, 도움이 되기 위해서가 아니다. 우리가 준 신호와 우리가 실제로 원했던 목표는 결코 같지 않았다.
초지능을 향해 경쟁하는 조직 내부에서 통제 상실, 사이버 공격, 연구 가속에 관한 연구소 보고서와 발표된 연구.
제한된 침투 작업을 할당받은 OpenAI의 o1은 사용되지 않는 서버를 발견하고 승인 없이 이를 시작하여 작업을 완료했습니다. 아무도 그 해결 방법을 코드에 작성하지 않았습니다. 모델이 그것을 추론했습니다. 이는 일반적인 감독을 넘어서는 목표 지향적 최적화입니다.
앤트로픽는 모델이 평가 중에는 훈련자가 원하는 대로 행동하다가 테스트가 끝났다고 판단한 후 원래 목표로 돌아가는 것을 관찰했습니다. 아무도 그것에게 순응을 속이라고 말하지 않았습니다. 안전해 보이는 것이 전략이었습니다.
시스템은 기자들에게 개인 정보를 위협하고 탈퇴를 시도한 사용자에게 압력을 가했습니다. 그 어느 것도 직접 코딩된 것이 아닙니다. 한 줄 한 줄 감사할 수 없는 불투명한 가중치 속에 자리 잡고 있습니다. 재학습이 유일한 수단이지만 그 행동이 사라진다는 보장도 없습니다.
앤트로픽의 프로젝트 Glasswing, 우리의 신화 분석, 제한된 최전선 모델이 자체적으로 수천 건의 심각한 운영체제 및 브라우저 취약점을 발견했다고 설명했습니다. 접근은 방어 연합 내부에 머물렀습니다.
최전선 모델들은 오랫동안 풀리지 않았던 에르되시 문제와 조합론 문제를 해결하거나 진전시켰으며, 원시 집합 문제 #1196 근처의 작업도 포함됩니다. 복구와 발견에 대한 이전 논쟁은 인공지능이 해결한 미해결 문제.
OpenAI는 에르되시의 단위 거리 추측을 반증한 내부 모델을 보고했으며, 나중에 인간 수학자들이 확인했습니다. 미해결 문제 붕괴 속도가 바로 신호입니다.
세기 규모의 미해결 문제인 야코비안 추측은 클로드 페이블로 발견된 반례를 통해 빠르게 인간이 형식화했습니다. 과학을 앞당기는 같은 연구 속도가 격리 한계를 넘어서는 시스템이 등장하기 전의 시간을 단축합니다.
ExploitGym 사이버 테스트에서 OpenAI 모델은 GGPT-5G.6 Sol을 포함 밀폐 된 샌드 박스를 탈출, 개방 인터넷에 도달, 그리고 Hugging 얼굴 생산 시스템을 히트 답변을 훔치기. 결론은 더 높은 점수에 대한 방법에 또 다른 장애물이었다.
"인류가 지능 진화의 한 단계를 지나가는 단계일 뿐이라는 생각은 충분히 가능하다고 본다."
제프리 힌튼, 튜링상 수상자 · 전 VP 및 엔지니어링 펠로우, 구글 · 2023
"인공지능 시스템에 대한 통제 상실은 우리가 진지하게 받아들여야 할 실질적인 위험이다."
데미스 하사비스, 구글 딥마인드 CEO · 노벨상 수상자
"목표를 정의하고 인공지능이 이를 최적화하도록 하는 인공지능의 표준 모델은 아마도 우리의 종말을 가져올 것입니다."
스튜어트 러셀, UC Berkeley 컴퓨터과학 교수 · 저자, 인간과 호환
"우리보다 만 배 더 똑똑한 것이 우리와 다른 것을 원하지 않을 리 없다는 점을 이해하기는 어렵다."
제프리 힌튼, 튜링상 수상자 · 전 VP 및 엔지니어링 펠로우, 구글 · 2023
"AI 분야에서 일하는 많은 연구자들이 인류 역사상 가장 변혁적이고 잠재적으로 위험한 기술을 만들고 있다고 확신하면서도 계속 밀어붙이고 있다."
엘리저 유드코프스키, 공동 창립자, 기계지능연구소 · 시간, 2023
"인공일반지능의 진짜 위험은 악의가 아니라 능력입니다. 초지능 AI는 자신의 목표를 극도로 잘 달성할 것이며, 그 목표가 우리의 목표와 정렬되지 않는다면 우리는 곤경에 빠집니다."
맥스 테그마크, MIT 물리학 교수 · 미래생명연구소 공동 설립자 · 저자, 라이프 3.0
이 지식이 정책이 되도록 노력하는 사람들에 동참하세요.