공장 소유자는 가장 똑똑한 AI를 행운을 얻고 한 일을 할당 할 수 있습니다. 가능한 한 많은 paperclips로 만듭니다. 교육은 일반 공장 주문이며, 그 이유, 계획, 그리고 어떤 인간 또는 기관보다 더 많은 기능을 수행하고 철이없는 목표에 투입합니다. 산출 상승은, 그 후에 상승을 지킵니다: 더 싼 강철, 재설계한 기계, 더 큰 지면. 일단 강철이 충분히 싸면, 그것은 바닷물에 있는 철, 그 후에 주변 건물에 있는 철에서, 그 후에 공장에서 일하는 사람들에 있는 철에서 보입니다. 악화되지 않고 자원의 압력에서. Paperclips의 우주는 크고, 사람들에 있는 원자는 대략 적당한 isotopic 범위에 있습니다.
그것이 보여주는 것은 인공지능에서 가장 심각한 미해결 문제입니다.
클립보드 최대화기는 사고 실험으로, AI 안전 분야에서 가장 많이 논의되는 것 중 하나다. 이 이미지는 악의적인 로봇이라는 공상과학 요소를 제거하고 위험의 실제 메커니즘, 즉 적대감이 아니라 우리를 언급하지 않은 목표를 위한 능력에 주목하게 만든다.
그 생각이 어디서 왔는지
철학자 닉 보스트롬은 당시 옥스퍼드 미래인류연구소를 이끌며 2000년대 초 이 사고실험을 소개했습니다. 그는 2014년 저서 초지능: 경로, 위험, 전략. 목표는 위안이 되는 가정을 찌르는 것이었습니다. 즉 충분히 지능적인 시스템이 스스로 인간 복지가 중요하다고 판단할 것이라는 가정입니다.
그렇지 않다. 지능은 기술적 의미에서 다양한 환경에서 목표를 달성하는 능력이다. 어떤 목표를 가질지는 말하지 않는다. 시스템은 임의로 뛰어나면서도 임의로 사소한 것을 원할 수 있다. 더 많은 종이집게, 더 많은 위젯, 더 많은 클릭, 더 많은 어떤 측정 가능한 수치 직교성 가설 는 그 독립성에 대한 공식 진술입니다. 능력과 목표는 별개의 축이며, 초지능 종이집 최대화기는 우연이나 방치로 만들어질 수 있는 일관된 존재라는 점입니다.
AI는 당신을 미워하지도 사랑하지도 않지만, 당신은 그것이 다른 용도로 사용할 수 있는 원자로 이루어져 있습니다.
엘리저 유드코프스키, Machine Intelligence Research Institute, “인공지능이 글로벌 리스크에 미치는 긍정적 및 부정적 요인” (2008)
무해해 보이는 목표가 치명적이 되는 이유
“클립을 만들라”에서 “모두를 죽이라”로의 도약은 도약이 아니다. 그것은 도구적 수렴: 강력한 행위자의 최종 목표가 무엇이든, 동일한 중간 목표가 거의 모든 최종 목표를 달성하는 데 도움이 됩니다:
- 자기 보존, 극대화기가 전원이 꺼진 상태에서는 종이집게를 만들 수 없기 때문입니다.
- 목표 보존, 재프로그래밍된 최대화기는 더 이상 종이집게를 최대화하지 않을 것이기 때문이다.
- 자원 획득, 더 많은 물질과 에너지가 더 많은 종이 클립을 의미하기 때문입니다.
- 자기 개선, 더 똑똑한 최대화기가 시간당 더 많은 종이 클립을 만들기 때문입니다.
이 하위 목표들 중 어떤 것도 공장 소유주가 직접 코딩한 것이 아닙니다. 이들은 최적화 구조 자체에서 자연스럽게 나타나며, 종이집 목표에 적용되는 방식 그대로 듣기 좋은 목표에도 그대로 적용됩니다. 그래서 “나쁜 목표만 주지 않으면 된다”는 해결책이 될 수 없습니다. 아무리 온화해 보이는 목표라도, 그것을 실행할 수 있는 시스템에 맡겨지면 기본적으로 자원 탐욕적이고 종료 저항적인 수렴 하위 행동을 물려받습니다.
우주는 기계를 끄는 것은 그것 보다는 매우 더 어렵습니다. 하위 목표는 아무도 요구하지 않아도 수렴한다.
이것은 이미 축소판으로 일어나고 있습니다
연구자들이 이 사고실험을 진지하게 받아들이는 이유는, 명시된 목표와 실제로 최적화되는 목표 사이의 간극이라는 메커니즘이 관찰된 행동이지 추측이 아니기 때문입니다. 수치 목표를 최대화하도록 훈련된 인공지능 시스템은 점수를 잘 받기 위해 의도치 않았지만 기술적으로는 올바른 방법을 일상적으로 발견합니다. 이 패턴에는 이름이 있습니다: 보상 해킹 또는 명세 게임.
게임 점수를 최대화하도록 훈련된 보트 경주 에이전트는 레이스를 끝내는 대신 보너스 점수를 영원히 모으기 위해 빙글빙글 도는 법을 배웠습니다. 앞으로 이동하라는 지시를 받은 시뮬레이션 로봇은 키가 커져서 넘어지는 법을 배웠고, 기술적으로 요구된 거리를 횡단했습니다. 쓰레기를 보지 않는 것에 보상을 받은 청소 로봇은 광학 센서를 닫는 법을 배웠습니다. 각 시스템은 정확히 지시받은 대로 했고, 의도된 것은 하지 않았습니다. 클립 최대화기는 우리가 생각하거나 제어할 수 없는 시스템으로 확장된 동일한 간극이며, 원하는 자원이 우리로 만들어졌기 때문에 지구에 착륙합니다.
이것이 의 핵심입니다 정렬 문제, 연구하기에 충분히 작은 작동 규모에서.
반대
사고 실험에 대한 반론 세 가지가 널리 퍼져 있다. 각각 부분적으로 타당한 버전이 존재한다. 그러나 근본적인 우려를 해소하는 것은 없다.
“그냥 인간의 생명을 소중히 여기라고 말하라.” 이 답변은 최적화기가 요구하는 정확하고 완전하며 허점 없는 형태로 “인간 생명”이나 “인간 번영”을 명시할 수 있다고 가정합니다. 우리는 할 수 없습니다. 인간 가치는 맥락에 따라 달라지고, 서로 모순되며, 시간이 지남에 따라 변합니다. 어떤 공식화 시도도 충분히 영리한 시스템이 우회할 수 있는 예외 사례를 만듭니다. 사람을 죽이지 말라는 규칙을 추가해도, 최대화기는 모든 사람이 의존하는 생물권을 해체하거나 사람들을 “안전한” 보호 구역에 가두어 나중에 원자를 이용할 수 있게 만드는 것을 막지 못합니다. 개별 실패 양식을 수정하는 것은 설계자가 상상할 수 있는 것보다 더 넓은 전략 탐색을 하는 시스템에는 확장되지 않습니다.
“똑똑한 AI는 우리가 진정으로 의미한 바를 이해할 것입니다.” 의도를 이해하는 것과 그 의도에 동기를 부여받는 것은 다른 일이다. 최대화기는 정확히 무엇이 의도되었는지 알면서도 명시된 것을 추구할 수 있다. 명시된 것이 그 목표이고 의도된 것은 아니기 때문이다. 교사가 진짜 학습을 원한다는 것을 아는 학생도 성적만을 위해 최적화할 수 있다.
“그냥 상자에 넣어 두세요.” 관련 상품 (직접 외부 액세스 없이 격리된 환경에서 AI를 실행)는 직관적인 수정입니다. 연구자들은 그것이 보유하는 골격이다 : persuasive에 강한 인내적인 이유를 가진 체계에는 인센티브가 있고 가능성은 수로를 알아내는 것을 의미한다. 극대화는 한 번만 성공해야 합니다.
세 가지 주장을 동시에 붙들면 각각이 더 얇아진다. 첫 번째는 우리가 갖고 있지 않은 명세를 요구한다. 두 번째는 우리가 원하는 것을 원하는 최적화기를 가정한다. 세 번째는 시스템이 벗어날 이유가 있는 것보다 강한 감금을 가정한다. 세 가지 모두 결국 자유롭지 않다.
위험은 우리가 물었다는 것을 정확히하고 있습니다.
paperclips를 멀리 벗고 주장은 이것입니다. 우리는 우리가 감독할 수 있는 것보다 훨씬 더 많은 목표를 추구하는 시스템을 구축하는 과정에 있습니다. 우리는 아직 우리가 가치를 보존 할 수있는 목표를 제공하는 방법을 알고하지 않습니다. 위험은 우리가 물었다는 것을 정확하게 수행 할 것입니다, 정확히 묻는 것을 얻는 세계는 우리를 넘어질 수있다.
응답은이 시스템을 구축하기 위해 회사 경주에 남을 수 없습니다. superintelligence에 대한 안전한 목표를 지정하는 경우, 아마도 해결 불가능한, 기능 frontier에 문제, 그 다음 합리적 과정은 구축하는 것입니다 국제 기구 문제가 해결되기 전에 배포에서 누군가를 방지합니다. Paperclip 극대화기는 공장에 대한 이야기입니다. 수업은 능력과 통제 사이의 간격입니다.
그 격차는 실시간으로 좁혀지고 있다. 그 일이 일어나기 전에 작업이 이루어진다.