한국과 영국은 2023년 11월 블레츨리 파크에서 시작된 시리즈의 두 번째 회의인 AI 서울 정상회의를 공동 주최했다. 의제는 명확히 나뉘었다. 기업 트랙에서는 주요 개발사들이 공개 안전 공약을 발표했고, 정부 트랙에서는 평가 과학에 대한 협력을 심화하기로 합의했다. 각 트랙이 무엇을 이루었고 무엇을 열어 두었는지는 2024년 초지능 거버넌스가 어디에 있었는지 가장 분명하게 보여준다.
공약 및 정부의 궤도는 법의 힘없이 공공 문서이었다.
최전선 인공지능 안전 서약
헤드라인 문서는 Frontier AI Safety Commitments로 미국, 중국, 영국, UAE의 개발사를 포함한 16개 주요 AI 기업이 서명했습니다. 기업들은 프론티어 모델의 위험을 평가하는 방법을 설명하는 안전 프레임워크를 발표하고, 참을 수 없는 것으로 간주하는 위험 임계점을 정의하며, 결정적으로 그러한 임계점을 그 선 아래로 유지할 수 없는 경우 모델을 개발하거나 배포하지 않겠다고 약속했습니다.
의미 있는 변화는 공적 원칙이었다. 선도 개발자들은 기록으로 일부 능력은 배치하기에 너무 위험하며, 적색선을 정하고 그에 따라 행동하겠다고 말했다. 업계는 모호한 보장에서 명시된 한계로 이동했다. 그 한계는 여전히 스스로 정한 것이었다.
자발적 약속만으로는 충분하지 않은 이유
- 기업들이 스스로 문턱을 설정합니다. 각 개발자가 용납할 수 없는 위험과 이를 측정하는 방법을 정의합니다. 공통 기준도 없고 정의를 검증하는 외부 기관도 없습니다.
- 독립적인 검증이 없습니다. 내부 안전 체계가 실제로 준수되는지, 평가가 정직하게 이루어지는지 확인할 방법이 없습니다. 준수는 개발자의 말에 전적으로 의존합니다.
- 집행 없음. 서약을 끊는 것은 가장 평판이 좋은 비용이며, 서약은 법이 아닙니다.
- 그것들은 수정되거나 폐기될 수 있다. 경쟁 압력 아래서 자발적 약속은 경쟁 상대가 앞서 나갈 때 조용히 무너질 수 있다. 자율 규제는 그렇게 취약하다.
약속자는 정의 할 수, 측정, 그리고 혼자 휴식은 지배를 위한 placeholder입니다. 무언가를 더 열심히 대체하는 경우에만 Placeholders.
안전 연구소 네트워크
정부 트랙은 더 튼튼한 잠재력을 가진 무언가를 일으켰습니다: AI 안전 학회의 국제적인 네트워크를 향해 순간. 영국과 미국의 새로 만들어진 몸에 건물, 국가는 프론트어 모델, 공유 방법, 정렬 테스트, 및 기술 용량을 구축하는 evaluating의 과학에 협력하기로 합의, 어떤 미래 검증 요법이 필요. 모델이 위험하다는 것을 실제로 평가할 수있는 공공 기관은 연결 조직이 결국 치료해야합니다.
모인 정부들이 지지한 서울 선언은 인간 중심적이고 안전하며 신뢰할 수 있는 AI와 지속적인 국제 협력을 재확인했습니다. 블레츨리 선언처럼 이는 의무가 아닌 방향성 선언이었습니다.
패턴과 격차
서울은 위험한 기술 거버넌스에서 알려진 패턴에 들어맞습니다. 인지, 그다음 자발적 약속, 그리고 과정이 성공하면 구속력 있는 규칙입니다. 기업 서약과 연구소 네트워크는 두 번째 단계입니다. 미완의 작업은 세 번째 단계입니다. 공통 기준, 독립 검증, 법적 의무입니다.
안전 연구소는 가장 유망한 가교다. 그들이 쌓는 역량이 바로 구속력 있는 체제가 사용할 역량이기 때문이다. 위험은 정상회의 과정이 자발적 단계에서 멈추고, 세계가 조약보다 쉬운 약속에 안주하는 동시에 역량은 계속 발전하는 것이다. 서울은 약속과 거버넌스 사이의 간극을 드러냈다. 그 간극을 메우는 것이 남은 과제다. 재단의 입장은 이를 메우는 것이 기업 약속에서 예방적 국제법 자가 정의한 금지선이 경쟁 압력 아래 녹아내리기 전에. 관련 읽을거리: 자발적 인공지능 안전 서약이 유일한 전략으로 실패하는 이유.