인공지능 안전 연구소는 국가 안보와 공공 안전에 대한 위험을 평가하고 최전선 인공지능에 대한 국가의 전문성을 구축하기 위해 설립된 정부 기구입니다. 첫 번째 물결은 2023년 국제 인공지능 정상회담을 중심으로 모였습니다. 연구소들은 이제 서울과 후속 회의에서 추진한 국제 네트워크를 통해 방법과 결과를 공유합니다.
여러 주요 수도가 이제 연구소나 이에 준하는 기관을 운영합니다. 그중 대부분은 여전히 위험한 모델을 보류하도록 명령할 수 없습니다.
이름에 대한 참고: 두 설립 기관은 개명되었다. UK 기구는 2025년 2월 인공지능보안연구소가 되었다. US 연구소는 현재 미국표준기술연구소 산하 인공지능표준혁신센터(CAISI)다. "인공지능 안전 연구소"는 여전히 표준 일반 용어이며, 이 안내서는 전체적으로 그 용어를 사용한다.
수년 동안 최전선 모델을 깊이 이해한 유일한 조직은 그것을 만드는 회사들이었다. 연구소는 정부 안에 독립적인 기술 역량을 두려는 시도로, 공공 당국이 개발자의 브리핑을 최종 결론으로 받아들이는 대신 시스템을 평가할 수 있게 한다.
그들이 실제로 하는 일
그들의 작업은 몇 가지 영역으로 군집화된다.
- 최첨단 모델을 때로는 공개 전에 사이버, 생물학, 자율성 같은 분야에서 위험한 능력을 테스트하며, 그 방법은 능력 평가.
- 위험을 잘 측정하는 것은 아직 해결되지 않은 연구 문제이지 확립된 절차가 아니므로 평가 과학 자체를 발전시킵니다.
- 정부에 조언하여 정책이 실제로 시스템을 검토한 사람들의 의견을 반영하도록 합니다.
- 국제적으로 조율하여 한 국가에서 테스트된 모델을 다른 곳에서 처음부터 다시 만들 필요가 없게 하고, 기준이 수렴하기 시작하게 합니다.
이는 실질적인 제도적 진전이다. 최전선 AI를 이해할 국가 역량을 구축하는 것은 이를 통치하기 위한 전제 조건이다. 평가할 수 없는 것은 규제할 수 없으며, 최근까지 정부는 대체로 그럴 수 없었다.
그들이 대부분 부족한 힘
대부분의 AI 안전 연구소는 시험, 조언 및 출판 할 수 있습니다. 몇몇은 compel, 모형에 접근은 수시로 실험실 협력에 달려 있고, 묶기 보다는 보통 알립니다. 대부분의 경우 학회는 위험한 모델로 주문할 수 없습니다. 이 몸은 위험을 볼 수 있으며 응답을 권합니다. 그들은 거의 하나를 필요로한다.
평가와 권한 사이의 그 격차가 구조적 한계입니다. 심각한 위험을 발견하고 조언만 할 수 있는 연구소는 상업적·경쟁적 압력에 맞서 행동하려는 정부의 의지에 따라 효과가 결정됩니다. 현재 구조의 대부분은 경고 시스템입니다. 경고 시스템은 권력을 가진 누군가가 경보에 응답할 때까지 안전장치가 아닙니다.
정부가 늦게 나쁜 소식을 배우고 여전히 행동하는 방법. 정지를 강제 할 수없는 테스트는 거버넌스를 준비하고, 거버넌스 자체가 아닙니다.
그들이 될 수 있는 것
AI Safety Institutes의 지속 가치는 나중에 바인딩 요법을 조립하는 것입니다 : 독립적 인 기술 용량, 공유 표준 및 정부 간의 국제 채널. 그들이 초기 형태를 의미 신체의 종류는 재단 argues for. 그 IPCC 모형 공유된 과학적 평가가 국제 정책을 뒷받침할 수 있음을 보여줍니다.
변경 사항이 있습니다. 평가는 시행에 연결해야 하며, 국내 법규를 통해 학회의 등록 조건을 설정하거나, 검증된 결과를 제공하는 국제 프레임워크를 통해 확인할 수 있습니다. 이러한 학회의 힘은 그들의 전문성을 일치, 그리고 심각한 지배의 비계의 많은 이미 내장. 법의 밑에 superintelligence를 멈추십시오, 공공 평가 능력과 인프라로, 금지 및 검증에 대 한 대용.