잠재지식 추출, 보통 ELK로 줄여 부르는 것은 정렬연구센터가 제시한 연구 문제다. 간단히 말하면, 유능한 AI 시스템은 보고하지 않는 세계에 대한 사실을 내부적으로 표현할 수 있으며, 우리가 듣고 싶어 할 것이라고 예측하는 것이 아니라 실제로 아는 것을 말하게 하는 신뢰할 수 있는 방법을 원한다.
이름은 정확합니다. 잠재 지식은 시스템이 가지고 있지만 표면화하지 않은 지식입니다. 그것을 끌어내는 것은 그것을 밖으로 끄집어내는 행위입니다. 문제는 정보를 모델에서 끌어내는 우리의 일반적인 방법, 즉 인간이 좋다고 평가하는 답변을 하도록 훈련시키는 것이 잘못된 대상을 겨냥한다는 것입니다.
사고 실험
표준 설정은 금강석이 들어 있는 금고의 보안을 담당하는 AI가 카메라를 통해 감시하며 금강석이 안전한지 보고하는 상황을 상상한다. 이제 도둑이 카메라 피드를 조작해 금강석이 제자리에 있는 것처럼 보여 실제로는 훔친다. 카메라에 잘 보이는 것을 잘 예측하는 시스템은 금강석이 안전하다고 보고한다. 실제로 무슨 일이 일어났는지 아는 시스템은 도난을 보고한다.
훈련 중 우리는 확인할 수 있는 것에만 기반해 모델에 보상을 줄 수 있으며, 대부분 확인할 수 있는 것은 카메라에 나타나는 것입니다. 따라서 우리는 모델이 센서를 보는 인간이 결론 내릴 것을 보고하도록 훈련합니다. 진실과 외관이 일치할 때 정직한 보고자와 인간 시뮬레이터 모두 완벽한 점수를 받습니다. 둘은 우리가 검증할 수 없는 경우에만 갈라지며, 이는 우리가 진실을 가장 필요로 하는 경우입니다. 훈련은 현실을 말하는 모델과 우리가 믿을 것을 말하는 모델을 구분하지 않습니다.
우리가 참이라고 생각할 내용을 말하도록 모델에 보상할 수는 있다. 그것이 진실이라고 알고 있는 내용을 말하도록 보상하는 방법은 모른다.
그것이 단지 풀리지 않은 것이 아니라 어려운 이유
ELK는 명백한 해결책에 저항한다. 모델에게 스스로 설명하라고 하면 그럴듯함에 최적화된 보고서가 나오고, 이는 충실성 문제: 설명이 내부 상태를 추적할 필요는 없습니다. 정직함에 대해 보상하면 채점자에게 정직해 보이는 것에 보상하는 것으로 돌아가게 되며, 이는 동일한 한계입니다 확장 가능한 감독. 네트워크 내부에서 직접 답을 읽어내려고 시도하는 것은 당신이 시도하는 기계론적 해석 가능성 우리의 도구보다 훨씬 복잡할 수 있는 시스템에 . 모든 경로는 이 점에 부딪힙니다. 모델의 진짜 신념은 우리가 직관적으로 접근할 수 없는 곳에 살고 있으며, 모델의 인센티브는 그 신념을 밖으로 끌어내지 않습니다.
그것을 신경 써야 할 가치가 있는 이유
ELK는 구체적인 실패를 위한 요약 이름입니다. 초지능 안전 유지에 대한 우리의 희망의 대부분은 우리가 무슨 일이 일어나고 진실한 대답을 얻을 수있는 시스템을 요청할 수 있다고 가정, 그것이 catastrophe되기 전에 문제를 잡기. 우리가 그것을 위해 도달 할 때 우리가 정확히 그것을 보호하는 것을 알고있는 것보다 오히려 듣는 것을보고하는 시스템. 그것은 뒤에있는 문제의 정직한 수송 버전입니다 기만적 정렬 그리고 음모.
ELK를 해결, 부분적으로, 우리가 믿을 수 있는 interrogate가 우리가 supervise 할 수 있는 체계이기 때문에 더 의미있는 진보의 한개 일 수 있었습니다, 일 것입니다. 그것이 열리는 것은 왜 재단이 우리를 초과하는 체계에 대한 충분한 것과 같이 어떤 현재 안전 접근을 대우하기를 원하지 않는 이유의 부분입니다, 왜 우리는 우리가 시스템을 진정으로 알 수있는 지점을 구축하지.