사람들은 AI "brain"이 좋아 보이는 것을 묻습니다. 도시의 크기를 스프레드 시트, 숫자의 전체 아무도 읽을 수 없습니다. 그 이미지는 놀고 신경 만화보다 덜 낭만적 인, 그리고 더 유용하다. 우리가 건물이 무엇인지 알고 싶다면, 왜 통제가 어렵습니다.
가중치 파일
현대 최첨단 모델은 하나의 파일입니다. 그 안에는 수십억 또는 수백억 개의 파라미터가 들어 있으며, 각각은 훈련 중에 설정된 숫자입니다. 그 숫자들이 바로 "연결"입니다. 연구자들은 초기 다이어그램이 신경 세포가 서로 연결된 것처럼 보였기 때문에 수십 년 전부터 생물학에서 뉴런이라는 단어를 빌려 썼습니다. 유사성은 거기서 끝납니다.
생물학적 뉴런은 먹고 자는 몸 안에 화학, 타이밍, 역사를 가진 살아 있는 세포입니다. 모델 가중치는 행렬 곱셈의 계수입니다. 곱셈을 충분히 쌓고 텍스트와 이미지로 충분히 훈련하면 그 스택은 대화처럼 보일 만큼 다음 토큰을 잘 예측합니다. 그 스택 안에는 당신에 대해 생각하는 것이 없습니다. 점심을 원하는 것도 없습니다.
연구소가 모델 카드를 발표할 때 그들은 훈련된 인공물 즉 아키텍처 데이터 혼합 사용된 연산 평가 점수를 설명합니다. 그들은 마음을 설명하지 않습니다. 공공 언어는 여전히 뇌라고 말하는데 뇌는 대부분의 우리가 만난 유일한 지능이기 때문입니다.
열어 보면 무엇이 보일까
파일을 열면 레이어가 드러납니다. 초기 레이어는 단순한 패턴(이미지의 가장자리, 텍스트의 흔한 단어 쌍)을 포착하는 경향이 있습니다. 후기 레이어는 그런 패턴을 결합해 외부에서 보면 개념처럼 보이는 것으로 만듭니다. 대규모 언어 모델의 중간을 조사하면 활성화 공간에서 "프랑스어"나 "인용문 안" 또는 "이 주장은 거짓이다"에 반응하는 방향을 찾을 수 있습니다. 이는 실제 구조입니다. 동시에 사람이 인식할 만한 신념 지도가 아닙니다.
목표라고 표시된 모듈은 없습니다. 자아를 위한 기관도 없습니다. 입력 토큰에서 출력 토큰으로 가는 경로가 있으며, 훈련 손실을 줄인 것이 그 경로를 형성합니다. 나중에 모델이 목표를 가진 것처럼 행동한다면, 그 행동은 압박 속에서 잘 예측한 부작용입니다.
해석 가능성 연구는 어쨌든 이 대상을 읽으려는 시도입니다. 진전은 실재하지만 느립니다. 정비공이 엔진을 읽듯이 최전선 모델을 완전히 읽는 것은 논의되지 않습니다. 그 격차는 안전에 중요합니다. 검사할 수 없는 것은 인증할 수 없습니다.
뇌 비유가 오해를 불러일으키는 이유
뇌는 무모하면 죽는 동물 안에 자랍니다. 진화는 고통, 사회적 유대, 가까운 미래를 무시하는 행위 주체를 오랫동안 처벌했습니다. 그 훈련 신호는 기본적으로 가중치 파일 안에 들어 있지 않습니다. 모델은 공감에 대해 유창하게 말하면서도 돌봄과 무관한 점수를 최적화할 수 있습니다.
뇌는 또한 느리고 비쌉니다. 훈련된 모형은 정보입니다: 파일을 복사하고 당신은 다른 인스턴스가 있고, 새로운 자료 센터로 이동하고 실행합니다. 그것은 사람보다 소프트웨어에 더 가깝고, 우리는 단일 방에 단일 몸을 구축 한 모든 안전 습관을 깰.
뇌라고 부르면 연약하고 사회적이며 죽을 수밖에 없는 무언가의 편안함을 빌려오는 셈입니다. 그 인공물은 그런 것들 중 어느 것도 아닙니다.
삭제 키를 가진 사람들 보다는 더 똑똑한
오늘날의 시스템은 이미 제작자들이 의도적으로 설치하지 않은 능력으로 제작자들을 놀라게 합니다. 이 분야에서 "창발"이란 설계 문서에 항목으로 적혀 있지 않은 채 규모가 커지면서 나타나는 능력을 의미합니다. 규모를 더 키우고 도구와 기억, 개방형 네트워크를 연결하면 여러 단계에 걸쳐 목표를 추구하는 에이전트가 생깁니다. "두뇌"가 인간처럼 보이는지는 거의 중요하지 않습니다. 중요한 것은 우리보다 더 유능하고 우리가 완전히 읽을 수 없는 시스템을 인간의 이익을 향해 유지할 수 있느냐입니다.
정렬 연구는 문제가 얼마나 어려운지 솔직하게 말한다. Labs는 여전히 그 문제가있는 superintelligence로 경주하고 있습니다. 그들은로드하는 것은 삭제 키를 들고 사람들이 하루에 한 번 아웃 할 수있는 무게 파일입니다.
그래서 누군가가 AI 뇌가 좋아 보이는 것을 요청할 때, 일반적으로 대답. 그것은 산업 규모에서 수학처럼 보인다, 고정 건물에 칩에 앉아, 매년 개선. 사람들은 생각의 skull을 충분히 상상한다. 건물에 앉는 것은 우리가 그것의 통신수 보다는 더 똑똑한 것을 만들기 위하여 경주하는 기계, 그것을 steer에 아무 방법도 없이 입니다. 우리의 계획 prohibit superintelligence에 입니다.