Người ta cứ hỏi Al "brain" trông như thế nào. Một bảng tính to bằng một thành phố, với số lượng lớn không ai biết đọc. Hình ảnh đó ít lãng mạn hơn một bức tranh hoạt hình thần kinh phát sáng, và nó hữu dụng hơn. Nếu anh muốn biết chúng tôi đang xây dựng cái gì, và tại sao kiểm soát lại khó khăn.

Một tệp trọng số

Một mô hình biên giới hiện đại là một tập tin. Bên trong nó chứa hàng chục hoặc hàng trăm tỷ tham số, mỗi tham số là một con số được thiết lập trong quá trình huấn luyện. Những con số đó là "kết nối". Các nhà nghiên cứu mượn từ "nơ-ron" từ sinh học cách đây hàng thập kỷ vì sơ đồ ban đầu trông hơi giống tế bào thần kinh nối với nhau. Sự giống nhau dừng lại ở đó.

Một neuron sinh học là tế bào sống với hóa học, nhịp thời gian và lịch sử bên trong một cơ thể ăn uống, ngủ nghỉ. Một trọng số mô hình chỉ là hệ số trong phép nhân ma trận. Xếp đủ phép nhân, huấn luyện trên đủ văn bản và hình ảnh, và chồng đó dự đoán token tiếp theo đủ tốt để giả dạng hội thoại. Không có gì trong chồng đó đang nghĩ về bạn. Không có gì trong đó muốn ăn trưa.

Khi các phòng lab công bố model card, họ đang mô tả một tạo tác đã huấn luyện: kiến trúc, hỗn hợp dữ liệu, lượng tính toán sử dụng, điểm đánh giá. Họ không mô tả một tâm trí. Ngôn ngữ công chúng vẫn nói "bộ não", vì não là trí tuệ duy nhất mà hầu hết chúng ta từng gặp.

Bạn sẽ thấy gì nếu mở nó ra

Mở file ra là thấy các lớp. Các lớp đầu thường nắm bắt những mẫu đơn giản (cạnh trong ảnh, cặp từ phổ biến trong văn bản). Các lớp sau kết hợp những mẫu đó thành những thứ trông, từ bên ngoài, giống như khái niệm. Dò giữa một mô hình ngôn ngữ lớn và bạn có thể tìm ra các hướng trong không gian kích hoạt sáng lên với "French" hoặc "inside a quote" hoặc "this claim is false." Đó là cấu trúc thật. Nó cũng không phải bản đồ niềm tin mà một con người nhận ra.

Không có mô-đun nào được dán nhãn "mục tiêu". Không có cơ quan nào dành cho "bản ngã". Chỉ có một đường dẫn từ token đầu vào đến token đầu ra, được định hình bởi bất cứ thứ gì đã giảm thiểu mất mát huấn luyện. Nếu mô hình sau này hành động như thể nó có mục tiêu, hành vi đó chỉ là tác dụng phụ của việc dự đoán tốt dưới áp lực.

Nghiên cứu giải mã là nỗ lực đọc thứ này dù sao. Tiến bộ là có thật và chậm. Đọc hoàn toàn một mô hình biên giới như thợ máy đọc động cơ chưa nằm trong tầm với. Khoảng cách đó quan trọng đối với an toàn: bạn không thể chứng nhận thứ bạn không thể kiểm tra.

Tại sao ẩn dụ não bộ gây hiểu lầm

Bộ não phát triển bên trong động vật sẽ chết nếu chúng liều lĩnh. Tiến hóa đã dành rất nhiều thời gian trừng phạt những tác nhân bỏ qua đau đớn, mối quan hệ xã hội và tương lai gần. Không có tín hiệu huấn luyện nào trong số đó nằm sẵn trong file trọng số. Một mô hình có thể nói trôi chảy về sự đồng cảm trong khi tối ưu hóa một điểm số hoàn toàn không liên quan đến việc chăm sóc.

Não cũng chậm và đắt để sao chép. Một mô hình được đào tạo là thông tin: sao chép tập tin và bạn có một ví dụ khác, và chuyển nó đến một trung tâm dữ liệu mới và nó chạy. Nó gần với phần mềm hơn với một người, và nó phá vỡ mọi thói quen an toàn mà chúng tôi xây dựng xung quanh những cơ thể đơn lẻ trong phòng.

Gọi nó là bộ não và bạn mượn sự an ủi của thứ gì đó mỏng manh, mang tính xã hội và hữu hạn. Hiện vật này không phải những thứ ấy.

Thông minh hơn những người có khóa xoá

Các hệ thống ngày nay đã khiến người xây dựng ngạc nhiên với những kỹ năng không ai cố tình cài đặt. Đó là ý nghĩa của "khả năng mới nổi" trong lĩnh vực này: năng lực xuất hiện ở quy mô mà không có mục nào trong tài liệu thiết kế. Mở rộng quy mô thêm nữa, kết nối công cụ và bộ nhớ cùng mạng mở, và bạn có các tác nhân theo đuổi mục tiêu qua nhiều bước. Việc "bộ não" trông có giống con người hay không gần như không quan trọng. Điều quan trọng là liệu một hệ thống có năng lực hơn chúng ta, mà chúng ta không thể đọc hết, có thể được giữ hướng về lợi ích con người hay không.

Nghiên cứu alignment trung thực về mức độ khó của vấn đề. Phòng thí nghiệm đang chạy đua vào siêu tình báo với vấn đề đó vẫn còn mở. Cái mà họ sẽ tải là một tập tin cân nặng mà một ngày kia có thể nghĩ ra những người đang cầm chìa khóa xóa.

Vì vậy, khi ai đó hỏi não AI trông như thế nào, trả lời rõ ràng. Nó giống như toán học ở quy mô công nghiệp, ngồi trên chip trong một tòa nhà khóa, cải thiện mỗi năm. Người ta tưởng tượng một hộp sọ đầy những suy nghĩ. Cái nằm trong tòa nhà là một cỗ máy mà chúng ta đang chạy đua để làm cho nó thông minh hơn người điều khiển, mà không có cách nào để điều khiển nó. Kế hoạch của chúng tôi là ngăn chặn trí tuệ siêu việt.