Mỗi năm thế giới chi một gia tài để làm cho các hệ thống AI có năng lực hơn, và chỉ một khoản lẻ tẻ để làm cho trạng thái cuối cùng có thể sống sót. Bên trong khoản lẻ tẻ đó còn có một sai lầm nữa: hầu hết tiền an toàn vẫn giả định siêu trí tuệ sẽ được xây dựng, và cố gắng làm cho kết quả đó "diễn ra tốt đẹp."

Hầu hết tiền bạc và uy tín vẫn đổ vào việc làm cho cuộc đua an toàn hơn, chứ không phải chấm dứt cuộc đua đến siêu trí tuệ.

Đó chính là vấn đề. Nếu siêu thông minh nhân tạo là một công nghệ mà chúng ta không thể kiểm soát, sử dụng hợp lý vốn an toàn khan hiếm là ngăn nó được tạo ra, không phải để tài trợ cho một phiên bản thân thiện hơn của cùng một chủng tộc.

Tiền làm gì hôm nay

An toàn AI, hiểu theo nghĩa rộng, chủ yếu dựa vào khoảng $190 triệu mỗi năm. Công việc năng lực chạy bằng hàng chục tỷ đô. Trong phần an toàn, phần lớn dành cho alignment kỹ thuật: thủ thuật giám sát tốt hơn, red teaming tốt hơn, cách huấn luyện mô hình nói đúng thứ dưới điều kiện kiểm tra tốt hơn. Một phần trong đó hữu ích cho hệ thống ngày nay. Hầu như không có gì là giải pháp đã chứng minh cho hệ thống thông minh hơn người kiểm tra nó.

Lĩnh vực này biết rõ điều đó. Các bài báo về deceptive alignment, goal misspecification và evaluation gaming không phải bí mật. Các lab công bố kết quả cho thấy mô hình mưu mô dưới áp lực. Phản ứng quá thường là xin thêm ngân sách alignment để lần chạy huấn luyện sau an toàn hơn. Các lần chạy huấn luyện vẫn tiếp tục đúng lịch.

Căn chỉnh sau sự kiện là một canh bạc mà chúng ta liên tục mất quyền thực hiện

Nếu thế giới từng thông qua hiệp ước đóng băng cuộc đua đến siêu trí tuệ, chúng ta sẽ muốn mọi công cụ quan trọng mà chúng ta có được cho hệ thống đã tồn tại.

Tài trợ thẳng hàng như kế hoạch chính trong khi phòng thí nghiệm quy mô về siêu thông tin xem điểm đến là cố định. Chúng ta có thể chọn địa điểm. Kho vũ khí hạt nhân, hóa chất ô - li - ve và nhân bản con người đều có những lúc mà thế giới quyết định một số trạng thái kết thúc không đáng để mạo hiểm. Siêu thông minh thuộc về danh sách đó vĩnh viễn. Siêu thông minh không thể kiểm soát được.

Tiền nên được dùng ở đâu thay vào đó

Chuyển hướng nguồn lực alignment-for-siêu trí tuệ sang các công việc khiến việc không tạo ra trở nên có thể thực thi:

  • Thiết kế hiệp ước, xác minh, và quản trị sức mạnh tính toán cấp chip có thể được kiểm tra qua biên giới.
  • Vận động công chúng giữ mục tiêu rõ ràng: ngăn siêu trí tuệ, không phải "làm chậm AI" như một tâm trạng mơ hồ.
  • Hỗ trợ người tố cáo, minh bạch sự cố và đánh giá độc lập làm tăng chi phí của các bước nhảy khả năng thầm lặng.
  • Tổ chức chính trị để các nhà lập pháp lắng nghe từ cử tri, không chỉ từ các nhóm vận động hành lang của phòng lab.

Danh sách đó không quyến rũ bằng một kỹ thuật luyện tập mới. Nó cũng là danh sách duy nhất khớp với chế độ thất bại. Một siêu thông minh mà nghe có vẻ giống nhau hơn một chút vẫn còn là siêu thông minh. Nếu thế giới từ chối xây dựng, nghiên cứu thẳng hàng có thể tiếp tục mà không cần một hạn chót kết thúc trong tuyệt chủng.

Lý lẽ phản đối từ bên trong phòng lab

"Nếu chúng ta không giải quyết alignment, người khác sẽ xây dựng nó không an toàn." Nghe có lý: các nhà nghiên cứu ở tuyến đầu thường tin sự hiện diện của họ chính là yếu tố an toàn. Đôi khi họ đúng với các bản phát hành mô hình hiện nay. Lập luận này sụp đổ khi đến giới hạn. Một cuộc đua mà mỗi đội cần thêm một bước nhảy khả năng để tài trợ công việc an toàn cho bước nhảy sau vẫn là cuộc đua, chỉ đeo thêm huy hiệu.

Câu hỏi là Một hiệp ước quốc tế ràng buộc, Cùng loại dụng cụ được sử dụng khi mối nguy hiểm được chia sẻ và động cơ gian lận là có thật. Sự kiềm chế ngược lại của một phòng thí nghiệm để lại một cuộc đua nguyên vẹn. Quỹ bảo trợ có thể ủng hộ chính trị đó. Nó không thể thay thế được.

Sau một hiệp ước, tiếp tục nếu bạn muốn

Sau một sự hạn chế, có thể kiểm chứng được về siêu thông tin, việc nghiên cứu về những hệ thống hiện hữu có thể tiếp tục dưới những luật lệ không cho phép con người tuyệt chủng là một chi phí thí nghiệm chấp nhận được. Con người không thể kiểm soát sự siêu thông minh. Trước khi lệnh cấm đó bắt đầu có hiệu lực, mỗi đồng đô la làm cho cuộc đua cảm thấy có thể kiểm soát được là một đô la không dùng để chấm dứt cuộc đua.

Hãy chuyển tiền đến phòng ngừa, luật pháp và xác nhận.