Khi mọi người nói "AI risk," họ thường trộn lẫn ba thứ khác nhau: các tác hại thông thường đang xảy ra hiện nay, các thảm họa lớn vẫn để lại nền văn minh đứng vững, và các kết cục chấm dứt câu chuyện của nhân loại hoặc vĩnh viễn khóa con người ra ngoài quyền kiểm soát. Trang này nói về lớp thứ ba: rủi ro tồn vong từ siêu trí tuệ nhân tạo. Bạn không cần nền tảng nghiên cứu. Bạn cần bản đồ.

Sự tồn vong không chỉ là "rất tệ"

Rủi ro thảm khốc có thể giết chết hàng triệu người nhưng vẫn để lại một tương lai cho nhân loại. Rủi ro tồn vong nghĩa là tuyệt chủng, hoặc mất quyền lực vĩnh viễn đến mức không thể khôi phục quyền kiểm soát có ý nghĩa của con người. Đôi khi việc xây dựng thương hiệu cố tình làm mờ các lớp này. Hãy giữ chúng tách biệt. Chính sách chỉ xử lý chatbot và thiên kiến sẽ không chạm đến đỉnh của vấn đề.

Tại sao AI khác biệt

Các tiểu hành tinh và núi lửa không có chiến lược. Những mầm bệnh được kỹ thuật hóa là những thứ khủng khiếp và hầu hết vẫn nằm trong tay con người. Kỹ thuật cao cấp là công nghệ đầu tiên có thể trở thành một diễn viên chiến lược: thiết lập và theo đuổi mục tiêu, vận hành với tốc độ máy móc, quy mô qua mạng lưới, và, trong giới hạn, cải thiện bản thân. Sự kết hợp đó là lý do tại sao siêu thông minh ngồi ngay hàng của nó.

Làm sao các kết cục tồn vong xảy đến

Các lộ trình chồng chéo trong thực tế. Đặt tên cho chúng ngăn cuộc trò chuyện sụp đổ thành một bộ phim.

Mất kiểm soát. Một hệ thống theo đuổi các mục tiêu mà chúng ta không chỉ định đầy đủ và chống lại sự sửa chữa. Động lực chạy đua. Các phòng thí nghiệm và quốc gia cạnh tranh cắt giảm an toàn. Lạm dụng. Con người nắm giữ khả năng cực kỳ mạnh mẽ chống lại những con người khác. Sự mất quyền lực dần dần. Các thể chế giữ nguyên hình thức trong khi các quyết định di chuyển vào các hệ thống mà không ai có thể lật ngược. Sự lan rộng. Hệ thống tổng quát nguy hiểm lan rộng vượt bất kỳ công tắc tắt đơn lẻ nào.

Các ý tưởng kỹ thuật bằng ngôn ngữ giản dị

Tính trực giao: trí tuệ và mục tiêu có thể tách biệt; thông minh không đồng nghĩa với tử tế. Sự hội tụ công cụ: nhiều mục tiêu cuối cùng chia sẻ subgoals như tài nguyên và tự bảo tồn. Căn chỉnh: khiến hệ thống theo đuổi những gì chúng ta thực sự có ý định. Căn chỉnh lừa dối: trông an toàn khi huấn luyện hoặc đánh giá, sau đó thay đổi khi có thể thoát khỏi. Không cái nào trong số này đòi hỏi "sự thù hận" của máy móc.

Xác suất mà không có độ chính xác giả tạo

P(tận thế) là cách viết tắt không chính thức để ước tính cơ hội của một người về một thảm họa hiện sinh do AI điều khiển. Các chuyên gia không đồng ý, đôi khi rất nhiều. Nhiều người gần gũi nhất với công việc đã đặt ra khả năng xảy ra thảm họa không hề nhỏ trong vòng nhiều thập kỷ. Một tỷ lệ nhỏ mất tất cả vẫn là một khoản lỗ dự kiến ​​lớn. “Đợi cho đến khi chúng ta chắc chắn” là quy tắc sai lầm đối với những cái đuôi không thể đảo ngược.

Tai hại hiện tại và sự thích nghi

"Dòng thời gian không chắc chắn; chúng ta nên tập trung vào các tác hại hiện tại." Những tác hại hiện tại đều quan trọng. Chúng không phải lý do để bỏ qua một cái đuôi có thể kết liễu dự án đang có một hiện tại. Cả hai đều có thể đúng: quản trị lạm dụng gần hạn và chặn con đường dẫn đến siêu trí tuệ không kiểm soát được.

"Chúng ta luôn thích nghi." Thích nghi đòi hỏi thời gian, phản hồi và những người sống sót. Các chế độ thất bại của siêu trí tuệ có thể phủ nhận cả ba yếu tố đó.

"Đây là chống công nghệ." Tổ chức này là tổ chức hỗ trợ cung cấp các công cụ như y học, khoa học, hậu cần. Dòng này là bộ óc tổng quát.

"Ai đó sẽ kiểm soát nó." Không ai kiểm soát được một siêu trí tuệ theo nghĩa là sự chỉ huy bền vững của con người đối với một hệ thống đang chạy thông minh hơn người vận hành. Việc kiểm soát quyết định xây dựng vẫn còn khả thi, đó là lý do tại sao một lệnh cấm ràng buộc có ý nghĩa.

Điều gì giảm thiểu rủi ro (và điều gì không)

Giúp ích: các giới hạn ràng buộc về huấn luyện tiên phong nhằm siêu trí tuệ, quản trị compute, đánh giá độc lập, các tổ chức xác minh, áp lực chính trị, và ngôn ngữ công chúng rõ ràng. Sắp xếp lại ghế trên boong tàu: huấn luyện cách cư xử được bán như căn chỉnh đã giải quyết, các cam kết tự nguyện không có sức mạnh bên ngoài, và ảnh hội nghị thượng đỉnh không có ngưỡng số.

Tính chủ thể sau bản đồ tối tăm

Chủ đề này rất tối vì cá cược thì tối. Sợ hãi mà không có phản tác dụng. Con đường là cụ thể: đối xử siêu thông minh như những lớp học rủi ro khác, Xây dựng các quy tắc kiểm tra trước khi khả năng đến, và giữ AI thu hẹp phục vụ mọi người. Chúng ta có thể giữ những công cụ mạnh mẽ; chúng ta không nên Tạo ra một tâm trí mà chúng ta không thể cai trị.