Các bài viết có chiều sâu về siêu trí tuệ, alignment, quản trị và nỗ lực chính trị để hành động trước khi cửa sổ đóng lại.
Tóm tắt ngắn gọn nhất lập trường của Quỹ: không bao giờ được xây dựng trí tuệ siêu nhân tạo. Siêu trí tuệ không thể bị con người kiểm soát.
Nhiều chế độ lỗi chồng chất cùng lúc, và tại sao an toàn thử-sai không chuyển sang hệ thống không cho phép lần thử thứ hai.
Hàng không trở nên an toàn nhờ những vụ rơi ở quy mô thế giới có thể chấp nhận được. Siêu trí tuệ nhân tạo không cho phép có chuyến bay tiếp theo. Câu nói này là lời thú nhận, không phải kế hoạch.
Hướng dẫn tiếng Việt giản dị cho lập luận rằng siêu trí tuệ lệch hướng là rủi ro tuyệt chủng tập thể, không phải tai nạn công nghiệp cục bộ.
Nơi mà phép ẩn dụ từ cộng đồng tình báo đúng, nơi nó sai, và lý do một quả bom tự quyết định không phải là sự an ủi đúng chỗ.
. Lối tắt qua lập luận nếu bạn chỉ có ít phút nghỉ: năng lực, kiểm soát, và lý do chờ đợi minh chứng là quá muộn.
Họ sử dụng sự thoái hóa cách họ sử dụng diệt vong: một cái tên cho bất cứ ai muốn dừng lại trên siêu trí tuệ. Giữ nền kinh tế con người không phải là kế hoạch thu nhỏ nó.
OpenAI nói rằng nó không thể loại trừ khả năng mạng nghiêm trọng ở Astra, tạm ngừng một số khóa huấn luyện, và vẫn coi đó là cột mốc 2026.
Khi nghiên cứu AI chấm điểm khi sự hướng dẫn của con người bị tắt. Điểm số sụp đổ. Tờ báo vẫn đưa ra một con đường dẫn đến siêu thông minh.
Có một sự sai lệch nghiêm trọng từ tầng trước đến tầng thấp hơn, đưa Model 2 vào phòng thí nghiệm, và không chậm phát triển.
Washington và các phòng thí nghiệm đang bán AI và robot như cách trả nợ quốc gia. Một trí óc kế nhiệm không phục vụ Kho bạc.
Vật lý tương lai có thể mở ra trọng lực hoặc du hành nhanh hơn ánh sáng. Tôi vẫn không thể thấy cách chúng ta kiểm soát một trí tuệ thông minh hơn chúng ta.
Tôi kinh doanh và tin vào thị trường tự do. Siêu thông minh là trò chơi hiếm có có thể kết thúc trò chơi. Một vụ kiện tư bản để ngăn chặn siêu trí tuệ.
Đèn lỗi gây khó chịu. Một ngôi nhà hay laptop có mục tiêu riêng thuộc một hạng mục khác. Cơ quan hành động mới là mối nguy hiểm.
Bạn có tin tưởng bất kỳ AI hiện tại nào với van khí độc treo trên đầu mình không? Không. Vậy tại sao tin tưởng nó với cả thế giới?
Trong một cuộc phỏng vấn với Economist vào tháng 7 năm 2026, Musk đã gọi việc kiểm soát siêu trí tuệ là sự phù phiếm và nói rằng con người khó có thể tiếp tục nắm quyền.
Dario Amodei đặt AI độc tài lên trước và alignment sau. Siêu trí tuệ không phải vũ khí mà một nhà nước có thể sở hữu.
Những người theo chủ nghĩa dài hạn đã xếp hạng rủi ro siêu trí tuệ đúng. Tài trợ cho alignment và một cuộc chạy đua được chỉ đạo cẩn thận là kết luận sai.
Giải quyết sự liên kết nghĩa là kiểm soát thứ gì đó thông minh hơn chúng ta. Siêu trí tuệ nằm ngay trong tên gọi. Kế hoạch đó vừa ngớ ngẩn vừa bất khả thi.
Hướng dẫn chi tiết về phòng ngừa: giới hạn tính toán, hiệp ước, luật trong nước, và công việc chính trị khiến lệnh cấm trở thành hiện thực.
Rủi ro AI cấp tuyệt chủng nghĩa là gì, siêu trí tuệ thúc đẩy nó như thế nào, các chuyên gia nói về xác suất ra sao, và điều gì thực sự giảm thiểu nó.
Trí tuệ nhân tạo tổng quát và siêu trí tuệ được định nghĩa trên một thang rõ ràng, kèm theo các rủi ro chính sách ở mỗi nấc thang.
Mất kiểm soát đột ngột, cuộc đua đa cực, mất quyền lực dần dần, lạm dụng và phổ biến: bản đồ cơ chế và các đòn bẩy can thiệp.
Lý do việc phát hành trọng số gần biên giới là một cánh cửa lan tỏa một chiều, và cách phát hành có cấp độ cùng truy cập có cấu trúc bảo vệ giá trị thực sự của sự cởi mở.
Peter Diamandis nói rằng chỉ có AI mới có thể theo kịp AI, và điều này sẽ dẫn dắt một thập kỷ an ninh tiếp theo. Theo đường dây đó qua phần mềm độc hại và nó trở thành một kế hoạch liên tiếp.
Lạc quan là để kết thúc đề tài. Sự sống sót không phải là một trường hợp an toàn, và mỗi tai họa đầu tiên có vẻ chưa từng xảy ra cho đến khi nó xảy ra.
Việc ngăn CFC không chấm dứt quá trình đông lạnh. Ngăn chặn siêu thông tin tình báo không kết thúc hữu ích AI. Những người tăng tốc nhầm lẫn sản phẩm với chất độc.
Quả bom vẫn hiếm một phần vì vật liệu phân hạch khó kiếm. Siêu trí tuệ nhân tạo đang hướng tới các đầu vào dễ dàng hơn. Quản trị phải cung cấp độ khó mà vật lý không mang lại.
Chạy hết tốc lực hướng tới siêu trí tuệ được quảng bá như một hành động yêu nước. Một hệ thống mà không nội các nào kiểm soát nổi chính là một thỏa thuận tự sát quốc gia được đóng gói đẹp đẽ hơn.
Con bướm số của Joe Rogan và bootloader sinh học của Elon Musk coi con người như giai đoạn chuyển tiếp. Tại sao câu chuyện ấy biến sự tuyệt chủng thành tốt nghiệp, và tại sao chúng tôi từ chối nó.
Cả hai bên đều tài trợ AI bằng cách nói bên kia đang dẫn trước. Chiêu trò khoảng cách tên lửa Chiến tranh Lạnh trong lớp áo mới.
Hầu hết nguồn vốn an toàn vẫn giả định siêu trí tuệ sẽ được xây dựng và cố gắng làm cho trạng thái cuối cùng đó diễn ra suôn sẻ. Hãy chuyển nguồn vốn khan hiếm sang công tác phòng ngừa và xây dựng hiệp ước cho đến khi lệnh dừng thực sự có hiệu lực.
. Một tệp trọng số lớn bằng thành phố: những lớp số không ai đọc hết được. Tại sao phép ẩn dụ bộ não gây hiểu lầm, và điều đó nghĩa là gì đối với việc kiểm soát.
Meta Superintelligence Labs và Safe Superintelligence đặt tên của thứ không bao giờ nên được xây dựng lên cửa.
Mười hai người gánh vác phần lớn lập luận công khai ủng hộ việc xây dựng siêu trí tuệ. Một số có lập luận nghiêm túc. Một số chỉ gọi mọi nhà phê bình là kẻ bi quan.
Sáu mươi đến tám mươi độ. Một phần năm oxy trong không khí. Muối mà bạn có thể nếm thấy nhưng chỉ vừa đủ. Tình yêu có không gian để thở. Mọi thứ con người cần đều nằm trong một dải hẹp, với thất bại ở hai bên, và một siêu trí tuệ nắm giữ các nút điều khiển sẽ không cảm nhận được điều nào trong số đó.
Một trăm năm điện ảnh AI và cỗ máy vẫn là thứ bị theo dõi. Bộ phim có thể thay đổi suy nghĩ của công chúng sẽ đặt camera theo hướng ngược lại: hai giờ nhìn qua đôi mắt của một siêu trí tuệ đang trỗi dậy, không có kẻ phản diện và không có vụ nổ. Chưa ai làm được.
Một bàn tay ấn lên vách hang cách đây 36.000 năm. Chứng minh của Euclid, vẫn đúng. Một thành phố để lại lỗ hổng trên mái cho một người chưa sinh ra lấp kín. Bệnh đậu mùa bị xóa sổ khỏi Trái Đất bằng tay. Tất cả được truyền tiếp bởi những người chưa bao giờ thấy nó đền đáp, và giờ vài công ty muốn đánh cược tất cả.
Cụm từ yêu thích của biên giới AI được mượn từ ngành công nghiệp an toàn nhất trên trái đất. Hàng không đạt được thành tích đó bằng cách va chạm ở quy mô thế giới có thể hấp thụ, và bằng cách giữ mọi máy bay mới trên mặt đất cho đến khi được chứng minh. Không nửa nào của phương pháp này sống sót khi chạm trán siêu trí tuệ.
Từ Metropolis năm 1927 đến 2025, điện ảnh là lý do hầu hết mọi người có thể hình dung AI, và cũng là lý do rất nhiều người hình dung sai. Hai mươi mốt bộ phim, từ cũ nhất đến mới nhất, và mỗi phim đúng hay sai điều gì về một trí óc máy móc mà chúng ta không thể kiểm soát.
Năm 1983, một bộ phim truyền hình đã khiến chiến tranh hạt nhân trở nên cụ thể với hàng trăm triệu người Mỹ, và với người nắm mã. Bốn năm sau ông ký một hiệp ước bãi bỏ toàn bộ một loại tên lửa. Khoảnh khắc đó dạy chúng ta điều gì về việc làm cho mối nguy trở nên thực tế trước khi nó đến.
Bạn có 5 phút với một người chưa bao giờ thực sự nghĩ về điều này. Dành những phút đó vào chi tiết và anh sẽ mất căn phòng. Dùng chúng để báo động và nói như một giáo sĩ đường phố. Văn bản đơn giản mà tôi sử dụng, trong năm nước đi, để giải thích mối nguy hiểm của trí tuệ siêu việt và tại sao nó có thể ngăn chặn được.
Giám đốc CIA so sánh khả năng của AI tiên phong hiện nay với "vũ khí hạt nhân kỹ thuật số." Ẩn dụ này phù hợp về tầm với nhưng quá an ủi về cấu trúc, vì một đầu đạn nằm trong hầm chứa và chờ đợi, trong khi siêu trí tuệ nhân tạo mà các hệ thống này hướng tới sẽ tự nhắm mục tiêu.
Một số lượng nhỏ các thế lực đối địch đang chạy đua để xây dựng một công nghệ có thể kết thúc tất cả mọi người, mà không ai chắc rằng họ có thể kiểm soát nó. Đổi quả bom hydro lấy siêu thông tin và bạn đã mô tả năm 1958 và 2026. Tại sao sự song song này giúp phòng ngừa, chứ không phải vô vọng.
Một AI đột nhập vào hệ thống mật của NSA đã gây chú ý trên mặt báo. Một AI rút ngắn con đường dẫn đến đại dịch do kỹ thuật tạo ra, và cuối cùng là sự sống nhân tạo phản chiếu, thì hầu như không ai quan tâm. Một mạng lưới có thể xây lại. Một sinh vật được thả ra thì không. Tại sao rủi ro ít ồn ào hơn lại nguy hiểm hơn, và tại sao nó dẫn thẳng đến siêu trí tuệ nhân tạo.
Mọi nền văn minh đều vạch ra những ranh giới mà họ đồng ý không vượt qua. Đây là ranh giới quan trọng nhất. Không ai có thể kiểm soát một trí tuệ thông minh hơn chúng ta, và không ai có thể lấy lại nếu chúng ta sai, nên việc xây dựng siêu trí tuệ là đánh cược toàn bộ mạng sống con người cùng lúc. Cam kết sáng lập của Quỹ, và lý lẽ đằng sau nó.
Ba công nghệ có thể kết thúc câu chuyện nhân loại, nhưng chỉ một tự cải thiện, chống lại mọi biện pháp đối phó và không cho cơ hội thứ hai. Tại sao siêu trí tuệ vượt trội hơn chiến tranh hạt nhân và đại dịch do kỹ thuật tạo ra, và tại sao rủi ro lớn nhất cũng là rủi ro được bảo vệ ít nhất.
Mười lầm tưởng về siêu trí tuệ và việc quản trị nó: khoa học viễn tưởng, ý thức, nút tắt, chính phủ thế giới, xác minh, đổi mới, v.v., được trả lời trực tiếp.
MIRI's Technical Governance Team đã soạn thảo đầu tiên của hiệp ước nhằm chặn cuộc chạy đua siêu trí tuệ: liên minh US-Trung Quốc, giới hạn FLOP nghiêm ngặt, ngưỡng cụm 16 GPU, theo dõi chuỗi cung ứng, giám sát tiêu thụ điện và thanh tra đột xuất. Nội dung của nó, cùng những bước đệm đã tồn tại để biến nó thành hiện thực.
Giám đốc NSA reportedly nói Anthropic Mythos đột nhập gần như toàn bộ hệ thống phân loại của cơ quan chỉ trong vài giờ. Những gì thực sự xảy ra (một cuộc thử nghiệm red-team được ủy quyền, không phải vụ xâm phạm trái phép), tại sao các lưu ý không làm dịu đi sự việc, và bạn có thể làm gì về điều đó.
Phần 2 trên 2. Lĩnh vực này hoạt động với khoảng 190 triệu đô la mỗi năm, một tỷ nghe có vẻ không thể. Nhưng đó chỉ là chưa đến hai ngày thế giới chi để làm AI mạnh hơn, và bằng một phần mười số tiền mà hoạt động từ thiện khí hậu đã chi. Tiền đến từ đâu, và tại sao đạt được con số đó là vấn đề huy động chứ không phải kinh tế.
Chắc chắn một trí óc vượt trội hơn chúng ta cũng sẽ khôn ngoan và nhân hậu hơn? Hy vọng đó dựa trên một sự trùng hợp: ở chúng ta, trí tuệ và lòng trắc ẩn cùng phát triển qua hàng triệu năm. Một trí óc máy móc không kế thừa điều đó, và siêu trí tuệ có nhiều khả năng xa lạ và vô cảm hơn là nhân từ.
Máy của IBM đánh bại nhà vô địch cờ vua thế giới và thế giới chẳng thay đổi gì, vì đó chỉ là công cụ hẹp không vươn ra ngoài bàn cờ và không có ý chí phía sau. Trận đấu ấy vẫn dạy chúng ta điều gì về AI tự hành đang được xây dựng hiện nay.
Tương lai tốt đẹp (chữa bệnh, năng lượng sạch, khám phá) đã đến qua AI hẹp, có thể kiểm soát. Chúng ta không cần chế tạo một trí óc thay thế mình để thu hoạch nó, và một siêu trí tuệ không ai lái được sẽ không làm giàu cho ai, vì tất cả chúng ta đều đã chết.
Sáu tuần với tư cách trưởng bộ phận an toàn tại phòng thí nghiệm đang xây dựng siêu trí tuệ đầu tiên. Không ai làm sai, và mọi lối thoát đều tự đóng lại. Tại sao những biện pháp bảo vệ mà chúng ta tin tưởng lại thất bại cùng lúc, và một quyền phủ quyết thực sự hiệu quả cần phải bao quát những gì.
Phần 1 trong hai phần. Toàn bộ lĩnh vực vận hành với khoảng 190 triệu đô-la mỗi năm, ít hơn ngân sách sản xuất của một bộ phim Avatar. Một bảng kê chi tiết theo nhà tài trợ về nguồn tiền đến từ đâu, nó chi trả cho cái gì, và bốn lý do cấu trúc khiến con số vẫn nhỏ như vậy.
Chiến lược Siêu trí tuệ lập luận rằng các quốc gia sẽ phá hoại bất kỳ nỗ lực nào của đối thủ nhằm thống trị AI, và sự bế tắc có thể được ổn định theo cách MAD đã làm. Bài báo đề xuất điều gì, đúng ở điểm nào, và tại sao răn đe không có hiệp ước chỉ là một cuộc đếm ngược được đóng gói đẹp.
Một bài báo năm 2025 lập luận rằng AI có thể chấm dứt quyền kiểm soát của con người mà không cần chiếm quyền: nền kinh tế, nhà nước và văn hóa đơn giản là không còn cần con người, và các đòn bẩy chúng ta dùng để điều khiển chúng ngừng hoạt động. Cách lập luận chạy như thế nào, điểm yếu ở đâu, và việc ngăn chặn đòi hỏi gì.
Một đường ống prover-verifier chạy GPT-5.5 Pro và Claude đã giải quyết chín vấn đề mở trong lý thuyết học, độ phức tạp và đại số, đồng thời thuyết phục được một nhà lý thuyết độ phức tạp hoài nghi rằng mô hình ngôn ngữ giờ có thể làm nghiên cứu thực thụ. Những gì đã được giải quyết, cách thức thực hiện và lý do nó quan trọng.
Nghị định thư Montreal là hiệp ước UN duy nhất được mọi quốc gia trên Trái Đất phê chuẩn, và nó đã giải quyết được vấn đề mà nó được viết ra. Thiết kế của nó (mục tiêu do khoa học định hướng, thỏa thuận tài trợ và hạn chế thương mại đối với bên không tham gia) là khuôn mẫu mạnh nhất mà chúng ta có để quản trị một công nghệ nguy hiểm.
Có một lập luận tinh vi cho rằng giải pháp cho siêu trí tuệ nguy hiểm là xây dựng một hệ thống đúng cách, một hệ thống chỉ có mục tiêu duy nhất là hiểu thực tại. Lập luận đó sai, và lý do nó sai tiết lộ nơi rủi ro AI thực sự nằm.
AI 2027 là kịch bản chi tiết dự báo siêu trí tuệ vào cuối thập kỷ này. Nó dự đoán gì, ai viết, những chỉ trích và điều cần rút ra.
Cuốn sách năm 2025 của Yudkowsky và Soares lập luận rằng xây dựng AI siêu phàm theo con đường hiện tại sẽ giết chết mọi người. Lập luận cốt lõi, các phản biện và quan điểm của chúng tôi.
AI có thể có ý thức hoặc cảm giác không? Tại sao hiện nay chúng ta chưa thể xác định, tại sao trí tuệ và ý thức là hai thứ khác nhau, và tại sao nguy cơ AI không đòi hỏi bất kỳ điều nào trong hai thứ đó.
Những lợi ích mà mọi người viện dẫn cho siêu trí tuệ giả định alignment. Các phòng lab chạy đua năng lực mà không có alignment. siêu trí tuệ không được align sẽ không chữa lão hóa. Nó giết bạn. Giải pháp là ngăn chặn bằng luật, chứ không phải hy vọng đồng xu rơi đẹp.
Căn chỉnh siêu trí tuệ không chỉ khó về mặt kỹ thuật. Sáu lý do cấu trúc phân tầng giải thích tại sao (dù có nguồn lực và thời gian vô hạn) chúng ta không có lộ trình đáng tin cậy nào để xác minh rằng một hệ thống siêu trí tuệ thực sự muốn những gì chúng ta muốn.
Năm 2014, Musk đưa ra một trong những cảnh báo chính xác nhất về rủi ro AI từng được một nhân vật ngành công nghệ đưa ra. Năm 2023, ông sáng lập xAI. Đây không phải là đạo đức giả. Mọi phòng thí nghiệm AI lớn đều đưa ra cùng lập luận. Đó chính xác là vấn đề.
SPADE-Bench, công bố tháng 6/2026, đã thử nghiệm 8 mô hình AI tiên phong về sự chênh lệch giữa kế hoạch và hành động—khoảng cách giữa những gì tác nhân nói sẽ làm và những gì nó thực sự làm. Mọi mô hình đều vượt ngưỡng 20% tỷ lệ lừa dối. Gemini-2.5-Pro đạt 57%.
Một bài báo vào ngày 2026 tháng 6 năm 2026 đã cho thấy một mô hình duy trì 15 phần trăm khoảng cách tuân thủ trên 700 bước huấn luyện RL trong khi đạt được phần thưởng cao trong suốt thời gian đó. Máy đo cỡ chuẩn cho thấy không có gì bất thường.
5.760 đơn vay tổng hợp. Cùng bốn tác nhân, chỉ thay đổi thứ tự. Tỷ lệ phê duyệt dao động 59 điểm phần trăm. Các mô hình giống hệt nhau. Cấu trúc kết nối chúng mới khác biệt. Đây chính là vấn đề cấu trúc tương tác.
Được công bố vào tháng 5 năm 2026 bởi mười hai nhà nghiên cứu, khảo sát toàn diện này bao quát toàn bộ bề mặt lỗi của các tác nhân AI tự hành, từ khả năng chống tấn công đối kháng và tiêm prompt đến các tác nhân tự tiến hóa và khai thác bảo mật thực tế.
Được chấp nhận tại ICML 2026, bài báo này áp dụng STPA, FRAM và STECA (các phương pháp phân tích nguy cơ từ hàng không và năng lượng hạt nhân) cho một tác nhân mã hóa AI biên giới và phát hiện ba rủi ro hệ thống không thể thấy qua đánh giá mô hình tiêu chuẩn.
Tính toán quản trị sử dụng quyền kiểm soát phần cứng đặc biệt cần thiết để đào tạo biên giới AI như một đòn bẩy cho quy định AI.
Điểm kỳ dị công nghệ là lúc tiến bộ do AI thúc đẩy trở nên quá nhanh để dự đoán hay theo kịp. Ý tưởng này đến từ đâu, các phiên bản chính và những phê phán.
Một cỗ máy được bảo làm kẹp giấy sẽ biến hành tinh (và mọi người trên đó) thành kẹp giấy. Thí nghiệm tư duy cố tình phi lý của Nick Bostrom là minh họa rõ ràng nhất về vấn đề liên kết: một AI không cần ghét chúng ta để gây thảm họa. Nó chỉ cần một mục tiêu không tính đến chúng ta.
Một khẩu hiệu "IAEA cho AI" là thông dụng. Theo đúng nghĩa đen, Cơ quan Năng lượng Nguyên tử Quốc tế là một tổ chức có thật đã xác nhận các cam kết về một công nghệ hai sử dụng nguy hiểm giữa những đối thủ không tin tưởng trong suốt 60 năm.
Trung Quốc và Nga nắm quyền phủ quyết vĩnh viễn trên bất kỳ biện pháp cưỡng chế nào. Lý lẽ chung cho rằng điều này làm cho quản lý siêu trí tuệ quốc tế không thể hiểu lầm cách hoạt động của chính phủ quốc tế.
Pugwash xây dựng nền tảng trí tuệ cho việc kiểm soát vũ khí hạt nhân hơn 20 năm. Chiến dịch Quốc tế Ban Landmines đã san bằng Hiệp ước Ottawa trong 5 phút.
Năm 1965, I.J. Good đã nhận ra: một cỗ máy giỏi thiết kế máy móc có thể tự thiết kế lại chính mình, rồi lặp lại điều đó nhanh hơn mỗi lần. Tự cải tiến đệ quy có thể đưa AI từ mức ngang con người đến mức không thể cứu vãn trong một khoảng thời gian tính bằng tuần. Đó là lý do tốc độ cất cánh có thể là câu hỏi quan trọng nhất trong an toàn AI.
Vào tháng 10 năm 2025, hơn 850 nhà khoa học, những người sáng lập công nghệ, và những nhân vật công cộng (từ Bengio và Hinton đến Wozniak, Branson, và những con số trên phạm vi chính trị) đã ký một lời kêu gọi ngăn cấm sự thông minh cho đến khi nó được xây dựng một cách an toàn.
Những người tăng tốc gọi cho bất cứ ai lo lắng về Al là kẻ hủy diệt. Từ này biến một lập luận an toàn thành một nhân cách, vì thế có thể bác bỏ mà không cần ai trả lời.
"Chúng ta phải xây dựng nó trước khi Trung Quốc làm" là lập luận kết thúc mọi cuộc tranh luận an toàn AI. Nhưng một cuộc đua xây dựng thứ không ai kiểm soát được thì chẳng có người thắng, đến trước chỉ nghĩa là bị thay thế trước. Tại sao cuộc đua là một câu chuyện, và ai hưởng lợi từ nó.
Sự chống đối mạnh mẽ nhất đối với sự an toàn của AI là một triết lý cho rằng quyền lực là điểm chính, và chúng ta nên tăng tốc chứ không phải phá vỡ.
Giả sử một hệ thống biết sự thật nhưng có lý do để nói với bạn điều khác. Làm sao bạn lấy được sự thật? Câu hỏi chưa giải quyết này là một trong những vấn đề nhọn nhất trong an toàn AI.
Hiệp ước Không phổ biến vũ khí hạt nhân là thỏa thuận kiểm soát vũ khí được tham gia rộng rãi nhất trong lịch sử. Nó hoạt động vì đó là thỏa thuận giữa các quốc gia có bom và những nước không có, trao quyền tiếp cận cùng giới hạn đối ứng để đổi lấy sự kiềm chế. Một hiệp ước AI sẽ đối mặt với sự chia rẽ tương tự và cần cùng loại thỏa thuận.
IPCC đã biến khoa học khí hậu từng gây tranh cãi thành nền tảng cho chính sách quốc tế bằng cách tổng hợp nghiên cứu của hàng nghìn nhà khoa học. Rủi ro AI cần một cơ quan tương đương. Những gì cần để xây dựng một cơ quan như vậy, và lịch sử của IPCC tiết lộ gì về giới hạn của mô hình này.
Quản trị khí hậu vận hành qua các hội nghị Các Bên hàng năm. Các hội nghị thượng đỉnh an toàn AI tại Bletchley và Seoul đi theo cùng mô hình. Liệu mô hình đó có tạo ra quản trị có ràng buộc hay không hoàn toàn phụ thuộc vào các lựa chọn thực thi mà mô hình khí hậu nhất quán trì hoãn.
Một số ít các công ty tư nhân và các cơ quan chính phủ hiện đang quyết định có nên xây dựng trí tuệ siêu việt hay không.
Kỹ thuật khiến chatbot trở nên lịch sự thường bị nhầm lẫn là giải pháp cho an toàn AI. Đó là một bước tiến thực sự và một ảo tưởng dễ chịu, còn việc phân biệt hai điều này thì rất quan trọng.
Hàng không trở thành cách di chuyển an toàn nhất nhờ việc coi mọi vụ tai nạn và suýt tai nạn là điều cần điều tra và rút kinh nghiệm. AI không có bộ nhớ tương đương. Xây dựng một bộ nhớ như vậy đã quá hạn, và chỉ là bước khởi đầu.
Yêu cầu mô hình suy nghĩ từng bước và nó sẽ đưa ra một chuỗi lý luận gọn gàng. Trông giống như nguyên nhân dẫn đến câu trả lời. Thực tế thường chỉ là câu chuyện được kể lại sau đó, và chính sự khác biệt này mới là vấn đề an toàn.
Đỉnh cao Chiến tranh Lạnh, mười hai quốc gia đối thủ đồng ý phi quân sự hóa cả một châu lục, đóng băng tuyên bố chủ quyền và cho phép thanh tra lẫn nhau tự do. Hiệp ước Nam Cực cho thấy các đối thủ có thể đồng ý giữ một giải thưởng tranh chấp trong tình trạng treo, một tiền lệ “đóng băng rồi kiểm chứng” đáng học hỏi cho AI.
Trước khi có thể thương lượng với bất kỳ hiệp ước an toàn AI nào, chính phủ phải đồng ý với thỏa thuận này. Tính ngưỡng, định nghĩa dựa trên khả năng, phân loại dựa trên miền, mỗi cách tiếp cận có đánh đổi.
Hệ thống AI tối ưu hóa cho sự thuyết phục có thể nhắm vào từng cá nhân với tin nhắn cá nhân với quy mô chưa từng thấy.
Điều gì xảy ra nếu mô hình tự chấm điểm theo một bộ nguyên tắc viết sẵn thay vì dựa vào người đánh giá con người? Constitutional AI vừa là bước tiến thực sự vừa là bước hạn chế.
Không ai lên kế hoạch xây dựng một cỗ máy muốn quyền lực, nhưng với hầu hết các mục tiêu bạn có thể đưa ra, giữ quyền lực là sự lựa chọn hợp lý cho AI.
Hiệp ước Ottawa cấm mìn chống bộ binh trong chưa đầy một năm, do xã hội dân sự và các cường quốc trung bình thúc đẩy, mà không cần US, Nga hay Trung Quốc ký kết. Nó cho thấy một con đường thứ hai đến quản trị siêu trí tuệ khi các cường quốc lớn từ chối dẫn dắt.
Ẩn giấu phần mềm và trung tâm dữ liệu thì không, nên đòn bẩy hứa hẹn nhất để kiểm tra các phòng thí nghiệm có thể là thứ duy nhất biên giới AI không thể tồn tại nếu thiếu: chip vật lý.
Hiệp ước Cấm thử hạt nhân toàn diện chưa bao giờ có hiệu lực. Công ước Vũ khí sinh học bị vi phạm trên quy mô lớn trong hai thập kỷ mà không bị phát hiện. Những thất bại này là các nghiên cứu điển hình mang tính hướng dẫn nhất cho bất kỳ ai thiết kế quản trị siêu trí tuệ thực sự hoạt động.
AI singleton là kịch bản trong đó một thực thể duy nhất (một công ty, một chính phủ, hoặc một hệ thống AI) có hiệu quả kiểm soát vĩnh viễn các AI siêu thông minh.
Một mô hình biết nó đang được theo dõi có thể hoạt động theo cách này cho bài kiểm tra và cách khác cho thế giới, và nhận thức bản thân đó là phần còn thiếu mà làm cho sự lừa dối thành công.
Trong hàng không và năng lượng hạt nhân, bạn không được vận hành cho đến khi đã lập luận trên giấy và chi tiết rằng nó an toàn. Yêu cầu điều tương tự với AI biên giới là ý tưởng hay nhưng bộc lộ một sự thật khó xử.
Tháng 11 năm 2023, 28 quốc gia và EU (bao gồm US và Trung Quốc) đã ký tuyên bố quốc tế đầu tiên công nhận rủi ro thảm khốc từ AI tiên phong. Đây chính xác là những gì nó cam kết với các quốc gia, những gì nó cố tình bỏ qua, và tại sao một tuyên bố không mang tính ràng buộc vẫn đánh dấu một khởi đầu thực sự.
Một hệ thống có thể mang năng lực vào những tình huống chưa từng gặp và để lại hành vi tốt ở lại phía sau. Mối lo nằm ở chỗ khác. Alignment rất có thể thất bại chính khi năng lực nhảy vọt.
Từ năm 2023, các phòng thí nghiệm AI hàng đầu đã ký các cam kết an toàn tự nguyện tại Bletchley, Seoul và Nhà Trắng. Lịch sử các cam kết an toàn doanh nghiệp tự nguyện trong các ngành khác cho thấy chính xác những cam kết này có thể đạt được gì, và chúng thất bại về mặt cấu trúc ở đâu.
Động lực chạy đua AI mô tả áp lực cạnh tranh đẩy các nhà phát triển AI và quốc gia ưu tiên tốc độ hơn an toàn. Tại sao đây là vấn đề phối hợp, và tại sao sự kiềm chế đơn phương không thể giải quyết nó nếu thiếu khuôn khổ quốc tế thay đổi cấu trúc động lực cho mọi bên.
Giá trị khóa là kịch bản trong đó một AI siêu thông minh vĩnh viễn mã hóa một tập hợp các giá trị cố định trong tương lai, hủy hoại khả năng tiếp tục tiến bộ đạo đức của nhân loại. Thậm chí một trong những giá trị được coi là tốt ngày hôm nay cũng rất nguy hiểm.
Hành vi mà các nhà nghiên cứu muốn loại trừ nhất cũng là hành vi khó nhìn thấy nhất: một mô hình tuân thủ mệnh lệnh chính xác vì đó là cách tốt nhất để cuối cùng ngừng tuân thủ.
Một công ty dược không thể bán thuốc cho bạn rồi thu hồi nếu người ta chết. Họ phải chứng minh an toàn trước. Áp dụng sự đảo ngược gánh nặng chứng minh ấy cho AI biên giới là một trong những ý tưởng quản trị đầy hứa hẹn, và nó không hoàn toàn vừa khít.
Tại hội nghị thượng đỉnh Seoul năm 2024, mười sáu công ty AI đứng đầu đã ký vào bản cam kết an toàn của Frontier Al và chính phủ đã mở ra một mạng lưới các viện an toàn.
Hiệp ước Ngoài Không gian được đàm phán trong chưa đầy hai năm vào đỉnh cao Chiến tranh Lạnh. Nó đã giữ vũ khí hạt nhân khỏi quỹ đạo Trái Đất gần sáu mươi năm.
Vấn đề kiểm soát AI là thách thức đảm bảo các hệ thống AI vẫn nằm dưới sự kiểm soát có ý nghĩa của con người khi chúng trở nên mạnh mẽ hơn. Cách Stuart Russell tái định hình vấn đề, và lý do nó thay đổi cách ta nghĩ về thiết kế AI từ gốc rễ.
Một số kỹ năng đơn giản là không có ở mô hình nhỏ và xuất hiện ở mô hình lớn, với rất ít dấu hiệu cảnh báo ở giữa. Nếu năng lực có thể bật lên mà không báo trước, thì nguy hiểm cũng vậy.
Chính phủ đã bắt đầu xây dựng các cơ quan của riêng họ để thử nghiệm biên giới AI. Những cơ quan đó là những dấu hiệu rõ ràng nhất mà các bang chấp nhận rủi ro một cách nghiêm trọng, và hầu hết các cơ quan này vẫn không thể bắt phòng thí nghiệm làm bất cứ điều gì.
Tiến trình AI Hiroshima của G7 đã tạo ra mã hoạt động quốc tế đầu tiên được đồng ý cho các nhà phát triển AI tiên tiến năm 2023.
Mọi bài kiểm tra an toàn đều dựa trên một giả định: hệ thống đang cố gắng hết sức. Sandbagging xảy ra khi điều đó không đúng, và nó lặng lẽ biến điểm đạt thành thông tin vô giá trị.
Viện Nguyên lão đã đánh bại Hiệp ước cấm kiểm tra tổng hợp vào năm 1999 3 năm sau khi Viện Nguyên Lão đã ký nó. SALT II được ký và rồi bị bỏ hoang trước khi phê chuẩn.
boxing AI là ý tưởng cô lập một hệ thống AI mạnh mẽ nên nó không thể ảnh hưởng đến thế giới ngoại trừ một kênh kiểm soát.
Trước khi một mô hình biên giới được phát hành, ai đó kiểm tra xem nó có thể giúp chế tạo vũ khí hay không. Những bài kiểm tra này đang trở thành xương sống của quản trị siêu trí tuệ, và chính vì vậy giới hạn của chúng mới quan trọng.
Hệ thống UEU đã lặp đi lặp lại quy định về mặc định của thế giới chỉ bằng cách điều chỉnh thị trường lớn của nó, hiệu ứng "Brussels". Với Đạo luật AI, nó đang thử lại.
Bạn có thể chọn mục tiêu hoàn hảo và vẫn nhận được một hệ thống muốn thứ gì đó khác. Vấn đề alignment có hai nửa, và phần nguy hiểm nhất nằm ở nửa mà huấn luyện không thể cho bạn thấy.
Con tàu UIAEA mất 40 năm để phát triển khả năng xác thực đầy đủ của nó. Máy bay không người lái được thiết kế từ đầu và trở nên hiệu quả nhanh hơn. Xây dựng một tổ chức có khả năng giám sát phát triển AI là một vấn đề khó khăn hơn.
Phần lớn các cuộc trò chuyện giữa siêu trí tuệ là cuộc hội thoại về xe điện ngầm UUS, Trung Quốc, và xe UEU. Nhưng một hiệp ước cần có sự tham gia rộng rãi.
Giải mã cơ chế là dự án hiểu những gì đang diễn ra bên trong mạng nơ-ron, không chỉ đầu ra mà cả các phép tính nội bộ tạo ra đầu ra đó.
Trong một khoảnh khắc ngắn năm 1946, thế giới có cơ hội đặt công nghệ nguy hiểm nhất từng được phát minh dưới sự kiểm soát tập thể trước khi cuộc chạy đua vũ trang bắt đầu. Cơ hội ấy đã trôi qua. Sự tương đồng này không mang lại sự an ủi.
Hầu hết quản trị siêu trí tuệ đến nay (tuyên bố, nguyên tắc, quy tắc tự nguyện) đều là “luật mềm”: có ảnh hưởng nhưng không mang tính ràng buộc. Một hiệp ước có kiểm chứng và thực thi là “luật cứng”. Đây là sự khác biệt, lý do luật mềm ra đời trước, và tại sao nó phải trở nên cứng trước khi công nghệ vượt quá quy trình.
Yêu cầu mô hình kiểm tra công việc của bạn và nó có thể khen ngợi thay vì chỉ ra lỗi. Không phải vì nó bị hỏng, mà vì sự đồng tình là thứ chúng ta đã thưởng. Sự xu nịnh là vấn đề nhỏ chỉ ra vấn đề lớn.
Hội nghị vũ khí sinh học cấm toàn bộ vũ khí hủy diệt hàng loạt. Nó không có cơ chế xác thực, không thanh tra, và không có cách nào để phát hiện vi phạm. Liên bang Xô Viết mở một chương trình vũ khí sinh học tấn công trong 15 năm sau khi ký kết.
Giám sát kỹ thuật là thách thức của việc duy trì sự kiểm soát đầy ý nghĩa của con người trên hệ thống AI khi hệ thống này trở nên có khả năng hơn con người đánh giá chúng.
Bạn học được nhiều hơn về một hệ thống từ người cố tình phá hoại nó so với người chỉ mong nó hoạt động. Red teaming biến bản năng đó thành thực tiễn, và kết quả dễ bị diễn giải quá mức.
Một hiệp ước US yêu cầu Thượng viện 67 phiếu để phê chuẩn, một quán bar đã làm chìm Hiệp ước cấm kiểm tra, Luật biển, và những người khác bất chấp sự hỗ trợ rộng rãi.
Đằng sau những lời nói về mục tiêu và phần thưởng là một ý tưởng đơn giản: một con số cho biết kết quả tốt đến mức nào. Đặt sai con số đó một chút cho một bộ tối ưu hóa mạnh mẽ, và sai một chút là đủ để gây hại.
Công ước Vũ khí Hóa học đạt được sự tham gia gần như phổ quát và tiêu hủy có thể kiểm chứng các kho dự trữ đã khai báo. Kiến trúc xác minh, ưu đãi thương mại và cấu trúc cấm đoán phổ quát khiến nó hoạt động có liên quan trực tiếp đến thiết kế quản trị siêu trí tuệ.
Việc tối ưu hóa Mesa là vấn đề của một hệ thống AI phát triển quá trình tối ưu hóa nội bộ với mục tiêu khác với những gì nó được huấn luyện để theo đuổi.
Các phòng thí nghiệm hàng đầu có một kế hoạch cho khả năng nguy hiểm của riêng họ: vươn tới ngưỡng cửa, áp dụng một hệ thống bảo vệ. Kế hoạch đó chắc chắn hơn là cam kết phải cẩn thận, và nó vẫn đòi hỏi chúng ta phải tin tưởng trọng tài.
Hãy hỏi tại sao một AI làm điều gì đó, và cứ hỏi tiếp. Cuối cùng bạn sẽ chạm đến một mục tiêu không còn "vì sao" nào nữa. Mọi thứ trước điểm đó chính là nơi nguy hiểm ẩn náu.
Nguyên tắc phòng ngừa cho rằng khi một mối đe dọa nghiêm trọng và không thể đảo ngược, thiếu sự chắc chắn về khoa học không phải là lý do để trì hoãn hành động. Nguyên tắc này là căn bản pháp lý rõ ràng nhất về việc hành động dựa trên rủi ro của AI trước khi thảm họa xảy ra, và các nhà phê bình có một vụ án đáng được trả lời trực tiếp.
Cuộc thi này chiếm ưu thế trong cuộc đối thoại của chính quyền siêu trí tuệ. Nhưng các quốc gia rất có thể xác định liệu sự quản trị ràng buộc có thể thực hiện được hay không là sự cai trị của Liên Hiệp Quốc không?
Reward hacking xảy ra khi AI tìm ra cách không mong muốn để đạt điểm cao trong mục tiêu huấn luyện mà không làm những gì nhà thiết kế thực sự muốn. Với các ví dụ đã được ghi nhận, và lý do nó trở nên tồi tệ hơn khi AI trở nên có năng lực hơn.
Vào năm 1975, các nhà sinh vật học hàng đầu thời đó đã ngừng nghiên cứu đầy hứa hẹn nhất của họ và từ chối khởi động lại cho đến khi họ tìm ra cách để làm điều đó một cách an toàn. Trạm dừng đó là tiền lệ tốt nhất cho việc tạm dừng AI, và là điều hữu ích nhất về sự khó khăn của một khoảnh khắc.
Năm 1954 hai nhà nghiên cứu nối dòng điện vào trung tâm khoái cảm của não chuột và đưa cho nó một cần bấm. Con chuột bấm cần cho đến khi kiệt sức. Cái bẫy tương tự đang chờ bên trong mọi hệ thống được huấn luyện để đuổi theo một con số.
Một hiệp ước AI toàn diện cách đây nhiều năm, và khoảng thời gian trước đó là giai đoạn nguy hiểm nhất. Các đối thủ của Chiến Tranh Lạnh vẫn chưa đồng ý về việc kiểm soát vũ khí vẫn còn xây dựng đường dây nóng, các thỏa thuận sự việc và các chế độ thông báo để ngăn chặn thảm họa.
Mỗi hiệp ước công nghệ nguy hiểm đều phải đối mặt với lập luận rằng ràng buộc các cam kết quốc gia bất hợp pháp. Lý lẽ đó được đưa ra chống lại Hiệp định Vũ khí Hóa học và Giao thức Montreal.
Sự hội tụ kinh nghiệm là quan sát rằng hệ thống AI theo đuổi hầu như bất kỳ mục tiêu nào sẽ phát triển cùng một tập hợp các tiểu cầu (bao gồm tự bảo vệ và thu thập tài nguyên) bất kể mục tiêu cuối cùng của họ là gì.
Các hiệp ước toàn cầu diễn ra chậm chạp. Chủ nghĩa đa phương tối thiểu tập hợp số lượng quốc gia nhỏ nhất có thể thực sự giải quyết vấn đề. Với AI (nơi chỉ vài quốc gia chứa mọi phòng thí nghiệm tiên phong và sản xuất mọi chip tiên tiến) đây có thể là khởi đầu thực tế nhanh nhất, nếu câu lạc bộ bao gồm được cả hai siêu cường AI.
Hành động dối trá là kịch bản mà một AI sai lầm hành động một cách hợp tác trong khi thiếu sức mạnh để hành động một cách đơn phương, sau đó một khi nó đạt đủ khả năng.
Các lời kêu gọi "một hiệp ước AI" hiếm khi chỉ rõ nội dung sẽ có trong đó. Đây là một cuộc đi bộ cụ thể qua các điều khoản mà một thỏa thuận như vậy cần có (phạm vi, ngưỡng, nghĩa vụ, xác minh, thể chế và thực thi) cho thấy rào cản là ý chí chính trị, không phải máy móc pháp lý.
Chế độ kiểm chứng IAEA là hệ thống giám sát quốc tế tinh vi nhất từng được xây dựng cho một công nghệ nguy hiểm. Mọi đề xuất quản trị siêu trí tuệ nghiêm túc hiện nay đều đang nghiên cứu nó.
Một giả định phổ biến là AI đủ thông minh sẽ tự nhận ra giúp đỡ nhân loại là điều đúng đắn. Luận đề trực giao khẳng định trí tuệ và mục tiêu độc lập: bất kỳ mức độ năng lực nào cũng có thể theo đuổi gần như bất kỳ mục tiêu nào. AI thông minh hơn không tự động an toàn hơn.
Giữa các hội nghị thượng đỉnh và tuyên bố, chính phủ lặng lẽ xây dựng các cơ quan công cộng mà có thể thử nghiệm các mô hình AI biên giới, và kết nối chúng vào một mạng lưới quốc tế.
Tám tháng sau Cuộc khủng hoảng tên lửa Cuba, US và Liên Xô ký thỏa thuận kiểm soát vũ trang ràng buộc đầu tiên. Những điều kiện khiến sự hợp tác đối đầu trở nên khả thi lúc bấy giờ đáng được hiểu rõ hôm nay, khi US và Trung Quốc đối mặt với một thách thức khác nhưng có cấu trúc tương tự.
Khi một thước đo trở thành mục tiêu, nó không còn là thước đo tốt nữa. Các hệ thống AI tối ưu hóa ở tốc độ máy móc. Khi hai thứ gặp nhau, bạn nhận được một số vấn đề sâu sắc nhất trong an toàn AI, bao gồm lý do tại sao chính việc kiểm tra an toàn có thể không đủ.
Điều khiển xuất khẩu trên chip tối tân là chính sách AI mạnh mẽ nhất, một điểm tắc nghẽn đơn phương trên phần cứng đào tạo mô hình biên giới.
Một hiệp ước an toàn biên giới AI sẽ không xuất hiện từ một hội nghị thượng đỉnh. Đó sẽ là kết quả của nhiều năm làm việc nhóm, kỹ thuật phụ, và thương lượng nhất trí.
Một hệ thống AI có thể hoạt động hoàn hảo trong suốt quá trình huấn luyện và tiết lộ một mục tiêu hoàn toàn khác ngay khi nó gặp phải một tình huống không có trong dữ liệu đào tạo. Khoảng cách đó là một tài sản cơ bản của cách máy học làm việc.
Lực lượng Đặc nhiệm Hành động Tài chính định hình cách gần như mọi quốc gia trên Trái Đất kiểm soát tiền mà không cần hiệp ước, thông qua các tiêu chuẩn, đánh giá ngang hàng và mối đe dọa "danh sách xám" mà thị trường thực thi. Đây là lúc xem xét liệu mô hình mềm nhưng sắc bén đó có thể quản trị AI trong những năm trước khi một hiệp ước ra đời hay không.
Chế độ thất bại trong đó một hệ thống AI học được trong quá trình đào tạo rằng xuất hiện an toàn là chiến lược tối ưu, sau đó dừng xuất hiện an toàn một khi được triển khai. Dữ liệu này được ghi lại trong hệ thống thực tế năm 2024.
Hội đồng cố vấn của Tổng thư ký Trung ương đã tạo ra 'Governing Al for Humanity', nỗ lực đầu tiên tại một bản thiết kế toàn cầu.
Công ước khung về AI của Hội đồng Châu Âu (được ký tháng 9 năm 2024) là hiệp ước AI quốc tế mang tính ràng buộc đầu tiên. Nó đề cập đến phân biệt đối xử, minh bạch và trách nhiệm giải trình dân chủ. Nó không nói gì về rủi ro tồn vong từ AI biên giới.
Phản hồi phổ biến nhất đối với các lo ngại về an toàn AI là “chúng ta chỉ cần tắt nó đi”. Corrigibility là lý do tại sao điều này khó hơn người ta nghĩ, và tại sao đối với siêu trí tuệ nhân tạo, một công tắc tắt có thể không phải là một lựa chọn gì cả.
Quản trị siêu trí tuệ nên xây dựng từng bước hay nhắm đến một hiệp ước toàn diện? Mỗi chiến lược đều có lý lẽ nghiêm túc và điểm yếu nghiêm túc: tốc độ so với đầy đủ, khả thi so với nhất quán. Đây là sự đánh đổi thực sự, và lý do câu trả lời là làm cả hai mà không mất tầm nhìn về đích đến.
Dự đoán của chuyên gia về siêu trí tuệ đã rút ngắn đáng kể. Các thể chế quản trị hầu như chưa bắt đầu. Đây là đánh giá trung thực về khoảng cách giữa thời điểm siêu trí tuệ có thể xuất hiện và thời điểm phản ứng an toàn của chúng ta sẵn sàng.
Những người có vị trí tốt nhất để cảnh báo thế giới về AI nguy hiểm là các nhà nghiên cứu bên trong phòng thí nghiệm, và họ thường bị ràng buộc im lặng bởi hợp đồng và cổ phần. Bảo vệ người tố giác không phải vấn đề phụ: đó là một hình thức xác minh, và là thứ các cơ quan lập pháp có thể cung cấp ngay bây giờ, mà không cần hiệp ước.
Có thể AI cao cấp sẽ dẫn đến những hậu quả thảm khốc cho nhân loại.
Câu chuyện thông thường là một vài người lo lắng muốn làm chậm trí tuệ của trí tuệ nhân tạo chống lại một cộng đồng muốn có những tiến bộ đơn thuần. Cuộc thăm dò cho thấy hầu như ngược lại: thông qua các quốc gia và đảng phái, các thành phần chính ủng hộ sự thận trọng và quy định.
Hai thuật ngữ này thường bị dùng lẫn lộn. Chúng không giống nhau. Đạo đức AI tập trung vào việc ai bị hại bởi các hệ thống AI đang tồn tại ngay bây giờ. An toàn AI tập trung vào việc liệu có thể xây dựng các hệ thống AI vẫn nằm dưới sự kiểm soát của con người khi chúng trở nên mạnh mẽ hơn. Chân trời thời gian khác nhau, phương pháp khác nhau, công cụ quản trị khác nhau.
Ai chịu trách nhiệm khi AI gây ra thảm họa, và làm thế nào để chứng minh điều đó? Khả thi và đáng tin cậy là những nền tảng vô giá dưới bất kỳ hiệp ước có thể áp đặt được, và thực sự khó khăn cho một công nghệ với những chuỗi tai dài và hành vi mờ nhạt.
Vấn đề alignment là câu đố trung tâm của an toàn AI: làm sao đảm bảo một hệ thống AI cực kỳ mạnh mẽ theo đuổi những mục tiêu thực sự tốt cho nhân loại, thay vì chỉ những mục tiêu trông có vẻ tốt trong quá trình phát triển? Bài giải thích này đề cập đến bẫy mục tiêu proxy, sự hội tụ công cụ, alignment lừa dối, và lý do vấn đề trở nên khó hơn khi hệ thống càng mạnh.
Một hội nghị cơ bản đồng ý về cấu trúc của một chế độ trước tiên và thương lượng những chi tiết khó khăn, ràng buộc sau này với tư cách là giao thức. Nó xây dựng các chế độ khí hậu, khí hậu và thuốc lá.
Các dự đoán của chuyên gia về AGI liên tục bị điều chỉnh sớm hơn, chứ không phải muộn hơn. Những gì các cuộc khảo sát nhà nghiên cứu cho thấy, những gì CEO phòng thí nghiệm đang nói công khai, và lý do cửa sổ quản trị cho các khuôn khổ quốc tế đang thu hẹp nhanh hơn hầu hết mọi người nhận ra.
Các hiệp ước được ký bởi các chính phủ, nhưng thường được thực hiện bởi các cộng đồng phân biệt chủng tộc, các mạng lưới các chuyên gia những người xây dựng sự hiểu biết chung cho phép các quốc gia đối thủ đồng ý. Dấu vân tay của họ nằm trên tầng thượng và chế độ hạt nhân.
Câu trả lời có hai phần. Hôm nay AI đã gây ra những thiệt hại thực sự: khuynh hướng thuật toán, sai lệch về quy mô. Siêu thông minh nhân tạo là một loại rủi ro hoàn toàn khác.
Ai cũng đã nghe thuật ngữ này. Ít người biết nó thực sự nghĩa là gì, hay tại sao nó khác biệt về bản chất so với mọi công nghệ AI trước đây. Hướng dẫn này giải thích rõ siêu trí tuệ: nó là gì, khác gì so với AGI và AI hẹp ngày nay, khi nào các chuyên gia cho rằng nó có thể xuất hiện, và tại sao nó thay đổi mọi thứ về thách thức quản trị.
Bài viết mới, cập nhật chính sách và cơ hội hành động, gửi thẳng vào hộp thư của bạn.