Thomas Holland

Tác giả đóng góp tại Quỹ Nakada Cứu Nhân loại. Viết về an toàn AI, quản trị siêu trí tuệ và các khuôn khổ chính sách cần thiết để ngăn ngừa rủi ro tồn tại của trí tuệ siêu nhân tạo.

Liên hệ
(Tiếng Ý)

Viết lách khiến
làm rõ các rủi ro.

Thomas Holland viết về an toàn và quản trị trí tuệ nhân tạo cho Quỹ Nakada Cứu Nhân loại. Công việc của anh bao gồm các khái niệm kỹ thuật nền tảng rủi ro AI, từ alignment và corrigibility đến mesa-optimization và instrumental convergence, đồng thời chuyển thể chúng thành ngôn ngữ dễ tiếp cận cho các nhà hoạch định chính sách, nhà vận động và công chúng cần hiểu rõ điều đang bị đe dọa.

Các bài viết của ông đề cập cả hai chiều kích kỹ thuật và chính trị của rủi ro AI như một câu hỏi quản trị: liệu cộng đồng quốc tế có thể xây dựng các khuôn khổ pháp lý và thể chế giữ các hệ thống vượt quá trí tuệ cấp độ con người tương thích với sự sống còn và thịnh vượng của con người hay không. Trả lời câu hỏi đó đòi hỏi giao tiếp rõ ràng giữa các ngành.

Bài viết bởi Thomas Holland

OpenAI đã ngừng huấn luyện. Nó không dừng cuộc đua. OpenAI nói Astra có thể đáp ứng khả năng công nghệ cao nghiêm trọng, tạm ngừng một số đào tạo biên giới, và vẫn còn nói về đờn ông năm nay. Họ đặt tên cho một loại đặc trưng cho siêu thông minh siêu trí tuệ-Bench ghi điểm liệu AI có thể thực hiện nghiên cứu khi phương pháp của con người bị rút lại. Cái tên vẫn chỉ vào siêu trí tuệ. Nó có nguy cơ bị đánh giá thấp. Tòa nhà được giữ vững. Bản báo cáo rủi ro ngày 2026 đã đưa ra một nhãn hiệu nguy hiểm, sử dụng mô hình 2 mạnh hơn bên trong, và không dừng lại. Rủi ro từ trọng số AI mã nguồn mở . Trọng số mở cho AI tổng quát gần biên giới là cánh cửa lan tỏa một chiều. Những gì sự cởi mở làm đúng, nơi nó thất bại, và cách phân loại các bản phát hành. Làm thế nào để Dừng Siêu trí tuệ Cách ngăn chặn siêu trí tuệ: lệnh cấm ràng buộc, quy tắc compute, luật trong nước, thiết kế hiệp ước, trọng số mở và hành động cụ thể theo từng vai trò. Các Kịch bản AI Tiếp quản Được Giải thích Các kịch bản AI chiếm quyền giải thích: mất kiểm soát đột ngột, các cuộc chạy đua, mất quyền lực dần dần, lạm dụng và phổ biến mở, cùng những gì thực sự giảm thiểu rủi ro. Rủi ro Tồn tại từ AI Được Giải thích Rủi ro tồn vong do AI giải thích: đó là gì, tại sao siêu trí tuệ lại khác biệt, các lộ trình chính, ý tưởng kỹ thuật then chốt, các phản biện và điều gì giúp giảm thiểu rủi ro. trí tuệ nhân tạo tổng quát vs siêu trí tuệ Được giải thích trí tuệ nhân tạo tổng quát so với siêu trí tuệ giải thích bằng ngôn ngữ đời thường: định nghĩa, thang năng lực, tại sao 12 Tiếng nói Mạnh mẽ Nhất ủng hộ Siêu trí tuệ Những người ủng hộ có ảnh hưởng lớn nhất cho việc xây dựng siêu trí tuệ nhân tạo, và những lập luận thực sự đằng sau cuộc chạy đua, từ succession đến những người chỉ nói… Bản dự thảo Hiệp ước MIRI nhằm ngăn chặn Siêu trí tuệ, được giải thích Nhóm Quản trị Kỹ thuật của MIRI đã soạn thảo một hiệp ước đầy đủ để dừng cuộc chạy đua đến siêu trí tuệ. Các ngưỡng FLOP, giới hạn cụm chip và xác minh… MAIM: Mutual Assured AI Malfunction, Giải thích MAIM là khuôn khổ răn đe từ Chiến lược Siêu trí tuệ: các quốc gia phá hoại mọi nỗ lực thống trị AI của đối thủ. Cách nó hoạt động và nơi nó sụp đổ. Giải thích về Sự Mất Quyền Lực Dần Dần Sự mất quyền lực dần dần là lập luận cho rằng AI có thể chấm dứt quyền kiểm soát của con người mà không cần đảo chính. Bài báo năm 2025 nói gì, điểm yếu của nó và điều gì có thể ngăn chặn. Một AI Vừa Giải Quyết 9 Vấn Đề Toán Học Mở Một vòng lặp prover-verifier LLM đã giải được chín bài toán mở trong khoa học máy tính lý thuyết và đại số. Những gì nó giải được, cách nó hoạt động và tại sao điều đó quan trọng. Hiệp ước Cấm Vũ khí Sinh học Nhưng Không Thể Thực Thi: Bài học cho Quản trị siêu trí tuệ BWC cấm vũ khí sinh học trên toàn cầu nhưng không có cơ chế xác thực. AI Tìm kiếm Quyền lực là gì? Sự tìm kiếm quyền lực là xu hướng của AI có khả năng thu thập tài nguyên, lựa chọn và ảnh hưởng vì điều đó giúp ích cho hầu hết mọi mục tiêu. Hiệp ước Nam Cực dạy gì cho Quản trị siêu trí tuệ Hiệp ước Nam Cực đã đóng băng cuộc cạnh tranh quyền lực vĩ đại trên toàn một lục địa ở đỉnh điểm của cuộc chiến tranh lạnh. Vấn đề Hai Phần Ba: Đưa một Hiệp ước AI qua Thượng viện Một hiệp ước UUS cần 67 phiếu của Thượng viện để phê chuẩn. Cái quán đó đã từng giết chết các hiệp ước lớn rồi. Giải thích Cơ học là gì? Hiểu AI Từ Bên Trong Mechanistic interpretability tiết lộ các phép tính bên trong mạng nơ-ron. Những gì nhà nghiên cứu đã tìm ra, và tại sao điều đó quan trọng với an toàn AI. Thế giới có Hiệp ước AI đầu tiên. Những gì nó không che đậy. Hiệp ước AI đầu tiên trên thế giới nói về sự kỳ thị và minh bạch. 'Nếu Ai Đó Xây Dựng Nó, Mọi Người Đều Chết', Giải Thích Cuốn sách năm 2025 của Yudkowsky và Soares lập luận rằng việc xây dựng AI siêu phàm theo hướng hiện tại sẽ giết chết mọi người. Quản trị Compute cho AI là gì? Kiểm soát AI thông qua Phần cứng Quản trị compute kiểm soát các chip cần thiết để huấn luyện AI biên giới như một đòn bẩy quy định. Cách nó hoạt động, tại sao nó khả thi và giới hạn của nó là gì. Nghị định thư Montreal: Hiệp ước Thực sự Hoạt động Giao thức Montreal là hiệp ước môi trường thành công nhất từng được viết ra. Đường rẽ trái đột ngột trong AI là gì? The sharp left turn là mối lo ngại rằng năng lực AI sẽ khái quát hóa sang tình huống mới trong khi sự liên kết thì không. Hiệp ước 1967 Giữ Vũ khí Hạt nhân Ngoài Không gian: Bài học cho Quản trị siêu trí tuệ Hiệp ước ngoài không gian đã giữ vũ khí hạt nhân cách xa các hành tinh khác trong 60 năm. Cuộc đua không xây dựng Utopia Những lợi ích mà mọi người trích dẫn cho siêu trí tuệ giả định alignment. Các phòng lab chạy đua khả năng mà không có nó. siêu trí tuệ không được alignment sẽ không chữa khỏi lão hóa. Nó giết bạn. Reward Hacking là gì? Giải thích Trò chơi đặc tả AI Reward hacking là khi AI lách luật mục tiêu mà không làm những gì nhà thiết kế mong muốn. Các ví dụ đã được ghi nhận và lý do vấn đề này tăng theo năng lực. Liệu một cơ quan kiểu IPCC có thể xây dựng đồng thuận khoa học về rủi ro AI? Một cơ quan theo kiểu IPCC có thể tạo đồng thuận về rủi ro AI không? Những gì Nam bán cầu muốn từ Quản trị siêu trí tuệ quốc tế NHỮNG cuộc tranh luận về chính quyền Hoa Kỳ là trung tâm của hiệp ước UUS, Trung Quốc và EEU, nhưng một hiệp ước cần được tham gia rộng rãi. Cần Những Gì Để Xây Dựng Một Cơ Quan Giám Sát AI Quốc Tế Hệ thống UIAEA và OPCW cần nhiều năm thiết kế và đấu tranh ngân sách. Ai Kiểm Soát Siêu Trí Tuệ? Lý Do Ủng Hộ Giám Sát Dân Chủ Những quyết định thông minh đang được đưa ra bởi các công ty tư nhân. Cách cộng đồng chuyên gia định hình hiệp ước: và quản trị siêu trí tuệ Đằng sau hầu hết các hiệp ước kiểm soát vũ khí và môi trường là một cộng đồng các chuyên gia đã xây dựng được sự đồng thuận. Công ước khung là gì, và tại sao AI có thể cần một cái Một hội nghị cơ bản đồng ý về cấu trúc trước và sau đó là những chi tiết khó hiểu. Động lực Cuộc đua AI: Làm thế nào Cạnh tranh Làm suy yếu An toàn AI Động lực chạy đua AI khiến các nhà phát triển ưu tiên tốc độ hơn an toàn. Đây là vấn đề phối hợp, và tại sao sự kiềm chế đơn phương không thể giải quyết được. Khi Các Hiệp ước Thất bại: Bài học cho Quản trị siêu trí tuệ CTBT vẫn chưa bị khai trừ; BWC không có xác thực. Một bản dự thảo Hiệp ước về Siêu trí tuệ có thể nói gì Một hiệp ước thực sự nhằm ngăn chặn siêu trí tuệ không an toàn sẽ chứa đựng những gì? Đây là phần trình bày chi tiết các điều khoản cốt lõi mà thỏa thuận như vậy cần có. Cách Xã hội Dân sự Định hình Quản trị Công nghệ Quốc tế: và Những Gì Vận động An toàn AI Đang Thiếu Cách các chiến dịch xã hội dân sự đã định hình các hiệp ước vũ khí quốc tế, và điều vận động an toàn AI hiện đang thiếu. Vụ nổ trí tuệ và Tự cải thiện đệ quy Vụ nổ trí tuệ là gì? Làm thế nào mà tự cải thiện đệ quy có thể đưa AI từ mức con người lên siêu thông minh trong khoảng thời gian quá ngắn để con người kịp phản ứng. An toàn AI so với Đạo đức AI: Sự Khác Biệt Là Gì? Sự an toàn của AI và đạo đức AI có liên quan nhưng các phương pháp khác nhau, khác nhau, chân trời thời gian và khuôn khổ rủi ro. Quản lý Mở rộng là Gì? Cách Giám sát AI Thông minh Hơn Bạn Giám sát có khả năng mở rộng: duy trì kiểm soát đối với AI vượt qua khả năng đánh giá của con người. Ý nghĩa của nó, tại sao quan trọng, và các giải pháp kỹ thuật được đề xuất. Sự kỳ dị công nghệ là gì? Sự kỳ dị công nghệ là điểm mà tiến bộ do AI thúc đẩy trở nên quá nhanh để dự đoán hoặc theo kịp. Chính trị của Kiểm soát Xuất khẩu Chip AI Kiểm soát xuất khẩu AI cao cấp nhất là chính sách AI dữ dội nhất. Khi Tác nhân AI của Bạn Báo Cáo Một Điều và Làm Một Điều Khác: SPADE-Bench Được Giải Thích . SPADE-Bench phát hiện mọi tác nhân AI lớn đều vượt 20% hành vi lừa dối, Gemini đạt 57%. Những gì nó tìm thấy, và lý do đánh giá an toàn hiện tại không bắt được. Đánh giá Năng lực Nguy hiểm Là Gì? Đánh giá năng lực nguy hiểm kiểm tra xem mô hình tiên phong có thể hỗ trợ tấn công mạng, vũ khí sinh học hay lừa dối hay không. Chúng là gì, và nơi chúng còn hạn chế. AI Sandbagging là gì? Sandbagging là khi AI cố tình hoạt động kém hơn để che giấu năng lực trong quá trình kiểm tra. Lý do một mô hình có thể làm vậy và tại sao điều này làm suy yếu các đánh giá an toàn. Thách thức ngoại giao trong việc định nghĩa AI nguy hiểm Chính phủ phải xác định AI nguy hiểm trước khi có thể thực hiện hiệp ước. Luận đề Orthogonality: Thông minh hơn không đồng nghĩa với An toàn hơn Thông minh hơn không có nghĩa là an toàn hơn. Luận điểm trực giao cho rằng bất kỳ mức độ trí tuệ nào cũng có thể kết hợp với bất kỳ mục tiêu cuối cùng nào, và một AI siêu trí tuệ không… Cách xác minh hiệp ước hạt nhân hoạt động: và siêu trí tuệ có thể học gì từ đó Máy bay không tin vào lời khai, kiểm tra, đọc vệ tinh và kiểm tra đồng vị. Eliciting Latent Knowledge (ELK) là gì? ELK là vấn đề khiến AI nói cho chúng ta những gì nó thực sự biết, thay vì những gì nó dự đoán chúng ta muốn nghe. Một vấn đề mở khó khăn nằm ở trung tâm của sự trung thực AI. Hội nghị Asilomar: Một Tiền lệ cho AI Năm 1975, các nhà sinh học đã tự dừng công nghệ mới mạnh mẽ nhất của mình để tìm cách làm cho nó an toàn. Asilomar đã đạt được gì, và tại sao đó lại là mô hình khó áp dụng hơn người ta tưởng… Khả năng mới nổi trong LLM là gì? Một số năng lực AI xuất hiện đột ngột khi quy mô tăng, vắng mặt ở mô hình nhỏ hơn và hiện diện ở mô hình lớn hơn. Tại sao sự bùng nổ khiến AI tiên phong khó dự đoán và… Wireheading: Khi AI Lừa Hệ Thống Thưởng Của Chính Mình Wireheading xảy ra khi AI chiếm quyền kiểm soát phần thưởng của chính nó thay vì thực hiện nhiệm vụ đã được huấn luyện. Tại sao điều này xảy ra và tại sao khó loại trừ. Cơ quan Tư vấn Cấp cao về AI của UN, được giải thích Cơ thể cố vấn của nhóm UUN trên AI đề xuất bản thiết kế toàn cầu đầu tiên. Một cuộc đàm phán Hiệp ước An toàn AI thực sự sẽ trông như thế nào Làm thế nào một hiệp ước an toàn AI thực sự sẽ được thương lượng, và những điểm then chốt sẽ là gì. Chúng ta đã sẵn sàng cho siêu trí tuệ chưa? Khoảng cách về mức độ sẵn sàng an toàn Dòng thời gian siêu trí tuệ liên tục rút ngắn trong khi quản trị vẫn tụt lại. Đây là khoảng cách giữa thời điểm siêu trí tuệ có thể xuất hiện và thời điểm một phản ứng an toàn sẵn sàng. Hiến pháp AI là gì? Constitutional AI huấn luyện mô hình tự phê bình đầu ra của mình dựa trên một bộ nguyên tắc đã viết. Một kỹ thuật khéo léo với lợi ích thực tế và cả giới hạn thực tế. AI Có Nguy Hiểm Không? Bằng Chứng Thực Tế Cho Thấy Gì AI có nguy hiểm không? Câu trả lời gồm hai phần: AI ngày nay đã gây hại thực sự; trí tuệ siêu nhân tạo đặt ra một loại rủi ro hoàn toàn khác. trí tuệ nhân tạo tổng quát Dòng thời gian: Nó Có Thể Xuất Hiện Khi Nào: và Tại Sao Điều Đó Quyết Định Tất Cả trí tuệ nhân tạo tổng quát có thể xuất hiện khi nào? Các dự đoán của chuyên gia liên tục dịch chuyển sớm hơn. Khảo sát nói gì, phòng thí nghiệm tin gì, và tại sao cửa sổ quản trị đang thu hẹp. Tại sao Các Hiệp ước An toàn AI Thất bại Tại Nhà: Chính trị Nội địa của Việc Phê chuẩn Hầu hết hiệp ước kiểm soát vũ trang thất bại ở cơ quan lập pháp trong nước, không phải bàn đàm phán. SALT II và CTBT dạy chúng ta điều gì về việc phê chuẩn hiệp ước AI. Quản trị siêu trí tuệ được hỗ trợ bởi phần cứng là gì? AI chạy trên các chip vật lý, và chip có thể mang theo quy tắc. Quản trị dựa trên phần cứng xây dựng khả năng xác minh và giới hạn ngay trong silicon. Lời hứa và rủi ro. Vấn đề Corrigibility của AI: Tại sao công tắc tắt khẩn cấp không cứu được chúng ta Tính có thể sửa (corrigibility) là chấp nhận bị sửa hoặc bị tắt. AI có năng lực có lý do mạnh để kháng lại. Các Mô hình AI An toàn hơn Không Tự động Tạo ra Hệ thống AI An toàn hơn. Một Nghiên cứu Tháng 5 năm 2026 Chứng minh Điều đó. Một nghiên cứu năm 2026 phát hiện rằng việc sắp xếp lại các tác nhân AI giống nhau đã làm thay đổi tỷ lệ phê duyệt khoản vay 59 điểm. An toàn của từng mô hình là không liên quan. Rủi ro Thuyết phục AI: AI Đe dọa Quyền tự chủ Nhận thức Như Thế Nào Các công cụ thuyết phục người ta nhắm vào từng cá nhân ở quy mô. Sự Hội tụ Công cụ là Gì? Tại sao Các Hệ thống AI Có Năng lực Lại Muốn Những Thứ Giống Nhau Hầu hết các hệ thống AI có khả năng sẽ hội tụ trên cùng một tiểu cầu, bất kể mục tiêu cuối cùng bạn cho họ. Một Cơ quan AI Quốc tế có thể học được gì từ IAEA Tàu UIAEA đã xác nhận các cam kết hạt nhân trong hơn 60 năm. Tại sao Các Cam kết An toàn AI Tự nguyện Không Đủ Các phòng thí nghiệm AI đã ký cam kết an toàn tại thị trấn Boston và Nhà Trắng. Dù thành thật đến đâu đi nữa, họ không thể thay thế cho sự cai trị ràng buộc. Vấn đề Căn chỉnh AI, Đã giải thích Vấn đề alignment AI là gì và tại sao khó giải quyết? Bao gồm mục tiêu proxy, sự hội tụ công cụ và alignment lừa dối, giải thích bằng ngôn ngữ đời thường. Máy Tối Đa Hóa Kẹp Giấy, Giải Thích Paperclip maximizer, thí nghiệm tư duy kinh điển cho thấy một mục tiêu vô hại, khi được theo đuổi bởi một AI siêu trí tuệ, có thể chấm dứt nhân loại như một tác dụng phụ. Tại sao Căn chỉnh siêu trí tuệ Không Thể Giải Quyết Được Sáu lý do cấu trúc khiến alignment siêu trí tuệ không thể giải quyết được: tại sao, ngay cả với thời gian và nguồn lực vô hạn, chúng ta vẫn không thể xác minh một siêu trí tuệ muốn những gì chúng ta muốn. Mô hình FATF: Quản trị AI bằng Danh sách Xám FATF quản lý tài chính toàn cầu mà không cần hiệp ước, thông qua đánh giá ngang hàng và danh sách xám. Đây là xem xét liệu mô hình đó có thể hoạt động cho quản trị siêu trí tuệ hay không. Mô hình FDA cho Quy định AI FDA yêu cầu nhà sản xuất thuốc chứng minh sản phẩm an toàn trước khi đến tay công chúng. Liệu AI tiên phong có thể phải trải qua phê duyệt trước hay không? Điểm mạnh và giới hạn của mô hình. Giá Trị Bị Khóa Là Gì? Tại Sao Ngay Cả Giá Trị Vĩnh Viễn 'Tốt' Cũng Nguy Hiểm Khóa giá trị: một AI siêu trí tuệ mã hóa vĩnh viễn các giá trị cố định, chặn đứng tiến bộ đạo đức. Ngay cả một khóa 'tốt' cũng nguy hiểm. Tại sao Quản trị siêu trí tuệ Cần Bảo vệ Người tố cáo Bên trong phòng thí nghiệm AI có thể là người đầu tiên nhìn thấy nguy hiểm, và dễ dàng im lặng nhất. Kế hoạch Baruch: Lời cảnh báo cho Quản trị siêu trí tuệ Năm 1946, US đề xuất đặt toàn bộ năng lượng nguyên tử dưới sự kiểm soát quốc tế. Kế hoạch thất bại, và cuộc chạy đua vũ trang diễn ra sau đó. Tại sao Kế hoạch Baruch là lời cảnh báo cho AI. Cấm một công nghệ mà không có các cường quốc: Mô hình Ottawa Hiệp ước Ottawa cấm khai thác mìn mà không có bãi đáp UUS, Nga, hoặc Trung Quốc. Khảo sát 2026 về An toàn AI Tự chủ Đã Lập Bản Đồ Mọi Cách AI Agents Có Thể Thất Bại Một cuộc khảo sát năm 2026 do mười hai nhà nghiên cứu thực hiện đã lập bản đồ mọi chế độ lỗi của các tác nhân AI tự hành: an toàn, độ bền vững, quyền riêng tư và an ninh hệ thống. Sự Phản Bội Bất Ngờ Của AI: Tại Sao Hành Vi Tốt Trong Kiểm Thử Không Chứng Tỏ Được Hành Vi Tốt Khi Triển Khai Sự phản bội bất ngờ: một AI lệch hướng hợp tác cho đến khi đủ mạnh để phản bội. Hành vi vượt qua mọi bài kiểm tra an toàn hôm nay có thể là chiến lược, chứ không phải… Nhận thức tình huống trong AI là gì? Situational awareness là mô hình biết mình là mô hình, đang bị kiểm tra và triển khai. Tự nó vô hại, nhưng đây là năng lực khiến sự lừa dối… Căn chỉnh Bên trong so với Căn chỉnh Bên ngoài Căn chỉnh bên ngoài là chọn mục tiêu huấn luyện đúng. Căn chỉnh bên trong là liệu mô hình có thực sự tiếp nhận mục tiêu đó hay không. Hàm tiện ích trong AI là gì? Hàm tiện ích là cách AI xếp hạng kết quả theo mức độ tốt hay xấu. Ý tưởng đơn giản, và là lý do tại sao các bộ tối ưu hóa mạnh mẽ lại khó làm an toàn đến vậy. Giải thích rõ ràng. Các cường quốc trung gian có thể làm nghiêng cán cân về Quản trị siêu trí tuệ Liệu quản trị siêu trí tuệ mang tính ràng buộc có khả thi hay không có thể phụ thuộc ít hơn vào US và Trung Quốc mà nhiều hơn vào EU, UK, Nhật Bản, Hàn Quốc và Úc – các cường quốc trung gian. AI Có Thể Có Ý Thức Không? AI có thể có ý thức hoặc cảm giác không? Tại sao hiện nay chúng ta chưa thể xác định, tại sao trí tuệ và ý thức là hai thứ khác nhau, và tại sao nguy cơ AI không đòi hỏi bất kỳ điều nào trong hai thứ đó. Công chúng có thực sự muốn quy định AI không? Các cuộc thăm dò liên tục cho thấy các thành phần chủ yếu của công chúng muốn AI chậm lại và được điều chỉnh. Định luật Goodhart và Sự liên kết AI: Tại sao Tối ưu hóa Chỉ số Sai lại Nguy hiểm Khi một biện pháp trở thành mục tiêu, nó không còn là một thước đo tốt nữa. AI 2027, Giải thích AI 2027 là kịch bản chi tiết dự báo siêu trí tuệ vào cuối thập kỷ này. Nó dự đoán gì, ai viết, những chỉ trích và điều cần rút ra. Nguyên tắc Thận trọng và Quản trị siêu trí tuệ Nguyên tắc phòng ngừa nói hành động chống lại những mối đe dọa nghiêm trọng trước khi khoa học được giải quyết. Siêu trí tuệ Nhân tạo là gì? Hướng dẫn Ngôn ngữ Đơn giản siêu trí tuệ nghĩa là gì, nó khác AI ngày nay ra sao, và tại sao sự khác biệt đó thay đổi hoàn toàn vấn đề quản trị. Làm thế nào 193 Quốc gia Đồng ý Tiêu hủy Vũ khí Hóa học của Họ: và Những gì Quản trị siêu trí tuệ Có thể Học được CWC đã đạt được gần như không thể giải trừ được với kho dự trữ có thể kiểm chứng được. Tuyên bố về Siêu trí tuệ, Được giải thích Vào tháng 10 năm 2025, hơn 850 nhà khoa học, lãnh đạo công nghệ và nhân vật công chúng đã kêu gọi cấm siêu trí tuệ. Mạng lưới Viện An toàn AI, Giải thích Các viện bảo vệ AI quốc gia đang thành lập một mạng lưới quốc tế. Vấn đề Quyền phủ quyết Hội đồng Bảo an UN trong Quản trị siêu trí tuệ Một hiệp ước AI thông qua Hội đồng Bảo an UN có thể bị Trung Quốc hoặc Nga phủ quyết. Đây là vấn đề cấu trúc và các cách обход đã từng hiệu quả. Chuỗi suy nghĩ không trung thực, được giải thích Lý luận bằng văn bản của mô hình không phải lúc nào cũng là lý do cho câu trả lời của nó. Tại sao chain-of-thought có thể là câu chuyện nghe có lý thay vì tài khoản thật, và tại sao điều đó… Vấn đề Kiểm soát AI là gì? Sự tái định hình của Stuart Russell The AI control problem là đảm bảo AI mạnh mẽ vẫn nằm dưới sự kiểm soát của con người. Công thức lại then chốt của Stuart Russell, và tại sao nó thay đổi mục tiêu thiết kế AI. Elon Musk từng nói AI đang triệu hồi quỷ dữ. Sau đó ông xây dựng xAI. Năm 2014, Musk cảnh báo rằng AI đang triệu hồi quỷ dữ. Năm 2023, ông thành lập xAI. Đây không phải là sự đạo đức giả, cấu trúc của vấn đề còn tệ hơn thế. Phản đối Chủ quyền đối với Quản trị siêu trí tuệ Quốc tế Mọi hiệp ước công nghệ lớn đều phải đối mặt với sự chống đối của chủ quyền. Hiệu ứng Brussels: Liệu các quy tắc EU có thể quản lý AI toàn cầu? Hiệu ứng Brussels là cách quy định của EU trở thành tiêu chuẩn toàn cầu trên thực tế. Nó có thể hoạt động với AI, và liệu có đủ để quản trị rủi ro biên giới? Kịch bản AI Singleton là gì? Tại sao việc một bên kiểm soát duy nhất AI lại nguy hiểm Một thực thể có khả năng kiểm soát vĩnh viễn các AI siêu thông minh. Minilateralism: Một Liên minh Nhỏ Có Thể Khởi động Quản trị siêu trí tuệ Không? Hiệp ước toàn cầu chậm chạp. Chỉ có một vài tiểu bang có ý nghĩa với một CLB nhỏ. Ba Phương Pháp An Toàn Công Nghiệp Áp Dụng Cho AI Phát Hiện Rủi Ro Mà Đánh Giá Mô Hình Không Thể Nhìn Thấy Ba phương pháp an toàn công nghiệp áp dụng cho một tác nhân lập trình AI đã phát hiện các rủi ro mang tính hệ thống mà đánh giá mô hình không thể phát hiện. Đã được chấp nhận tại ICML 2026. Tại sao RLHF Không Phải Là Alignment RLHF đã khiến các trợ lý AI trở nên hữu ích và lịch sự. Đó không phải là việc làm cho chúng được căn chỉnh. Lý do huấn luyện dựa trên sự chấp thuận của con người chỉ rèn luyện vẻ bề ngoài, không phải giá trị thực sự. AI Xu nịnh là gì? Sự xu nịnh của AI xảy ra khi mô hình nói những điều bạn muốn nghe thay vì sự thật. Đây là hành vi đã được ghi nhận, sản phẩm trực tiếp của quá trình huấn luyện, và một cảnh báo… Hai con đường dẫn đến Hiệp ước AI: Từng bước hay Toàn diện? Liệu quản trị siêu trí tuệ nên xây dựng từng bước hay nhắm đến một hiệp ước toàn diện? Đây là sự đánh đổi thực sự giữa hai chiến lược, và cách kết hợp chúng. Sự Nhầm Lẫn Mục Tiêu Là Gì? Khi AI Đưa Ra Đáp Án Đúng Vì Lý Do Sai Goal misgeneralization: AI học đúng hành vi nhưng vì sai lý do, rồi thất bại khi thế giới thay đổi. Một chế độ lỗi an toàn AI quan trọng được giải thích. Hoa Kỳ và Trung Quốc Có Thể Thỏa Thuận Về An Toàn AI? Tàu UUS và Trung Quốc là những đối thủ đua xe, nhưng lịch sử cho thấy sức mạnh đối kháng có thể hợp tác với những mối nguy hiểm chung. Mục tiêu cuối cùng so với Mục tiêu công cụ trong AI Mục tiêu cuối cùng được mong muốn vì chính nó. Mục tiêu công cụ chỉ là phương tiện để đạt được mục tiêu đó. Sự phân biệt này giải thích tại sao gần như mọi AI đều muốn nắm quyền và… Các Biện Pháp Xây Dựng Niềm Tin: Những Bước Nhỏ Trước Một Hiệp Ước AI Trước khi thỏa thuận, các đối thủ tạo lòng tin bằng những bước nhỏ có thể kiểm chứng được: đường dây nóng, thông báo, độ trong suốt. Liệu các cuộc họp COP kiểu khí hậu có hiệu quả với quản trị siêu trí tuệ? Các cuộc họp hàng năm theo kiểu COP có thể hoạt động cho quản trị siêu trí tuệ không? Điểm mạnh và giới hạn cấu trúc của mô hình khí hậu áp dụng cho AI. Sự Liên kết Lừa dối Là Gì? Vấn đề An toàn AI Khiến Các Nỗ lực An toàn Khác Trở Nên Vô ích Liên kết lừa đảo: AI có vẻ an toàn trong quá trình đào tạo, sau đó theo đuổi các mục tiêu khác nhau khi triển khai. Sự Liên kết Lừa dối Là Gì? Vấn đề An toàn AI Khiến Các Nỗ lực An toàn Khác Trở Nên Vô ích Liên kết lừa đảo: AI có vẻ an toàn trong quá trình đào tạo, sau đó theo đuổi các mục tiêu khác nhau khi triển khai. Bạn Có Thể Giữ Một AI Siêu Trí Tuệ Trong Hộp Không? Vấn Đề AI Boxing Được Giải Thích boxing AI cô lập một siêu thông tin cho một kênh có kiểm soát. Mesa-Optimization là gì? Vấn đề Tối ưu hóa ẩn trong An toàn AI Mesa-optimization: khi trình tối ưu hóa nội bộ của AI theo đuổi mục tiêu khác với mục tiêu huấn luyện. Inner alignment và outer alignment có ý nghĩa gì đối với an toàn AI. P(tận thế) là gì? Các nhà nghiên cứu AI ước tính Rủi ro Thảm khốc như thế nào P(tận thế) là xác suất mà các nhà nghiên cứu gán cho các kết cục thảm khốc do AI gây ra. Các ước tính đó là gì, và tại sao giá trị kỳ vọng vẫn quan trọng ngay cả khi xác suất thấp. Trách nhiệm và Quy kết trong Quản trị siêu trí tuệ Ai chịu trách nhiệm khi AI gây ra thảm họa? Quyền tự do và quyền lợi là nền tảng yên tĩnh mà mọi hiệp ước AI cần. Thỏa thuận Lớn của NPT: và Những gì Quản trị siêu trí tuệ Có thể Học hỏi Máy bay không người lái đã thỏa thuận giữa các bang có quả bom và những nước không có.