Hàn Quốc và Vương quốc Anh đồng chủ trì Hội nghị thượng đỉnh AI Seoul, cuộc họp thứ hai trong loạt hội nghị bắt đầu tại Bletchley Park tháng 11 năm 2023. Chương trình nghị sự chia rõ ràng. Trên lộ trình doanh nghiệp, các nhà phát triển hàng đầu đưa ra cam kết an toàn công khai. Trên lộ trình chính phủ, các quốc gia đồng ý tăng cường hợp tác về khoa học đánh giá. Những gì mỗi lộ trình mang lại và những gì còn bỏ ngỏ vẫn là cách đọc rõ ràng nhất về vị trí của quản trị siêu trí tuệ năm 2024.

Sự cam kết và việc theo dõi của chính phủ là những tài liệu công khai mà không cần đến luật pháp.

Cam kết an toàn của Frontier AI

Tài liệu tiêu đề là Frontier AI Safety Commitments, được ký bởi mười sáu công ty AI lớn, bao gồm các nhà phát triển từ Hoa Kỳ, Trung Quốc, Vương quốc Anh và UAE. Các công ty cam kết công bố các khuôn khổ an toàn mô tả cách họ đánh giá rủi ro từ các mô hình tiên phong; xác định ngưỡng rủi ro họ coi là không thể chấp nhận; và, quan trọng, không phát triển hoặc triển khai mô hình nếu những ngưỡng đó không thể giữ dưới đường đó, bao gồm cam kết rút lui khi các biện pháp giảm thiểu thất bại.

Sự thay đổi có ý nghĩa nằm ở nguyên tắc công khai. Các nhà phát triển hàng đầu đã tuyên bố công khai rằng một số năng lực quá nguy hiểm để triển khai, và họ sẽ xác định các lằn ranh đỏ rồi hành động theo đó. Ngành công nghiệp chuyển từ những cam kết mơ hồ sang các giới hạn được nêu rõ. Các giới hạn đó vẫn do chính họ tự định nghĩa.

Tại sao các cam kết tự nguyện là chưa đủ

  • Các công ty tự đặt ngưỡng của riêng mình. Mỗi nhà phát triển tự định nghĩa rủi ro không thể chấp nhận và cách đo lường nó. Không có tiêu chuẩn chung và không có cơ quan bên ngoài xác thực các định nghĩa.
  • Không có xác minh độc lập. Không có gì xác nhận rằng khuôn khổ an toàn nội bộ được tuân thủ, hay các đánh giá là trung thực. Việc tuân thủ chỉ dựa vào lời của nhà phát triển.
  • Không có thực thi. Bẻ bỏ lời thề phải trả giá bằng danh dự, và cam kết không phải là luật pháp.
  • Chúng có thể được sửa đổi hoặc bỏ. Các cam kết tự nguyện dưới áp lực cạnh tranh có thể âm thầm suy yếu khi đối thủ chạy đua phía trước. Tự điều chỉnh là thứ mong manh như vậy.

Một lời hứa mà người hứa có thể định nghĩa, đo đạc và phá vỡ một mình là một người giữ chỗ cho việc quản lý. Người giữ chỗ chỉ giúp đỡ nếu có gì khó khăn hơn thay thế họ.

Mạng lưới các viện an toàn

Đường đua của chính phủ tạo ra một thứ có tiềm năng bền vững hơn: đà hướng tới một mạng lưới quốc tế của các viện an toàn AI. Tòa nhà dựa trên cơ thể mới được thành lập của Vương Quốc Anh và Hoa Kỳ, các bang đồng ý hợp tác trong việc đánh giá các mô hình biên giới, phương pháp chia sẻ, tiến hành thử nghiệm, và xây dựng khả năng kỹ thuật mà bất cứ chế độ xác thực nào trong tương lai cần thiết. Các cơ quan công cộng có thể đánh giá liệu mô hình có nguy hiểm hay không là sự kết nối của một hiệp ước.

Tuyên bố Seoul, được các chính phủ tham dự thông qua, tái khẳng định AI lấy con người làm trung tâm, an toàn và đáng tin cậy, cùng tiếp tục hợp tác quốc tế. Giống văn bản Bletchley, đây là tuyên bố định hướng chứ không phải tập hợp nghĩa vụ.

Mô hình và khoảng cách

Seoul phù hợp với mô hình đã biết trong quản trị các công nghệ nguy hiểm: thừa nhận, sau đó cam kết tự nguyện, rồi (nếu quá trình thành công) các quy tắc ràng buộc. Các cam kết doanh nghiệp và mạng lưới viện là giai đoạn thứ hai. Công việc còn dang dở là giai đoạn thứ ba: tiêu chuẩn chung, xác minh độc lập và nghĩa vụ pháp lý.

Các viện an toàn là cầu nối đầy hứa hẹn nhất, vì năng lực họ xây dựng chính là thứ mà một chế độ ràng buộc sẽ sử dụng. Rủi ro là quá trình thượng đỉnh dừng lại ở giai đoạn tự nguyện, thế giới hài lòng với lời cam kết vì cam kết dễ hơn hiệp ước, trong khi năng lực vẫn tiếp tục tiến bộ. Seoul đã làm rõ khoảng cách giữa cam kết và quản trị. Nhiệm vụ còn lại là thu hẹp khoảng cách đó. Vị thế của Quỹ Nakada là thu hẹp nó đồng nghĩa với việc chuyển từ cam kết của công ty sang luật pháp quốc tế mang tính phòng ngừa trước khi các đường đỏ tự định nghĩa tan biến dưới áp lực cuộc đua. Đọc thêm: tại sao các cam kết an toàn AI tự nguyện thất bại khi là chiến lược duy nhất.