Anthropic công bố Chính sách Tỷ lệ Có trách nhiệm đầu tiên vào tháng 9 năm 2023. Mở tài liệu và cấu trúc hiện ra trong các tiêu đề trước khi lời lẽ làm vậy. Các mức năng lực được đặt tên trước. Mỗi mức được ghép với các biện pháp bảo vệ được cho là sẽ bật khi đánh giá cho thấy mô hình đã vượt đường: bảo mật trọng số chặt chẽ hơn, quy tắc triển khai chặt chẽ hơn, red-teaming sâu hơn, và ở các cấp trên cùng là cam kết bằng văn bản không huấn luyện hoặc phát hành cho đến khi các biện pháp bảo vệ được chỉ định có hiệu lực. Tên ngắn ngành là RSP. Logic cơ bản thường được gọi là cam kết if-then.
Các phòng thí nghiệm biên giới hàng đầu công bố các phiên bản nổi tiếng nhất, và định dạng lan rộng. Các cấp thường chạy từ hệ thống tương đương hiện nay đến các mô hình có thể hỗ trợ đáng kể vũ khí sinh học, tấn công mạng nghiêm trọng hoặc tự hành nguy hiểm. Tài liệu nhằm trả lời một câu hỏi đơn giản trước khi khẩn cấp xảy ra: khi năng lực tăng, công ty sẽ làm chính xác điều gì?
Tại sao định dạng này là một cải tiến thực sự
So với lời hứa chung chung sẽ coi trọng an toàn, RSP cụ thể hơn. Nó nêu rõ năng lực, ngưỡng và phản ứng từ trước, biến một tâm trạng thành thứ mà người ngoài có thể chỉ ra. Nó mang tính dự báo. Phòng thí nghiệm phải quyết định một năng lực nguy hiểm sẽ khiến họ mất gì trước khi làn sóng khám phá và chu kỳ báo chí ập đến cùng lúc.
Định dạng cũng gắn từ với các bài kiểm tra qua đánh giá khả năng nguy hiểm, Vậy ngưỡng có ý nghĩa hoạt động hơn là khẩu hiệu. Một số chính sách đi xa hơn và cam kết ngăn chặn sự phát triển nếu không thể bảo vệ kịp thời. Đưa nó vào một tài liệu công cộng là một bước tiến thực sự.
Bản nháp không phải là hiến pháp.
Luật công cộng, cụ thể, đã được tuyên bố trước đó là cách các ngành công nghiệp trưởng thành. RPs có thể là bản nháp. Họ không phải là một hiến pháp trong khi cùng một công ty viết, điểm số và lợi nhuận từ bài kiểm tra. Khuyến khích bản nháp. Đừng coi nó như một luật lệ phải tuân theo.
Đúng vậy, và điểm yếu vẫn mang tính cấu trúc. Cùng một phòng thí nghiệm soạn chính sách, xác định ngưỡng, chạy đánh giá, phán quyết xem đường ranh đã bị vượt qua chưa, quyết định liệu các biện pháp bảo vệ của mình có đủ không, và giữ quyền sửa đổi văn bản. Khi áp lực thương mại buộc phải giao hàng va chạm với một cam kết do chính phòng thí nghiệm soạn thảo và quản lý, không có bên thứ ba độc lập nào nắm được còi.
Lịch sử không ủng hộ việc đọc lạc quan. Thành tích của Tự nguyện đảm bảo an toàn cho công ty dưới áp lực cạnh tranh là một thành tích về tiêu chuẩn làm mềm đi khi họ bắt đầu cắn. Một quy tắc nếu-sau đó chỉ mạnh như lúc đó, và sau đó được thực thi bởi các bên nhận được lợi ích từ việc làm suy yếu nó. Luật lệ mà bạn đặt ra, đo đạc và có thể sửa đổi cho chính bạn là một lời tuyên bố có mục đích. Nó không phải là sự ép buộc.
Hai khoảng trống còn lại nằm dưới tài liệu. RSP phụ thuộc vào đánh giá để phát hiện ngưỡng đã bị vượt qua, nên mọi thứ hạn chế đánh giá (bao gồm cố tình làm kém, năng lực chưa biết và khó khăn trong việc chứng minh an toàn) hạn chế chính sách được xây dựng dựa trên chúng. Và một RSP chỉ ràng buộc phòng thí nghiệm áp dụng nó. Một đối thủ cạnh tranh từ chối, hoặc một chương trình nhà nước nằm ngoài văn hóa này, sẽ không bị ảnh hưởng. Không một công ty nào có thể tự mình giải quyết vấn đề phối hợp đó.
Cách Quỹ đọc chúng
Giữ lại cơ chế tốt. Tái sử dụng logic ngưỡng, cấu trúc if-then và liên kết với đánh giá. Thay đổi người cầm bút và người thực thi lệnh dừng. Chuyển các ngưỡng kích hoạt đó từ chính sách tự nguyện sang luật ràng buộc, được hậu thuẫn bởi một cơ quan độc lập và bởi quản trị compute, để phòng thí nghiệm không thể âm thầm điều chỉnh trần của chính mình khi trần trở nên bất tiện.
Xử lý các chính sách như là bản thảo các quy tắc có thể áp dụng, sau đó hoàn thành công việc bên ngoài phòng thí nghiệm: Luật ràng buộc, thực thi độc lập, điều khiển tính toán.