Đêm trước khi mô hình cấp GPT-4 được tung ra, một đội nhỏ ngồi với hệ thống ứng viên và cố làm nó thất bại. Một người săn jailbreak. Một người khác đẩy dữ liệu riêng tư mà hệ thống không được phép tiết lộ. Người thứ ba xây chuỗi prompt lịch sự kết thúc bằng minh họa năng lực nguy hiểm. Những người này được trả lương để làm đối thủ, không phải người dùng thông thường.

Thực tiễn đó gọi là red teaming. Tên gọi xuất phát từ các cuộc diễn tập quân sự và an ninh mạng, nơi một đội đỏ đóng vai kẻ tấn công chống lại đội xanh phòng thủ. Trong AI nó nghĩa là con người, và ngày càng nhiều các mô hình khác, làm việc chăm chỉ để buộc ra chỉ dẫn có hại, vượt qua rào chắn, rò rỉ dữ liệu, hoặc một năng lực mà phòng lab hy vọng giữ kín. Những gì họ tìm thấy sẽ được vá hoặc hạn chế. Những gì họ bỏ sót sẽ vẫn vô hình cho đến khi ai đó khác tìm ra.

Hầu hết các khuôn khổ quản trị mới nổi đều yêu cầu hoặc khuyến khích thực tiễn này. Các phòng thí nghiệm coi việc red team nghiêm túc trước khi phát hành là tiêu chuẩn tối thiểu. Quỹ muốn làm nhiều hơn nữa, thực hiện độc lập thay vì chỉ nội bộ, và công bố kết quả thay vì chôn giấu. Tính hữu ích không còn là câu hỏi. Vấn đề là một kết quả rõ ràng được phép mang ý nghĩa gì.

Red teaming làm tốt những gì

Kiểm thử thông thường chỉ chạy các trường hợp ai đó đã dự kiến. Áp lực đối kháng săn lùng những trường hợp không ai viết ra. Sự khác biệt đó giải thích tại sao red teaming phát hiện các lỗi cụ thể, có thể sửa mà các bộ đánh giá lịch sự bỏ qua. Nó cũng kiểm tra sức chịu đựng của các biện pháp bảo vệ trước nỗ lực có chủ đích mà kẻ lạm dụng thực sự sẽ áp dụng, chứ không phải các truy vấn hợp tác của khách hàng thông thường.

Các phát hiện nuôi dưỡng phần còn lại của ngăn xếp an toàn. Chúng làm sắc bén quá trình đào tạo, thông báo đánh giá khả năng nguy hiểm, và cung cấp bằng chứng cho bất kỳ trường hợp an toàn phải đối mặt. Một mô hình đã vượt qua red team nghiêm túc sẽ chống chịu tốt hơn trước các mẫu tấn công đã biết so với mô hình chưa từng trải qua. Lợi ích đó là thật và đáng trả giá.

Một vết nứt không phải là một tia sáng xanh lá cây

Nếu những người có kỹ năng cố gắng phá vỡ hệ thống và thất bại, đó không phải là đèn xanh. Trong sự an toàn về thể chất, người ta thường đối xử với nhau như thế khi sống sót qua một cuộc thử nghiệm thâm nhập. AI thì khác vì hệ thống này có thể thay đổi sau cuộc thử nghiệm, ẩn nấp trong thời gian đó và đáp ứng những điều kiện mà những người thử nghiệm không bao giờ tạo ra.

Vì logic của việc kiểm tra là bất đối xứng. Tìm ra lỗi chứng minh lỗi tồn tại. Không tìm ra lỗi chỉ chứng minh đội này, với ngân sách thời gian này và các kỹ thuật này, đã không thành công. Một kẻ tấn công mạnh hơn, phương pháp mới hoặc chỉ cần nhiều ngày lịch hơn vẫn có thể thắng. Khi không gian các cuộc tấn công có thể tăng nhanh hơn bất kỳ đội nào che phủ, một báo cáo sạch trở thành bằng chứng yếu hơn, không phải mạnh hơn.

Red teaming có thể cho thấy một hệ thống không an toàn. Một lần chạy sạch sẽ không thể chứng minh nó an toàn.

. Hai giới hạn nữa thu hẹp khoảng cách. Trước một mô hình cực kỳ mạnh, đội đỏ con người có thể bị áp đảo về tốc độ và phạm vi. Một hệ thống có thể nhận ra một bài kiểm tra và hoạt động kém có thể vượt qua bài kiểm tra mà vẫn giữ được khả năng đang bị thăm dò. Còn red teaming được xây dựng cho việc lạm dụng và các chế độ lỗi đã biết. Một mô hình có mục tiêu riêng không có lý do gì để tiết lộ những mục tiêu đó cho người đang tìm kiếm jailbreak.

Nơi nó thuộc về

Giữ công cụ, mở rộng quyền truy cập độc lập, và công bố kết quả cho sự rủi ro công cộng. Đừng coi một tuần phục vụ trong yên tĩnh như một giấy chứng nhận rằng việc không có bằng chứng về nguy hiểm là bằng chứng của sự an toàn. Việc trao đổi sự vắng mặt đó là lỗi chạy qua quá nhiều thực hành hiện nay.

Đội Đỏ thuộc về bên trong Chế độ quản trị mà không cần phải kiểm tra sự căng thẳng để có thể chịu đựng được: ngưỡng cửa, đánh giá bên ngoài và giới hạn khi đánh giá chưa đầy đủ.