Constitutional AI là phương pháp huấn luyện do Anthropic phát triển. Ý tưởng là giảm sự phụ thuộc hành vi của mô hình vào việc con người gán nhãn đầu ra có hại, thay vào đó để mô hình tự đánh giá phản hồi của mình dựa trên một bộ nguyên tắc được viết ra, gọi là hiến pháp.
Trong thực tế nó hoạt động qua hai giai đoạn. Đầu tiên, mô hình tạo phản hồi, sau đó phê bình phản hồi đó theo hiến pháp và sửa đổi, học từ những chỉnh sửa của chính mình. Thứ hai, mô hình so sánh các cặp phản hồi và đánh giá cái nào thỏa mãn các nguyên tắc tốt hơn, và những đánh giá đó huấn luyện nó giống như cách xếp hạng của con người trong RLHF. Vì phản hồi đến từ mô hình áp dụng hiến pháp thay vì từ con người, một phần cách tiếp cận đôi khi được gọi là học tăng cường từ phản hồi AI.
Những gì nó làm đúng
Có những lợi thế thực sự, và chúng đáng được thừa nhận một cách rõ ràng.
- Các nguyên tắc được nêu rõ ràng. Thay vì các giá trị ngầm định bởi hàng nghìn nhãn con người riêng lẻ, có một văn bản bạn có thể đọc, tranh luận và sửa đổi. Điều đó minh bạch hơn một đống xếp hạng.
- Nó mở rộng quy mô tạo phản hồi. Việc con người gán nhãn nội dung có hại chậm, tốn kém và gây áp lực cho người gán nhãn. Để mô hình làm nhiều công việc đó hơn sẽ gỡ bỏ một nút thắt.
- Nó có thể cải thiện tính nhất quán. Một tiêu chuẩn được viết ra áp dụng đồng đều tránh được một số nhiễu và sai lệch từ nhiều người đánh giá con người khác nhau vào những ngày khác nhau.
Đây là những bước tiến kỹ thuật thực sự, và constitutional AI đã tạo ra các mô hình vừa hữu ích hơn vừa ít dễ gây hại rõ ràng. Foundation không có ý định bác bỏ công việc hữu ích.
Những gì nó không giải quyết
Những câu hỏi khó hơn vẫn tồn tại nguyên vẹn qua phương pháp, và điều quan trọng là phải hiểu tại sao.
Kỹ thuật này vẫn tối ưu hóa mô hình để đáp ứng tiêu chuẩn đã nêu theo đánh giá của một mô hình. Nó đưa con người ra khỏi vòng lặp từng phản hồi, và không thay đổi hình dạng cơ bản của vấn đề, đó là hệ thống đang được huấn luyện để tạo ra đầu ra đạt điểm tốt so với mục tiêu. Nếu hiến pháp không đầy đủ, hoặc các nguyên tắc xung đột trong tình huống không ai dự đoán, mô hình tối ưu hóa đúng theo những gì được viết, với cùng Goodhart áp lực như cũ. Viết các giá trị thành hiến pháp cũng không giải quyết được khó khăn khi phải xác định giá trị; nó chỉ chuyển vấn đề vào văn bản.
Hai giới hạn sâu hơn vẫn chưa được chạm đến. Phương pháp này định hình hành vi, và không đưa ra đảm bảo nào về mục tiêu nội bộ của mô hình, do đó khoảng cách giữa việc trông có vẻ aligned và thực sự aligned căn chỉnh nội tại vấn đề, vẫn còn bỏ ngỏ. Và nó dựa vào khả năng tự đánh giá đầu ra của chính mô hình, vốn chỉ đáng tin cậy chừng nào mô hình còn trung thực và có khả năng phán đoán, đúng là điều ta không thể giả định với một hệ thống đang tiếp cận hoặc vượt quá mức trí tuệ của chúng ta.
Constitutional AI là cách tốt hơn để định hướng hành vi. Định hướng hành vi chưa bao giờ là phần alignment mà chúng ta không biết cách làm.
Giữ mọi thứ ở mức độ hợp lý
Hiến pháp AI là một ví dụ điển hình về một mô hình mà Tổ chức theo dõi chặt chẽ: sự tiến bộ an toàn thực sự, có giá trị mà dễ dàng đọc quá nhiều. Những phương pháp như thế này làm cho các mô hình hiện tại dễ kiểm soát hơn và rõ ràng hơn về các tiêu chuẩn của họ, và điều đó cũng đáng để có. Họ không chứng minh rằng chúng ta có thể sắp xếp một hệ thống mà chúng ta không nghĩ nhiều về chúng ta, và họ không đóng cái khoảng trống mà toàn bộ lập luận của chúng ta bật lên. Rất hoan nghênh sự tiến bộ trong việc huấn luyện. Đó không phải là lý do để Tiếp tục phát triển khả năng trên giả định rằng phần còn lại sẽ theo sau.