Anthropic опубликовала свою первую политику ответственного масштабирования в сентябре 2023 года. Откройте документ, и структура появится в заголовках раньше, чем появится риторика. Уровни возможностей называются заранее. Каждый уровень сочетается с мерами безопасности, которые должны включаться, когда оценки показывают, что модель перешла черту: более строгие меры безопасности, более строгие правила развертывания, более глубокая «красная команда», а на верхних уровнях — письменное обязательство не обучать и не выпускать до тех пор, пока не будут установлены определенные меры защиты. Сокращенное название отрасли — RSP. Основополагающую логику часто называют обязательствами «если-то».

Ведущие лаборатории переднего края опубликовали самые известные версии, и формат распространился. Уровни обычно идут от систем примерно сегодняшнего уровня до моделей, способных существенно помочь в создании биологического оружия, серьёзной кибератаки или опасной автономии. Документ призван ответить на простой вопрос до наступления чрезвычайной ситуации: когда возможности растут, что именно делает компания?

Почему формат — это реальное улучшение

По сравнению с общим обещанием серьёзно относиться к безопасности RSP гораздо конкретнее. Он заранее называет возможности, пороги и ответные меры, превращая настроение в то, на что можно указать извне. Он упреждающий. Лаборатория должна решить, во что ей обойдётся опасная возможность, ещё до того, как придёт волна открытий и прессы.

Формат также связывает слова с тестами через оценки опасных возможностей, Таким образом, пороги имеют оперативный смысл, а не лозунг. Некоторые политики идут дальше и обязуются остановить развитие, если гарантии не могут идти в ногу с возможностями. Включение этого в публичный документ считается реальным авансом.

Проект не является конституцией.

Общественные, конкретные, заранее принятые правила — это то, как развиваются отрасли. RSP может быть проектом. Они не являются конституцией, в то время как одна и та же фирма пишет, оценивает и получает прибыль от теста. Поощряйте проект. Не относитесь к этому как к закону, которому должны были следовать.

Верно, и слабость всё равно структурная. Одна и та же лаборатория пишет политику, определяет пороги, проводит оценки, решает, была ли черта перейдена, определяет, достаточны ли её меры безопасности, и сохраняет право менять текст. Когда коммерческое давление выпустить продукт сталкивается с обязательством, которое сама лаборатория написала и которым сама управляет, независимая сторона не держит свисток.

История не благоприятствует оптимистичному чтению. Запись Добровольные корпоративные гарантии безопасности под давлением конкуренции Это рекорд стандартов, которые смягчаются, когда они начинают кусаться. Правило «если-то» настолько же сильно, как и тогда, и тогда его соблюдает партия, которая выигрывает от его ослабления. Правило, которое вы устанавливаете, измеряете и можете изменить для себя, является заявлением о намерениях. Это не ограничение.

Два дополнительных пробела остаются под документом. RSP зависят от оценок, чтобы заметить пересечённый порог, поэтому всё, что ограничивает оценки (включая занижение результатов, неизвестные возможности и трудность доказательства безопасности) ограничивают политику, построенную на них. А RSP обязывает только ту лабораторию, которая его приняла. Конкурент, который откажется, или государственная программа вне этой культуры, остаются незатронутыми. Ни одна компания не может в одиночку решить эту проблему координации.

Как Фонд их интерпретирует

Сохраните хорошую механику. Используйте пороговую логику, структуру «если — то» и связь с оценками. Измените, кто держит ручку и кто останавливает процесс. Перенесите эти триггеры из добровольной политики в обязательное законодательство, подкреплённое независимым органом и управление вычислениями, поэтому лаборатория не сможет тихо поднять собственный потолок, когда он станет неудобным.

Относитесь к политике как к проектам обязательных правил, а затем заканчивайте работу за пределами лаборатории: обязательный закон, независимое правоприменение, вычислительный контроль.