Каждый год мир тратит целое состояние на то, чтобы сделать ИИ-системы способнее, и копейки — на то, чтобы конечное состояние стало выживаемым. Внутри этих копеек скрыта ещё одна ошибка: большая часть денег на безопасность по-прежнему исходит из предположения, что сверхинтеллект будет создан, и пытается сделать так, чтобы этот исход «прошёл хорошо».

Большая часть денег и престижа по-прежнему уходит на то, чтобы сделать гонку безопаснее, а не на прекращение гонки к сверхразум.

Это предположение является проблемой. Если искусственный суперинтеллект является технологией, которую мы не можем контролировать, рациональное использование дефицитного капитала безопасности заключается в том, чтобы остановить его создание, а не финансировать более дружелюбную версию той же расы.

Что делают деньги сегодня

Безопасность ИИ, понимаемая широко, опирается примерно на $190 млн в год. Работа над способностями обходится в десятки миллиардов. В рамках безопасности значительная часть уходит на техническое выравнивание: улучшенные приёмы надзора, более качественное тестирование на атаки, лучшие способы обучения моделей выдавать правильные ответы в тестовых условиях. Часть этой работы полезна для сегодняшних систем. Почти ни одна из них не является доказанным решением для системы, умнее тех, кто её тестирует.

В отрасли это знают. Статьи о deceptive alignment, goal misspecification и evaluation gaming не являются секретом. Лаборатории публикуют результаты, где модели при давлении прибегают к интригам. Ответ слишком часто сводится к просьбе о большем бюджете на alignment, чтобы следующий тренировочный запуск стал безопаснее. Тренировочные запуски продолжаются по прежнему графику.

Выравнивание постфактум — это ставка, право на которую мы продолжаем терять

Если мир когда-нибудь примет договор, который заморозит гонку суперинтеллекта, нам понадобятся все серьезные инструменты, которые мы можем получить для систем, которые уже существуют.

Выравнивание финансирования в качестве основного плана, в то время как лаборатории масштабируются в сторону суперинтеллекта, рассматривают пункт назначения как фиксированный. Мы можем выбрать пункт назначения. Ядерные арсеналы, химия озона и клонирование человека имели моменты, когда мир решил, что определенные конечные состояния не стоят остаточного риска. Суперинтеллект постоянно входит в этот список. Суперинтеллект нельзя контролировать.

Куда вместо этого должны идти деньги

Перенаправить средства на выравнивание сверхразум на работу, которая сделает отказ от создания enforceable:

  • Дизайн договора, верификация и управление вычислительными мощностями на уровне чипов, которые можно проверять через границы.
  • Публичное формирование позиции, сохраняющее цель чёткой: остановить сверхинтеллект, а не «замедлить ИИ» как расплывчатое настроение.
  • Поддержка whistleblowers, прозрачность инцидентов и независимая оценка, повышающая цену тихих скачков возможностей.
  • Политическая организация, чтобы законодатели слышали избирателей, а не только лоббистов лабораторий.

Этот список менее гламурный, чем новая техника обучения. Это также единственный список, который соответствует режиму отказа. Суперинтеллект, который немного лучше в выравнивании звука, по-прежнему является суперинтеллектом. Если мир откажется от его создания, исследования по выравниванию могут продолжаться без срока, который заканчивается вымиранием.

Возражение изнутри лаборатории

«Если мы не решим выравнивание, кто-то другой создаст небезопасную систему». Услышим честно: исследователи, остающиеся на переднем крае, часто считают, что именно их присутствие обеспечивает безопасность. Иногда они правы относительно сегодняшних релизов. Аргумент не работает на пределе. Гонка, в которой каждая команда нуждается в ещё одном скачке возможностей, чтобы профинансировать безопасность следующего скачка, остаётся гонкой, просто с другим значком.

Вопрос в том, Обязательный международный договор, Такой же инструмент использовался, когда опасность разделялась, и стимул к обману был реальным. Одностороннее ограничение одной лабораторией оставляет гонку нетронутой. Финансирование может поддержать эту политику. Он не должен подменять его.

После договора продолжайте, если хотите

После обязательного, поддающегося проверке запрета на суперинтеллект, исследования уже существующих систем могут продолжаться в соответствии с правилами, которые не рассматривают вымирание человека как приемлемую экспериментальную стоимость. Суперинтеллект не может контролироваться людьми. До того, как этот запрет вступил в силу, каждый доллар, который заставляет гонку чувствовать себя управляемой, - это доллар, не потраченный на прекращение гонки.

Переведите деньги на профилактику, закон и проверку.