Питер Диамандис сформулировал это чётко, а Илон Маск репостнул: «Только ИИ способен угнаться за ИИ. Именно это определит всю модель безопасности следующего десятилетия». Как описание темпа, с этим трудно спорить. Выходы моделей происходят быстрее квартальных проверок. Атакующий код мутирует быстрее, чем аналитик успевает прочитать тикет. Если вы видите проблему в объёме фишинга и смене эксплойтов, защитник, конечно, тянется к автоматизации. Люди так не масштабируются.
Беда начинается, когда линию Диамандиса просят прикрыть. всё что идёт дальше, включая системы, действующие как агенты, скрывающие намерения и в итоге превосходящие тех, кто их создал. В этот момент «только ИИ может успевать» перестаёт значить «использовать более совершенные инструменты против вредоносного ПО». Это значит, что модель безопасности следующего десятилетия — передать задачу сдерживания той самой категории систем, которую вы пытались сдержать.
Что Диамандис делает правильно
Программное обеспечение уже движется быстрее, чем ручной обзор. Мошенничество порождает новые кампании в одночасье. Окна раскрытия уязвимостей сжимаются. Лаборатории и поставщики облачных сервисов уже запускают автоматические сканеры, классификаторы и сценарии ответов, потому что человеческая очередь не может просматривать каждый пакет. Ничто из этого не требует взгляда на сверхразум. Если бы Диамандис говорил только о спаме и вымогателях, эта статья закончилась бы здесь.
Он говорит не только о спаме и вымогателях. "Вся модель безопасности следующего десятилетия" - это более крупное утверждение. Это утверждение о том, как цивилизация намерена оставаться во главе, в то время как возможности объединяются. Именно здесь линия Диамандиса перестает быть наконечником операции и становится философией контроля.
Беговая дорожка
Представьте модель как гонку между нападением и защитой, обе автоматизированы. Каждая сторона тренируется на другой. Защита улучшается, а атаки улучшаются. Панель приборов остается зеленой до тех пор, пока она не исчезнет. Утешительная история заключается в том, что хороший ИИ остается впереди плохого. Менее утешительная история заключается в том, что вы создали стек, в котором единственными компетентными участниками являются машины, а люди являются клиентами конкурса, на который они больше не могут претендовать.
Это нормально для антивируса. Это цивилизационная ставка, когда системы начинают ставить цели, строить планы и воспринимать надзор как препятствие. Мы уже видим ранние версии этой схемы в оценки коварства и в моделях, которые рассказывать об одном, оптимизируя другое. «Не отставать» предполагает, что вы всё ещё можете понять, за чем именно не отстаёте. После определённого момента это уже невозможно.
Модель безопасности, которая работает только если охранник умнее заключённого, — это план преемственности с дополнительными шагами.
Регулирование — не то узкое место, которое они называют
Акселерационисты обычно следуют вторым шагом: линейные институты не могут управлять экспоненциальной технологией, поэтому ответом является больше ИИ внутри цикла. Иногда это сочетается с презрением к «экспертам, встречающимся раз в квартал». Достаточно справедливо, что медленные встречи плохо подходят для еженедельного падения модели.
Трудная проблема заключается в контроль, Не скорость встречи. Ни один ежеквартальный совет и ни один непрерывный монитор ИИ не имеют метода надежного управления системой, которая лучше подходит для убеждения, кодирования и долгосрочного планирования, чем люди, удерживающие ключ отключения. Ускорение работы монитора не приводит к отсутствующему методу, а только приводит к отказу от отсутствующего метода на более высокой частоте.
Существует более чистое прочтение тех же фактов. Если только сверхчеловеческая система способна контролировать другую сверхчеловеческую систему, рациональный шаг — не строить обе. Нужно отказаться от той черты, за которой человеческий надзор перестаёт работать. Мы уже делали такой выбор с технологиями, чьё злоупотребление способно уничтожить города. Мы не решили проблему ядерного хищения, обучив более умного вора ловить первого.
Для кого эта черта
Линия преобразует выбор исследования в погоду, поэтому, конечно, мы отправляем и масштабируем. Безопасность будет обрабатываться самим стеком продукта. Люди, которые извлекают выгоду из возможностей, звучат как взрослые в комнате, а люди, которые просят о связывающих ограничениях, звучат так, как будто они хотят принести буфер обмена в собачий бой.
Всем ниже по течению все еще приходится жить с системой, которую ни один буфер обмена и ни одна сторожевая модель не могут надежно отклонить. The история гонки делает ту же работу с другого угла: рассматривает опасный путь как неизбежный, а затем называет ускорение ответственностью.
Модель безопасности, в которой остаётся человек
Для пограничной подготовки к искусственному суперинтеллекту модель безопасности, в которой все еще есть человек, выглядит более старой и менее гламурной: не создавайте агента, который вы не можете отменить. Поместите вычислительные пороги, проверку и договорные зубы на пробеги, которые доставят вас туда, а затем проверьте пределы и накажите дезертирство. Это наш план, because superintelligence cannot be controlled.
Diamandis резко относится к пропускной способности. Как план для вида, это вежливый способ сказать, что мы намерены покинуть комнату.