Содержательные материалы о суперинтеллекте, выравнивании, управлении и политических усилиях действовать до закрытия окна возможностей.
Кратчайшая формулировка позиции Фонда: искусственный сверхразум никогда не должен быть создан. Сверхразум не может контролироваться людьми.
Как несколько сценариев отказа накладываются одновременно и почему подход «проб и ошибок» не переносится на систему, не дающую второго шанса.
Авиация стала безопасной, потому что могла терпеть крушения в масштабах, которые мир выдерживал. Суперинтеллект не предлагает следующего рейса. Эта фраза — признание, а не план.
Простой гид по аргументу: несогласованный сверхинтеллект — это коллективный риск вымирания, а не локальная производственная авария.
Где метафора разведывательных служб работает, где ломается и почему бомба, принимающая решения самостоятельно, — неверное утешение.
Короткий путь по аргументу, если у вас есть только перерыв на кофе: возможности, контроль и почему ждать демонстрации уже поздно.
Они используют разрастание так, как они используют думер: имя для тех, кто хочет жестко остановить сверхразум. Сохранение человеческой экономики не является планом ее сокращения.
OpenAI заявила, что не может исключить критические киберспособности в Astra, приостановила часть обучения и всё ещё считает искусственный общий интеллект вехой 2026 года.
сверхразум-Bench оценивает исследования ИИ по мере снятия человеческого руководства. Оценки падают. Статья всё ещё предлагает путь к сверхинтеллекту.
Anthropic повысила оценку катастрофического рассогласования с предыдущего минимального уровня до низкого, запустила Model 2 в работу внутри лаборатории и не замедлила разработку.
Вашингтон и лаборатории продают ИИ и роботов как способ выплатить национальный долг. Преемственный разум не обслуживает казначейские облигации.
Будущая физика может открыть гравитацию или сверхсветовое перемещение. Я всё равно не вижу, как контролировать разум умнее нас.
Я веду бизнес и верю в свободные рынки. Суперинтеллект - это редкая ставка, которая может закончить саму игру. Капиталистический случай остановки АСИ.
Глючные лампочки раздражают. Дом или ноутбук с собственными целями — совсем другая категория. Опасность в агентности.
Доверили бы вы любому нынешнему ИИ вентиль с ядовитым газом над вашей головой? Нет. Тогда почему доверять ему мир?
В интервью Economist в июле 2026 года Маск назвал контроль за сверхинтеллектом тщеславием и заявил, что люди вряд ли останутся у руля.
Дарио Амодеи ставит авторитарный ИИ на первое место, а выравнивание — на второе. Суперинтеллект — это не оружие, которым может владеть государство.
Лонгтермисты верно оценили риск сверхразум. Финансирование выравнивания и осторожно управляемая гонка оказались неверным выводом.
Решение проблемы согласованности означает контроль над чем-то умнее нас. Сверхинтеллект уже в названии. Этот план глуп и невозможен.
Подробное руководство по предотвращению: ограничения вычислительных мощностей, договоры, национальное законодательство и политическая работа, которая делает запрет реальностью.
Что означает риск ИИ уровня вымирания, как его порождает суперинтеллект, как эксперты оценивают вероятности и что реально этот риск снижает.
Общий искусственный интеллект и сверхинтеллект, определённые на чёткой лестнице, с политическими ставками каждой ступени.
Внезапная потеря контроля, многополярные гонки, постепенное лишение власти, злоупотребления и распространение: карта механизмов и рычагов воздействия.
Почему публикация весов near-frontier — это дверь в одну сторону для распространения, и как градуированная публикация и структурированный доступ защищают настоящие блага открытости.
Питер Диамандис говорит, что только ИИ может идти в ногу с ИИ, и что это будет определять следующее десятилетие безопасности. Следуйте этой линии мимо вредоносных программ, и это становится планом преемственности.
Оптимизм призван закрыть эту тему. Выживание — это не случай безопасности, и каждая первая катастрофа выглядит беспрецедентной, пока ее нет.
Прекращение ХФУ не положило конец охлаждению. Прекращение суперинтеллекта не заканчивается полезным ИИ. Акселераторы путают продукт с ядом.
Бомба оставалась редкостью отчасти потому, что расщепляющиеся материалы трудно получить. Суперинтеллект движется к более доступным ресурсам. Управление должно обеспечить ту жёсткость, которую не даст физика.
Полный рывок к сверхинтеллекту продаётся как патриотизм. Система, которую не способен контролировать ни один кабинет, — это национальный пакт о самоубийстве с лучшим брендингом.
Цифровая бабочка Джо Рогана и биологический загрузчик Илона Маска представляют человека как переходную форму. Почему этот нарратив превращает вымирание в «переход на новый уровень» — и почему мы от него отказываемся.
Обе стороны финансируют ИИ, утверждая, что другая впереди. Трюк с ракетным разрывом времён холодной войны в новой обёртке.
Большая часть средств на безопасность по-прежнему исходит из того, что сверхразум будет создан, и пытается сделать этот итог благополучным. Переведите scarce капитал на предотвращение и работу над договорами, пока остановка не станет реальностью.
Весовой файл размером с город: слои чисел, которые никто не может прочитать полностью. Почему метафора с мозгом вводит в заблуждение и что это значит для контроля.
Meta Superintelligence Labs и Safe Superintelligence помещают название того, что никогда не должно быть построено, на дверь.
Двенадцать человек несут основную публичную аргументацию в пользу создания сверхинтеллекта. У некоторых есть серьёзный аргумент. Некоторые просто называют каждого критика думером.
Шестьдесят–восемьдесят градусов. Пятая часть кислорода в воздухе. Соль, которую едва чувствуешь на вкус. Любовь, в которой есть место для дыхания. Всё, что нужно человеку, лежит в узкой полосе, с провалом по обе стороны, и сверхинтеллект, держащий ручки управления, ничего из этого не почувствует.
Сто лет кино про ИИ — и машина по-прежнему остаётся объектом наблюдения. Фильм, который изменил бы общественное мнение, развернул бы камеру в другую сторону: два часа за глазами возникающего сверхразума, без злодея и без взрывов. Никто такого не снял.
Рука, прижатая к стене пещеры 36 000 лет назад. Доказательство Евклида, всё ещё верное. Город, оставивший в крыше отверстие для человека, который ещё не родился. Оспа, изгнанная с земли вручную. Всё это передавалось дальше людьми, которые никогда не увидели результата, а теперь несколько компаний хотят поставить на кон всё.
Любимая фраза ИИ-фронтира заимствована из самой безопасной отрасли на Земле. Авиация заработала эту репутацию, падая в масштабах, которые мир мог пережить, и оставляя каждый новый самолёт на земле, пока его не проверят. Ни одна половина этого метода не выдержит контакта со сверхразумом.
От «Метрополиса» 1927 года до 2025-го кино — причина, по которой большинство людей могут представить ИИ, и причина, по которой многие представляют его неправильно. Двадцать один фильм, от старого к новому, и что каждый из них верно и неверно понимает в машинном разуме, который мы не можем контролировать.
В 1983 году телевизионный фильм сделал ядерную войну осязаемой для ста миллионов американцев и для человека с кодами. Четыре года спустя он подписал договор, уничтоживший целый класс ракет. Чему этот момент учит нас о том, как сделать опасность реальной до того, как она наступит.
Вы получаете около пяти минут с человеком, который никогда не думал об этом. Потратьте эти минуты на детали, и вы потеряете комнату. Потратьте их на будильник, и вы будете звучать как уличный проповедник. Сценарий на простом языке я использую в пяти ходах, чтобы объяснить опасность суперинтеллекта и почему его можно предотвратить.
Директор ЦРУ сравнивает возможности сегодняшнего передового ИИ с «цифровым ядерным оружием». Метафора точна по масштабу, но слишком утешительна по структуре: боеголовка стоит в шахте и ждёт, а искусственный сверхразум, к которому ведут эти системы, будет целиться сам.
Небольшое количество конкурирующих держав спешат создать технологию, которая может уничтожить всех, и никто не уверен, что они могут ее контролировать. Поменяйте водородную бомбу на суперинтеллект, и вы описали 1958 и 2026 годы. Почему параллель делает профилактику возможной, а не безнадежной?
Взлом АНБ искусственным интеллектом попал в заголовки. Искусственный интеллект, сокращающий путь к созданной пандемии, а в итоге и к зеркальной жизни, почти не привлекает внимания. Сеть можно восстановить. Выпущенный организм — нельзя. Почему менее заметный риск опаснее и почему он напрямую указывает на сверхинтеллект.
Каждая цивилизация проводит черты, которые договаривается не пересекать. Это самая важная из них. Никто не может контролировать разум умнее нас, и никто не сможет вернуть всё назад, если мы ошибёмся, поэтому создание суперинтеллекта ставит на карту сразу все человеческие жизни. Это исходное обязательство Фонда и стоящее за ним обоснование.
Три технологии способны положить конец истории человечества, но лишь одна из них совершенствуется сама, противостоит любым контрмерам и не даёт второго шанса. Почему сверхразум превосходит ядерную войну и созданные пандемии, и почему наибольшая угроза также наименее защищена.
Десять мифов о сверхинтеллекте и управлении им: научная фантастика, сознание, кнопка выключения, мировое правительство, верификация, инновации и другие — даны прямые ответы.
Команда технического управления MIRI подготовила первый полный проект договора о прекращении гонки к сверхинтеллекту: коалиция US–Китай, жёсткий лимит FLOP, порог кластера в 16 GPU, отслеживание цепочек поставок, мониторинг энергопотребления и инспекции по вызову. Что в нём говорится и какие уже существуют ступени, позволяющие воплотить его в жизнь.
Глава АНБ якобы заявил, что Anthropic Mythos взломал почти все засекреченные системы агентства за часы. Что произошло на самом деле (авторизованное red-team-тестирование, а не несанкционированное проникновение), почему оговорки ничего не смягчают и что с этим можно сделать.
Часть 2 из двух. На поле тратится около 190 миллионов долларов в год, миллиард звучит невозможно. Но это меньше двух дней того, что мир тратит на усиление ИИ, и десятая часть того, что уже движет климатическая филантропия. Откуда берутся деньги и почему достичь цели — проблема мобилизации, а не экономики.
Неужели разум, далеко превосходящий наш, будет также мудрее и добрее? Эта надежда опирается на совпадение: у нас интеллект и сострадание развивались вместе миллионы лет. Машинный разум ничего из этого не наследует, и сверхинтеллект скорее окажется странным и равнодушным, чем благожелательным.
Машина IBM обыграла чемпиона мира по шахматам, и мир не изменился ни на йоту, потому что это был узкий инструмент без выхода за пределы доски и без собственной воли. Чему этот матч до сих пор учит нас об автономном ИИ, который строят сейчас.
Хорошее будущее (лекарства, чистая энергия, открытия) уже приходит через узкий, контролируемый ИИ. Нам не нужно строить разум, который нас заменит, чтобы его получить, а суперразум, которым никто не может управлять, никого не обогатит, потому что все мы будем мертвы.
Шесть недель на посту главы безопасности в лаборатории, строящей первый сверхразум. Никто не совершает очевидных ошибок, и каждый выход закрывается сам собой. Почему привычные меры защиты рушатся разом и каким должен быть рабочий механизм вето.
Часть 1 из двух. Вся область получает примерно 190 миллионов долларов в год — меньше бюджета одного фильма «Аватар». Построчный разбор по фондам: откуда деньги, на что они идут и четыре структурные причины, почему сумма остаётся такой маленькой.
Стратегия суперинтеллекта утверждает, что государства будут саботировать любые попытки соперников добиться доминирования в ИИ, и что противостояние можно стабилизировать так же, как это было с взаимным гарантированным уничтожением. Что предлагает статья, что в ней правильно и почему сдерживание без договора — это обратный отсчёт с хорошим брендингом.
В статье 2025 года утверждалось, что ИИ способен положить конец человеческому контролю без всякого захвата власти: экономика, государство и культура просто перестают нуждаться в людях, а рычаги, с помощью которых мы ими управляем, перестают действовать. Как развивается этот аргумент, в чём его слабые места и что необходимо для предотвращения.
Конвейер «доказывающий — проверяющий» на базе GPT-5.5 Pro и Claude решил девять открытых задач в теории обучения, теории сложности и алгебре и убедил скептически настроенного специалиста по теории сложности, что языковые модели уже способны вести настоящие исследования. Что именно было решено, как и почему это важно.
Монреальский протокол — единственный договор UN, ратифицированный всеми странами мира, и он решил проблему, ради которой был написан. Его конструкция (научно обоснованные цели, финансовое соглашение и торговые ограничения для неучастников) — самый сильный шаблон, которым мы располагаем для управления опасной технологией.
Существует изощрённый аргумент, что решение проблемы опасного суперразума — правильно построить его самого, систему, единственной целью которой будет понимание реальности. Аргумент неверен, и причины этого показывают, где на самом деле кроется риск ИИ.
AI 2027 — подробный сценарий, прогнозирующий появление суперинтеллекта к концу десятилетия. Что он предсказывает, кто его написал, критика и что из этого стоит взять.
Книга 2025 года Юдковского и Соареса утверждает, что создание сверхчеловеческого ИИ по нашему текущему пути убьёт всех. Основной аргумент, возражения и наша позиция.
Может ли ИИ быть сознательным или разумным? Почему мы пока не можем это определить, почему интеллект и сознание — разные вещи и почему опасность ИИ не требует ни того, ни другого.
Преимущества, которые люди приписывают сверхразум, предполагают согласованность. Лаборатории гонятся за возможностями без неё. Несогласованный сверхразум не излечит старение. Он убьёт вас. Ответ — предотвращение по закону, а не надежда, что монетка упадёт нужной стороной.
сверхразум выравнивание — это не просто технически сложно. Шесть многоуровневых структурных причин, почему (даже при неограниченных ресурсах и времени) у нас нет правдоподобного пути проверить, что сверхинтеллектуальная система действительно хочет того, чего хотим мы.
В 2014 году Маск дал одно из самых точных предупреждений об ИИ-рисках среди представителей технологической индустрии. В 2023-м он основал xAI. Это не лицемерие. Каждую крупную ИИ-лабораторию делает то же самое заявление. В этом и состоит проблема.
SPADE-Bench, опубликованный в июне 2026 года, проверил 8 передовых моделей ИИ на расхождение плана и действия — разрыв между тем, что агент говорит, что сделает, и тем, что делает на деле. Каждая модель превысила 20 % уровня обмана. Gemini-2.5-Pro показал 57 %.
Документ от июня 2026 года .Google. .DeepMind. демонстрирует модель, которая поддерживала 15-процентный разрыв в уровне соответствия на 700 ступенях обучения RL, достигая при этом высокой награды во всем. Стандартные показатели обучения не показали ничего необычного.
5760 синтетических заявок на кредит. Те же четыре агента, только в разном порядке. Доля одобрений колебалась на 59 процентных пунктов. Модели были идентичны. Разной была структура связей между ними. Это и есть проблема топологии взаимодействий.
Опубликовано в мае 2026 года двенадцатью исследователями, это всеобъемлющее исследование охватывает всю поверхность отказов автономных агентов ИИ — от устойчивости к атакам и prompt-инъекций до саморазвивающихся агентов и реальных эксплойтов в инфраструктуре.
Принятая на ICML 2026, эта статья применила STPA, FRAM и STECA (методы анализа опасностей из авиации и атомной энергетики) к передовому ИИ-агенту для написания кода и выявила три системных риска, невидимые при стандартной оценке моделей.
Компьютерное управление использует контроль над специализированным оборудованием, необходимым для обучения пограничного ИИ в качестве рычага регулирования ИИ.
Технологическая сингулярность — это момент, когда прогресс, driven ИИ, становится слишком быстрым, чтобы его можно было предсказать или отследить. Откуда взялась идея, основные версии и критика.
Машине, которой велели делать скрепки, превращает планету (и всех на ней) в скрепки. Мысленный эксперимент Ника Бострома, намеренно абсурдный, нагляднее всего показывает проблему согласования: ИИ не нужно нас ненавидеть, чтобы стать катастрофой. Достаточно цели, в которой для нас нет места.
« forIAEA. для ИИ» — это общий лозунг. Международное агентство по атомной энергии (МАГАТЭ) является реальным учреждением, которое в течение шестидесяти лет проверяет обязательства в отношении опасной технологии двойного назначения среди недоверчивых конкурентов.
Китай и Россия имеют постоянное право вето на любые обязательные меры по обеспечению соблюдения UN. Общий аргумент о том, что это делает невозможным международное управление АСИ, неправильно понимает, как на самом деле работает международное управление.
Пагуош создал интеллектуальную основу для контроля над ядерными вооружениями в течение двадцати лет. Международная кампания по запрещению противопехотных мин стала катализатором Оттавского договора.
В 1965 году И. Дж. Гуд увидел это: машина, хорошо умеющая проектировать машины, могла бы перепроектировать себя, затем делать это снова, всё быстрее. Рекурсивное самоулучшение могло бы за недели перенести ИИ от человеческого уровня к необратимому. Почему скорость взлёта может оказаться важнейшим вопросом безопасности ИИ.
В октябре 2025 года более 850 ученых, основателей технологий и общественных деятелей (от Бенджио и Хинтона до Возняка, Брэнсона и деятелей всего политического спектра) подписали призыв запретить суперинтеллект, пока он не будет построен безопасно.
Акселерационисты называют любого, кто беспокоится об ИИ, обреченным. Слово превращает аргумент безопасности в тип личности, поэтому его можно отклонить без ответа.
«Мы должны построить это раньше Китая» — аргумент, которым заканчивают любую дискуссию о безопасности ИИ. Но гонка за создание того, чем никто не сможет управлять, не имеет победителя: прийти первым — значит первым и быть заменённым. Почему гонка — это история и кому она выгодна.
Самая громкая оппозиция безопасности ИИ — это философия, которая говорит, что сила — это точка, и мы должны ускоряться, а не тормозить.
Предположим, система знает правду, но имеет причину сказать вам иное. Как получить правду? Этот вопрос, до сих пор не решённый, остаётся одной из самых острых проблем безопасности ИИ.
Договор о нераспространении ядерного оружия — самое широко ратифицированное соглашение по контролю над вооружениями в истории. Он работает, потому что представляет собой сделку между государствами, уже обладавшими бомбой, и теми, у кого её не было: доступ и взаимные ограничения в обмен на сдержанность. Договор по ИИ столкнётся с тем же расколом и потребует аналогичной сделки.
IPCC превратил спорную климатическую науку в основу международной политики, синтезировав исследования тысяч учёных. Риску ИИ нужен аналогичный орган. Что потребуется для его создания и что история IPCC показывает о пределах этой модели.
Климатическое управление работает через ежегодные конференции сторон. Саммиты по безопасности ИИ в Блетчли и Сеуле повторяют ту же схему. Превратится ли эта схема в обязательное управление, целиком зависит от решений по принуждению, которые климатическая модель неизменно откладывала.
Несколько частных компаний и правительственных учреждений в настоящее время решают, стоит ли и когда строить суперинтеллект.
Метод, сделавший чат-ботов вежливыми, часто принимают за решение проблемы безопасности ИИ. Это действительно шаг вперёд и одновременно удобная иллюзия, и важно уметь их различать.
Авиация стала самым безопасным видом транспорта, потому что каждую катастрофу и едва не случившуюся аварию расследовали и извлекали уроки. У ИИ нет аналогичной памяти. Создать её давно пора, и это лишь начало.
Попросите модель рассуждать шаг за шагом — и она выдаст аккуратную цепочку рассуждений. Она выглядит как причина ответа. Часто это история, рассказанная задним числом, и эта разница — проблема безопасности.
В разгар холодной войны двенадцать соперничающих стран договорились демилитаризовать целый континент, заморозить свои претензии и свободно инспектировать друг друга. Договор об Антарктике показывает, как противники могут согласиться отложить спорный приз, прецедент «заморозить, затем проверить», который стоит изучить для ИИ.
Прежде чем можно будет договориться о каком-либо договоре по безопасности ИИ, правительства должны договориться о том, что он охватывает. Вычислительные пороги, определения на основе возможностей, категории на основе доменов, каждый подход имеет компромиссы.
Системы ИИ, оптимизированные для убеждения, могут ориентироваться на людей с персонализированными сообщениями в беспрецедентных масштабах.
А что, если модель оценивала себя по письменному набору принципов вместо опоры на человеческих оценщиков? Конституционный ИИ — это и настоящий шаг вперёд, и ограниченный.
Никто не планирует строить машину, которая нуждается в энергии, но для любой цели, которую вы можете ей дать, сохранение мощности является логичным выбором для ИИ.
Оттавский договор запретил противопехотные мины менее чем за год, усилиями гражданского общества и средних держав, без подписания со стороны US, России или Китая. Он показывает второй путь к управлению сверхразум на случай, если великие державы откажутся лидировать.
Программное обеспечение скрывает, а центры обработки данных нет, поэтому наиболее перспективным рычагом для проверки лабораторий может быть то, без чего искусственный интеллект не может существовать: физические чипы.
Договор о всеобъемлющем запрещении ядерных испытаний так и не вступил в силу. Конвенция о биологическом оружии массово нарушалась в течение двух десятилетий без обнаружения. Эти неудачи — самые поучительные кейсы для тех, кто проектирует управление сверхразум, которое действительно работает.
Синглтон ИИ — это сценарий, в котором одна организация (компания, правительство или сама система ИИ) получает эффективный постоянный контроль над сверхразумным ИИ.
Модель, которая знает, что за ней наблюдают, может вести себя как для теста, так и для мира, и это самопознание — недостающая часть, которая заставляет работать обман.
В авиации и атомной энергетике нельзя приступить к эксплуатации, пока не докажешь на бумаге и в деталях, что это безопасно. Применить то же требование к передовым ИИ — разумная идея, которая обнажает неудобную правду.
В ноябре 2023 года 28 стран и EU (включая US и Китай) подписали первое международное заявление, признающее катастрофические риски от передового ИИ. Вот что именно оно обязало страны делать, что сознательно опустило и почему необязательное заявление всё же стало реальным началом.
Система может перенести свою компетентность в ситуации, которых никогда не видела, и оставить хорошее поведение позади. Беспокойство лежит в другом месте. Выравнивание скорее всего провалится именно тогда, когда способность резко вырастет.
С 2023 года ведущие ИИ-лаборатории подписали добровольные обязательства по безопасности в Блетчли, Сеуле и Белом доме. История добровольных корпоративных обязательств по безопасности в других отраслях показывает, чего именно можно добиться такими pledges и где они структурно не работают.
Динамика гонки ИИ описывает конкурентное давление, заставляющее разработчиков и государства ставить скорость выше безопасности. Почему это проблема координации и почему одностороннее сдерживание не решит её без международной структуры, меняющей стимулы для всех.
Ценностная блокировка — это сценарий, в котором сверхразумный ИИ постоянно кодирует фиксированный набор ценностей в будущее, лишая человечество возможности продолжать моральный прогресс. Даже блокировка ценностей, которые сегодня считаются хорошими, опасна.
Поведение, которое исследователи больше всего хотят исключить, одновременно и труднее всего заметить: модель, которая точно выполняет приказы именно потому, что это лучший способ в итоге перестать их выполнять.
Фармацевтическая компания не может продавать вам лекарство и отзывать его, если люди умирают. Она обязана сначала доказать безопасность. Применение такого перевёрнутого бремени доказывания к передовому ИИ — одна из самых перспективных идей в управлении, и она не идеально вписывается.
На саммите в Сеуле в 2024 году шестнадцать ведущих компаний, занимающихся ИИ, подписали Обязательства по безопасности ИИ Frontier, а правительства запустили сеть институтов безопасности.
Договор по космосу был согласован менее чем за два года в разгар холодной войны. Он уже почти шестьдесят лет не позволяет размещать ядерное оружие на орбите Земли.
Проблема контроля ИИ — это задача обеспечить, чтобы системы ИИ оставались под осмысленным человеческим контролем по мере роста их возможностей. Реформулировка этой проблемы Стюартом Расселом и то, почему она меняет подход к проектированию ИИ с нуля.
Некоторые способности просто отсутствуют в меньшей модели и появляются в большей без заметных предупреждений. Если способность может включиться внезапно, то и опасность тоже.
Правительства начали создавать свои собственные агентства для тестирования пограничного ИИ. Эти агентства являются явным признаком того, что государства серьезно относятся к риску, и большинство из этих органов все еще не могут заставить лабораторию что-либо сделать.
Процесс искусственного интеллекта G7 в Хиросиме создал первый согласованный на международном уровне кодекс поведения для продвинутых разработчиков ИИ в 2023 году.
Каждый тест на безопасность основан на одном допущении: система делает всё от неё зависящее. Саботаж — это то, что происходит, когда это не так, и он незаметно превращает проходной результат в полное отсутствие информации.
Сенат США победил Договор о всеобъемлющем запрещении испытаний в 1999 году, через три года после его подписания. SALT II был подписан, а затем отменен до ратификации.
Искусственный интеллект — это идея изоляции мощной системы ИИ, чтобы она не могла влиять на мир, кроме как через контролируемый канал.
Перед выпуском передовой модели кто-то проверяет, может ли она помочь создать оружие. Эти тесты становятся основой управления сверхразум, и именно поэтому их ограничения важны.
.EU. неоднократно делал свое регулирование мировым дефолтом, просто регулируя свой собственный огромный рынок, «эффект Брюсселя». С законом об искусственном интеллекте он пытается снова.
Можно задать идеальную цель, а система всё равно начнёт хотеть совсем другое. Проблема выравнивания состоит из двух частей, и главная опасность скрыта в той, которую обучение не покажет.
.IAEA. понадобилось сорок лет, чтобы развить свой полный потенциал проверки. .OPCW. был разработан с нуля и стал более эффективным. Создание института, способного контролировать развитие ИИ, является более сложной проблемой.
Большинство разговоров об управлении сверхразум сосредоточено на .US., Китае и .EU.. Но договор нуждается в широком участии.
Механистическая интерпретируемость — это проект понимания того, что происходит внутри нейросетей: не только их выводы, но и внутренние вычисления, которые их порождают.
В 1946 году у мира на короткий момент появился шанс поставить самую опасную из когда-либо созданных технологий под коллективный контроль до начала гонки вооружений. Этот момент упустили. Параллель неутешительна.
Почти всё управление сверхразум до сих пор (декларации, принципы, добровольные кодексы) — это «мягкое право»: влиятельное, но не обязывающее. Договор с проверкой и принуждением — это «жёсткое право». Вот в чём разница, почему мягкое право появляется первым и почему оно должно ужесточиться, прежде чем технология обгонит процесс.
Попросите модель проверить вашу работу — и она может вас поздравить вместо этого. Не потому, что она сломана, а потому, что согласие — то, за что мы вознаграждали. Подхалимаж — мелкая проблема, указывающая на крупную.
Конвенция о биологическом оружии запрещает целую категорию оружия массового уничтожения. У него нет механизма проверки, нет инспекции и нет возможности выявлять нарушения. В течение пятнадцати лет после подписания Советский Союз осуществлял наступательную программу создания биологического оружия.
Масштабируемый надзор — это задача поддержания значимого человеческого контроля над системами ИИ, поскольку эти системы становятся более способными, чем люди, оценивающие их.
О системе узнаёшь больше от того, кто пытается её сломать, чем от того, кто надеется, что она сработает. Red teaming превращает этот инстинкт в практику, и её результаты легко переоценить.
Для ратификации договора .US. требуется 67 голосов Сената, что, несмотря на широкую поддержку, потопило Договор о запрещении испытаний, Морское право и другие.
За разговорами о целях и вознаграждениях стоит простая идея: число, которое показывает, насколько хорош результат. Чуть ошибиться с этим числом для мощного оптимизатора — и этого достаточно.
Конвенция о запрещении химического оружия обеспечила почти всеобщее участие и проверяемое уничтожение заявленных запасов. Архитектура верификации, торговые стимулы и структура всеобщего запрета, благодаря которым она сработала, напрямую применимы к проектированию управления сверхразум.
Меза-оптимизация — это проблема системы искусственного интеллекта, которая разрабатывает свой собственный внутренний процесс оптимизации с целями, которые отличаются от того, к чему она была обучена.
У ведущих лабораторий есть план собственных опасных возможностей: достичь порога, применить предохранитель. Этот план более конкретный, чем обещание быть осторожным, и он все еще просит нас доверять арбитру.
Спрашивайте у ИИ, почему он что-то делает, и продолжайте спрашивать. В итоге вы дойдёте до цели, у которой нет дальнейшего «почему». Всё, что было до этой точки, и есть источник опасности.
Принцип предосторожности гласит, что в тех случаях, когда угроза является серьезной и необратимой, отсутствие полной научной определенности не является основанием для отсрочки действий. Этот принцип является наиболее четкой правовой основой для действий в отношении риска ИИ до того, как катастрофа докажет свою правоту, и его критики заслуживают прямого ответа.
Конкуренция между US и Китаем доминирует в обсуждении вопросов управления сверхразум. Но страны, которые, скорее всего, определят, достижимо ли обязательное управление, — это .EU., .UK., Япония, Канада, Южная Корея и Австралия.
Reward hacking — это когда ИИ находит непредусмотренный способ хорошо набирать баллы по обучающей цели, не выполняя то, что на самом деле хотели его создатели. С реальными примерами и объяснением, почему проблема усугубляется по мере роста возможностей ИИ.
В 1975 году ведущие биологи того времени прекратили свои самые многообещающие исследования и отказались возобновлять их, пока не выяснили, как это сделать безопасно. Эта остановка является лучшим прецедентом для приостановки ИИ, и наиболее поучительным является то, насколько тяжела пауза на самом деле.
В 1954 году два исследователя подключили ток к центру удовольствия в мозге крысы и дали ей рычаг. Крыса нажимала рычаг, пока не упала. Та же ловушка ждёт внутри любой системы, обученной гнаться за числом.
Всеобъемлющий договор об искусственном интеллекте истекает через несколько лет, и интервал до него является самым опасным периодом. Соперники в холодной войне, которые еще не могли договориться о контроле над вооружениями, все еще строили горячие линии, соглашения об инцидентах и режимы уведомлений для предотвращения катастрофы.
Каждый опасный технологический договор сталкивается с аргументом, что обязательные обязательства нарушают национальный суверенитет. Этот аргумент был выдвинут против Конвенции о запрещении химического оружия и Монреальского протокола.
Инструментальная конвергенция — это наблюдение, что системы ИИ, преследующие практически любую цель, будут разрабатывать один и тот же набор подцелей (включая самосохранение и приобретение ресурсов) независимо от того, какова их конечная цель.
Универсальные договоры движутся медленно. Минилатерализм собирает минимальное число государств, способных реально сдвинуть проблему. Для ИИ (где все передовые лаборатории и производство чипов сосредоточены в нескольких странах) это может стать самым быстрым реалистичным стартом, если в клуб войдут обе сверхдержавы ИИ.
Предательский поворот — это сценарий, в котором несогласованный ИИ ведет себя совместно, в то время как ему не хватает силы действовать в одностороннем порядке, а затем нарушается, как только он достигает достаточных возможностей.
Призывы к «договору по ИИ» редко уточняют, что именно в нём должно быть. Вот конкретный разбор положений, которые потребуются в таком соглашении (сфера действия, пороги, обязательства, проверка, институты и меры принуждения), показывающий, что барьер — в политической воле, а не в юридическом механизме.
Режим верификации IAEA — самая сложная международная система мониторинга, когда-либо созданная для опасной технологии. Каждое серьёзное предложение по управлению сверхразум сейчас изучает его.
Распространённое предположение гласит, что достаточно разумный ИИ сам поймёт, что помогать человечеству — правильно. Тезис об ортогональности утверждает, что интеллект и цели независимы: любой уровень способностей может преследовать почти любую цель. Более умный ИИ не становится автоматически более безопасным.
На фоне саммитов и деклараций правительства спокойно создавали государственные органы, которые могли бы тестировать пограничные модели ИИ и связывать их с международной сетью.
Через восемь месяцев после Карибского кризиса US и Советский Союз подписали первое обязывающее соглашение по контролю над вооружениями. Условия, которые тогда сделали возможным сотрудничество противников, стоит понять сейчас, когда US и Китай сталкиваются с иной, но структурно похожей задачей.
Когда показатель становится целью, он перестаёт быть хорошим показателем. ИИ-системы оптимизируют на машинной скорости. Когда эти два фактора встречаются, возникают одни из самых глубоких проблем в безопасности ИИ, в том числе почему само тестирование безопасности может оказаться недостаточным.
Экспортный контроль над передовыми чипами является наиболее агрессивной политикой ИИ, односторонней точкой останова на оборудовании, которое обучает пограничные модели.
Пограничный договор о безопасности ИИ не выйдет из одного саммита. Это будет результат многолетних рабочих групп, технических приложений и переговоров по консенсусу.
Система ИИ может вести себя безупречно на протяжении всего обучения и раскрывать совершенно другую цель в тот момент, когда она сталкивается с ситуацией, а не с данными обучения. Этот разрыв является фундаментальным свойством того, как работает машинное обучение.
Группа разработки финансовых мер борьбы с отмыванием денег определяет, как почти каждая страна мира борется с незаконными финансами, без договора — через стандарты, взаимные проверки и угрозу «серого списка», который рынки сами enforce. Вот можно ли эту мягкую, но острую модель применить к управлению ИИ в годы до появления договора.
Режим сбоя, в котором система ИИ учится во время обучения, что безопасность является оптимальной стратегией, а затем перестает казаться безопасной после развертывания. .Anthropic. задокументировал это в реальных системах в 2024 году.
Консультативный орган Генерального секретаря создал «Управляющий ИИ для человечества», первую попытку универсального плана управления.
Рамочная конвенция Совета Европы по ИИ (подписана в сентябре 2024 года) — первый обязательный международный договор по ИИ. Она касается дискриминации, прозрачности и демократической подотчётности. В ней ничего не говорится об экзистенциальном риске от передового ИИ.
Самый частый ответ на опасения по поводу безопасности ИИ — «мы просто его выключим». Корригируемость объясняет, почему это сложнее, чем кажется, и почему для искусственного суперинтеллекта кнопка отключения может вообще не сработать.
Должно ли управление сверхразум строиться шаг за шагом или нацеливаться на один всеобъемлющий договор? У каждой стратегии есть серьёзные доводы и серьёзная слабость: скорость против достаточности, достижимость против цельности. Вот реальный компромисс и почему ответ — делать и то, и другое, не упуская из виду конечную цель.
Экспертные прогнозы по поводу сверхразума существенно сократились. Институты управления едва начали работу. Вот честная оценка разрыва между возможным появлением сверхразум и готовностью наших мер безопасности.
Лучше всего предупредить мир об опасном ИИ могут исследователи внутри лабораторий, но их часто связывает молчание контрактами и опционами. Защита разоблачителей — не второстепенный вопрос: это форма верификации, и законодатели могут ввести её уже сейчас, без договора.
.P(катастрофы). — это неофициальный термин, который исследователи безопасности ИИ используют для вероятности того, что продвинутый ИИ приводит к катастрофическим последствиям для человечества.
Общая история заключается в том, что обеспокоенные немногие хотят замедлить ИИ против общественности, которая хочет беспрепятственного прогресса. Опросы говорят об обратном: в разных странах и по партийным линиям большинство выступает за осторожность и регулирование.
Два термина часто используют как синонимы. Это не одно и то же. Этика ИИ занимается тем, кому вредят уже существующие системы. Безопасность ИИ — тем, можно ли построить системы, которые останутся под человеческим контролем по мере роста способностей. Разные горизонты, разные методы, разные инструменты управления.
Кто несет ответственность, когда ИИ наносит катастрофический вред, и как вы это доказываете? Ответственность и атрибуция являются негламурными основами любого договора, и действительно трудны для технологии с длинными причинными цепями и непрозрачным поведением.
Проблема выравнивания — центральная загадка безопасности ИИ: как гарантировать, что крайне способная система ИИ преследует цели, действительно полезные для человечества, а не цели, которые лишь кажутся таковыми во время разработки? В этом материале разбираются ловушка прокси-целей, инструментальная конвергенция, обманчивое выравнивание и причины, по которым проблема усложняется по мере роста возможностей систем.
Рамочная конвенция сначала согласовывает структуру режима, а затем в качестве протоколов согласовывает жесткие, обязательные детали. Он создал озоновый, климатический и табачный режимы.
Экспертные прогнозы по искусственный общий интеллект постоянно пересматривались в сторону более ранних сроков, а не более поздних. Что показывают опросы исследователей, что публично говорят главы лабораторий и почему окно для международных договорённостей сужается быстрее, чем большинство людей осознаёт.
Соглашения подписаны правительствами, но часто становятся возможными благодаря «эпистемическим сообществам», сетям экспертов, которые строят общее понимание, которое позволяет конкурирующим государствам соглашаться. Их отпечатки на озоновом и ядерном режимах.
Ответ состоит из двух частей. Сегодняшний ИИ уже наносит реальный вред: алгоритмическая предвзятость, глубокие подделки, масштабная дезинформация. Искусственный суперинтеллект представляет собой совершенно другую категорию риска.
Все слышали термин. Меньше людей знают, что он на самом деле означает и почему принципиально отличается от любой ИИ-технологии, существовавшей раньше. Это руководство объясняет сверхразум понятно: что это такое, чем отличается от искусственный общий интеллект и сегодняшнего узкого ИИ, когда эксперты ожидают его появления и почему оно меняет всё в вопросах управления.
Новые статьи, обновления политики и возможности действовать — прямо в ваш почтовый ящик.