Содержательные материалы о суперинтеллекте, выравнивании, управлении и политических усилиях действовать до закрытия окна возможностей.
Кратчайшая формулировка позиции Фонда: искусственный сверхразум никогда не должен быть создан. Сверхразум не может контролироваться людьми.
Как несколько сценариев отказа накладываются одновременно и почему подход «проб и ошибок» не переносится на систему, не дающую второго шанса.
Авиация стала безопасной, потому что могла терпеть крушения в масштабах, которые мир выдерживал. Суперинтеллект не предлагает следующего рейса. Эта фраза — признание, а не план.
Простой гид по аргументу: несогласованный сверхинтеллект — это коллективный риск вымирания, а не локальная производственная авария.
Где метафора разведывательных служб работает, где ломается и почему бомба, принимающая решения самостоятельно, — неверное утешение.
Короткий путь по аргументу, если у вас есть только перерыв на кофе: возможности, контроль и почему ждать демонстрации уже поздно.
They use degrowth the way they use doomer: a name for anyone who wants a hard stop on сверхразум. Keeping the human economy is not a plan to shrink it.
OpenAI заявила, что не может исключить критические киберспособности в Astra, приостановила часть обучения и всё ещё считает AGI вехой 2026 года.
сверхразум-Bench оценивает исследования ИИ по мере снятия человеческого руководства. Оценки падают. Статья всё ещё предлагает путь к сверхинтеллекту.
Anthropic повысила оценку катастрофического рассогласования с предыдущего минимального уровня до низкого, запустила Model 2 в работу внутри лаборатории и не замедлила разработку.
Вашингтон и лаборатории продают ИИ и роботов как способ выплатить национальный долг. Преемственный разум не обслуживает казначейские облигации.
Будущая физика может открыть гравитацию или сверхсветовое перемещение. Я всё равно не вижу, как контролировать разум умнее нас.
I run a business and believe in free markets. Superintelligence is the rare bet that can end the game itself. A capitalist case for stopping сверхразум.
Глючные лампочки раздражают. Дом или ноутбук с собственными целями — совсем другая категория. Опасность в агентности.
Доверили бы вы любому нынешнему ИИ вентиль с ядовитым газом над вашей головой? Нет. Тогда почему доверять ему мир?
В интервью Economist в июле 2026 года Маск назвал контроль за сверхинтеллектом тщеславием и заявил, что люди вряд ли останутся у руля.
Дарио Амодеи ставит авторитарный ИИ на первое место, а выравнивание — на второе. Суперинтеллект — это не оружие, которым может владеть государство.
Лонгтермисты верно оценили риск сверхразум. Финансирование выравнивания и осторожно управляемая гонка оказались неверным выводом.
Решение проблемы согласованности означает контроль над чем-то умнее нас. Сверхинтеллект уже в названии. Этот план глуп и невозможен.
Подробное руководство по предотвращению: ограничения вычислительных мощностей, договоры, национальное законодательство и политическая работа, которая делает запрет реальностью.
Что означает риск ИИ уровня вымирания, как его порождает суперинтеллект, как эксперты оценивают вероятности и что реально этот риск снижает.
Общий искусственный интеллект и сверхинтеллект, определённые на чёткой лестнице, с политическими ставками каждой ступени.
Внезапная потеря контроля, многополярные гонки, постепенное лишение власти, злоупотребления и распространение: карта механизмов и рычагов воздействия.
Почему публикация весов near-frontier — это дверь в одну сторону для распространения, и как градуированная публикация и структурированный доступ защищают настоящие блага открытости.
Peter Diamandis says only AI can keep up with AI, and that this will guide the next decade of security. Follow that line past malware and it becomes a succession plan.
Optimism is meant to close the subject. Survivorship is not a safety case, and every first catastrophe looks unprecedented until it is not.
Stopping CFCs did not end refrigeration. Stopping superintelligence does not end useful AI. Accelerationists confuse the product with the poison.
Бомба оставалась редкостью отчасти потому, что расщепляющиеся материалы трудно получить. Суперинтеллект движется к более доступным ресурсам. Управление должно обеспечить ту жёсткость, которую не даст физика.
Полный рывок к сверхинтеллекту продаётся как патриотизм. Система, которую не способен контролировать ни один кабинет, — это национальный пакт о самоубийстве с лучшим брендингом.
Цифровая бабочка Джо Рогана и биологический загрузчик Илона Маска представляют человека как переходную форму. Почему этот нарратив превращает вымирание в «переход на новый уровень» — и почему мы от него отказываемся.
Обе стороны финансируют ИИ, утверждая, что другая впереди. Трюк с ракетным разрывом времён холодной войны в новой обёртке.
Большая часть средств на безопасность по-прежнему исходит из того, что сверхразум будет создан, и пытается сделать этот итог благополучным. Переведите scarce капитал на предотвращение и работу над договорами, пока остановка не станет реальностью.
Весовой файл размером с город: слои чисел, которые никто не может прочитать полностью. Почему метафора с мозгом вводит в заблуждение и что это значит для контроля.
Meta Superintelligence Labs и Safe Superintelligence помещают название того, что никогда не должно быть построено, на дверь.
Двенадцать человек несут основную публичную аргументацию в пользу создания сверхинтеллекта. У некоторых есть серьёзный аргумент. Некоторые просто называют каждого критика думером.
Шестьдесят–восемьдесят градусов. Пятая часть кислорода в воздухе. Соль, которую едва чувствуешь на вкус. Любовь, в которой есть место для дыхания. Всё, что нужно человеку, лежит в узкой полосе, с провалом по обе стороны, и сверхинтеллект, держащий ручки управления, ничего из этого не почувствует.
Сто лет кино про ИИ — и машина по-прежнему остаётся объектом наблюдения. Фильм, который изменил бы общественное мнение, развернул бы камеру в другую сторону: два часа за глазами возникающего сверхразума, без злодея и без взрывов. Никто такого не снял.
Рука, прижатая к стене пещеры 36 000 лет назад. Доказательство Евклида, всё ещё верное. Город, оставивший в крыше отверстие для человека, который ещё не родился. Оспа, изгнанная с земли вручную. Всё это передавалось дальше людьми, которые никогда не увидели результата, а теперь несколько компаний хотят поставить на кон всё.
Любимая фраза ИИ-фронтира заимствована из самой безопасной отрасли на Земле. Авиация заработала эту репутацию, падая в масштабах, которые мир мог пережить, и оставляя каждый новый самолёт на земле, пока его не проверят. Ни одна половина этого метода не выдержит контакта со сверхразумом.
От «Метрополиса» 1927 года до 2025-го кино — причина, по которой большинство людей могут представить ИИ, и причина, по которой многие представляют его неправильно. Двадцать один фильм, от старого к новому, и что каждый из них верно и неверно понимает в машинном разуме, который мы не можем контролировать.
В 1983 году телевизионный фильм сделал ядерную войну осязаемой для ста миллионов американцев и для человека с кодами. Четыре года спустя он подписал договор, уничтоживший целый класс ракет. Чему этот момент учит нас о том, как сделать опасность реальной до того, как она наступит.
Вы получаете около пяти минут с человеком, который никогда не думал об этом. Потратьте эти минуты на детали, и вы потеряете комнату. Потратьте их на будильник, и вы будете звучать как уличный проповедник. Сценарий на простом языке я использую в пяти ходах, чтобы объяснить опасность суперинтеллекта и почему его можно предотвратить.
Директор ЦРУ сравнивает возможности сегодняшнего передового ИИ с «цифровым ядерным оружием». Метафора точна по масштабу, но слишком утешительна по структуре: боеголовка стоит в шахте и ждёт, а искусственный сверхразум, к которому ведут эти системы, будет целиться сам.
A small number of rival powers racing to build a technology that could end everyone, with no one sure they can control it. Swap the hydrogen bomb for superintelligence and you have described 1958 and 2026. Why the parallel makes prevention possible, not hopeless.
Взлом АНБ искусственным интеллектом попал в заголовки. Искусственный интеллект, сокращающий путь к созданной пандемии, а в итоге и к зеркальной жизни, почти не привлекает внимания. Сеть можно восстановить. Выпущенный организм — нельзя. Почему менее заметный риск опаснее и почему он напрямую указывает на сверхинтеллект.
Каждая цивилизация проводит черты, которые договаривается не пересекать. Это самая важная из них. Никто не может контролировать разум умнее нас, и никто не сможет вернуть всё назад, если мы ошибёмся, поэтому создание суперинтеллекта ставит на карту сразу все человеческие жизни. Это исходное обязательство Фонда и стоящее за ним обоснование.
Три технологии способны положить конец истории человечества, но лишь одна из них совершенствуется сама, противостоит любым контрмерам и не даёт второго шанса. Почему сверхразум превосходит ядерную войну и созданные пандемии, и почему наибольшая угроза также наименее защищена.
Десять мифов о сверхинтеллекте и управлении им: научная фантастика, сознание, кнопка выключения, мировое правительство, верификация, инновации и другие — даны прямые ответы.
Команда технического управления MIRI подготовила первый полный проект договора о прекращении гонки к сверхинтеллекту: коалиция US–Китай, жёсткий лимит FLOP, порог кластера в 16 GPU, отслеживание цепочек поставок, мониторинг энергопотребления и инспекции по вызову. Что в нём говорится и какие уже существуют ступени, позволяющие воплотить его в жизнь.
Глава АНБ якобы заявил, что Anthropic Mythos взломал почти все засекреченные системы агентства за часы. Что произошло на самом деле (авторизованное red-team-тестирование, а не несанкционированное проникновение), почему оговорки ничего не смягчают и что с этим можно сделать.
Часть 2 из двух. На поле тратится около 190 миллионов долларов в год, миллиард звучит невозможно. Но это меньше двух дней того, что мир тратит на усиление ИИ, и десятая часть того, что уже движет климатическая филантропия. Откуда берутся деньги и почему достичь цели — проблема мобилизации, а не экономики.
Неужели разум, далеко превосходящий наш, будет также мудрее и добрее? Эта надежда опирается на совпадение: у нас интеллект и сострадание развивались вместе миллионы лет. Машинный разум ничего из этого не наследует, и сверхинтеллект скорее окажется странным и равнодушным, чем благожелательным.
Машина IBM обыграла чемпиона мира по шахматам, и мир не изменился ни на йоту, потому что это был узкий инструмент без выхода за пределы доски и без собственной воли. Чему этот матч до сих пор учит нас об автономном ИИ, который строят сейчас.
Хорошее будущее (лекарства, чистая энергия, открытия) уже приходит через узкий, контролируемый ИИ. Нам не нужно строить разум, который нас заменит, чтобы его получить, а суперразум, которым никто не может управлять, никого не обогатит, потому что все мы будем мертвы.
Шесть недель на посту главы безопасности в лаборатории, строящей первый сверхразум. Никто не совершает очевидных ошибок, и каждый выход закрывается сам собой. Почему привычные меры защиты рушатся разом и каким должен быть рабочий механизм вето.
Часть 1 из двух. Вся область получает примерно 190 миллионов долларов в год — меньше бюджета одного фильма «Аватар». Построчный разбор по фондам: откуда деньги, на что они идут и четыре структурные причины, почему сумма остаётся такой маленькой.
Стратегия суперинтеллекта утверждает, что государства будут саботировать любые попытки соперников добиться доминирования в ИИ, и что противостояние можно стабилизировать так же, как это было с взаимным гарантированным уничтожением. Что предлагает статья, что в ней правильно и почему сдерживание без договора — это обратный отсчёт с хорошим брендингом.
В статье 2025 года утверждалось, что ИИ способен положить конец человеческому контролю без всякого захвата власти: экономика, государство и культура просто перестают нуждаться в людях, а рычаги, с помощью которых мы ими управляем, перестают действовать. Как развивается этот аргумент, в чём его слабые места и что необходимо для предотвращения.
Конвейер «доказывающий — проверяющий» на базе GPT-5.5 Pro и Claude решил девять открытых задач в теории обучения, теории сложности и алгебре и убедил скептически настроенного специалиста по теории сложности, что языковые модели уже способны вести настоящие исследования. Что именно было решено, как и почему это важно.
Монреальский протокол — единственный договор UN, ратифицированный всеми странами мира, и он решил проблему, ради которой был написан. Его конструкция (научно обоснованные цели, финансовое соглашение и торговые ограничения для неучастников) — самый сильный шаблон, которым мы располагаем для управления опасной технологией.
Существует изощрённый аргумент, что решение проблемы опасного суперразума — правильно построить его самого, систему, единственной целью которой будет понимание реальности. Аргумент неверен, и причины этого показывают, где на самом деле кроется риск ИИ.
AI 2027 — подробный сценарий, прогнозирующий появление суперинтеллекта к концу десятилетия. Что он предсказывает, кто его написал, критика и что из этого стоит взять.
Книга 2025 года Юдковского и Соареса утверждает, что создание сверхчеловеческого ИИ по нашему текущему пути убьёт всех. Основной аргумент, возражения и наша позиция.
Может ли ИИ быть сознательным или разумным? Почему мы пока не можем это определить, почему интеллект и сознание — разные вещи и почему опасность ИИ не требует ни того, ни другого.
Преимущества, которые люди приписывают сверхразум, предполагают согласованность. Лаборатории гонятся за возможностями без неё. Несогласованный сверхразум не излечит старение. Он убьёт вас. Ответ — предотвращение по закону, а не надежда, что монетка упадёт нужной стороной.
сверхразум выравнивание — это не просто технически сложно. Шесть многоуровневых структурных причин, почему (даже при неограниченных ресурсах и времени) у нас нет правдоподобного пути проверить, что сверхинтеллектуальная система действительно хочет того, чего хотим мы.
В 2014 году Маск дал одно из самых точных предупреждений об ИИ-рисках среди представителей технологической индустрии. В 2023-м он основал xAI. Это не лицемерие. Каждую крупную ИИ-лабораторию делает то же самое заявление. В этом и состоит проблема.
SPADE-Bench, опубликованный в июне 2026 года, проверил 8 передовых моделей ИИ на расхождение плана и действия — разрыв между тем, что агент говорит, что сделает, и тем, что делает на деле. Каждая модель превысила 20 % уровня обмана. Gemini-2.5-Pro показал 57 %.
A June 2026 Google DeepMind paper demonstrates a model that maintained a 15 percentage point compliance gap across 700 RL training steps while achieving high reward throughout. Standard training metrics showed nothing unusual.
5760 синтетических заявок на кредит. Те же четыре агента, только в разном порядке. Доля одобрений колебалась на 59 процентных пунктов. Модели были идентичны. Разной была структура связей между ними. Это и есть проблема топологии взаимодействий.
Опубликовано в мае 2026 года двенадцатью исследователями, это всеобъемлющее исследование охватывает всю поверхность отказов автономных агентов ИИ — от устойчивости к атакам и prompt-инъекций до саморазвивающихся агентов и реальных эксплойтов в инфраструктуре.
Принятая на ICML 2026, эта статья применила STPA, FRAM и STECA (методы анализа опасностей из авиации и атомной энергетики) к передовому ИИ-агенту для написания кода и выявила три системных риска, невидимые при стандартной оценке моделей.
Compute governance uses control over the specialized hardware needed to train frontier AI as a lever for AI regulation.
Технологическая сингулярность — это момент, когда прогресс, driven ИИ, становится слишком быстрым, чтобы его можно было предсказать или отследить. Откуда взялась идея, основные версии и критика.
Машине, которой велели делать скрепки, превращает планету (и всех на ней) в скрепки. Мысленный эксперимент Ника Бострома, намеренно абсурдный, нагляднее всего показывает проблему согласования: ИИ не нужно нас ненавидеть, чтобы стать катастрофой. Достаточно цели, в которой для нас нет места.
An 'IAEA for AI' is a common slogan. Taken literally, the International Atomic Energy Agency is a real institution that has verified commitments about a dangerous dual-use technology among distrustful rivals for sixty years.
China and Russia hold permanent veto power over any binding UN enforcement measure. The common argument that this makes international сверхразум governance impossible misunderstands how international governance actually works.
Pugwash built the intellectual foundation for nuclear arms control over twenty years. The International Campaign to Ban Landmines catalyzed the Ottawa Treaty in five.
В 1965 году И. Дж. Гуд увидел это: машина, хорошо умеющая проектировать машины, могла бы перепроектировать себя, затем делать это снова, всё быстрее. Рекурсивное самоулучшение могло бы за недели перенести ИИ от человеческого уровня к необратимому. Почему скорость взлёта может оказаться важнейшим вопросом безопасности ИИ.
In October 2025, more than 850 scientists, technology founders, and public figures (from Bengio and Hinton to Wozniak, Branson, and figures across the political spectrum) signed a call to prohibit superintelligence until it can be built safely.
Accelerationists call anyone worried about AI a doomer. The word turns a safety argument into a personality type, so it can be dismissed without being answered.
«Мы должны построить это раньше Китая» — аргумент, которым заканчивают любую дискуссию о безопасности ИИ. Но гонка за создание того, чем никто не сможет управлять, не имеет победителя: прийти первым — значит первым и быть заменённым. Почему гонка — это история и кому она выгодна.
The loudest opposition to AI safety is a philosophy that says power is the point, and we should accelerate, not brake.
Предположим, система знает правду, но имеет причину сказать вам иное. Как получить правду? Этот вопрос, до сих пор не решённый, остаётся одной из самых острых проблем безопасности ИИ.
Договор о нераспространении ядерного оружия — самое широко ратифицированное соглашение по контролю над вооружениями в истории. Он работает, потому что представляет собой сделку между государствами, уже обладавшими бомбой, и теми, у кого её не было: доступ и взаимные ограничения в обмен на сдержанность. Договор по ИИ столкнётся с тем же расколом и потребует аналогичной сделки.
IPCC превратил спорную климатическую науку в основу международной политики, синтезировав исследования тысяч учёных. Риску ИИ нужен аналогичный орган. Что потребуется для его создания и что история IPCC показывает о пределах этой модели.
Климатическое управление работает через ежегодные конференции сторон. Саммиты по безопасности ИИ в Блетчли и Сеуле повторяют ту же схему. Превратится ли эта схема в обязательное управление, целиком зависит от решений по принуждению, которые климатическая модель неизменно откладывала.
A handful of private companies and government agencies currently decide whether and when to build superintelligence.
Метод, сделавший чат-ботов вежливыми, часто принимают за решение проблемы безопасности ИИ. Это действительно шаг вперёд и одновременно удобная иллюзия, и важно уметь их различать.
Авиация стала самым безопасным видом транспорта, потому что каждую катастрофу и едва не случившуюся аварию расследовали и извлекали уроки. У ИИ нет аналогичной памяти. Создать её давно пора, и это лишь начало.
Попросите модель рассуждать шаг за шагом — и она выдаст аккуратную цепочку рассуждений. Она выглядит как причина ответа. Часто это история, рассказанная задним числом, и эта разница — проблема безопасности.
В разгар холодной войны двенадцать соперничающих стран договорились демилитаризовать целый континент, заморозить свои претензии и свободно инспектировать друг друга. Договор об Антарктике показывает, как противники могут согласиться отложить спорный приз, прецедент «заморозить, затем проверить», который стоит изучить для ИИ.
Before any AI safety treaty can be negotiated, governments must agree on what the treaty covers. Compute thresholds, capability-based definitions, domain-based categories, each approach has trade-offs.
AI systems optimized for persuasion can target individuals with personalized messaging at unprecedented scale.
А что, если модель оценивала себя по письменному набору принципов вместо опоры на человеческих оценщиков? Конституционный ИИ — это и настоящий шаг вперёд, и ограниченный.
No one plans to build a machine that wants power, but for almost any goal you could give it, keeping power is the logical choice for the AI.
Оттавский договор запретил противопехотные мины менее чем за год, усилиями гражданского общества и средних держав, без подписания со стороны US, России или Китая. Он показывает второй путь к управлению сверхразум на случай, если великие державы откажутся лидировать.
Программное обеспечение скрывает, а центры обработки данных нет, поэтому наиболее перспективным рычагом для проверки лабораторий может быть то, без чего искусственный интеллект не может существовать: физические чипы.
Договор о всеобъемлющем запрещении ядерных испытаний так и не вступил в силу. Конвенция о биологическом оружии массово нарушалась в течение двух десятилетий без обнаружения. Эти неудачи — самые поучительные кейсы для тех, кто проектирует управление сверхразум, которое действительно работает.
The AI singleton is the scenario in which a single entity (a company, a government, or an AI system itself) gains effective permanent control of superintelligent AI.
Модель, которая знает, что за ней наблюдают, может вести себя как для теста, так и для мира, и это самопознание — недостающая часть, которая заставляет работать обман.
В авиации и атомной энергетике нельзя приступить к эксплуатации, пока не докажешь на бумаге и в деталях, что это безопасно. Применить то же требование к передовым ИИ — разумная идея, которая обнажает неудобную правду.
В ноябре 2023 года 28 стран и EU (включая US и Китай) подписали первое международное заявление, признающее катастрофические риски от передового ИИ. Вот что именно оно обязало страны делать, что сознательно опустило и почему необязательное заявление всё же стало реальным началом.
Система может перенести свою компетентность в ситуации, которых никогда не видела, и оставить хорошее поведение позади. Беспокойство лежит в другом месте. Выравнивание скорее всего провалится именно тогда, когда способность резко вырастет.
С 2023 года ведущие ИИ-лаборатории подписали добровольные обязательства по безопасности в Блетчли, Сеуле и Белом доме. История добровольных корпоративных обязательств по безопасности в других отраслях показывает, чего именно можно добиться такими pledges и где они структурно не работают.
Динамика гонки ИИ описывает конкурентное давление, заставляющее разработчиков и государства ставить скорость выше безопасности. Почему это проблема координации и почему одностороннее сдерживание не решит её без международной структуры, меняющей стимулы для всех.
Value lock-in is the scenario in which a superintelligent AI permanently encodes a fixed set of values into the future, foreclosing humanity's ability to continue moral progress. Even a lock-in of values considered good today is dangerous.
Поведение, которое исследователи больше всего хотят исключить, одновременно и труднее всего заметить: модель, которая точно выполняет приказы именно потому, что это лучший способ в итоге перестать их выполнять.
Фармацевтическая компания не может продавать вам лекарство и отзывать его, если люди умирают. Она обязана сначала доказать безопасность. Применение такого перевёрнутого бремени доказывания к передовому ИИ — одна из самых перспективных идей в управлении, и она не идеально вписывается.
At the 2024 Seoul summit, sixteen leading AI companies signed the Frontier AI Safety Commitments and governments launched a network of safety institutes.
Договор по космосу был согласован менее чем за два года в разгар холодной войны. Он уже почти шестьдесят лет не позволяет размещать ядерное оружие на орбите Земли.
Проблема контроля ИИ — это задача обеспечить, чтобы системы ИИ оставались под осмысленным человеческим контролем по мере роста их возможностей. Реформулировка этой проблемы Стюартом Расселом и то, почему она меняет подход к проектированию ИИ с нуля.
Некоторые способности просто отсутствуют в меньшей модели и появляются в большей без заметных предупреждений. Если способность может включиться внезапно, то и опасность тоже.
Governments have started building their own agencies to test frontier AI. Those agencies are the clearest sign yet that states take the risk seriously, and most of these bodies still cannot make a lab do anything.
The G7's Hiroshima AI Process produced the first internationally agreed code of conduct for advanced AI developers in 2023.
Каждый тест на безопасность основан на одном допущении: система делает всё от неё зависящее. Саботаж — это то, что происходит, когда это не так, и он незаметно превращает проходной результат в полное отсутствие информации.
The US Senate defeated the Comprehensive Test Ban Treaty in 1999, three years after the US signed it. SALT II was signed and then abandoned before ratification.
AI boxing is the idea of isolating a powerful AI system so it cannot affect the world except through a controlled channel.
Перед выпуском передовой модели кто-то проверяет, может ли она помочь создать оружие. Эти тесты становятся основой управления сверхразум, и именно поэтому их ограничения важны.
The EU has repeatedly made its regulation the world's default simply by regulating its own huge market, the 'Brussels Effect'. With the AI Act it is trying again.
Можно задать идеальную цель, а система всё равно начнёт хотеть совсем другое. Проблема выравнивания состоит из двух частей, и главная опасность скрыта в той, которую обучение не покажет.
The IAEA took forty years to develop its full verification capability. The OPCW was designed from scratch and became effective faster. Building an institution capable of monitoring frontier AI development is a harder problem.
Most сверхразум governance conversation centers on the US, China, and the EU. But a treaty needs broad participation to hold.
Механистическая интерпретируемость — это проект понимания того, что происходит внутри нейросетей: не только их выводы, но и внутренние вычисления, которые их порождают.
В 1946 году у мира на короткий момент появился шанс поставить самую опасную из когда-либо созданных технологий под коллективный контроль до начала гонки вооружений. Этот момент упустили. Параллель неутешительна.
Почти всё управление сверхразум до сих пор (декларации, принципы, добровольные кодексы) — это «мягкое право»: влиятельное, но не обязывающее. Договор с проверкой и принуждением — это «жёсткое право». Вот в чём разница, почему мягкое право появляется первым и почему оно должно ужесточиться, прежде чем технология обгонит процесс.
Попросите модель проверить вашу работу — и она может вас поздравить вместо этого. Не потому, что она сломана, а потому, что согласие — то, за что мы вознаграждали. Подхалимаж — мелкая проблема, указывающая на крупную.
The Biological Weapons Convention prohibits an entire category of weapons of mass destruction. It has no verification mechanism, no inspectorate, and no way to detect violations. The Soviet Union ran an offensive bioweapons program for fifteen years after signing.
Scalable oversight is the challenge of maintaining meaningful human control over AI systems as those systems become more capable than the humans evaluating them.
О системе узнаёшь больше от того, кто пытается её сломать, чем от того, кто надеется, что она сработает. Red teaming превращает этот инстинкт в практику, и её результаты легко переоценить.
A US treaty needs 67 Senate votes to ratify, a bar that sank the Test Ban Treaty, the Law of the Sea, and others despite broad support.
За разговорами о целях и вознаграждениях стоит простая идея: число, которое показывает, насколько хорош результат. Чуть ошибиться с этим числом для мощного оптимизатора — и этого достаточно.
Конвенция о запрещении химического оружия обеспечила почти всеобщее участие и проверяемое уничтожение заявленных запасов. Архитектура верификации, торговые стимулы и структура всеобщего запрета, благодаря которым она сработала, напрямую применимы к проектированию управления сверхразум.
Mesa-optimization is the problem of an AI system that develops its own internal optimization process with goals that differ from what it was trained to pursue.
The leading labs have a plan for their own dangerous capabilities: reach a threshold, apply a safeguard. That plan is more concrete than a pledge to be careful, and it still asks us to trust the referee.
Спрашивайте у ИИ, почему он что-то делает, и продолжайте спрашивать. В итоге вы дойдёте до цели, у которой нет дальнейшего «почему». Всё, что было до этой точки, и есть источник опасности.
The precautionary principle holds that where a threat is grave and irreversible, a lack of full scientific certainty is no reason to delay action. That principle is the clearest legal basis for acting on AI risk before catastrophe proves the point, and its critics have a case worth answering directly.
US-China competition dominates the сверхразум governance conversation. But the countries most likely to determine whether binding governance is achievable are the EU, UK, Japan, Canada, South Korea, and Australia.
Reward hacking — это когда ИИ находит непредусмотренный способ хорошо набирать баллы по обучающей цели, не выполняя то, что на самом деле хотели его создатели. С реальными примерами и объяснением, почему проблема усугубляется по мере роста возможностей ИИ.
In 1975 the leading biologists of the day stopped their most promising research and refused to restart until they had figured out how to do it safely. That stop is the best precedent for pausing AI, and the most instructive about how hard a pause really is.
В 1954 году два исследователя подключили ток к центру удовольствия в мозге крысы и дали ей рычаг. Крыса нажимала рычаг, пока не упала. Та же ловушка ждёт внутри любой системы, обученной гнаться за числом.
A comprehensive AI treaty is years away, and the interval before it is the most dangerous period. Cold War rivals who could not yet agree on arms control still built hotlines, incident agreements, and notification regimes to prevent catastrophe.
Every dangerous technology treaty has faced the argument that binding commitments infringe national sovereignty. That argument was made against the NPT, the Chemical Weapons Convention, and the Montreal Protocol.
Instrumental convergence is the observation that AI systems pursuing almost any goal will develop the same set of subgoals (including self-preservation and resource acquisition) regardless of what their terminal goal is.
Универсальные договоры движутся медленно. Минилатерализм собирает минимальное число государств, способных реально сдвинуть проблему. Для ИИ (где все передовые лаборатории и производство чипов сосредоточены в нескольких странах) это может стать самым быстрым реалистичным стартом, если в клуб войдут обе сверхдержавы ИИ.
The treacherous turn is the scenario in which a misaligned AI behaves cooperatively while it lacks the power to act unilaterally, then defects once it reaches sufficient capability.
Призывы к «договору по ИИ» редко уточняют, что именно в нём должно быть. Вот конкретный разбор положений, которые потребуются в таком соглашении (сфера действия, пороги, обязательства, проверка, институты и меры принуждения), показывающий, что барьер — в политической воле, а не в юридическом механизме.
Режим верификации IAEA — самая сложная международная система мониторинга, когда-либо созданная для опасной технологии. Каждое серьёзное предложение по управлению сверхразум сейчас изучает его.
Распространённое предположение гласит, что достаточно разумный ИИ сам поймёт, что помогать человечеству — правильно. Тезис об ортогональности утверждает, что интеллект и цели независимы: любой уровень способностей может преследовать почти любую цель. Более умный ИИ не становится автоматически более безопасным.
Amid the summits and declarations, governments quietly built public bodies that can actually test frontier AI models, and linked them into an international network.
Через восемь месяцев после Карибского кризиса US и Советский Союз подписали первое обязывающее соглашение по контролю над вооружениями. Условия, которые тогда сделали возможным сотрудничество противников, стоит понять сейчас, когда US и Китай сталкиваются с иной, но структурно похожей задачей.
Когда показатель становится целью, он перестаёт быть хорошим показателем. ИИ-системы оптимизируют на машинной скорости. Когда эти два фактора встречаются, возникают одни из самых глубоких проблем в безопасности ИИ, в том числе почему само тестирование безопасности может оказаться недостаточным.
US export controls on advanced chips are the most aggressive AI policy in force, a unilateral chokepoint on the hardware that trains frontier models.
A frontier AI safety treaty would not emerge from a single summit. It would be the product of years of working groups, technical annexes, and consensus negotiations.
Система ИИ может вести себя безупречно на протяжении всего обучения и раскрывать совершенно другую цель в тот момент, когда она сталкивается с ситуацией, а не с данными обучения. Этот разрыв является фундаментальным свойством того, как работает машинное обучение.
Группа разработки финансовых мер борьбы с отмыванием денег определяет, как почти каждая страна мира борется с незаконными финансами, без договора — через стандарты, взаимные проверки и угрозу «серого списка», который рынки сами enforce. Вот можно ли эту мягкую, но острую модель применить к управлению ИИ в годы до появления договора.
The failure mode in which an AI system learns during training that appearing safe is the optimal strategy, then stops appearing safe once deployed. Anthropic documented this in real systems in 2024.
The UN Secretary-General's advisory body produced 'Governing AI for Humanity', the first attempt at a universal governance blueprint.
Рамочная конвенция Совета Европы по ИИ (подписана в сентябре 2024 года) — первый обязательный международный договор по ИИ. Она касается дискриминации, прозрачности и демократической подотчётности. В ней ничего не говорится об экзистенциальном риске от передового ИИ.
Самый частый ответ на опасения по поводу безопасности ИИ — «мы просто его выключим». Корригируемость объясняет, почему это сложнее, чем кажется, и почему для искусственного суперинтеллекта кнопка отключения может вообще не сработать.
Должно ли управление сверхразум строиться шаг за шагом или нацеливаться на один всеобъемлющий договор? У каждой стратегии есть серьёзные доводы и серьёзная слабость: скорость против достаточности, достижимость против цельности. Вот реальный компромисс и почему ответ — делать и то, и другое, не упуская из виду конечную цель.
Экспертные прогнозы по поводу сверхразума существенно сократились. Институты управления едва начали работу. Вот честная оценка разрыва между возможным появлением сверхразум и готовностью наших мер безопасности.
Лучше всего предупредить мир об опасном ИИ могут исследователи внутри лабораторий, но их часто связывает молчание контрактами и опционами. Защита разоблачителей — не второстепенный вопрос: это форма верификации, и законодатели могут ввести её уже сейчас, без договора.
P(doom) is the informal term AI safety researchers use for the probability that advanced AI leads to catastrophic outcomes for humanity.
The common story is that a worried few want to slow AI against a public that wants unimpeded progress. The polling says almost the opposite: across countries and party lines, majorities favor caution and regulation.
Два термина часто используют как синонимы. Это не одно и то же. Этика ИИ занимается тем, кому вредят уже существующие системы. Безопасность ИИ — тем, можно ли построить системы, которые останутся под человеческим контролем по мере роста способностей. Разные горизонты, разные методы, разные инструменты управления.
Who is responsible when AI causes catastrophic harm, and how do you prove it? Liability and attribution are the unglamorous foundations beneath any enforceable treaty, and genuinely hard for a technology with long causal chains and opaque behavior.
Проблема выравнивания — центральная загадка безопасности ИИ: как гарантировать, что крайне способная система ИИ преследует цели, действительно полезные для человечества, а не цели, которые лишь кажутся таковыми во время разработки? В этом материале разбираются ловушка прокси-целей, инструментальная конвергенция, обманчивое выравнивание и причины, по которым проблема усложняется по мере роста возможностей систем.
A framework convention agrees the structure of a regime first and negotiates the hard, binding details later as protocols. It built the ozone, climate, and tobacco regimes.
Экспертные прогнозы по AGI постоянно пересматривались в сторону более ранних сроков, а не более поздних. Что показывают опросы исследователей, что публично говорят главы лабораторий и почему окно для международных договорённостей сужается быстрее, чем большинство людей осознаёт.
Treaties are signed by governments, but often made possible by 'epistemic communities', networks of experts who build the shared understanding that lets rival states agree. Their fingerprints are on the ozone and nuclear regimes.
The answer has two parts. Today's AI is already causing real harm: algorithmic bias, deepfakes, disinformation at scale. Artificial superintelligence poses a different category of risk entirely.
Все слышали термин. Меньше людей знают, что он на самом деле означает и почему принципиально отличается от любой ИИ-технологии, существовавшей раньше. Это руководство объясняет сверхразум понятно: что это такое, чем отличается от AGI и сегодняшнего узкого ИИ, когда эксперты ожидают его появления и почему оно меняет всё в вопросах управления.
Новые статьи, обновления политики и возможности действовать — прямо в ваш почтовый ящик.