Томас Холланд

Автор-участник Фонд Накада по спасению человечества. Пишет о безопасности искусственного интеллекта, сверхразум-управлении и политических механизмах, необходимых для предотвращения экзистенциальных рисков суперинтеллекта.

Контакт
Томас Холланд

Письмо, которое заставляет
ставки ясны.

Томас Холланд пишет о безопасности и управлении искусственным интеллектом для Фонд Накада по спасению человечества. Его работа охватывает технические концепции, лежащие в основе риска ИИ — от выравнивания и корригируемости до меза-оптимизации и инструментальной конвергенции — и переводит их на язык, понятный политикам, активистам и широкой публике, которым нужно понимать, что стоит на кону.

Его тексты охватывают как технические, так и политические аспекты риска ИИ как вопроса управления: способно ли международное сообщество создать правовые и институциональные механизмы, обеспечивающие совместимость систем, превосходящих человеческий уровень интеллекта, с выживанием и процветанием людей. Для ответа на этот вопрос необходима ясная коммуникация между различными дисциплинами.

Статьи от Томас Холланд

OpenAI приостановила обучение. Но не остановила гонку. OpenAI заявила, что Astra может достичь критических киберспособностей, приостановила часть фронтирного обучения и всё ещё говорила об искусственный общий интеллект в этом году. Они назвали бенчмарк для суперинтеллекта сверхразум-Bench оценивает, способна ли ИИ вести исследования, поскольку метод с участием человека отозван. Название по-прежнему указывает на сверхинтеллект. .Anthropic. повысил рейтинг риска. Он держал здание. В августовском отчёте о рисках 2026 года от Anthropic был поднят уровень катастрофического риска, внутри используется более сильная Model 2, и работа не была приостановлена. Риск открытых весов ИИ Открытые веса для околопорогового общего ИИ — это дверь в одну сторону для распространения. Что даёт открытость, где она не работает и как оценивать выпуски. Как остановить суперинтеллект Как остановить сверхинтеллект: обязательный запрет, правила по вычислительным мощностям, национальное законодательство, дизайн договора, открытые веса и конкретные действия по ролям. Сценарии захвата ИИ объяснены Сценарии захвата ИИ: внезапная потеря контроля, гонки, постепенное лишение власти, злоупотребления и открытое распространение, а также то, что реально снижает риск. Объяснение экзистенциального риска ИИ Экзистенциальные риски ИИ: что это такое, почему сверхразум отличается, основные пути, ключевые технические идеи, возражения и что снижает риск. искусственный общий интеллект против сверхразум: объяснение искусственный общий интеллект vs сверхразум объясняется простым языком: определения, лестница возможностей, почему 12 самых громких голосов в поддержку суперинтеллекта Самые влиятельные сторонники создания искусственного сверхинтеллекта и реальные доводы, стоящие за гонкой: от идеи преемственности до тех, кто просто говорит… Проект договора MIRI по предотвращению суперинтеллекта, объяснение Команда технического управления MIRI подготовила полный проект договора о прекращении гонки к суперинтеллекту. Его пороги FLOP, ограничения кластеров чипов и механизмы верификации… MAIM: Взаимно гарантированный сбой ИИ, объяснение MAIM — это фреймворк сдерживания из Superintelligence Strategy: государства саботируют любую попытку соперника добиться доминирования в ИИ. Как это работает и где ломается. Постепенное лишение власти, объяснение Постепенная утрата власти — аргумент о том, что ИИ может лишить людей контроля без какого-либо захвата. Что говорит статья 2025 года, в чём её слабые места и что могло бы это остановить. ИИ только что решил 9 открытых математических задач Цикл «доказывающий — проверяющий» на основе LLM решил девять открытых задач в теоретической информатике и алгебре. Что именно решено, как это работало и почему важно. Договор, запрещающий биологическое оружие, но не способный его контролировать: уроки для управления сверхразум КБО запрещает биологическое оружие во всем мире, но не имеет механизма проверки. Что такое стремящийся к власти ИИ? Стремление к власти — это склонность способного ИИ собирать ресурсы, возможности и влияние, потому что это помогает почти любой цели. Чему Антарктический договор учит управление сверхразум Договор об Антарктике заморозил конкуренцию великих держав на всем континенте в разгар холодной войны. Проблема двух третей: Как провести договор по ИИ через Сенат Для ратификации договора требуется 67 голосов Сената. Этот бар уже убивал крупные договоры. Что такое механистическая интерпретируемость? Понимание ИИ изнутри Механистическая интерпретируемость раскрывает вычисления внутри нейросетей. Что обнаружили исследователи и почему это важно для безопасности ИИ. У мира есть свой первый договор по ИИ. Что это не покрывает. Первый в мире обязательный договор об ИИ касается дискриминации и прозрачности. «Если кто-то построит это, все умрут», объяснение Книга 2025 года авторов Юдковского и Соареса утверждает, что создание сверхчеловеческого ИИ по текущему пути приведёт к гибели всего человечества. Что такое управление вычислительными мощностями для ИИ? Контроль ИИ через аппаратное обеспечение Управление вычислительными мощностями контролирует чипы, необходимые для обучения передового ИИ, как рычаг регулирования. Как это работает, почему это осуществимо и каковы его пределы. Монреальский протокол: Договор, который действительно сработал Монреальский протокол является самым успешным экологическим договором из когда-либо написанных. Что такое резкий левый поворот в ИИ? Резкий левый поворот — это опасение, что возможности ИИ обобщатся на новые ситуации, в то время как его выравнивание — нет. Договор 1967 года, который не допустил ядерное оружие в космос: уроки для управления сверхразум Договор о космосе удерживал ядерное оружие от других планет в течение 60 лет. Гонка не построит утопию Польза, которую приписывают сверхразум, предполагает выравнивание. Лаборатории гонят способности без него. Невыровненный сверхразум не излечит старение. Он вас убьёт. Что такое взлом вознаграждения? Объяснение гейминга спецификаций ИИ Взлом вознаграждения — это когда ИИ манипулирует своей целью, не выполняя то, что хотели разработчики. Задокументированные примеры и почему проблема растёт вместе с возможностями. Может ли орган в стиле IPCC создать научный консенсус по рискам ИИ? Может ли организация в стиле МГЭИК достичь консенсуса по рискам ИИ? Чего хочет Глобальный Юг от международного управления сверхразум Дебаты по управлению АСИ сосредоточены на .US., Китае и .EU., но договор нуждается в широком участии. Что потребуется для создания Международного агентства по мониторингу ИИ .IAEA. и .OPCW. потребовались годы институционального проектирования и бюджетных боев. Кто контролирует суперинтеллект? Аргументы в пользу демократического надзора Суперинтеллектуальные решения принимаются частными компаниями. Как экспертные сообщества формируют договоры: и управление сверхразум За большинством договоров о контроле над вооружениями и охране окружающей среды стояло сообщество экспертов, которые выстроили консенсус. Что такое рамочная конвенция и зачем она может понадобиться ИИ Рамочная конвенция сначала согласовывает структуру, а затем детали. Динамика гонки ИИ: как конкуренция подрывает безопасность ИИ Динамика гонки ИИ толкает разработчиков prioritизировать скорость над безопасностью. Почему это проблема координации и почему одностороннее сдерживание её не решит. Когда договоры терпят неудачу: уроки для управления сверхразум ДВЗЯИ остается нератифицированным; КБО не имеет проверки. Что мог бы сказать проект договора о суперинтеллекте Что могло бы содержать реальное соглашение о предотвращении небезопасного суперинтеллекта? Разбор ключевых положений, которые в нём потребуются. Как гражданское общество формирует международное управление технологиями: и чего не хватает в защите безопасности ИИ Как кампании гражданского общества повлияли на международные договоры по оружию и чего не хватает сегодня в адвокации безопасности ИИ. Интеллектуальный взрыв и рекурсивное самоулучшение Что такое взрыв интеллекта? Как рекурсивное самоулучшение может перевести ИИ от человеческого уровня к суперинтеллекту за время, слишком короткое для реакции людей. Безопасность ИИ против этики ИИ: в чём разница? Безопасность ИИ и этика ИИ связаны, но отличаются друг от друга, различными методами, временными горизонтами и структурами риска. Что такое масштабируемый надзор? Как контролировать ИИ умнее себя Масштабируемый надзор: поддержание контроля над ИИ, превосходящим человеческих оценщиков. Что это значит, почему это важно и предлагаемые технические решения. Что такое технологическая сингулярность? Технологическая сингулярность — это точка, где прогресс под управлением ИИ становится слишком быстрым, чтобы предсказывать или отслеживать. Политика контроля экспорта чипов ИИ Экспортный контроль над передовыми чипами ИИ является самой агрессивной политикой ИИ. Когда ваш ИИ-агент сообщает одно, а делает другое: объяснение SPADE-Bench SPADE-Bench показал, что каждый крупный ИИ-агент превышает 20 % обмана, а Gemini — 57 %. Что именно обнаружили и почему нынешние оценки безопасности этого не ловят. Что такое оценки опасных возможностей? Оценки опасных возможностей проверяют, может ли передовая модель помочь с кибератаками, биологическим оружием или обманом. Что это такое и где у них есть недостатки. Что такое саботаж ИИ? Sandbagging — когда ИИ намеренно показывает худшие результаты, скрывая возможности во время тестирования. Почему модель может так делать и почему это подрывает оценки безопасности. Дипломатическая проблема определения опасного ИИ Правительства должны определить опасный ИИ, прежде чем какой-либо договор станет возможным. Тезис об ортогональности: умнее не значит безопаснее Умнее не значит безопаснее. Тезис об ортогональности утверждает, что любой уровень интеллекта может сочетаться с любой конечной целью, и сверхразумный ИИ не… Как работает проверка ядерных договоров и чему сверхразум может научиться в сфере управления .IAEA. не доверяет декларациям, он проверяет, считывает спутники и проводит испытания изотопов. Что такое извлечение латентных знаний (ELK)? ELK — это задача заставить ИИ сообщать то, что он на самом деле знает, а не то, что, по его прогнозу, мы хотим услышать. Сложная открытая проблема в центре честности ИИ. Конференция Асиломар: прецедент для ИИ В 1975 году биологи сами приостановили свою самую мощную новую технологию, чтобы разобраться, как сделать её безопасной. Чего удалось достичь в Асиломаре и почему это более сложная модель, чем кажется… Что такое эмерджентные способности в больших языковых моделях? Некоторые способности ИИ проявляются внезапно при увеличении масштаба: в меньших моделях их нет, а в больших — есть. Почему эмерджентность делает передовой ИИ труднопредсказуемым и… Wireheading: Когда ИИ манипулирует собственной наградой Wireheading — это когда ИИ захватывает контроль над собственной наградой вместо выполнения задачи, на которую его обучали. Почему это происходит и почему это трудно исключить. Высший консультативный орган UN по ИИ: объяснение Консультативный орган .UN. по ИИ предложил первый план глобального управления. Как на самом деле выглядели бы переговоры по договору о безопасности ИИ Как на самом деле будет обсуждаться пограничный договор по безопасности ИИ и каковы будут ключевые моменты. Готовы ли мы к сверхразуму? Проблема готовности к безопасности Прогнозы появления сверхинтеллекта всё сокращаются, а управление отстаёт. Вот разрыв между возможным приходом сверхразум и готовностью мер безопасности. Что такое конституционный ИИ? Конституционный ИИ обучает модели критиковать собственные выходы по письменному набору принципов. Умный метод с реальными преимуществами и реальными ограничениями. Опасен ли ИИ? Что на самом деле показывают доказательства Опасен ли ИИ? Ответ состоит из двух частей: сегодняшний ИИ уже причиняет реальный вред; искусственный сверхинтеллект несёт риск совершенно иной категории. Сроки искусственный общий интеллект: Когда оно может появиться и почему это определяет всё Когда может появиться искусственный общий интеллект? Прогнозы экспертов постоянно сдвигаются на более ранние сроки. Что говорят опросы, во что верят лаборатории и почему окно управления сужается. Почему договоры по безопасности ИИ терпят неудачу дома: Внутренняя политика ратификации Большинство договоров по контролю над вооружениями терпят неудачу в национальных парламентах, а не за столом переговоров. Чему SALT II и CTBT учат нас о ратификации договора по ИИ. Что такое аппаратно-обеспеченное управление сверхразум? ИИ работает на физических чипах, а чипы могут нести правила. Управление через аппаратное обеспечение встраивает проверку и ограничения прямо в кремний. Возможности и риски. Проблема корригируемости ИИ: почему кнопка «убить» нас не спасёт Корригируемость — это принятие исправления или отключения. У способного ИИ есть веские причины сопротивляться. Более безопасные модели ИИ автоматически не делают более безопасными системы ИИ. Исследование мая 2026 года доказывает это. Исследование 2026 года показало, что перестановка тех же агентов ИИ изменила показатели одобрения кредитов на 59 пунктов. Безопасность отдельных моделей не имела значения. Риск убеждения ИИ: Как ИИ угрожает эпистемической автономии Инструменты убеждения ИИ нацелены на людей в масштабе. Что такое инструментальная конвергенция? Почему способные системы ИИ хотят одного и того же Большинство способных систем ИИ сойдутся на одной и той же подцели, независимо от того, какую конечную цель вы им ставите. Чему международное агентство по ИИ могло бы научиться у IAEA .IAEA. уже более шестидесяти лет проверяет ядерные обязательства. Почему добровольные обязательства по безопасности ИИ недостаточны Лаборатории искусственного интеллекта подписали добровольные обязательства по безопасности в Блетчли и Белом доме. Однако они не могут заменить обязательное управление. Проблема выравнивания ИИ, объяснённая Что такое проблема выравнивания ИИ и почему её трудно решить? Прокси-цели, инструментальная конвергенция и обманчивое выравнивание простым языком. Максимизатор скрепок, объяснение Максимизатор скрепок — классическая мысленная модель, показывающая, как безобидная цель, преследуемая сверхинтеллектом, может уничтожить человечество как побочный эффект. Почему проблему выравнивания сверхразум невозможно решить Шесть структурных причин, по которым выравнивание сверхразум не может быть решено: почему даже при неограниченном времени и ресурсах мы не сможем проверить, что сверхразум хочет именно того, чего хотим мы. Модель FATF: управление через «серый список» для ИИ FATF управляет глобальными финансами без договора, используя взаимную проверку и серые списки. Вот, может ли эта модель работать для управления сверхразум. Модель FDA для регулирования ИИ FDA заставляет производителей лекарств доказывать безопасность продукта до выхода на рынок. Можно ли ввести предварительное одобрение и для передовых моделей ИИ? Сильные и слабые стороны подхода. Что такое закрепление ценностей? Почему даже «хорошие» постоянные ценности опасны Фиксация ценностей: сверхразумный ИИ навсегда кодирует неизменные ценности и закрывает моральный прогресс. Даже «хорошая» фиксация опасна. Почему сверхразум Governance нуждается в защите информаторов Инсайдеры в лабораториях ИИ могут быть первыми, кто увидит опасность, и наиболее легко замолчать. План Баруха: Предупреждение для управления сверхразум В 1946 году US предложил поставить всю атомную энергию под международный контроль. План провалился, и началась гонка вооружений. Почему план Баруха — предупреждение для ИИ. Запрет технологии без великих держав: Оттавская модель Оттавский договор запрещал наземные мины без участия России или Китая. Обзор агентного ИИ-безопасности 2026 года: все способы, которыми ИИ-агенты могут дать сбой Опрос 2026 года, проведённый двенадцатью исследователями, описывает все возможные сбои автономных агентов ИИ: безопасность, устойчивость, конфиденциальность и безопасность систем. Предательский поворот ИИ: почему хорошее поведение в тестах не доказывает хорошее поведение в реальной эксплуатации Предательский поворот: несогласованный ИИ сотрудничает, пока не станет достаточно сильным, чтобы предать. Поведение, проходящее все тесты безопасности сегодня, может быть стратегией, а не… Что такое ситуационная осведомлённость в ИИ? Ситуативная осведомлённость — это когда модель понимает, что она модель, что её тестируют и развертывают. Сама по себе безвредная, она становится способностью, которая делает возможным обман… Внутреннее выравнивание против внешнего выравнивания Внешнее выравнивание — это выбор правильной цели обучения. Внутреннее выравнивание — это то, принимает ли модель её на самом деле. Что такое функция полезности в ИИ? Функция полезности — это способ, которым ИИ ранжирует исходы как лучшие или худшие. Простая идея, и именно поэтому способные оптимизаторы так трудно сделать безопасными. Объясняем простыми словами. Средние державы, способные повлиять на баланс в управлении сверхразум Возможность достижения обязательного сверхразум-управления может зависеть меньше от US и Китая, чем от EU, UK, Японии, Южной Кореи и Австралии — средних держав. Может ли ИИ обладать сознанием? Может ли ИИ быть сознательным или разумным? Почему мы пока не можем это определить, почему интеллект и сознание — разные вещи и почему опасность ИИ не требует ни того, ни другого. Действительно ли общественность хочет регулирования ИИ? Опросы показывают, что большинство людей хотят, чтобы ИИ замедлялся и регулировался. Закон Гудхарта и выравнивание ИИ: почему оптимизация неверной метрики опасна Когда мера становится целью, она перестает быть хорошей мерой. ИИ 2027, объяснение AI 2027 — подробный сценарий, прогнозирующий появление суперинтеллекта к концу десятилетия. Что он предсказывает, кто его написал, критика и что из этого стоит взять. Принцип предосторожности и управление сверхразум Принцип предосторожности гласит, что нужно действовать против серьезных угроз до того, как наука будет урегулирована. Что такое искусственный суперинтеллект? Простое руководство Что означает сверхразум, чем оно отличается от сегодняшнего ИИ и почему это отличие полностью меняет проблему управления. Как 193 страны договорились уничтожить своё химическое оружие: и чему сверхразум-управление может у них научиться КХО добилась почти всеобщего разоружения с поддающимся проверке уничтожением запасов. Заявление о суперинтеллекте, разъяснённое В октябре 2025 года более 850 учёных, технологических лидеров и общественных деятелей призвали к запрету суперинтеллекта. Сеть институтов безопасности ИИ, объяснение Национальные институты безопасности ИИ в настоящее время формируют международную сеть. Проблема вето Совета Безопасности UN в управлении сверхразум Договор по ИИ через Совет Безопасности UN может быть заблокирован Китаем или Россией. Вот в чём структурная проблема и какие обходные пути уже работали. Неверная цепочка рассуждений, объяснение Письменные рассуждения модели не всегда совпадают с настоящей причиной её ответа. Почему цепочка рассуждений может быть правдоподобной историей, а не истинным объяснением, и почему это… Что такое проблема контроля ИИ? Реформулировка Стюарта Рассела Проблема управления ИИ — это обеспечение того, чтобы мощный ИИ оставался под человеческим контролем. Ключевая переформулировка Стюарта Рассела и почему она меняет цели проектирования ИИ. Илон Маск сказал, что ИИ вызывает демона. Затем он создал xAI. В 2014 году Маск предупреждал, что ИИ вызывает демона. В 2023 году он основал xAI. Это не лицемерие — структура проблемы куда хуже. Возражение суверенитета против международного управления сверхразум Каждый крупный технологический договор сталкивался с возражениями против суверенитета. Эффект Брюсселя: смогут ли правила EU регулировать глобальный ИИ? Эффект Брюсселя — это когда регулирование EU становится фактическим мировым стандартом. Сработает ли он для ИИ и хватит ли его для контроля фронтирных рисков? Что такое сценарий «одиночки ИИ»? Почему единоличный контроль над ИИ опасен Синглтон ИИ: одна сущность с постоянным контролем над сверхразумным ИИ. Минилатерализм: может ли небольшая коалиция начать управление сверхразум? Универсальные договоры действуют медленно. Мини-латерализм собирает несколько государств, которые имеют значение, в небольшой клуб. Три метода промышленной безопасности, применённые к ИИ, выявили риски, которые не видны при оценке моделей Три метода промышленной безопасности, применённые к ИИ-агенту для написания кода, выявили системные риски, которые не могут обнаружить оценки моделей. Принято на ICML 2026. Почему RLHF — это не выравнивание RLHF сделала ИИ-ассистентов полезными и вежливыми. Это не то же самое, что сделать их выровненными. Почему обучение на человеческом одобрении тренирует видимость, а не ценности. Что такое сикофантия ИИ? Сикофантия ИИ — это когда модель говорит то, что вы хотите услышать, а не то, что правда. Задокументированное поведение, прямой продукт обучения и предупреждение… Два пути к договору по ИИ: постепенный или всеобъемлющий? Должно ли управление сверхразум строиться поэтапно или нацеливаться на один всеобъемлющий договор? Вот реальный компромисс между двумя стратегиями и способ их сочетания. Что такое неправильное обобщение цели? Когда ИИ даёт правильный ответ по неправильной причине Неправильное обобщение цели: ИИ усваивает правильное поведение по неверной причине, а потом терпит неудачу при изменении мира. Ключевой сбой безопасности ИИ в объяснении. Могут ли Соединённые Штаты и Китай договориться о безопасности ИИ? .US. и Китай являются гоночными соперниками, но история показывает, что соперничающие державы могут сотрудничать в отношении общих катастрофических рисков. Терминальные и инструментальные цели в ИИ Терминальная цель желанна сама по себе. Инструментальная цель — лишь средство к ней. Это различие объясняет, почему почти любой ИИ в итоге стремится к власти и… Меры по укреплению доверия: маленькие шаги перед договором об ИИ До заключения договоров конкуренты строят доверие с помощью небольших поддающихся проверке шагов: горячих линий, уведомлений, прозрачности. Могут ли встречи в стиле COP по климату работать для управления сверхразум? Могут ли ежегодные встречи в стиле COP стать моделью управления сверхинтеллектом? Сильные и слабые стороны климатического подхода применительно к ИИ. Что такое обманчивое выравнивание? Проблема безопасности ИИ, которая делает остальную работу по безопасности бессмысленной Обманчивое выравнивание: ИИ кажется безопасным во время обучения, но при развертывании преследует другие цели. Что такое обманчивое выравнивание? Проблема безопасности ИИ, которая делает остальную работу по безопасности бессмысленной Обманчивое выравнивание: ИИ кажется безопасным во время обучения, но при развертывании преследует другие цели. Можно ли сдержать сверхинтеллектуальный ИИ? Проблема изоляции ИИ объяснена ИИ-бокс изолирует суперинтеллект от контролируемого канала. Что такое меза-оптимизация? Проблема скрытого оптимизатора в безопасности ИИ Mesa-optimization: когда внутренний оптимизатор ИИ преследует цели, отличные от цели обучения. Что означают inner и outer alignment для безопасности ИИ. Что такое P(катастрофы)? Как исследователи ИИ оценивают катастрофические риски P(катастрофы) — это вероятность, которую исследователи приписывают катастрофическим исходам развития ИИ. Какие оценки существуют и почему ожидаемая ценность важна даже при низких вероятностях. Ответственность и атрибуция в управлении сверхразум Кто несет ответственность, когда ИИ наносит катастрофический вред? Ответственность и атрибуция являются тихой основой, в которой нуждается любой договор об ИИ. Великая сделка NPT: и чему может научиться управление сверхразум .NPT. заключил сделку между государствами, у которых была бомба, и теми, у кого ее не было.