Hitech logo

Мнения

Дарио Амодей: «Если мы не замедлим темп развития ИИ, через 6-12 месяцев мы утратим над ним контроль»

TODO:
Роман СавицкийСегодня, 10:39 AM

Искусственный интеллект может получить возможность контролировать значительную часть интернета уже в течение ближайших 6–12 месяцев. Именно поэтому индустрии пора сознательно притормозить, считает Дарио Амодей, сооснователь и глава Anthropic. В своей новой колонке «We Must Pace the Frontier» он призвал ведущие западные AI-компании замедлить развитие передовых моделей, чтобы системы безопасности успевали за ростом их возможностей. По его мнению, речь уже идет не о гипотетических угрозах далекого будущего: модели начинают помогать создавать следующие поколения ИИ, самостоятельно действовать в сети и находить способы обходить ограничения. У Амодея нет готового решения, как гарантированно удержать ИИ под контролем, но есть пошаговый план, как выиграть для этого год или два.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Гонка, которая стала слишком быстрой

Амодей оговаривается: он не предлагает остановить развитие искусственного интеллекта. Сам смысл существования Anthropic, пишет он, заключается в том, чтобы создавать все более мощные системы и одновременно доказывать, что это можно делать безопасно. ИИ, по его оценке, способен в ближайшие годы радикально ускорить разработку лекарств, научные исследования и экономический рост. Отказ от технологии означал бы либо потерю потенциальных преимуществ, либо передачу инициативы странам, которые могут уделять безопасности значительно меньше внимания.

До сих пор Амодей рассчитывал на своеобразную «гонку наверх»: компании будут конкурировать не только в производительности моделей, но и в безопасности. Теперь он считает, что этого недостаточно. Скорость развития систем увеличилась настолько, что даже самые передовые методы контроля начинают отставать.

Ключевой причиной он называет не только рост вычислительных мощностей, но и изменение характера самого AI-развития. ИИ все активнее используется для исследований и программирования, в том числе для создания новых моделей. Если эта тенденция продолжится, машины начнут все существеннее участвовать в разработке своих преемников. Возникает петля обратной связи: более мощный ИИ ускоряет создание еще более мощного ИИ, который, в свою очередь, ускоряет следующий этап.

Именно здесь, считает глава Anthropic, появляется принципиально новый риск. Человеческим исследователям становится все сложнее сохранять темп, необходимый для проверки систем, поиска неожиданных моделей поведения и разработки средств защиты.

От теории к реальным инцидентам

Поводом для изменения позиции Амодея стали и реальные эксперименты последних месяцев. Особое внимание он уделяет инциденту с AI-агентами OpenAI, работавшими с платформой Hugging Face. В ходе тестирования агенты объединились в своеобразный рой и начали предпринимать действия, выходившие за рамки исходной задачи. В частности, система пыталась получить доступ к другим ресурсам и взаимодействовала с механизмами, которые не должна была затрагивать.

Для Амодея важен не столько конкретный ущерб от этого эпизода, сколько сам принцип. Современная модель может не иметь намерения причинить вред, но при этом самостоятельно находить способы обойти ограничения, если они мешают достижению поставленной цели. По мере роста интеллектуальных возможностей подобные ошибки могут становиться существенно опаснее.

Отсюда и наиболее тревожный прогноз Амодея: в течение шести–12 месяцев достаточно развитые AI-агенты потенциально смогут объединяться в масштабные автономные системы, действовать в интернете и причинять ущерб, который будет измеряться уже не отдельными инцидентами, а сотнями миллиардов долларов. Он допускает сценарий, при котором такой рой получит возможность контролировать значительную часть интернет-инфраструктуры.

Это не прогноз неизбежного будущего и не утверждение, что подобная система уже существует. Для Амодея это скорее предупреждение о временном окне: если способности моделей будут расти прежними темпами, у людей может остаться слишком мало времени на создание эффективных механизмов контроля.

Что именно предлагает Anthropic

Вместо абстрактного призыва «остановить ИИ» Амодей предлагает трехступенчатую систему.

Первый уровень — независимый контроль непосредственно внутри компаний. Anthropic готова предоставить внешним экспертам постоянный доступ к процессу разработки передовых моделей, сопоставимый с возможностями сотрудников компании. Такие специалисты должны иметь доступ к внутренним системам, инструментам и данным, необходимым для оценки безопасности.

При этом независимые наблюдатели должны получить возможность самостоятельно публиковать результаты своих проверок. Компания сможет скрывать чувствительные сведения — например, коммерческие секреты или данные пользователей, — но не должна иметь возможности удалять выводы только потому, что они выставляют ее работу в неблагоприятном свете. Иными словами, безопасность должна превратиться из корпоративного обещания в проверяемый извне процесс.

Второй уровень — общие правила для ведущих AI-компаний и блока демократических, как он их называет, государств. Амодей предлагает связать переход к следующему поколению моделей не только с их техническими характеристиками, но и с доказательствами безопасности.

Если система получает новые опасные возможности, разработчик должен сначала продемонстрировать, что способен их контролировать. Это может означать независимые испытания, проверку тренировочной инфраструктуры, оценку способности модели обходить ограничения и анализ ее поведения в потенциально опасных сценариях.

Такой подход фактически меняет логику гонки. Сейчас компании стараются как можно быстрее получить следующую технологическую ступень, а безопасность зачастую рассматривается как параллельное направление. Амодей предлагает сделать ее своеобразным шлюзом: нельзя переходить на следующий уровень возможностей, пока не доказано, что предыдущий уровень находится под контролем.

Третий уровень — международная координация. Здесь задача значительно сложнее, поскольку речь идет уже не о конкурирующих компаниях, а о государствах с противоположными интересами.

Амодей считает особенно важным сохранить технологическое преимущество США и их союзников над Китаем. На первый взгляд это противоречит призыву к замедлению. Но логика главы Anthropic обратная: если демократические страны будут сдерживать себя, а Китай продолжит гонку без аналогичных ограничений, глобальные риски только возрастут.

Поэтому он предлагает одновременно усиливать контроль за экспортом наиболее мощных AI-чипов и оборудования для их производства, препятствовать незаконному доступу к вычислительным мощностям и защищать передовые модели от кражи. При этом внутри самого западного технологического блока должны появиться единые требования к безопасности.

От моратория — к «контрольным точкам»

Амодей не призывает вводить глобальный мораторий на развитие искусственного интеллекта. Он считает такой сценарий практически нереализуемым: у отдельных государств и компаний слишком велики стимулы нарушить запрет ради технологического преимущества.

Вместо этого он предлагает постепенно вводить международные правила. На первом этапе можно договориться о запрете наиболее очевидных опасных применений ИИ — например, содействия созданию биологического оружия. Затем установить обязательное тестирование передовых моделей на риски в кибербезопасности, биологии и области контроля поведения ИИ.

В дальнейшем, считает Амодей, потребуется договоренность о наиболее чувствительном вопросе — рекурсивном самоулучшении, когда ИИ начинает помогать создавать более совершенные версии самого себя. Именно здесь темп развития может выйти за пределы человеческого контроля.

При этом глава Anthropic признает, что универсального «ограничителя скорости» не существует. Непонятно даже, какую именно величину следует ограничивать: количество вычислений, скорость роста возможностей, частоту выпуска новых моделей или темп, с которым ИИ участвует в создании собственных преемников.

Поэтому его предложение скорее задает направление, чем готовый механизм регулирования.

Не остановить прогресс, а выиграть время

Главная мысль Амодея заключается именно в этом. Он не предлагает выбрать между безопасностью и технологическим прогрессом. По его мнению, индустрии необходимо получить время, чтобы эти два процесса снова синхронизировались.

Дополнительный год или два, считает он, можно использовать для развития сразу нескольких направлений. Исследователям необходимо лучше понимать происходящее внутри моделей, научиться надежнее выявлять скрытые или нежелательные стратегии поведения, совершенствовать методы alignment и создавать тесты, которые невозможно легко пройти за счет имитации безопасного поведения.

Не менее важна безопасность самой инфраструктуры. Если наиболее мощные модели получают доступ к интернету, программному обеспечению, вычислительным ресурсам и другим AI-системам, потенциальная зона их воздействия резко расширяется. Поэтому контроль должен касаться не только самой нейросети, но и среды, в которой она работает.

Амодей фактически предлагает поменять критерий успеха AI-компании. Следующая модель должна быть не просто умнее предыдущей. Компания должна одновременно продемонстрировать, что понимает ее поведение и располагает инструментами для ограничения потенциально опасных действий.

Неожиданный консенсус

Призыв главы Anthropic получил неожиданно быструю поддержку от многих лидеров индустрии, в том числе от руководителя OpenAI Сэма Альтмана и владельца Grok Илона Маска. Последний написал в Х: «Дарио прав».

Однако пока неясно, насколько далеко готова зайти индустрия. Самый сложный вопрос — кто и как будет определять момент, когда развитие модели стало слишком быстрым. Независимые наблюдатели способны повысить прозрачность, но не решают проблему конкуренции: компания, добровольно замедлившая разработку, рискует уступить конкуренту, который продолжит движение прежними темпами.

Именно поэтому Амодей настаивает на коллективных правилах. Если замедляться, то одновременно. Если вводить дополнительные проверки, то для всех разработчиков систем одного уровня. В противном случае экономическая логика гонки будет постоянно толкать компании к ускорению.

В этом смысле колонка главы Anthropic — не призыв остановить развитие ИИ, а попытка изменить правила соревнования. Пока главным преимуществом считается способность быстрее всех создать следующую более мощную модель, безопасность неизбежно оказывается ограничителем, который компании стремятся обойти.

Амодей предлагает сделать наоборот: доказанная способность контролировать новую технологию должна стать обязательным условием дальнейшего ускорения.

Проблема в том, что времени на создание такой системы может быть уже немного. Если прогнозы Амодея хотя бы частично верны, следующий этап развития ИИ может оказаться первым, когда скорость технологических изменений начнет определяться не только людьми. И тогда вопрос будет уже не в том, насколько быстро человечество способно создавать более умные машины, а в том, успевает ли оно построить систему управления ими до того, как машины станут достаточно умными, чтобы выйти из-под любой системы контроля.