Биологические исследования часто имеют двойное назначение: одни и те же знания могут служить и медицине, и созданию более опасных патогенов. Главная сложность для Anthropic — определить, где заканчивается легитимная наука и начинается опасная работа. По словам главы отдела угроз безопасности Джейкоба Кляйна, ситуация редко выглядит как явное заявление о недобросовестных намерениях — исследователи могут декларировать благовидные научные цели, преследуя при этом работу, вызывающую серьезные опасения. Расследование Anthropic выявило попытки обойти региональные ограничения и уклониться от систем безопасности. Компания забанила связанные с этим аккаунты и поделилась выводами с властями и другими ИИ-компаниями, пишет NYT.
Один из случаев касался вируса чикунгуньи, переносимого комарами. Системы Anthropic заблокировали запрос, связанный с заявкой на грант по исследованию усиления функций патогена. Работа предназначалась для военного исследовательского института, что усилило беспокойство компании. После блокировки запросов исследователи продолжили работу через другие каналы. Anthropic также нашла доказательства того, что некая платформа-посредник направляла отклоненные биологические запросы к моделям ИИ с более слабыми защитами.
Второй случай касался исследований высокопатогенного птичьего гриппа: по данным Anthropic, исследователь неделями использовал Claude для планирования экспериментов, анализа данных и научной интерпретации. Защитные механизмы не позволили ему получить доступ к самым мощным версиям моделей компании.
Еще три случая включали исследования с потенциальным применением вирусов оспы в качестве биологического оружия.
Все эти случаи произошли с декабря прошлого по август этого года. В отчете компания не раскрыла личности исследователей, их местоположение и конкретные биологические детали, подчеркивая, что не утверждает, будто ученые намеревались причинить вред.
Эта оговорка важна, потому что старые модели Claude не были достаточно умными для сложных биологических исследований. Новейшие версии — другое дело, пишет Anthropic. Ознакомившись с отчетом до публикации, Сьюзан Монарез, микробиолог и бывшая чиновница здравоохранения США, заявила, что продвинутые модели Anthropic могут помогать злоумышленникам прятать опасные исследования за легитимными научными целями.
Как стало известно весной из публикации The New York Times, чат-боты способны объяснить, как создать и применить биологическое оружие. Даже публично доступные модели могут быть опасны: ChatGPT и Google Gemini выдавали инструкции по созданию вирусов, рецепты токсинов и планы массовых атак.

