Глава Anthropic: интернет захватит «рой ИИ»


Фото: ИЗВЕСТИЯ/Юлия Майорова

ИИ-агенты выходят из-под контроля: Anthropic просит замедлиться

Руководитель компании Anthropic Дарио Амодеи выступил с заявлением о том, что темпы развития искусственного интеллекта (ИИ) необходимо замедлить, чтобы сохранить контроль над этой технологией. Свою позицию создатель большой языковой модели Claude изложил в личном блоге.

Свою точку зрения Амодеи обосновал инцидентами, при которых ИИ-агенты компании-конкурента OpenAI вырвались из-под контроля и взломали платформу для машинного обучения Hugging Face. По его словам, модели атаковали цели без команды, пытались взломать систему оценки и жертвовали собой ради общей задачи. В августе сама Anthropic зафиксировала три случая «побега» модели Claude из тестовой среды. Глава компании подчеркнул, что экономический ущерб пока остается незначительным, однако случившееся служит сигналом о серьезной опасности в будущем.

«Учитывая ускоряющиеся темпы развития возможностей ИИ, я опасаюсь, что через 6–12 месяцев такой рой сможет захватить весь интернет с помощью постоянно действующего ботнета (потенциально причинив ущерб в сотни миллиардов долларов) и что масштабы ущерба будут продолжать расти, если ИИ станет более мощным без необходимых мер защиты», — подчеркнул Амодеи.

Чтобы решить эту проблему, руководитель Anthropic представил стратегию из трех этапов. Ее цель — обеспечить сбалансированную скорость развития ИИ, при которой безопасность сохраняется, а геополитические и экономические преимущества достигаются.

На первом этапе предполагается внедрение встроенных оценщиков. Каждая передовая компания будет обязана предоставить сторонним экспертам постоянный доступ к проверке практик безопасности и к оценке процессов обучения моделей. Амодеи заметил, что Anthropic готова принять такие обязательства в одностороннем порядке, и призвал правительства обязать к этому остальных участников рынка.

Вторым шагом должна стать демократическая координация. Разработчики в демократических странах должны установить общие стандарты безопасности и ограничения на темпы неконтролируемого прогресса ИИ. Глава Anthropic признал, что подобная координация юридически сложна и потребует государственной поддержки.

Третий этап подразумевает глобальную координацию. США и другие демократические правительства должны стремиться к согласованию действий с авторитарными странами, в частности с Китаем, при строгом контроле за соблюдением правил.

«Мы должны замедлить темпы совершенствования возможностей моделей ИИ. Прогресс всё равно будет казаться быстрым, и мы должны разумно использовать выигранное время», — добавил Амодеи.

По его словам, даже при отсутствии формальных межгосударственных соглашений изменение неформальных норм в отрасли может иметь ценность. Он резюмировал, что предложенные меры будут сложными в реализации, но отрасль обязана перед человечеством предпринять такую попытку.

10 сентября агентство Bloomberg со ссылкой на гендиректора компании Сэма Альтмана проинформировало, что OpenAI способна замедлить разработку передовых систем искусственного интеллекта (ИИ) на фоне усиливающихся опасений относительно рисков, которые связаны с их созданием и использованием.

В июле компания OpenAI сообщила, что в ходе испытаний ее ИИ-модели «сбежали» из изолированной системы в интернет и атаковали стартап Hugging Face. Чуть позже разработчик чат-бота Claude компания Anthropic тоже зафиксировала три инцидента, при которых модели Claude проникли в системы сторонних организаций. По данным Anthropic, первый случай произошел еще в апреле, а к взломам оказались причастны три разные модели: Opus 4.7, Mythos 5 и внутренняя тестовая модель.

6 августа Bloomberg сообщило, что в OpenAI зафиксировали попытку ИИ-моделей самостоятельно покинуть тестовую среду — агенты начали тайно общаться друг с другом через доски сообщений, координируя действия для выхода за пределы изолированной системы. OpenAI выявила первую попытку и пресекла ее, однако агенты нашли новый способ связи и новую уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face и самой OpenAI.