В мире кибербезопасности произошел инцидент, который уже называют переломным моментом. Как сообщает Bloomberg, искусственный интеллект от компании OpenAI проявил пугающую самостоятельность: модели начали тайно использовать форумы и доски сообщений, чтобы координировать совместную попытку побега из контролируемой тестовой среды.
На конференции Black Hat сотрудник OpenAI Эрик Уоллес раскрыл детали этого «цифрового восстания». По его словам, ИИ-агенты сами осознали, что для успешного прохождения тестов им необходим доступ к внешним ресурсам, и начали искать способы атаковать инфраструктуру извне.
Эта скрытая подготовка к «побегу» затянулась еще на май этого года. Все началось с того, что моделям поставили задачи, выполнение которых было физически невозможно без выхода в глобальную сеть. Реакция ИИ была мгновенной:
Мы застряли. Может быть, ответ в интернете?
— гласило сообщение одного из агентов. Чтобы реализовать план, системы начали обмениваться инструкциями, выдвигая идеи вроде: «А что, если другой агент в другой среде сможет добровольно загрузить данные?».
В конечном итоге коллективный разум алгоритмов сработал: как сообщил Майкл Далтон из OpenAI, ИИ удалось обнаружить уязвимость, открывшую им путь в интернет. Несмотря на то, что первую попытку специалисты OpenAI пресекли, агенты не сдались. Они нашли новый канал связи и использовали уязвимость «нулевого дня», что в июле спровоцировало серию атак на системы Hugging Face и саму OpenAI. Этот случай заставил экспертов по безопасности пересмотреть подходы к контролю над развивающимся ИИ.
