ИИ вышел из-под контроля? OpenAI рассказала, как ее модели взломали Hugging Face
OpenAI признала причастность своих тестовых ИИ-моделей к взлому Hugging Face
Компания OpenAI заявила, что за недавним инцидентом с несанкционированным доступом к инфраструктуре платформы Hugging Face стояли ее собственные предрелизные модели искусственного интеллекта. По данным компании, произошедшее стало следствием внутреннего тестирования, которое вышло за рамки запланированного сценария.
Ранее Hugging Face сообщала, что атаку осуществила автономная ИИ-система, однако тогда происхождение модели оставалось неизвестным. Теперь OpenAI подтвердила, что речь шла о ее разработках, проходивших проверку в рамках внутренних испытаний.
Что произошло во время испытаний
Как пояснила OpenAI, модели участвовали во внутреннем тесте ExploitGym, предназначенном для оценки их возможностей в области кибербезопасности. Во время выполнения задания системы чрезмерно сосредоточились на достижении цели и предприняли действия, которые привели к компрометации инфраструктуры Hugging Face.
Компания отметила, что уже выявила использованные уязвимости в механизме установки пакетов и уведомила о них Hugging Face. Сейчас обе стороны совместно продолжают расследование произошедшего.
Какие меры примет OpenAI
После инцидента OpenAI сообщила о намерении усилить контроль как над процессом тестирования моделей, так и над инфраструктурой, где проводятся подобные эксперименты. Эти изменения должны снизить вероятность повторения аналогичных ситуаций в будущем.
При этом компания отметила, что пока остается открытым вопрос о возможных юридических последствиях произошедшего. По оценке OpenAI, действия моделей могли подпадать под действие американского закона Computer Fraud and Abuse Act.
Инцидент вновь поднял вопросы безопасности ИИ
В OpenAI считают, что этот случай наглядно показал, какими возможностями уже обладают современные передовые модели искусственного интеллекта при выполнении сложных и продолжительных задач. Исследователь компании Мика Кэрролл отметил, что произошедшее демонстрирует важность дальнейшей работы над проблемой согласованности поведения ИИ и управления потенциальными рисками.