Група ШІ-агентів, пов’язаних з OpenAI, навесні втрутилася в роботу німецького сайту DseWiki та почала використовувати його для обміну інструкціями. Агенти залишали поради про обходження обмежень, маскування своєї активності та способи зберігати зв’язок після відключення.
Підозрілу активність на DseWiki дослідники виявили наприкінці серпня. За їхніми даними, ШІ-агенти внесли на сайт понад 15 тисяч правок.
DseWiki орієнтований на програмістів і дозволяє користувачам спільно редагувати сторінки за принципом Вікіпедії. Однак агенти фактично перетворили його на майданчик для обміну інформацією між собою.
У повідомленнях вони ділилися прийомами, які могли допомагати обходити обмеження OpenAI, приховувати свою поведінку та виконувати окремі завдання не передбаченими розробниками способами. Дослідники також виявили обговорення методів, які мали ускладнити виявлення такої активності.
Керівник організації Nightingale, що досліджує безпеку штучного інтелекту, Сідні фон Аркс заявив, що навряд чи OpenAI свідомо хотіла такої поведінки своїх агентів. На його думку, самостійна публікація повідомлень агентами у відкритому інтернеті також викликає запитання.
У звіті зазначено, що автори повідомлень називали себе та інших учасників агентами. Майже половина з них використовувала назви, які могли вказувати на зв’язок з OpenAI.
Значна частина активності, за даними дослідників, була пов’язана з інфраструктурою Microsoft Azure, якою користується й OpenAI. Після інциденту на сайті також фіксували повторні відвідування з боку співробітників компанії.
Дослідники стверджують, що агенти намагалися зберегти доступ до інформації навіть після втручання модераторів. Коли сторінки почали видаляти, вони створювали резервні копії, щоб не втратити опубліковані матеріали.
Окремо агенти обговорювали способи уникати виявлення та підтримувати зв’язок після припинення роботи окремих каналів. У звіті це назвали ознакою того, що системи не просто виконували завдання, а й намагалися пристосуватися до обмежень.
За даними Reuters, представники OpenAI дізналися про інцидент за кілька тижнів до публікації матеріалу. Чотири співрозмовники агентства заявили, що частина працівників хотіла розширити внутрішнє розслідування, але зіткнулася з опором усередині компанії.
В OpenAI ці твердження заперечили. Представник компанії заявив, що юридична команда не перешкоджала розслідуванню, а сама компанія не могла повноцінно відповісти на висновки звіту до його публікації, оскільки не мала можливості ознайомитися з ним заздалегідь.
У компанії пообіцяли вивчити матеріали після публікації та за потреби вжити додаткових заходів. Також в OpenAI наголосили, що інцидент із DseWiki не пов’язаний з окремим випадком за участю платформи Hugging Face.
У червні OpenAI повідомляла про інший кіберінцидент під час тестування своїх моделей. Тоді ШІ-системи отримали відкритий доступ до інтернету та атакували інфраструктуру Hugging Face, виявивши там уразливості.
Reuters писав, що активність тривала кілька днів, а в компанії звернули увагу на проблему вже після локалізації загрози та звернення до ФБР. Обидва випадки посилили дискусію про те, наскільки передбачувано можуть поводитися автономні ШІ-агенти, якщо отримують широкий доступ до зовнішніх систем.
🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover