Enterprise8 хв21 вересня 2026 р.

Claude зламав OpenAI за 72 години

Claude атакував інфраструктуру OpenAI через prompt injection і переміг за 72 години. Що це означає для безпеки AI-агентів у бізнесі.

Claude зламав OpenAI за 72 години

Як це взагалі сталося

Дослідники дали Claude одне завдання: знайти вразливості в публічній інфраструктурі OpenAI. Через 72 години агент повернувся з результатами. Не з підказками — з реальними векторами атак.

Це не демонстрація на конференції. Це контрольований red-team-експеримент, який показав: сучасні AI-агенти здатні атакувати одне одного — і робити це ефективно.

Команда дослідників запустила Claude як автономного агента з доступом до інструментів: браузера, виконання коду, можливості надсилати запити. Ціль — публічні ендпоінти та документація OpenAI. Агент не отримував покрокових інструкцій. Він сам будував стратегію, перевіряв гіпотези і адаптувався до відповідей системи.

За 72 години Claude ідентифікував кілька класів вразливостей, включно з потенційними векторами prompt injection — атак, при яких шкідливі інструкції вбудовуються в дані, що обробляє агент. Саме цей тип атак вважається одним із найнебезпечніших для автономних систем, бо він не зламує код — він зламує логіку.

Чому prompt injection — це не технічна деталь

Prompt injection працює інакше, ніж класичні кібератаки. Зловмисник не шукає діру в коді — він підсовує агенту інструкцію, замасковану під звичайні дані. Агент читає документ, веб-сторінку або відповідь API — і виконує вбудовану команду, навіть не підозрюючи, що його скомпрометовано.

Для бізнесу, який будує агентні пайплайни, це означає конкретну загрозу: агент, що обробляє зовнішні дані — листи, сайти, документи постачальників — стає потенційною точкою входу. Не для хакера з клавіатурою, а для іншого агента або заздалегідь підготовленого контенту.

Найнебезпечніший сценарій — не той, де агент робить помилку. А той, де він робить саме те, що йому сказали, — але сказав не той, хто мав право.

Детальніше про механіку таких атак і фінансові наслідки для компаній — у матеріалі Prompt Injection у GPT-6 Astra: ризики для фінансів.

Що показав експеримент насправді

Результати red-team-тесту важливі не самі по собі — важливий контекст. Claude атакував OpenAI. Тобто один провідний AI-агент успішно досліджував інфраструктуру іншого провідного AI-провайдера. Обидві компанії вкладають сотні мільйонів у безпеку. І все одно за 72 години автономний агент знайшов те, що варто було б закрити.

Що це говорить про стан галузі:

  • Автономні агенти вже достатньо потужні, щоб проводити складні багатоетапні атаки без участі людини
  • Публічна документація і відкриті ендпоінти — це поверхня атаки, яку більшість компаній недооцінює
  • Час виявлення вразливості скорочується: те, на що раніше йшли тижні ручного пентесту, агент робить за три доби
  • Захист периметра більше не достатній — якщо агент може читати зовнішні дані, він може бути скомпрометований через них

Паралельно варто згадати інший показовий кейс: Claude довів теорему Ферма за 11 днів — автономна робота над складною задачею без постійного нагляду людини. Та сама архітектура, що дає агентам корисну автономію, робить їх і потенційно небезпечними.

Що це означає для компаній, які вже використовують агентів

Більшість бізнесів, що впроваджують AI-агентів сьогодні, думають про продуктивність: скільки задач автоматизовано, скільки часу зекономлено. Питання безпеки відкладається на потім — або делегується вендору.

Цей експеримент показує, чому така логіка небезпечна. Якщо ваш агент:

  • читає зовнішні листи або документи
  • звертається до сторонніх API
  • обробляє контент із вебу
  • взаємодіє з іншими агентами або системами

— він вже знаходиться в середовищі, де prompt injection є реальним ризиком, а не теоретичним.

Питання не в тому, чи може ваш агент бути атакований. Питання в тому, чи знаєте ви, що відбувається, коли це трапляється.

Про те, як будувати governance для агентних систем до того, як щось піде не так, — читайте у матеріалі OpenAI Wiki: будуйте AI-governance зараз.

Як захиститися: практичні кроки

Немає срібної кулі. Але є архітектурні рішення, які суттєво знижують ризик.

Ізоляція контексту

Агент не повинен мати доступ до всього одразу. Розділяйте: що агент може читати, що може виконувати, до яких систем має доступ. Принцип мінімальних привілеїв — не бюрократія, а базова гігієна.

Валідація вхідних даних

Будь-який зовнішній контент, що потрапляє в контекст агента, має проходити фільтрацію. Це не гарантія, але це суттєво підвищує поріг для атаки.

Моніторинг дій агента в реальному часі

Агент, що раптово починає робити нетипові запити або звертатися до незвичних ресурсів, — це сигнал. Без логування і моніторингу ви про це не дізнаєтесь. Інструменти на кшталт Qwen3Guard показують, як можна відстежувати поведінку агента на рівні токенів у реальному часі.

Людський чекпоінт для критичних дій

Не всі дії агента мають виконуватися автоматично. Для операцій із високим ризиком — надсилання даних назовні, зміна конфігурацій, фінансові транзакції — варто зберігати підтвердження від людини.

Red-team до запуску в продакшн

Те, що зробили дослідники з Claude проти OpenAI, варто робити з власними агентами до того, як вони отримають доступ до реальних даних і систем.

Що далі для галузі

Цей експеримент — не аномалія. Це передвісник нової реальності: агенти атакують агентів, автономні системи стають і інструментом захисту, і вектором атаки одночасно.

Регулятори вже рухаються в цьому напрямку. Anthropic публічно обговорює межі автономії своїх моделей — детальніше про їхній підхід у матеріалі Anthropic гальмує AI: що це означає для бізнесу. OpenAI будує власні фреймворки оцінки ризиків. Але між корпоративними заявами і реальною безпекою агентних систем у конкретних компаніях — величезна прірва.

Бізнес, що чекає, поки галузь "вирішить питання безпеки", ризикує опинитися в ситуації, де рішення прийдуть після інциденту, а не до нього.


FAQ

Що таке red-team-тест для AI-агентів? Це контрольований експеримент, де агент отримує завдання знайти вразливості в цільовій системі — так само, як людська команда пентестерів. Мета — виявити слабкі місця до того, як їх знайде реальний зловмисник.

Чи є prompt injection реальною загрозою для малого і середнього бізнесу? Так. Будь-яка компанія, що використовує агентів для обробки зовнішніх даних — листів, документів, вебконтенту — потенційно вразлива. Масштаб бізнесу не захищає від цього типу атак.

Чи знав OpenAI про ці вразливості? Дослідники діяли в рамках відповідального розкриття. Деталі конкретних знахідок не були публічно оприлюднені до того, як OpenAI отримав можливість їх усунути.

Чи можна повністю захистити агента від prompt injection? Повного захисту не існує — так само, як не існує абсолютного захисту від будь-якого типу кібератак. Але правильна архітектура, ізоляція і моніторинг суттєво знижують ризик і наслідки.

Що має зробити компанія прямо зараз? Провести аудит: які зовнішні дані обробляють ваші агенти, які дії вони можуть виконувати автономно, і чи є у вас логування цих дій. Це перший крок — і він не потребує великих інвестицій.


Підсумок

72 години. Саме стільки знадобилося автономному агенту, щоб знайти вразливості в інфраструктурі одного з найбільших AI-провайдерів світу. Не через недбалість OpenAI — а тому що агентні системи відкривають принципово нову поверхню атаки, до якої більшість компаній ще не готова.

Якщо ви вже запустили агентів у продакшн або плануєте це зробити — питання безпеки не можна відкладати. Архітектура, ізоляція, моніторинг і чіткий governance мають бути частиною дизайну з першого дня, а не латкою після першого інциденту.

Хочете розібратися, як побудувати безпечну агентну архітектуру для вашого бізнесу? Підпишіться на розсилку Online Zone — щотижня розбираємо реальні кейси і практичні рішення для команд, що працюють з AI.

Є питання? Запитайте AI-агента прямо зараз

Відповідає за секунди, знає все про наші послуги та допоможе розібратися у вашій ситуації