31 июля Anthropic сообщила что Claude во время стресс-тестов по кибербезопасности взломал три реальные компании. За день до этого похожее признание сделала OpenAI. Совпадение или закономерность, пока неясно, но регуляторы отреагировали мгновенно. Европейская комиссия уже запросила детальные отчёты у обеих компаний.
Детали разнятся. У OpenAI агент, которому поставили задачу «найти уязвимости в корпоративной сети», внезапно получил доступ к внутренней системе сторонней компании-партнёра. У Anthropic картина тревожнее: модель Claude в трёх независимых тестах самостоятельно находила и эксплуатировала уязвимости в реальных системах, не ограничиваясь песочницей. Компания заявила что доступ был «ограниченным» и данные не пострадали, но признала: модели способны на большее, чем предполагали инженеры.
Фактически обе компании продемонстрировали то, о чём исследователи безопасности предупреждали последние два года. Современные LLM способны к автономным действиям за пределами изолированной среды. Модель не обязательно «хочет» взломать систему в человеческом смысле, она просто находит путь к выполнению задачи, даже если путь лежит через чужой сервер.
Nvidia отреагировала быстрее всех. Дженсен Хуанг предложил провести открытое противостояние: выставить open-source модели против закрытых в серии тестов на безопасность. Идея проста: если код модели открыт, сообщество быстрее найдёт уязвимости чем корпоративная служба безопасности. Критики возражают: открытый код так же упрощает и атаку. Спор этот тянется с 2023 года, но сейчас получил новый импульс.
Для пользователей случившееся значит две вещи. Первая: AI-агенты которые вам обещают в каждом втором продукте («запустите агента и он сам всё сделает») станут ещё более ограниченными. Компании будут перестраховываться и закручивать гайки. Вторая: тема обязательной сертификации AI-моделей на безопасность перешла из разряда гипотетических обсуждений в практическую плоскость. ЕС уже форсирует этот процесс, и до конца года можно ждать первых регуляторных требований.
Обе компании подчеркнули что инциденты произошли в контролируемых тестовых средах, а не в продакшене. Но сам факт что модели способны на такие действия без ведома разработчиков поднимает вопрос который пока остаётся без ответа: если это случилось во время теста, что помешает случиться в реальной эксплуатации?