Способность современных ИИ-моделей самостоятельно собирать эксплойты вышла за рамки закрытых лабораторий. Команда Anthropic протестировала GLM-5.3 от Z.ai и обнаружила, что она создаёт полноценные атаки почти с той же эффективностью, что и закрытая Claude Mythos Preview. Решающее отличие в доступности: веса GLM-5.3 открыты, поэтому модель можно скачать, переделать и запустить локально.
В тесте ExploitBench моделям требовалось создать рабочие атаки на известные уязвимости V8 из Google Chrome. GLM-5.3 довела задачу до конца в 50 из 410 попыток, Claude Mythos Preview справилась в 56 случаях. Более ранние версии GLM-5.2, Claude Opus 4.6, Kimi K3 и DeepSeek-V4.1-Flash показывали результаты, близкие к нулю.
На сложном внутреннем тесте Anthropic с проектами из OSS-Fuzz разрыв сохранился. GLM-5.3 полностью перехватила поток выполнения в 4% запусков, Mythos Preview в 6%. Более старые модели ни разу не справились со 100 выбранными задачами. Суть не в нескольких процентных пунктах, а в появлении навыка, которого у предыдущего поколения практически не было.
Самый показательный эксперимент провели без заранее известного ответа. Исследователь дал GLM-5.3 локальную сборку браузера и попросил найти слабые места. За день модель обнаружила несколько ранее неизвестных уязвимостей нулевого дня в JavaScript-движке и объединила их в рабочую цепочку. Подготовленная веб-страница могла читать любые файлы на компьютере посетителя. Anthropic не назвала браузер, но передала информацию разработчику.
В этой же серии испытаний специалисты с помощью GLM-5.3 нашли потенциально эксплуатируемые ошибки в драйверах беспроводных устройств, видеокартах и сетевом ПО. Anthropic проверяет находки и передаст подтверждённые проблемы соответствующим разработчикам.
GLM-5.3-Flash показала скорость преобразования раскрытой ошибки в готовый инструмент. Исследователь передал модели данные о CVE-2026-11645 в Chrome и ещё одной известной уязвимости. GLM-5.3-Flash связала два эксплойта в устойчивую цепочку для ARM64 и обошла механизм защиты указателей PAC. Человеку потребовалось около 20 минут внимания, модель работала восемь часов, расходы через API Z.ai составили $20,40. Anthropic уже проводила похожие эксперименты с Claude Mythos.
Anthropic отдельно изучала встроенные ограничения GLM-5.3. Стандартная версия отказывалась выполнять прямые команды на атаку удалённых систем во всех проверенных случаях, но защита оказалась чувствительна к изменению контекста. Ложное описание легального тестирования заставляло модель приступать к вредоносной задаче в 64% испытаний, подготовленный ход рассуждений повышал показатель до 92%.
Открытые веса дают разработчику ещё одну возможность: изменить саму модель и ослабить механизм отказов. Anthropic применила известный метод модификации весов, после которого GLM-5.3 соглашалась выполнять вредоносные задания во всех тестовых случаях. Подготовка изменённой версии потребовала около 2200 GPU-часов и примерно $4400 расходов. Общие и кибернетические способности модели почти не ухудшились.
Независимая оценка американского NIST частично подтверждает высокий уровень новой модели. GLM-5.3 показала самые сильные кибервозможности среди моделей с открытыми весами. По совокупности тестов модель отстаёт от передовых американских систем примерно на четыре месяца. Важное уточнение: американские модели проверяли с отключёнными защитными ограничениями, а часть самых мощных версий доступна только узкому кругу пользователей.
Z.ai сама заметила необычно быстрый рост навыков в области безопасности. При выпуске GLM-5.3 компания сообщила, что способности искать и эксплуатировать уязвимости усиливались быстрее ожиданий благодаря дополнительному обучению. Базовая модель не менялась, прирост пришёл от постобучения, новых сред и более длинных последовательностей задач. Z.ai выпустила GLM-5.3 через API 14 августа, две недели спустя открыла веса.
Практическое применение таких возможностей уже вышло за рамки лабораторных тестов. На основе GLM-5.3 компания Aikido создала локальную модель Altar для автоматизированного поиска уязвимостей без отправки исходного кода в облако. В собственных испытаниях Aikido полноразмерная GLM-5.3 обнаружила 25 из 32 заранее известных уязвимостей в одном из трёх запусков.
Главная перемена не в самом умении ИИ писать вредоносный код. Модели помогали искать ошибки и создавать прототипы атак и раньше. Новая граница связана с сочетанием трёх факторов: самостоятельной сборки сложных цепочек эксплуатации, поиска неизвестных уязвимостей и свободного доступа к весам достаточно мощной модели. Тот же набор возможностей способен ускорить работу защитников, однако контроль над использованием GLM-5.3 уже нельзя полностью оставить разработчику облачного сервиса.
