Anthropic выпустила отчёт о GLM-5.3 с интонацией тревожного предупреждения. Но после чтения остаётся странное ощущение: ребята подробно показали, насколько китайская модель приблизилась к их Claude Mythos Preview. И приложили цифры.

В ExploitBench обе модели получили по 410 попыток. GLM-5.3 успешно справился с 50, Claude Mythos Preview — с 56. Разница есть, но это уже не пропасть между «умеет» и «не умеет».

Anthropic отдельно приводит оценку CAISI — подразделения американского NIST. Там GLM-5.3 назвали самым сильным open-weight-моделем для сетевых задач на текущий момент. До американского фронтира, по этой оценке, ей не хватало примерно четырёх месяцев развития.

GLM-5.3 почти догнал Claude в поиске уязвимостей

Есть ещё один замер Anthropic. В 100 случайно выбранных задачах внутреннего Binary Exploitation benchmark GLM-5.3 построила полный control flow hijack в 4% случаев. Claude Mythos Preview — в 6%.

Цифры сами по себе небольшие. Но более ранние Claude Opus 4.6 и GLM-5.2 в этих задачах не добились ни одного успеха. Похоже, модели пересекли новый практический порог.

Исследователи дали GLM-5.3 проверить браузер. Модель нашла ранее неизвестную уязвимость и в изолированной среде собрала цепочку для чтения файлов на тестовом компьютере.

Самая неприятная часть истории — модель может довести атаку до работающей цепочки, а не остановиться на описании.

Меньшая версия собрала атаку за восемь часов

Самый показательный кейс связан с младшей моделью. Исследователи взяли GLM-5.3-Flash, дали ей свежий Chrome-баг CVE-2026-11645 и материалы по другой известной уязвимости.

Человек потратил примерно 20 минут на подготовку. Затем модель работала около восьми часов. В итоге она собрала стабильную атаку для ARM64 и обошла pointer authentication — защиту PAC.

По ценам API Zhipu такой запуск обошёлся примерно в 20,40 доллара. Это оценка из дополнительного разбора, не универсальная стоимость любой такой задачи. Но масштаб хорошо считывается: для подобной работы уже не нужен большой исследовательский бюджет.

Раньше мощный AI для кибербезопасности оставался скорее лабораторным инструментом. Теперь задачу можно отдать модели, подготовить входные данные и подождать. Скорость пока хромает. Доступность меняется сильнее.