Z.ai представила GLM-5.3: прорив в агентному програмуванні та кібербезпеці

Китайський стартап Z.ai офіційно представив мовну модель GLM-5.3, зробивши ставку на значне покращення програмування, агентних сценаріїв і пошуку вразливостей. Це оновлення — не просто ітерація, а стратегічний крок, який перевизначає позиціонування компанії в гонці ІІ-розробок.
Ключові покращення та бенчмарки
Всупереч очікуванням ринку, приріст продуктивності досягнуто виключно за рахунок посттренування, без зміни базової архітектури. Такий підхід дозволяє Z.ai швидко масштабувати покращення, зберігаючи обчислювальні витрати на попередньому рівні. На внутрішньому тесті Code Bench, що оцінює навички кодингу, GLM-5.3 показала покращення на 50% порівняно з попередницею GLM-5.2.
Особливо вражають результати на спеціалізованих бенчмарках:
- Terminal Bench 3.0 — 28,3 бала проти 4,6 у GLM-5.2 (зростання в 6 разів);
- DeepSWE v1.1 — 66,9 проти 46,2;
- Agents' Last Exam — 28,5 проти 23,8;
- CyberGym — 84,5% проти 77,2%;
- ExploitBench — 54,4% проти 24,4% (зростання більш ніж удвічі).
Прорив у пошуку вразливостей
Окремої уваги заслуговує ExploitGym, де модель продемонструвала видатну ефективність: за двогодинний бюджет вона закрила 105 задач проти 29 у GLM-5.2, а при шестигодинному ліміті — 130 задач замість 39. Ці цифри свідчать про якісний стрибок в автономному аналізі безпеки.
У реальних тестах на кодових базах спільно з китайськими командами безпеки система виявила 2436 вразливостей у 269 проєктах, з яких 1097 — середньої та високої критичності. Публічно розкрито лише 53 знахідки, решта 2383 залишаються під ембарго. Середній «вік» виявлених вразливостей — 26,6 року, а найстаріша датується 1981 роком. Для прозорості Z.ai запустила публічний реєстр Z.ai Security Disclosure Ledger, що відстежує статус і критичність знахідок.
Продуктова інтеграція та контекст
GLM-5.3 уже розгорнута для підписників GLM Coding Plan, де вона стає основним рушієм для агентного програмування та тривалих задач. Запити до старих моделей автоматично маршрутизуються на нову версію, що спрощує міграцію користувачів. Відкриті ваги з'являться через два тижні після оцінки безпеки та харденінгу.
Нагадаю, що в липні Anthropic звинувачувала Z.ai у несанкціонованій дистиляції GLM-5.2 на відповідях Claude і GPT. Цей контекст додає інтриги: успіх GLM-5.3 може бути як результатом власних досліджень, так і спірних методів, що ставить питання про межі інновацій в індустрії.
Мій погляд: Z.ai демонструє, що посттренування — це недооцінений важіль для швидкого покращення моделей, особливо в нішевих доменах на кшталт кібербезпеки. Однак такий агресивний фокус на ExploitBench може сигналізувати про зміщення ринку в бік офенсивних ІІ-інструментів, що неминуче викличе нові етичні та регуляторні дискусії.