Z.ai випускає GLM-5.3: прорив у кодингу та кібербезпеці

Китайський стартап Z.ai офіційно представив мовну модель GLM-5.3, зробивши ставку на значне покращення програмування, агентних сценаріїв і пошуку вразливостей. Це оновлення позиціонується як відповідь на зростаючі вимоги до ШІ-систем у розробці ПЗ та кібербезпеці.
Ключові покращення та бенчмарки
У Z.ai наголошують, що приріст продуктивності досягнуто виключно за рахунок посттренування, без зміни базової архітектури, що відрізняє цей реліз від попередніх ітерацій. На внутрішньому тесті Code Bench нова модель показала покращення на 50% порівняно з GLM-5.2, що свідчить про серйозну оптимізацію алгоритмів.
У релізній таблиці Z.ai наводить вражаючі результати за низкою спеціалізованих тестів:
- Terminal Bench 3.0: 28,3 бала проти 4,6 у GLM-5.2 — зростання майже в шість разів.
- DeepSWE v1.1: 66,9 проти 46,2 — значний стрибок у вирішенні завдань розробки.
- Agents' Last Exam: 28,5 проти 23,8 — покращення агентних здібностей.
- CyberGym: 84,5% проти 77,2% — підвищення ефективності в кіберсередовищі.
- ExploitBench: 54,4% проти 24,4% — подвоєння результату в пошуку експлойтів.
Особливо виділяється ExploitGym: модель закрила 105 завдань за двогодинний бюджет проти 29 у попередника, а при шестигодинному бюджеті — 130 проти 39. Це демонструє не лише швидкість, а й глибину аналізу.
Практичне застосування та безпека
Z.ai також провела тестування на реальних кодових базах спільно з командами з безпеки в Китаї. Після перевірки та дедуплікації система виявила 2436 вразливостей у 269 проєктах, включно з 1097 проблемами середньої та високої критичності. Публічно розкрито лише 53 знахідки, решта 2383 залишаються під ембарго. Середній «термін життя» цих вразливостей оцінюється в 26,6 року, а найстаріша датується 1981 роком — це підкреслює масштаб проблеми legacy-коду.
Для прозорості запущено Z.ai Security Disclosure Ledger — публічний реєстр, що відстежує статус, зачеплені проєкти та критичність знахідок. Це важливий крок для індустрії, де часто бракує відкритості.
Продуктова інтеграція
GLM-5.3 уже розгорнута для підписників GLM Coding Plan, ставши основним рушієм для агентного програмування та тривалих завдань. Запити до старих моделей автоматично маршрутизуються на нову, що спрощує міграцію для користувачів. Відкриті ваги з'являться через два тижні після оцінки безпеки та харденінгу.
Нагадаю, що в липні Anthropic звинувачувала Z.ai у несанкціонованій дистиляції GLM-5.2 на відповідях Claude і GPT, що додає контексту до цього амбітного релізу.
Мій аналіз: GLM-5.3 — це не просто інкрементальне оновлення, а цілеспрямований ривок у нішевих, але критично важливих сферах. Покращення ExploitBench і CyberGym удвічі свідчить про те, що Z.ai серйозно інвестує в безпеку, що може стати ключовою конкурентною перевагою на тлі глобального попиту на ШІ-інструменти для захисту коду. Однак питання етики та походження технологій залишаються відкритими, і це може стримувати прийняття моделі на Заході.