Новини криптоміра

14.08.2026
07:47

Z.ai представила GLM-5.3: прорив у програмуванні та кібербезпеці

Китайський стартап Z.ai випустив оновлену мовну модель GLM-5.3, яка знаменує значний крок уперед у сфері програмування, агентних сценаріїв і пошуку вразливостей. На відміну від попередніх ітерацій, приріст продуктивності тут досягнуто виключно за рахунок посттренування, без зміни базової архітектури. Це інтригуючий підхід, який демонструє, що потенціал наявних моделей ще далеко не вичерпано.

На внутрішньому бенчмарку Code Bench, призначеному для оцінювання навичок кодингу, GLM-5.3 показала покращення на 50% порівняно з попередницею. Однак найвражаючіші результати видно у спеціалізованих тестах. Наприклад, у Terminal Bench 3.0 нова модель набрала 28,3 бала проти жалюгідних 4,6 у GLM-5.2. У DeepSWE v1.1 прогрес становив 66,9 проти 46,2, а в Agents' Last Exam — 28,5 проти 23,8.

Особливої уваги заслуговують показники у сфері безпеки. У тесті CyberGym модель досягла 84,5% успіху, а в ExploitBench — 54,4%, що більш ніж удвічі перевищує результат попередньої версії (24,4%). У межах двогодинного бюджету GLM-5.3 закрила 105 завдань, тоді як GLM-5.2 справлялася лише з 29. При збільшенні бюджету до шести годин розрив зберігається: 130 проти 39 завдань відповідно.

Реальні випробування та публічний реєстр

Z.ai також провела тестування на реальних кодових базах спільно з кількома китайськими командами з безпеки. Після перевірки та дедуплікації система виявила 2436 вразливостей у 269 проєктах, включно з 1097 проблемами середньої та високої критичності. Публічно розкрито лише 53 знахідки, решта 2383 залишаються під ембарго. Показово, що середній «термін життя» таких вразливостей оцінено у 26,6 року, а найстаріша з виявлених датується 1981 роком.

Для прозорості компанія запустила Z.ai Security Disclosure Ledger — публічний реєстр, де фіксуються статус, зачеплені проєкти та рівень критичності. Паралельно GLM-5.3 уже розгорнута для підписників GLM Coding Plan, ставши основним рушієм для агентного програмування та тривалих завдань. Запити до старих моделей автоматично маршрутизуються на нову версію.

Відкриті ваги моделі стануть доступні через два тижні після оцінки безпеки та додаткового харденінгу. Це розумний підхід, з огляду на чутливість інструменту.

Мій погляд: GLM-5.3 — це не просто еволюційне оновлення, а серйозна заявка на лідерство у сфері ІІ-агентів для кібербезпеки. Однак нагадаю, що в липні Anthropic звинувачувала Z.ai у несанкціонованій дистиляції GLM-5.2 на відповідях Claude і GPT. З огляду на такий різкий стрибок у ExploitBench, варто уважно стежити за подальшими розглядами, хоча доказів порушень поки немає.