16 червня китайська лабораторія Z.ai (колишня Zhipu AI) виклала у відкритий доступ ваги GLM-5.2 — Mixture-of-Experts моделі на 753 млрд параметрів (~40 млрд активних), із 1-мільйонним контекстним вікном.
За кілька днів модель очолила відкритий сегмент рейтингу Artificial Analysis Intelligence Index із результатом 51 бал, обігнавши MiniMax-M3, DeepSeek V4 Pro і Kimi K2.6, та виявилася на рівні провідних закритих моделей — Claude Opus 4.8, GPT-5.5, Claude Fable 5. Гучного маркетингу не було — Z.ai просто опублікувала ваги на Hugging Face, а спільнота сама побачила, що це новий стандарт. The Cool Down
Що показують бенчмарки
Модель створювали насамперед під довгі агентні задачі та автономне програмування. На SWE-bench Pro GLM-5.2 показала 62,1 — це переграє GPT-5.5 (58,6). На FrontierSWE (тест “довгого горизонту”) — 74,4% проти 72,6% у GPT-5.5 і майже паритет із Claude Opus 4.8 (75,1%). На MCP-Atlas (використання інструментів) — 77,0 проти 75,3 у GPT-5.5. На Code Arena (Frontend) у режимі Max — 1595 ELO, попереду всіх версій Claude Opus, неподалік Fable 5 (1665). А на Design Arena модель посіла перше місце з ELO 1360, обігнавши навіть Claude Fable 5.
Не на всіх тестах паритет: на ARC-AGI-2 GLM-5.2 здобула лише 22,8% проти 85% у GPT-5.5 — суттєве відставання у “розумовій” задачі. Але вартість виконання — приблизно у 7 разів менша. Це і є основна теза релізу: не “найкраща модель у світі”, а “найкраща модель на вашу гривню”.

Архітектурний трюк, який це уможливив
Найцікавіша інженерна частина — нова техніка IndexShare. У звичайних трансформерах кожен sparse-attention шар окремо обраховує, які токени важливі. У GLM-5.2 один “індексер” робить цей розрахунок лише раз і повторно використовується на кожних чотирьох attention-шарах. Результат: при контексті 1 мільйон токенів обчислення на токен зменшуються у 2,9 раза.
Ще один нюанс — оновлений шар Multi-Token Prediction, який пришвидшує inference приблизно на 20% через спекулятивне декодування. Це не просто більше параметрів — це інше розв’язання задачі дешевого служіння довгого контексту.
Ціна підтверджує ефект: GLM-5.2 коштує близько $1,40 за мільйон вхідних токенів і $4,40 за вихідні — проти $10/$50 у Claude Fable 5. Підписка стартує від $12,60 на місяць. Запустити модель локально теж можна, але ваги важать 1,51 ТБ — отже потрібно ~1,5 ТБ GPU-пам’яті.
Стратегічний контекст: Huawei, експорт, час
Реліз відбувся на тлі підвищеної напруги. 12 червня Міністерство торгівлі США обмежило експорт двох найпотужніших моделей Anthropic — Fable 5 і Mythos 5. Для розробників за межами США GLM-5.2 одразу стала найдоступнішою альтернативою у класі агентного кодінгу.
Окремо — китайський аспект Z.ai вже здатна тренувати моделі на чипах Huawei, що вписується у стратегію технологічної незалежності КНР. У 2025 році Z.ai потрапила до чорного списку Мінторгу США через нібито зв’язки з оборонним сектором, але це не завадило їй у січні 2026-го провести IPO у Гонконзі на $558 млн та залучити понад $1,5 млрд інвестицій від Alibaba, Tencent та інших.
Між релізом Claude Opus 4.5 (24 листопада 2025) і GLM-5.2 (16 червня 2026) — 204 дні. Це і є нинішня дистанція між фронтиром закритих моделей США та провідним відкритим моделюванням з Китаю — близько 6,8 місяця. Очікуване розширення розриву через експортні обмеження поки не відбулося.

Чому це принципово
Якщо модель здатна на рівні агентного кодінгу майже зрівнятись із закритими флагманами Заходу, економіка ринку зсувається: підприємствам стає вигідніше робити власне розгортання замість оплати топового API за подвійним тарифом. Засновник Z.ai заявив Ілону Маску, що “відкриті ваги класу Fable” з’являться раніше першого кварталу 2027 року. У 2024–2025 таке звучало б самонадіяно. У 2026 — уже ні.
































