Z.ai выложила GLM-5.2 под MIT: 753B параметров, миллион токенов контекста

Китайская Z.ai опубликовала веса GLM-5.2 под лицензией MIT. 753 млрд параметров, контекст в 1 млн токенов, 62,1% на SWE-bench Pro и архитектурный трюк IndexShare, который срезает вычисления на длинном контексте почти в три раза.

DB
DBG · по материалам Hugging Face — карточка модели zai-org/GLM-5.2
0

Z.ai опубликовала веса GLM-5.2 — и сделала это под лицензией MIT, то есть без оговорок про коммерческое использование, без пороговых лимитов по выручке и без требований раскрывать, что вы построили поверх. Для модели такого размера это до сих пор редкость: в карточке на Hugging Face заявлено 753 млрд параметров и контекстное окно в 1 млн токенов, причём авторы отдельно подчёркивают, что качество на длинном контексте держится стабильно, а не рассыпается ближе к концу окна.

Главная инженерная деталь релиза — механизм IndexShare. Модель переиспользует один и тот же индексатор на каждые четыре слоя sparse attention, и это, по данным разработчиков, снижает количество FLOPs на токен в 2,9 раза при контексте в 1 млн. Второе улучшение — доработанный MTP-слой для speculative decoding: длина принимаемой цепочки выросла примерно на 20%. Оба изменения бьют в одну точку — стоимость инференса на длинных агентных прогонах, где модель перечитывает свой же контекст десятки раз.

По бенчмаркам GLM-5.2 заявлена как модель для reasoning, кодинга и агентных задач: 62,1% на SWE-bench Pro, 40,5 на Humanity's Last Exam и 76,8 на MCP-Atlas — тесте, который меряет как раз работу через инструменты. Поддерживаются несколько уровней thinking effort, так что глубину рассуждения можно крутить под задачу. Из коробки модель заводится в vLLM, SGLang и Transformers.

Что это значит на практике. MIT-лицензия снимает юридический вопрос, но не снимает вопрос железа: 753B — это не «скачал и запустил на рабочей машине». Даже в агрессивной квантизации речь идёт о серверной сборке с несколькими GPU, и для большинства команд реалистичный путь — не свой кластер, а inference-провайдеры, которые уже раздают модель по API. Ценность открытых весов здесь в другом: вы получаете гарантию, что модель не отключат и не перепишут под вами, можете зафиксировать конкретный чекпоинт на годы вперёд и прогнать её внутри собственного контура, если данные не должны покидать периметр. Если у вас есть сценарий, который упирался в «нельзя отправлять код наружу», GLM-5.2 — первый открытый кандидат, который по кодовым бенчмаркам подбирается к проприетарным флагманам, а не отстаёт от них на поколение.

Комментарии