GLM-5: Бесплатная Open Source нейросеть нового поколения

Подробный обзор GLM-5 — китайской open source нейросети с архитектурой MoE, 745 млрд параметров и контекстом 200K токенов. Сравнение с GPT-5.5, цена, возможности и как использовать из России.

Что такое GLM-5 и кто её создал

GLM-5 — это флагманская языковая модель пятого поколения от китайской компании Z.ai (ранее Zhipu AI). Компания основана в 2019 году при поддержке Университета Цинхуа и с тех пор зарекомендовала себя как один из лидеров в области открытых моделей ИИ. В январе 2026 года Z.ai провела IPO в Гонконге, привлекая около 558 миллионов долларов, что позволило направить значительные ресурсы на разработку GLM-5.

Модель была выпущена 13 июня 2026 года под лицензией MIT, что означает полную открытость: веса можно скачать, запустить локально, дообучить и использовать в коммерческих продуктах без каких-либо ограничений. Это принципиально отличает GLM-5 от закрытых аналогов, таких как GPT-5.5 или Claude Opus 4.8.

Архитектура GLM-5 основана на Mixture-of-Experts (MoE): общее количество параметров составляет около 745 миллиардов, из которых активными на каждый токен являются примерно 44 миллиарда. Это достигается за счёт 256 экспертов на слой, из которых активируются только 8 (разреженность 5,9%). Первые три слоя модели являются плотными, а последующие используют DeepSeek-Style Sparse Attention (DSA) для эффективной обработки длинных последовательностей.

Контекстное окно GLM-5 составляет 200 000 токенов, что позволяет обрабатывать целые кодовые базы, научные статьи и юридические документы в одном запросе. Модель поддерживает многоязычность, включая английский, китайский и более 15 других языков.

Ключевые возможности GLM-5

GLM-5 демонстрирует впечатляющие результаты в нескольких ключевых областях:

Продвинутое рассуждение — модель способна выполнять многоэтапные логические цепочки, решать математические задачи и проводить сложный анализ. Это делает её пригодной для научных исследований, финансового моделирования и технической экспертизы.

Генерация кода — GLM-5 показывает лучшие в своём классе результаты на бенчмарках HumanEval и BigCodeBench. Она генерирует, отлаживает и рефакторит код на более чем 50 языках программирования. Разработчики отмечают, что модель способна анализировать целые репозитории и предлагать исправления с учётом общей архитектуры.

Агентный ИИ — встроенная архитектура позволяет GLM-5 автономно планировать, использовать инструменты, выполнять веб-навигацию и многошаговые сценарии с минимальным участием человека. Это особенно ценно для автоматизации CI/CD конвейеров, анализа данных и исследований.

Творческое письмо — модель создаёт качественные объёмные тексты, маркетинговые материалы, техническую документацию и художественную прозу с тонким контролем стиля.

Генерация изображений — экосистема GLM-5 включает Seedream 5.0 для фотореалистичной генерации изображений 2K из текстовых запросов, а также редактирования и мультисубъектной композиции.

Длинный контекст — 200K токенов позволяют обрабатывать длинные документы, кодовые базы и транскрипты в одной сессии без потери связности.

Сравнение с GPT-5.5: где GLM-5 сильнее, а где уступает

GLM-5.2 (актуальная версия на июнь 2026) сравнивают с GPT-5.5 по целому ряду бенчмарков. Важно понимать, что «обошла» — это не абсолютная истина, а результат на конкретных тестах.

Где GLM-5.2 впереди:

  • SWE-bench Pro: 62.1 против 58.6 у GPT-5.5
  • FrontierSWE: 74.4 против 72.6
  • MCP-Atlas: 77.0 против 75.3
  • HLE с инструментами: 54.7 против 52.2
  • PostTrainBench: 34.3 (выше GPT-5.5, но ниже Opus 4.8)

Где GLM-5.2 уступает:

  • Terminal-Bench 2.1: 81.0 против ~83-88 у GPT-5.5 (разброс зависит от версии прогона)
  • Text Arena: лишь 25-е место, на уровне GLM-5.1 — прогресс узко направлен на код и агентность

На длинных кодинг-бенчах и агентных задачах GLM-5.2 действительно опережает GPT-5.5, но на универсальных тестах и терминальных сценариях отстаёт. При этом сравнение зафиксировано на июнь 2026 — к июлю OpenAI уже выпустила GPT-5.6, что сместило акценты.

Отдельно стоит отметить, что по сравнению с другой китайской моделью Kimi K2.6/K2.7-Code, GLM-5.2 уступает на реальных repo-задачах (72 против 62.1), но выигрывает за счёт большего контекста (1 млн против 256K) и одношагового фронтенда.

Цена: действительно ли в шесть раз дешевле

Официальные прайсы за миллион токенов выглядят так:

  • GLM-5.2 (Z.ai): вход $1.40, выход $4.40, сумма $5.80
  • GPT-5.5 (OpenAI): вход $5.00, выход $30.00, сумма $35.00
  • GPT-5.5 Pro: вход $30.00, выход $180.00, сумма $210.00
  • Claude Opus 4.8: вход $5.00, выход $25.00, сумма $30.00
  • Gemini 3.1 Pro (до 200K): вход $2.00, выход $12.00, сумма $14.00
  • DeepSeek V4 Flash: вход $0.054, выход $0.242, сумма ~$0.30

$5.80 против $35 — это 6.03 раза, то есть действительно примерно в шесть раз дешевле. Если смотреть только на выходные токены (где обычно больше трафика), разрыв достигает 6.8 раза (30 против 4.40).

На OpenRouter отдельные провайдеры отдают GLM-5.2 ещё дешевле — до $0.447 за вход и $1.76-3.31 за выход, что даёт разницу до 10 раз по сравнению с официальным прайсом GPT-5.5. Однако стоит учитывать, что это рыночное предложение сторонних площадок, где качество сервиса и лимиты могут отличаться.

Важное преимущество GLM-5.2 — отсутствие ценовой лестницы для длинного контекста. У GPT-5.5 при превышении 272K токенов цена прыгает до $10/$45 за миллион, а у GLM-5.2 единый прайс на весь миллион контекста. Для агентных сценариев с длинной историей это даёт существенную экономию.

Открытые веса под лицензией MIT: что это даёт

Лицензия MIT — одна из самых свободных: она позволяет скачивать, использовать, модифицировать и распространять модель без каких-либо отчислений и запросов. Для GLM-5 это означает:

  1. Приватность — код с ключами и секретами не покидает ваш контур. Вы можете запустить модель на собственном сервере или локальной машине, и никакие данные не уйдут в облако.
  1. Независимость — вас не отключат от API, не введут лимиты на ровном месте и не изменят условия использования задним числом.
  1. Контроль — модель можно дообучить, зафайнтюнить, встроить в свой пайплайн без оглядки на чужие правила. Для закрытых GPT-5.5 и Opus 4.8 ничего из этого недоступно в принципе.
  1. Экономия — при больших объёмах запросов локальный запуск может оказаться значительно дешевле, чем оплата API каждого токена.

Для российских пользователей открытые веса решают главную проблему — оплату из-за рубежа. Z.ai напрямую не принимает карты РФ, но веса лежат на Hugging Face в открытом доступе, и их можно скачать без какой-либо подписки или валютного платежа.

Однако стоит учитывать, что для запуска модели с 745 млрд параметров требуется серьёзное оборудование: как минимум несколько GPU с большим объёмом памяти. Для тех, у кого нет такой возможности, остаётся вариант использования через API сторонних провайдеров.

Как использовать GLM-5 из России

Для российских пользователей доступ к GLM-5 возможен несколькими способами:

1. Через официальный сайт glm5.app — можно использовать веб-чат бесплатно с некоторыми ограничениями. Новым пользователям предоставляются бесплатные кредиты. Однако для оплаты API напрямую у Z.ai потребуется иностранная карта.

2. Через сторонних провайдеров — такие сервисы, как provod.ai, работают как российский OpenRouter: предоставляют доступ к топовым нейросетям (включая GLM-5, Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek v4, Qwen, Kimi) через единый API с оплатой в рублях. Цены обычно соответствуют официальным или даже ниже.

3. Локальный запуск — скачав веса с Hugging Face или ModelScope, можно запустить модель на собственном оборудовании. Для этого потребуются мощные GPU (например, NVIDIA A100 или H100) и достаточный объём оперативной памяти. Поддерживаются фреймворки transformers, vLLM, SGLang, xLLM и ktransformers.

4. Через облачные платформы — некоторые российские облачные провайдеры начинают предлагать GPU-инстансы с предустановленными моделями, включая GLM-5.

Важно: при использовании через API сторонних провайдеров внимательно читайте условия — некоторые могут ограничивать количество запросов или собирать данные.

Технические детали: архитектура и инновации

GLM-5 построена на архитектуре Transformer с декодером и использует несколько ключевых инноваций:

Mixture-of-Experts (MoE) — 78 слоёв, 256 экспертов на слой, из которых активируются 8. Это даёт 5,9% разреженность, то есть при каждом токене задействуется лишь малая часть параметров, что значительно снижает вычислительные затраты.

DeepSeek-Style Sparse Attention (DSA) — механизм внимания, оптимизированный для длинных последовательностей. Позволяет эффективно обрабатывать контекст до 200K токенов без квадратичного роста сложности.

Multi-Token Prediction (MTP) — модель предсказывает несколько токенов за один проход, что ускоряет инференс в 2 раза по сравнению с традиционным авторегрессивным декодированием. При этом качество вывода сохраняется.

IndexShare — механизм для экономии на длинном контексте. По заявлению разработчиков, снижает FLOPs на токен в 2.9 раза при контексте в 1 миллион токенов.

MTP-слой — поднимает acceptance rate спекулятивного декодирования примерно на 20%, что дополнительно ускоряет генерацию.

Обучение модели проводилось на оборудовании Huawei Ascend с использованием фреймворка MindSpore. Это важный геополитический аспект: Z.ai демонстрирует независимость от американских чипов и софта, что может быть критично для некоторых заказчиков.

Веса распространяются в форматах BF16 и FP8. Для запуска рекомендуется использовать библиотеки transformers, vLLM, SGLang, xLLM или ktransformers.

Практические примеры использования

GLM-5 находит применение в самых разных сценариях:

Разработка ПО — модель используется для генерации кода, отладки, рефакторинга и написания тестов. Разработчики отмечают, что GLM-5 способна анализировать целые репозитории, выявлять уязвимости и предлагать исправления. Один из пользователей сообщил, что конвейер ревью и генерации кода стал работать в 3 раза быстрее благодаря контексту 200K.

Автоматизация CI/CD — агенты GLM-5 читают логи, определяют причины проблем и предлагают решения. Команда, использующая модель для отладки CI/CD конвейера, экономит более 10 часов в неделю.

Анализ данных — модель обрабатывает сложные статистические запросы, которые раньше требовали часов ручного кодирования, за минуты с почти идеальной точностью. Также используется для синтеза сотен транскриптов пользовательских интервью в практичные выводы.

Генерация контента — от блог-постов и рекламных текстов до технической документации и игровых диалогов. Пользователи отмечают, что качество неотличимо от лучших копирайтеров.

Исследования — с контекстом 200K GLM-5 может рассуждать над длинными научными статьями, кодовыми базами и сложными анализами в одной сессии.

Образование — модель используется для создания учебных материалов, объяснения сложных концепций и проверки знаний.

Важно: все приведённые примеры основаны на отзывах пользователей и не являются гарантией для вашего конкретного случая. Результаты могут варьироваться в зависимости от задачи и качества промпта.

Ограничения и оговорки

Несмотря на впечатляющие возможности, GLM-5 имеет ряд ограничений, которые важно учитывать:

1. Узкая специализация — модель показывает лучшие результаты в кодинге и агентных задачах, но на универсальных тестах (Text Arena) занимает лишь 25-е место. Это означает, что для задач общего назначения (например, творческое письмо или общие вопросы) могут быть более подходящие модели.

2. Зависимость от версии — сравнение с GPT-5.5 зафиксировано на июнь 2026. OpenAI уже выпустила GPT-5.6, которая может изменить расклад. Рынок ИИ движется быстро, и сегодняшний лидер завтра может оказаться в середине списка.

3. Требования к оборудованию — для локального запуска модели с 745 млрд параметров необходимо серьёзное железо. Не у всех есть доступ к нескольким GPU A100 или H100.

4. Качество сторонних провайдеров — при использовании через OpenRouter или аналогичные сервисы качество может отличаться от официального API. Некоторые провайдеры могут ограничивать скорость или использовать квантованные версии.

5. Отсутствие гарантий — как и любая open source модель, GLM-5 не имеет официальной поддержки. Вы используете её на свой страх и риск.

6. Языковые ограничения — хотя модель поддерживает много языков, наилучшие результаты она показывает для английского и китайского. Для других языков качество может быть ниже.

7. Этические аспекты — как и любая мощная модель, GLM-5 может быть использована для создания вредоносного кода, дезинформации или других нежелательных целей. Разработчики не несут ответственности за такое использование.

Вопросы и ответы

Что такое GLM-5 и чем она отличается от других моделей?

GLM-5 — это флагманская языковая модель пятого поколения от китайской компании Z.ai (Zhipu AI). Она имеет 745 млрд параметров, архитектуру Mixture-of-Experts (активных ~44 млрд), контекст 200K токенов и выпущена под лицензией MIT. Главное отличие — открытые веса, которые можно скачать, дообучить и использовать в коммерческих продуктах без ограничений, а также низкая цена (примерно в 6 раз дешевле GPT-5.5).

Можно ли использовать GLM-5 бесплатно?

Да, GLM-5 можно использовать бесплатно через веб-чат на glm5.app (с некоторыми ограничениями) или скачав веса с Hugging Face и запустив локально. Однако для локального запуска требуется мощное оборудование (несколько GPU с большим объёмом памяти). Также существуют сторонние провайдеры, предлагающие доступ по API с оплатой в рублях.

Как GLM-5 сравнивается с GPT-5.5 по производительности?

На длинных кодинг-бенчах (SWE-bench Pro, FrontierSWE, MCP-Atlas) GLM-5.2 опережает GPT-5.5, но на Terminal-Bench и универсальных тестах уступает. В целом, модель специализируется на коде и агентных задачах, а не на универсальных сценариях. Сравнение зафиксировано на июнь 2026 — к июлю OpenAI выпустила GPT-5.6.

Какие языки поддерживает GLM-5?

Модель нативно поддерживает английский, китайский и более 15 других языков. Наилучшие результаты показывает для английского и китайского; для других языков качество может быть ниже. Многоязычные возможности оцениваются как одни из лучших среди open source моделей.

Можно ли использовать GLM-5 для коммерческих проектов?

Да, лицензия MIT позволяет использовать модель в коммерческих целях без отчислений. Вы можете встраивать её в свои продукты, дообучать и распространять. Однако внимательно ознакомьтесь с условиями на странице тарифов Z.ai — для API могут действовать отдельные ограничения.

Как получить доступ к GLM-5 из России?

Есть несколько способов: через веб-чат glm5.app (бесплатно, но с ограничениями), через сторонних провайдеров вроде provod.ai (оплата в рублях), скачав веса с Hugging Face для локального запуска, или через облачные платформы, предлагающие GPU-инстансы с предустановленными моделями.

Какое оборудование нужно для локального запуска GLM-5?

Для запуска модели с 745 млрд параметров требуется как минимум несколько GPU с большим объёмом памяти (например, NVIDIA A100 80GB или H100). Рекомендуется использовать фреймворки vLLM, SGLang или ktransformers. Для тех, у кого нет такого оборудования, доступен вариант через API.