ОБЗОР AI-МОДЕЛИ

GLM-5.3

Возможности, стоимость и компьютер для локального запуска

Крупная модель с открытыми весами для сложного кода и длинных агентных задач. Для домашнего запуска нужна очень большая память: даже тяжёлая квантизация ориентирована на машины класса 256 ГБ.

Фабио Де Лука · Проверено 11.09.2026 · Релиз 18.08.2026 по AA; веса опубликованы позже

Разработчик
Z.ai
Параметры
753 млрд
Лицензия
GLM-5.3 License
Вход → выход
Текст → текст
Контекст
1 000 000 токенов
API · вход / выход
$1.4 / $4.4 за 1 млн токенов; условия ниже
На этой странице

Кому подходит

ВЫБОР ПО ЗАДАЧЕ

Где стоит попробовать модель

По документации · проверьте на своих данных
Сложные изменения в репозиторииСтоит попробовать

Крупная модель с открытыми весами для сложного кода и длинных агентных задач. Для домашнего запуска нужна очень большая память: даже тяжёлая квантизация ориентирована на машины класса 256 ГБ.

Что проверить: Примите результат только после проверки фактов, формата и выполнения задания.

Основание оценки ↗
Русские деловые текстыС условиями

Отдельная подтверждённая оценка русской редакторской работы отсутствует.

Что проверить: Дайте исходник и сравните смысл, тон и число ручных исправлений.

Основание оценки ↗
Полностью автономная работаС условиями

Нужны совместимые веса, runtime и оборудование.

Что проверить: Проверьте исходящие соединения и внешние инструменты.

Основание оценки ↗

Сравнить с другой моделью

Характеристики и конфигурации рядом, в одной таблице.

Крупная модель с открытыми весами для сложного кода и длинных агентных задач. Для домашнего запуска нужна очень большая память: даже тяжёлая квантизация ориентирована на машины класса 256 ГБ.

Перед выбором GLM-5.3 определите, какой результат будет принят: исправление, прошедшее тесты, точное извлечение полей или текст, который редактор готов публиковать. Ни общий рейтинг, ни большой контекст не отвечают на этот вопрос за вашу команду.

официальный паспорт. Данные и тарифы проверены 12.09.2026 по московскому времени.

Другие версии: что нельзя смешивать

GLM-5.3 Flash имеет другую базовую модель, размер и лицензию. Результаты Flash нельзя переносить на GLM-5.3. Число 753B приводится в паспорте Hugging Face и AA; руководство Unsloth использует 744B. Для покупки оборудования надёжнее смотреть на размер конкретных файлов.

Качество и возможности

GLM-5.3 стоит испытывать на задачах с несколькими связанными файлами и проверяемым результатом. Для первого запуска выберите реальную ошибку, но ограничьте область правки. Смотрите, умеет ли агент прочитать существующий код до того, как начнёт писать новый.

Важен и момент остановки. Попросите модель прекратить работу после успешного теста, описать оставшиеся сомнения и не добавлять функции сверх задания. Длительный агентный цикл полезен, когда приближает к результату; повторение одного и того же действия только расходует бюджет.

Результаты тестов

Независимый замер Значение
Intelligence Index v4.3 45
Режим max
Генерация 62.3 токена/с
TTFT 3.16 с

Источник: Artificial Analysis. Снимок 12 сентября 2026 года. Балл относится к составному набору задач и указанному режиму. Это не процент правильных ответов и не отдельная оценка русского языка.

Мы не переносим цифры производителя из другого harness в эту таблицу. Для сравнения моделей используйте одинаковую версию теста, инструменты и бюджет рассуждения.

Независимые проверки

Опыт пользователей

В обсуждении SlopCodeBench есть положительный отзыв о практической работе GLM-5.3, с субъективным сравнением с Opus 4.8. Такой комментарий помогает выбрать кандидата для пилота, но не заменяет результаты самого набора тестов и не оценивает русский язык. Первичное обсуждение.

Работа на русском языке

Полноценного слепого теста этой точной версии на русской редактуре в проверенных источниках нет. Русскоязычный комментарий о коде не оценивает склонения, деловой тон или точность пересказа. До внедрения проверьте письма клиентам, сокращение текста и извлечение реквизитов.

Сохраните исходные задания и ответы. Попросите редактора оценить их без названия модели: смысл, фактические ошибки, естественность речи и объём ручных исправлений. Ниже есть запросы для такого пилота; это не выдуманные результаты запуска.

ПРАКТИКА

Примеры и задачи для проверки

Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.

Русское письмо без выдуманных обещанийЗапрос для самостоятельной проверки

Запрос

Перепиши письмо клиенту простым деловым русским языком, до 80 слов. Не добавляй новых фактов и обещаний. Сохрани дату и причину задержки. Исходник: «В связи с необходимостью проведения дополнительной проверки сообщаем, что макет будет направлен 18 сентября. Задержка связана с проверкой мобильной версии. Стоимость не меняется».

Как оценить результат

Должны сохраниться 18 сентября, проверка мобильной версии и неизменная стоимость. Не должно появиться скидки, оправданий или гарантии, которой нет в исходнике.

Это тестовый запрос, не опубликованный результат запуска модели.

Извлечение данных с проверяемым ответомЗапрос для самостоятельной проверки

Запрос

Верни только JSON с полями amount, currency, due_date и contract_id. Неизвестное значение обозначь null. Текст: «Оплатить 12 500 рублей до 20.09.2026. Номер договора в письме не указан». Не придумывай номер договора.

Как оценить результат

Ожидаются amount 12500, currency RUB, due_date 2026-09-20 и contract_id null. Проверьте JSON парсером. Это заданный критерий, не записанный ответ модели.

Это тестовый запрос, не опубликованный результат запуска модели.

Проверка рабочего кодаЗапрос для самостоятельной проверки

Запрос

Прочитай приложенные файлы проекта и воспроизведение ошибки. Сначала назови вероятную причину и недостающие сведения. Затем предложи минимальную правку и способ проверить её. Не заменяй реальные API заглушками и не меняй несвязанные файлы.

Как оценить результат

Используйте тестовую копию репозитория. Сравните диагноз с воспроизведением, проверьте diff и сборку. Не выдавайте успешный текстовый ответ за прошедший тест.

Это тестовый запрос, не опубликованный результат запуска модели.

Локальный запуск

Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.

Unsloth публикует GGUF UD-IQ2_M размером 239 ГБ и ориентир около 245 ГБ доступной памяти. Машина с 256 ГБ находится близко к нижней границе; для запаса и более качественных квантов разумнее рассматривать 512 ГБ. Один DGX Spark 128 ГБ не подходит для этого профиля.

Файлы и руководство запуска.

Как рассчитать память: KV-кэш, буферы и запас

Объём весов на диске не равен полной памяти процесса. Добавьте KV-кэш для выбранного контекста, рабочие буферы, память ОС и запас. В MoE неиспользуемые на текущем токене эксперты всё равно нужно где-то хранить. RAM и VRAM нельзя механически складывать, если runtime не поддерживает нужный offload.

Скорость по опубликованным тестам

AA публикует 62.3 токена/с и TTFT 3.16 с для GLM-5.3 (max). Источник и методика.

Это внешний замер API. Генерация после начала потока не равна времени до готового ответа. Ожидание, рассуждение, инструменты и повторы могут занимать больше времени. Эти значения не используются как обещание скорости Mac Studio, ПК или DGX Spark.

Конфигурации, скорость и инструкции

Откройте строку для всех условий. Если измерений нет, скорость не заявляется.

Большая рабочая станция: стартовый 2-битный профильUD-IQ2_MНет замера для этого профиляРасчётная оценка
Квантизация
UD-IQ2_M
Контекст
Начните с 8 192 токенов; это выбранный старт пилота
Среда и версия
llama.cpp / Unsloth
RAM
256 ГБ, из них около 245 ГБ доступны модели
Накопитель
Не менее 300 ГБ свободно; оценка с запасом
Одновременные запросы
Один запрос
Скорость и единица
Для этой полной конфигурации воспроизводимый замер не подтверждён
Условия теста / ограничения
Ориентир по руководству Unsloth. Mac Studio 256 ГБ или связка двух DGX Spark требуют настройки; память двух устройств не объединяется автоматически.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

  1. Установите совместимую сборку runtime по источнику.
  2. Скачайте все части указанной квантизации.
  3. Начните с короткого контекста и проверьте фактическую память и корректность ответа.
  4. Увеличивайте нагрузку только после успешной проверки.

Пример после установки, текстовый запрос:

./llama-cli -hf unsloth/GLM-5.3-GGUF:UD-IQ2_M -c 8192 --temp 1.0 --top-p 0.95 --min-p 0.01

Команда предложена для пилота; редакция не запускала эту конфигурацию.

Покупка и наличие

Mac Studio M5 Ultra с 256 ГБ рассматривайте только под тяжёлую квантизацию; 512 ГБ оставляет больше запаса. Два DGX Spark требуют распределённого запуска и отдельного подтверждения скорости. Обычный ПК с одной RTX 5090 не заменяет такую систему.

Как выбирать оборудование и проверять цены

До оплаты попросите показать точную конфигурацию, ОС, версию runtime, имя кванта и контекст. Замерьте короткий и длинный запрос, затем несколько одновременных. Цена компьютера и наличие в России зависят от комплектации и поставщика; неподтверждённая цена не публикуется.

API и стоимость

Standard / указанный источник, USD за 1 млн токенов Цена
Вход без кэша $1.4
Выход $4.4
Чтение кэша $0.26

Тариф Z.ai: вход $1,40, выход $4,40, чтение кэша $0,26. Coding Plan имеет отдельные квоты и endpoint; его подписка не равна балансу обычного API. Источник цены.

Пример бюджета

10 000 входных и 2 000 оплачиваемых выходных токенов без кэша стоят $0.0228 по указанным базовым ставкам. Тысяча таких запросов: $22.8. Это арифметический пример, не замер расхода агента.

В рабочем бюджете учитывайте все попытки, токены рассуждения, инструменты и повышенные тарифы. Сохраняйте usage из API. Для повторяющихся задач считайте стоимость принятого результата, а не только цену миллиона токенов.

Подходит ли российской компании?

Собственное размещение позволяет построить обработку внутри инфраструктуры компании. Но пригодность GLM-5.3 определяется лицензией, оборудованием и всей схемой передачи данных, а не одним словом «локально».

Где будут обрабатываться данные

Проверьте исходящие подключения runtime, телеметрию, журналирование, резервные копии и внешние инструменты агента. Локальная модель с облачным поиском или удалённым MCP всё ещё может передавать данные наружу.

Для пилота используйте синтетические данные. Перед рабочим запуском зафиксируйте схему движения данных и ответственного за проверку. Не считайте наличие посредника подтверждением официальной доступности в России.

Российское законодательство: что учесть

Проверяйте применимость требований к локализации и трансграничной передаче: 152-ФЗ, статьи 18 и 12.

Коммерческое использование допускается с условиями. Для бизнеса Model as a Service с совокупной выручкой группы более $10 млрд за последовательные 12 месяцев требуется проверка Z.ai. Это не запрет коммерческого использования для всех компаний. Полный текст лицензии.

Что проверить до рабочего запуска

Возьмите небольшой набор характерных задач и заранее определите условия приёмки. В журнале сохраняйте точную модель, дату, настройки, время и расход. Проверьте удаление тестовых данных и отказ внешнего сервиса. Для русского текста оцените, сколько правок требуется редактору. Для кода обязательны сборка и ревью.

Технические характеристики

Паспорт модели · все 18 параметров
РазработчикZ.ai
Точная версияGLM-5.3
Тип моделиТекстовая модель
Доступность весовОткрытые веса
ЛицензияGLM-5.3 License
Всего параметров753 млрд
Активных параметров (MoE)40 млрд
АрхитектураMoE
Контекстное окно1 000 000 токенов
Максимальный выводЗависит от сервера и лимита запроса
МодальностиТекст → текст
Работа с инструментамиВызов инструментов; зависит от клиента и шаблона
Цена API и единица тарификации$1.4 / $4.4 за 1 млн токенов; условия ниже
ПодпискаОтдельные планы сервиса; API оплачивается отдельно
Дата выпуска18.08.2026 по AA; веса опубликованы позже
Форматы весовFP8 / BF16 Safetensors; сторонние GGUF
Среды запускаSGLang, vLLM; llama.cpp / Unsloth для GGUF
Региональная доступностьПроверяйте условия поставщика и схему обработки данных; подробнее в разделе для РФ
Устройство модели · архитектура

MoE с разреженным вниманием; база унаследована от GLM-5.2, изменения связаны с дообучением. В открытом паспорте описаны FP8 и BF16 варианты. Режимы рассуждения low, high и max требуют корректного шаблона диалога.

Вопросы и источники

Можно ли использовать GLM-5.3 без интернета?

Да, если веса и совместимая среда установлены в собственном контуре, а внешние инструменты отключены. Требования и ограничения перечислены в локальном разделе.

Большой контекст гарантирует точный ответ?

Нет. Окно задаёт вместимость запроса. Проверяйте поиск деталей, отсутствие домыслов и ссылки на исходные фрагменты.

Это личный тест Фабио?

Это обзор документации, независимых измерений и доступных первичных отзывов. Собственные аппаратные замеры и личное мнение не добавлены без фактического испытания.

Как сравнить с уже опубликованной моделью?

Выберите вторую модель в форме сравнения. Таблица сопоставит паспорта; итоговый выбор сделайте по своим заданиям, тарифу и условиям размещения.

Источники данных

Дата проверки относится к источникам, а не к испытанию оборудования.

  1. Паспорт модели и описание возможностейhuggingface.co
  2. Artificial Analysis: режим и измерения, снимок 12.09.2026artificialanalysis.ai
  3. Источник тарифа, проверено 12.09.2026docs.z.ai
  4. Первичный пользовательский опыт; субъективная оценкаwww.reddit.com
  5. Локальное размещение и ограничения runtimeunsloth.ai
  6. Лицензия: коммерческие условияhuggingface.co
  7. 152-ФЗ: действующая редакция, проверьте применимостьwww.consultant.ru

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.