ОБЗОР AI-МОДЕЛИ
GLM-5.3
Возможности, стоимость и компьютер для локального запуска
Крупная модель с открытыми весами для сложного кода и длинных агентных задач. Для домашнего запуска нужна очень большая память: даже тяжёлая квантизация ориентирована на машины класса 256 ГБ.
- Разработчик
- Z.ai
- Параметры
- 753 млрд
- Лицензия
- GLM-5.3 License
- Вход → выход
- Текст → текст
- Контекст
- 1 000 000 токенов
- API · вход / выход
- $1.4 / $4.4 за 1 млн токенов; условия ниже
На этой странице
Кому подходит
Где стоит попробовать модель
Сложные изменения в репозиторииСтоит попробовать
Крупная модель с открытыми весами для сложного кода и длинных агентных задач. Для домашнего запуска нужна очень большая память: даже тяжёлая квантизация ориентирована на машины класса 256 ГБ.
Что проверить: Примите результат только после проверки фактов, формата и выполнения задания.
Основание оценки ↗Русские деловые текстыС условиями
Отдельная подтверждённая оценка русской редакторской работы отсутствует.
Что проверить: Дайте исходник и сравните смысл, тон и число ручных исправлений.
Основание оценки ↗Полностью автономная работаС условиями
Нужны совместимые веса, runtime и оборудование.
Что проверить: Проверьте исходящие соединения и внешние инструменты.
Основание оценки ↗Сравнить с другой моделью
Крупная модель с открытыми весами для сложного кода и длинных агентных задач. Для домашнего запуска нужна очень большая память: даже тяжёлая квантизация ориентирована на машины класса 256 ГБ.
Перед выбором GLM-5.3 определите, какой результат будет принят: исправление, прошедшее тесты, точное извлечение полей или текст, который редактор готов публиковать. Ни общий рейтинг, ни большой контекст не отвечают на этот вопрос за вашу команду.
официальный паспорт. Данные и тарифы проверены 12.09.2026 по московскому времени.
Другие версии: что нельзя смешивать
GLM-5.3 Flash имеет другую базовую модель, размер и лицензию. Результаты Flash нельзя переносить на GLM-5.3. Число 753B приводится в паспорте Hugging Face и AA; руководство Unsloth использует 744B. Для покупки оборудования надёжнее смотреть на размер конкретных файлов.
Качество и возможности
GLM-5.3 стоит испытывать на задачах с несколькими связанными файлами и проверяемым результатом. Для первого запуска выберите реальную ошибку, но ограничьте область правки. Смотрите, умеет ли агент прочитать существующий код до того, как начнёт писать новый.
Важен и момент остановки. Попросите модель прекратить работу после успешного теста, описать оставшиеся сомнения и не добавлять функции сверх задания. Длительный агентный цикл полезен, когда приближает к результату; повторение одного и того же действия только расходует бюджет.
Результаты тестов
| Независимый замер | Значение |
|---|---|
| Intelligence Index v4.3 | 45 |
| Режим | max |
| Генерация | 62.3 токена/с |
| TTFT | 3.16 с |
Источник: Artificial Analysis. Снимок 12 сентября 2026 года. Балл относится к составному набору задач и указанному режиму. Это не процент правильных ответов и не отдельная оценка русского языка.
Мы не переносим цифры производителя из другого harness в эту таблицу. Для сравнения моделей используйте одинаковую версию теста, инструменты и бюджет рассуждения.
Независимые проверки
Опыт пользователей
В обсуждении SlopCodeBench есть положительный отзыв о практической работе GLM-5.3, с субъективным сравнением с Opus 4.8. Такой комментарий помогает выбрать кандидата для пилота, но не заменяет результаты самого набора тестов и не оценивает русский язык. Первичное обсуждение.
Работа на русском языке
Полноценного слепого теста этой точной версии на русской редактуре в проверенных источниках нет. Русскоязычный комментарий о коде не оценивает склонения, деловой тон или точность пересказа. До внедрения проверьте письма клиентам, сокращение текста и извлечение реквизитов.
Сохраните исходные задания и ответы. Попросите редактора оценить их без названия модели: смысл, фактические ошибки, естественность речи и объём ручных исправлений. Ниже есть запросы для такого пилота; это не выдуманные результаты запуска.
Примеры и задачи для проверки
Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.
Русское письмо без выдуманных обещанийЗапрос для самостоятельной проверки
Запрос
Перепиши письмо клиенту простым деловым русским языком, до 80 слов. Не добавляй новых фактов и обещаний. Сохрани дату и причину задержки. Исходник: «В связи с необходимостью проведения дополнительной проверки сообщаем, что макет будет направлен 18 сентября. Задержка связана с проверкой мобильной версии. Стоимость не меняется».
Как оценить результат
Должны сохраниться 18 сентября, проверка мобильной версии и неизменная стоимость. Не должно появиться скидки, оправданий или гарантии, которой нет в исходнике.
Извлечение данных с проверяемым ответомЗапрос для самостоятельной проверки
Запрос
Верни только JSON с полями amount, currency, due_date и contract_id. Неизвестное значение обозначь null. Текст: «Оплатить 12 500 рублей до 20.09.2026. Номер договора в письме не указан». Не придумывай номер договора.
Как оценить результат
Ожидаются amount 12500, currency RUB, due_date 2026-09-20 и contract_id null. Проверьте JSON парсером. Это заданный критерий, не записанный ответ модели.
Проверка рабочего кодаЗапрос для самостоятельной проверки
Запрос
Прочитай приложенные файлы проекта и воспроизведение ошибки. Сначала назови вероятную причину и недостающие сведения. Затем предложи минимальную правку и способ проверить её. Не заменяй реальные API заглушками и не меняй несвязанные файлы.
Как оценить результат
Используйте тестовую копию репозитория. Сравните диагноз с воспроизведением, проверьте diff и сборку. Не выдавайте успешный текстовый ответ за прошедший тест.
Локальный запуск
Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.
Unsloth публикует GGUF UD-IQ2_M размером 239 ГБ и ориентир около 245 ГБ доступной памяти. Машина с 256 ГБ находится близко к нижней границе; для запаса и более качественных квантов разумнее рассматривать 512 ГБ. Один DGX Spark 128 ГБ не подходит для этого профиля.
Как рассчитать память: KV-кэш, буферы и запас
Объём весов на диске не равен полной памяти процесса. Добавьте KV-кэш для выбранного контекста, рабочие буферы, память ОС и запас. В MoE неиспользуемые на текущем токене эксперты всё равно нужно где-то хранить. RAM и VRAM нельзя механически складывать, если runtime не поддерживает нужный offload.
Скорость по опубликованным тестам
AA публикует 62.3 токена/с и TTFT 3.16 с для GLM-5.3 (max). Источник и методика.
Это внешний замер API. Генерация после начала потока не равна времени до готового ответа. Ожидание, рассуждение, инструменты и повторы могут занимать больше времени. Эти значения не используются как обещание скорости Mac Studio, ПК или DGX Spark.
Конфигурации, скорость и инструкции
Большая рабочая станция: стартовый 2-битный профильUD-IQ2_MНет замера для этого профиляРасчётная оценка
- Квантизация
- UD-IQ2_M
- Контекст
- Начните с 8 192 токенов; это выбранный старт пилота
- Среда и версия
- llama.cpp / Unsloth
- RAM
- 256 ГБ, из них около 245 ГБ доступны модели
- Накопитель
- Не менее 300 ГБ свободно; оценка с запасом
- Одновременные запросы
- Один запрос
- Скорость и единица
- Для этой полной конфигурации воспроизводимый замер не подтверждён
- Условия теста / ограничения
- Ориентир по руководству Unsloth. Mac Studio 256 ГБ или связка двух DGX Spark требуют настройки; память двух устройств не объединяется автоматически.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
- Установите совместимую сборку runtime по источнику.
- Скачайте все части указанной квантизации.
- Начните с короткого контекста и проверьте фактическую память и корректность ответа.
- Увеличивайте нагрузку только после успешной проверки.
Пример после установки, текстовый запрос:
./llama-cli -hf unsloth/GLM-5.3-GGUF:UD-IQ2_M -c 8192 --temp 1.0 --top-p 0.95 --min-p 0.01
Команда предложена для пилота; редакция не запускала эту конфигурацию.
Покупка и наличие
Mac Studio M5 Ultra с 256 ГБ рассматривайте только под тяжёлую квантизацию; 512 ГБ оставляет больше запаса. Два DGX Spark требуют распределённого запуска и отдельного подтверждения скорости. Обычный ПК с одной RTX 5090 не заменяет такую систему.
Как выбирать оборудование и проверять цены
До оплаты попросите показать точную конфигурацию, ОС, версию runtime, имя кванта и контекст. Замерьте короткий и длинный запрос, затем несколько одновременных. Цена компьютера и наличие в России зависят от комплектации и поставщика; неподтверждённая цена не публикуется.
API и стоимость
| Standard / указанный источник, USD за 1 млн токенов | Цена |
|---|---|
| Вход без кэша | $1.4 |
| Выход | $4.4 |
| Чтение кэша | $0.26 |
Тариф Z.ai: вход $1,40, выход $4,40, чтение кэша $0,26. Coding Plan имеет отдельные квоты и endpoint; его подписка не равна балансу обычного API. Источник цены.
Пример бюджета
10 000 входных и 2 000 оплачиваемых выходных токенов без кэша стоят $0.0228 по указанным базовым ставкам. Тысяча таких запросов: $22.8. Это арифметический пример, не замер расхода агента.
В рабочем бюджете учитывайте все попытки, токены рассуждения, инструменты и повышенные тарифы. Сохраняйте usage из API. Для повторяющихся задач считайте стоимость принятого результата, а не только цену миллиона токенов.
Подходит ли российской компании?
Собственное размещение позволяет построить обработку внутри инфраструктуры компании. Но пригодность GLM-5.3 определяется лицензией, оборудованием и всей схемой передачи данных, а не одним словом «локально».
Где будут обрабатываться данные
Проверьте исходящие подключения runtime, телеметрию, журналирование, резервные копии и внешние инструменты агента. Локальная модель с облачным поиском или удалённым MCP всё ещё может передавать данные наружу.
Для пилота используйте синтетические данные. Перед рабочим запуском зафиксируйте схему движения данных и ответственного за проверку. Не считайте наличие посредника подтверждением официальной доступности в России.
Российское законодательство: что учесть
Проверяйте применимость требований к локализации и трансграничной передаче: 152-ФЗ, статьи 18 и 12.
Коммерческое использование допускается с условиями. Для бизнеса Model as a Service с совокупной выручкой группы более $10 млрд за последовательные 12 месяцев требуется проверка Z.ai. Это не запрет коммерческого использования для всех компаний. Полный текст лицензии.
Что проверить до рабочего запуска
Возьмите небольшой набор характерных задач и заранее определите условия приёмки. В журнале сохраняйте точную модель, дату, настройки, время и расход. Проверьте удаление тестовых данных и отказ внешнего сервиса. Для русского текста оцените, сколько правок требуется редактору. Для кода обязательны сборка и ревью.
Технические характеристики
Паспорт модели · все 18 параметров
| Разработчик | Z.ai |
|---|---|
| Точная версия | GLM-5.3 |
| Тип модели | Текстовая модель |
| Доступность весов | Открытые веса |
| Лицензия | GLM-5.3 License |
| Всего параметров | 753 млрд |
| Активных параметров (MoE) | 40 млрд |
| Архитектура | MoE |
| Контекстное окно | 1 000 000 токенов |
| Максимальный вывод | Зависит от сервера и лимита запроса |
| Модальности | Текст → текст |
| Работа с инструментами | Вызов инструментов; зависит от клиента и шаблона |
| Цена API и единица тарификации | $1.4 / $4.4 за 1 млн токенов; условия ниже |
| Подписка | Отдельные планы сервиса; API оплачивается отдельно |
| Дата выпуска | 18.08.2026 по AA; веса опубликованы позже |
| Форматы весов | FP8 / BF16 Safetensors; сторонние GGUF |
| Среды запуска | SGLang, vLLM; llama.cpp / Unsloth для GGUF |
| Региональная доступность | Проверяйте условия поставщика и схему обработки данных; подробнее в разделе для РФ |
Устройство модели · архитектура
MoE с разреженным вниманием; база унаследована от GLM-5.2, изменения связаны с дообучением. В открытом паспорте описаны FP8 и BF16 варианты. Режимы рассуждения low, high и max требуют корректного шаблона диалога.
Вопросы и источники
Можно ли использовать GLM-5.3 без интернета?
Да, если веса и совместимая среда установлены в собственном контуре, а внешние инструменты отключены. Требования и ограничения перечислены в локальном разделе.
Большой контекст гарантирует точный ответ?
Нет. Окно задаёт вместимость запроса. Проверяйте поиск деталей, отсутствие домыслов и ссылки на исходные фрагменты.
Это личный тест Фабио?
Это обзор документации, независимых измерений и доступных первичных отзывов. Собственные аппаратные замеры и личное мнение не добавлены без фактического испытания.
Как сравнить с уже опубликованной моделью?
Выберите вторую модель в форме сравнения. Таблица сопоставит паспорта; итоговый выбор сделайте по своим заданиям, тарифу и условиям размещения.
Источники данных
- Паспорт модели и описание возможностейhuggingface.co
- Artificial Analysis: режим и измерения, снимок 12.09.2026artificialanalysis.ai
- Источник тарифа, проверено 12.09.2026docs.z.ai
- Первичный пользовательский опыт; субъективная оценкаwww.reddit.com
- Локальное размещение и ограничения runtimeunsloth.ai
- Лицензия: коммерческие условияhuggingface.co
- 152-ФЗ: действующая редакция, проверьте применимостьwww.consultant.ru