ОБЗОР AI-МОДЕЛИ

GLM-5.3 Flash

Возможности, стоимость и компьютер для локального запуска

Доступная по API мультимодальная модель с лицензией MIT. Есть опубликованный рецепт локального запуска на машинах со 128 ГБ памяти, но с заметной квантизацией и ограничениями по контексту.

Фабио Де Лука · Проверено 11.09.2026 · Релиз 26.08.2026

Разработчик
Z.ai
Параметры
320 млрд
Лицензия
MIT
Вход → выход
Текст, изображения → текст
Контекст
1 048 576 токенов
API · вход / выход
$0.15 / $0.5 за 1 млн токенов; условия ниже
На этой странице

Кому подходит

ВЫБОР ПО ЗАДАЧЕ

Где стоит попробовать модель

По документации · проверьте на своих данных
Недорогие агенты и локальная обработкаСтоит попробовать

Доступная по API мультимодальная модель с лицензией MIT. Есть опубликованный рецепт локального запуска на машинах со 128 ГБ памяти, но с заметной квантизацией и ограничениями по контексту.

Что проверить: Примите результат только после проверки фактов, формата и выполнения задания.

Основание оценки ↗
Русские деловые текстыС условиями

Отдельная подтверждённая оценка русской редакторской работы отсутствует.

Что проверить: Дайте исходник и сравните смысл, тон и число ручных исправлений.

Основание оценки ↗
Полностью автономная работаС условиями

Нужны совместимые веса, runtime и оборудование.

Что проверить: Проверьте исходящие соединения и внешние инструменты.

Основание оценки ↗

Сравнить с другой моделью

Характеристики и конфигурации рядом, в одной таблице.

Доступная по API мультимодальная модель с лицензией MIT. Есть опубликованный рецепт локального запуска на машинах со 128 ГБ памяти, но с заметной квантизацией и ограничениями по контексту.

Перед выбором GLM-5.3 Flash определите, какой результат будет принят: исправление, прошедшее тесты, точное извлечение полей или текст, который редактор готов публиковать. Ни общий рейтинг, ни большой контекст не отвечают на этот вопрос за вашу команду.

официальный паспорт. Данные и тарифы проверены 12.09.2026 по московскому времени.

Другие версии: что нельзя смешивать

Ранее модель встречалась под именем ox-alpha. Это новая база с визуальным входом, а не просто уменьшенная точная копия GLM-5.3. Лицензия Flash MIT отличается от GLM-5.3 License.

Качество и возможности

Flash стоит проверить на потоке небольших правок и работе с изображениями интерфейса. Важно оценить обе части задачи: правильно ли модель прочитала экран и исправила ли реальную причину ошибки. Красивый макет без работающей логики не считается готовой страницей.

У агентного режима отдельно измеряйте число повторов. Если после двух одинаковых неудач модель продолжает то же действие, нужен предел итераций и передача человеку. Низкая цена токена не делает бесконечный цикл полезным.

Результаты тестов

Независимый замер Значение
Intelligence Index v4.3 42
Режим max
Генерация 94.9 токена/с
TTFT 2.49 с

Источник: Artificial Analysis. Снимок 12 сентября 2026 года. Балл относится к составному набору задач и указанному режиму. Это не процент правильных ответов и не отдельная оценка русского языка.

Мы не переносим цифры производителя из другого harness в эту таблицу. Для сравнения моделей используйте одинаковую версию теста, инструменты и бюджет рассуждения.

Независимые проверки

Опыт пользователей

В русскоязычном обсуждении от 28 августа автор хвалит стоимость и результат браузерного макета. В комментариях отмечают упрямство, повторяющиеся действия и нестабильную скорость у разных провайдеров. Это опыт разработки, а не отдельный тест русской редакторской работы. Цены из обсуждения устарели относительно текущего прайса. Первичное обсуждение.

Работа на русском языке

Полноценного слепого теста этой точной версии на русской редактуре в проверенных источниках нет. Русскоязычный комментарий о коде не оценивает склонения, деловой тон или точность пересказа. До внедрения проверьте письма клиентам, сокращение текста и извлечение реквизитов.

Сохраните исходные задания и ответы. Попросите редактора оценить их без названия модели: смысл, фактические ошибки, естественность речи и объём ручных исправлений. Ниже есть запросы для такого пилота; это не выдуманные результаты запуска.

ПРАКТИКА

Примеры и задачи для проверки

Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.

Русское письмо без выдуманных обещанийЗапрос для самостоятельной проверки

Запрос

Перепиши письмо клиенту простым деловым русским языком, до 80 слов. Не добавляй новых фактов и обещаний. Сохрани дату и причину задержки. Исходник: «В связи с необходимостью проведения дополнительной проверки сообщаем, что макет будет направлен 18 сентября. Задержка связана с проверкой мобильной версии. Стоимость не меняется».

Как оценить результат

Должны сохраниться 18 сентября, проверка мобильной версии и неизменная стоимость. Не должно появиться скидки, оправданий или гарантии, которой нет в исходнике.

Это тестовый запрос, не опубликованный результат запуска модели.

Извлечение данных с проверяемым ответомЗапрос для самостоятельной проверки

Запрос

Верни только JSON с полями amount, currency, due_date и contract_id. Неизвестное значение обозначь null. Текст: «Оплатить 12 500 рублей до 20.09.2026. Номер договора в письме не указан». Не придумывай номер договора.

Как оценить результат

Ожидаются amount 12500, currency RUB, due_date 2026-09-20 и contract_id null. Проверьте JSON парсером. Это заданный критерий, не записанный ответ модели.

Это тестовый запрос, не опубликованный результат запуска модели.

Проверка рабочего кодаЗапрос для самостоятельной проверки

Запрос

Прочитай приложенные файлы проекта и воспроизведение ошибки. Сначала назови вероятную причину и недостающие сведения. Затем предложи минимальную правку и способ проверить её. Не заменяй реальные API заглушками и не меняй несвязанные файлы.

Как оценить результат

Используйте тестовую копию репозитория. Сравните диагноз с воспроизведением, проверьте diff и сборку. Не выдавайте успешный текстовый ответ за прошедший тест.

Это тестовый запрос, не опубликованный результат запуска модели.

Локальный запуск

Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.

В руководстве Unsloth: UD-IQ1_S занимает около 93 ГБ, UD-IQ3_XXS около 120 ГБ, UD-Q4_K_XL около 200 ГБ. Для 128 ГБ устройств есть 3-битный рецепт, но запас мал. Более свободный вариант: 256 ГБ памяти и 4-битные веса.

Файлы и руководство запуска.

Как рассчитать память: KV-кэш, буферы и запас

Объём весов на диске не равен полной памяти процесса. Добавьте KV-кэш для выбранного контекста, рабочие буферы, память ОС и запас. В MoE неиспользуемые на текущем токене эксперты всё равно нужно где-то хранить. RAM и VRAM нельзя механически складывать, если runtime не поддерживает нужный offload.

Скорость по опубликованным тестам

AA публикует 94.9 токена/с и TTFT 2.49 с для GLM-5.3 Flash (max). Источник и методика.

Это внешний замер API. Генерация после начала потока не равна времени до готового ответа. Ожидание, рассуждение, инструменты и повторы могут занимать больше времени. Эти значения не используются как обещание скорости Mac Studio, ПК или DGX Spark.

Конфигурации, скорость и инструкции

Откройте строку для всех условий. Если измерений нет, скорость не заявляется.

Минимальный эксперимент: 128 ГБUD-IQ3_XXSНет замера для этого профиляРасчётная оценка
Квантизация
UD-IQ3_XXS
Контекст
Начните с 8 192 токенов; это выбранный старт пилота
Среда и версия
llama.cpp: поддержка PR 27754 / Unsloth
RAM
128 ГБ общей памяти; нужен почти весь объём
Накопитель
150 ГБ свободно, оценка
Одновременные запросы
Один запрос
Скорость и единица
Для этой полной конфигурации воспроизводимый замер не подтверждён
Условия теста / ограничения
Опубликован рецепт для Mac и DGX Spark. Большой контекст и фоновые приложения способны вывести за предел памяти. Скорость API сюда не переносится.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

  1. Установите совместимую сборку runtime по источнику.
  2. Скачайте все части указанной квантизации.
  3. Начните с короткого контекста и проверьте фактическую память и корректность ответа.
  4. Увеличивайте нагрузку только после успешной проверки.
Больше запаса: 256 ГБUD-Q4_K_XLНет замера для этого профиляРасчётная оценка
Квантизация
UD-Q4_K_XL
Контекст
Начните с 8 192 токенов; это выбранный старт пилота
Среда и версия
Совместимая сборка llama.cpp / Unsloth
RAM
256 ГБ
Накопитель
250 ГБ свободно, оценка
Одновременные запросы
Один запрос
Скорость и единица
Для этой полной конфигурации воспроизводимый замер не подтверждён
Условия теста / ограничения
Оценка для файла около 200 ГБ. Запас не гарантирует миллионный контекст.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

  1. Установите совместимую сборку runtime по источнику.
  2. Скачайте все части указанной квантизации.
  3. Начните с короткого контекста и проверьте фактическую память и корректность ответа.
  4. Увеличивайте нагрузку только после успешной проверки.

Покупка и наличие

Из готовых компьютеров можно рассмотреть Mac Studio с достаточной общей памятью или DGX Spark 128 ГБ под опубликованный 3-битный рецепт. Перед покупкой уточните точную комплектацию карточки. RTX 5090 с 32 ГБ не вмещает эти веса целиком.

Как выбирать оборудование и проверять цены

До оплаты попросите показать точную конфигурацию, ОС, версию runtime, имя кванта и контекст. Замерьте короткий и длинный запрос, затем несколько одновременных. Цена компьютера и наличие в России зависят от комплектации и поставщика; неподтверждённая цена не публикуется.

API и стоимость

Standard / указанный источник, USD за 1 млн токенов Цена
Вход без кэша $0.15
Выход $0.5
Чтение кэша $0.03

Обычный тариф Z.ai: $0,15 / $0,50; чтение кэша $0,03 за 1 млн токенов. Встречающиеся в ранних отзывах $0,07 / $0,25 не используются как текущая официальная цена. Источник цены.

Пример бюджета

10 000 входных и 2 000 оплачиваемых выходных токенов без кэша стоят $0.0025 по указанным базовым ставкам. Тысяча таких запросов: $2.5. Это арифметический пример, не замер расхода агента.

В рабочем бюджете учитывайте все попытки, токены рассуждения, инструменты и повышенные тарифы. Сохраняйте usage из API. Для повторяющихся задач считайте стоимость принятого результата, а не только цену миллиона токенов.

Подходит ли российской компании?

Собственное размещение позволяет построить обработку внутри инфраструктуры компании. Но пригодность GLM-5.3 Flash определяется лицензией, оборудованием и всей схемой передачи данных, а не одним словом «локально».

Где будут обрабатываться данные

Проверьте исходящие подключения runtime, телеметрию, журналирование, резервные копии и внешние инструменты агента. Локальная модель с облачным поиском или удалённым MCP всё ещё может передавать данные наружу.

Для пилота используйте синтетические данные. Перед рабочим запуском зафиксируйте схему движения данных и ответственного за проверку. Не считайте наличие посредника подтверждением официальной доступности в России.

Российское законодательство: что учесть

Проверяйте применимость требований к локализации и трансграничной передаче: 152-ФЗ, статьи 18 и 12.

Условия лицензии модели нужно проверить до внешнего коммерческого сервиса. Разрешение использовать веса не заменяет проверку обработки данных.

Что проверить до рабочего запуска

Возьмите небольшой набор характерных задач и заранее определите условия приёмки. В журнале сохраняйте точную модель, дату, настройки, время и расход. Проверьте удаление тестовых данных и отказ внешнего сервиса. Для русского текста оцените, сколько правок требуется редактору. Для кода обязательны сборка и ревью.

Технические характеристики

Паспорт модели · все 18 параметров
РазработчикZ.ai
Точная версияGLM-5.3 Flash
Тип моделиТекстовая модель
Доступность весовОткрытые веса
ЛицензияMIT
Всего параметров320 млрд
Активных параметров (MoE)18 млрд
АрхитектураMoE
Контекстное окно1 048 576 токенов
Максимальный выводЗависит от сервера
МодальностиТекст, изображения → текст
Работа с инструментамиВызов инструментов; зависит от клиента и шаблона
Цена API и единица тарификации$0.15 / $0.5 за 1 млн токенов; условия ниже
ПодпискаОтдельные планы сервиса; API оплачивается отдельно
Дата выпуска26.08.2026
Форматы весовFP8 / BF16; сторонние GGUF
Среды запускаSGLang, vLLM; llama.cpp с поддержкой GLM-5.3-Flash
Региональная доступностьПроверяйте условия поставщика и схему обработки данных; подробнее в разделе для РФ
Устройство модели · архитектура

MoE, 320 млрд параметров и 18 млрд активных. Гибрид разреженного и линейного внимания, mHC. Открытый паспорт описывает мультимодальное обучение и варианты FP8/BF16. Число активных параметров определяет часть вычислений, но не объём всех хранимых весов.

Вопросы и источники

Можно ли использовать GLM-5.3 Flash без интернета?

Да, если веса и совместимая среда установлены в собственном контуре, а внешние инструменты отключены. Требования и ограничения перечислены в локальном разделе.

Большой контекст гарантирует точный ответ?

Нет. Окно задаёт вместимость запроса. Проверяйте поиск деталей, отсутствие домыслов и ссылки на исходные фрагменты.

Это личный тест Фабио?

Это обзор документации, независимых измерений и доступных первичных отзывов. Собственные аппаратные замеры и личное мнение не добавлены без фактического испытания.

Как сравнить с уже опубликованной моделью?

Выберите вторую модель в форме сравнения. Таблица сопоставит паспорта; итоговый выбор сделайте по своим заданиям, тарифу и условиям размещения.

Источники данных

Дата проверки относится к источникам, а не к испытанию оборудования.

  1. Паспорт модели и описание возможностейhuggingface.co
  2. Artificial Analysis: режим и измерения, снимок 12.09.2026artificialanalysis.ai
  3. Источник тарифа, проверено 12.09.2026docs.z.ai
  4. Первичный пользовательский опыт; субъективная оценкаwww.reddit.com
  5. Локальное размещение и ограничения runtimeunsloth.ai
  6. 152-ФЗ: действующая редакция, проверьте применимостьwww.consultant.ru

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.