ОБЗОР AI-МОДЕЛИ
GLM-5.3 Flash
Возможности, стоимость и компьютер для локального запуска
Доступная по API мультимодальная модель с лицензией MIT. Есть опубликованный рецепт локального запуска на машинах со 128 ГБ памяти, но с заметной квантизацией и ограничениями по контексту.
- Разработчик
- Z.ai
- Параметры
- 320 млрд
- Лицензия
- MIT
- Вход → выход
- Текст, изображения → текст
- Контекст
- 1 048 576 токенов
- API · вход / выход
- $0.15 / $0.5 за 1 млн токенов; условия ниже
На этой странице
Кому подходит
Где стоит попробовать модель
Недорогие агенты и локальная обработкаСтоит попробовать
Доступная по API мультимодальная модель с лицензией MIT. Есть опубликованный рецепт локального запуска на машинах со 128 ГБ памяти, но с заметной квантизацией и ограничениями по контексту.
Что проверить: Примите результат только после проверки фактов, формата и выполнения задания.
Основание оценки ↗Русские деловые текстыС условиями
Отдельная подтверждённая оценка русской редакторской работы отсутствует.
Что проверить: Дайте исходник и сравните смысл, тон и число ручных исправлений.
Основание оценки ↗Полностью автономная работаС условиями
Нужны совместимые веса, runtime и оборудование.
Что проверить: Проверьте исходящие соединения и внешние инструменты.
Основание оценки ↗Сравнить с другой моделью
Доступная по API мультимодальная модель с лицензией MIT. Есть опубликованный рецепт локального запуска на машинах со 128 ГБ памяти, но с заметной квантизацией и ограничениями по контексту.
Перед выбором GLM-5.3 Flash определите, какой результат будет принят: исправление, прошедшее тесты, точное извлечение полей или текст, который редактор готов публиковать. Ни общий рейтинг, ни большой контекст не отвечают на этот вопрос за вашу команду.
официальный паспорт. Данные и тарифы проверены 12.09.2026 по московскому времени.
Другие версии: что нельзя смешивать
Ранее модель встречалась под именем ox-alpha. Это новая база с визуальным входом, а не просто уменьшенная точная копия GLM-5.3. Лицензия Flash MIT отличается от GLM-5.3 License.
Качество и возможности
Flash стоит проверить на потоке небольших правок и работе с изображениями интерфейса. Важно оценить обе части задачи: правильно ли модель прочитала экран и исправила ли реальную причину ошибки. Красивый макет без работающей логики не считается готовой страницей.
У агентного режима отдельно измеряйте число повторов. Если после двух одинаковых неудач модель продолжает то же действие, нужен предел итераций и передача человеку. Низкая цена токена не делает бесконечный цикл полезным.
Результаты тестов
| Независимый замер | Значение |
|---|---|
| Intelligence Index v4.3 | 42 |
| Режим | max |
| Генерация | 94.9 токена/с |
| TTFT | 2.49 с |
Источник: Artificial Analysis. Снимок 12 сентября 2026 года. Балл относится к составному набору задач и указанному режиму. Это не процент правильных ответов и не отдельная оценка русского языка.
Мы не переносим цифры производителя из другого harness в эту таблицу. Для сравнения моделей используйте одинаковую версию теста, инструменты и бюджет рассуждения.
Независимые проверки
Опыт пользователей
В русскоязычном обсуждении от 28 августа автор хвалит стоимость и результат браузерного макета. В комментариях отмечают упрямство, повторяющиеся действия и нестабильную скорость у разных провайдеров. Это опыт разработки, а не отдельный тест русской редакторской работы. Цены из обсуждения устарели относительно текущего прайса. Первичное обсуждение.
Работа на русском языке
Полноценного слепого теста этой точной версии на русской редактуре в проверенных источниках нет. Русскоязычный комментарий о коде не оценивает склонения, деловой тон или точность пересказа. До внедрения проверьте письма клиентам, сокращение текста и извлечение реквизитов.
Сохраните исходные задания и ответы. Попросите редактора оценить их без названия модели: смысл, фактические ошибки, естественность речи и объём ручных исправлений. Ниже есть запросы для такого пилота; это не выдуманные результаты запуска.
Примеры и задачи для проверки
Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.
Русское письмо без выдуманных обещанийЗапрос для самостоятельной проверки
Запрос
Перепиши письмо клиенту простым деловым русским языком, до 80 слов. Не добавляй новых фактов и обещаний. Сохрани дату и причину задержки. Исходник: «В связи с необходимостью проведения дополнительной проверки сообщаем, что макет будет направлен 18 сентября. Задержка связана с проверкой мобильной версии. Стоимость не меняется».
Как оценить результат
Должны сохраниться 18 сентября, проверка мобильной версии и неизменная стоимость. Не должно появиться скидки, оправданий или гарантии, которой нет в исходнике.
Извлечение данных с проверяемым ответомЗапрос для самостоятельной проверки
Запрос
Верни только JSON с полями amount, currency, due_date и contract_id. Неизвестное значение обозначь null. Текст: «Оплатить 12 500 рублей до 20.09.2026. Номер договора в письме не указан». Не придумывай номер договора.
Как оценить результат
Ожидаются amount 12500, currency RUB, due_date 2026-09-20 и contract_id null. Проверьте JSON парсером. Это заданный критерий, не записанный ответ модели.
Проверка рабочего кодаЗапрос для самостоятельной проверки
Запрос
Прочитай приложенные файлы проекта и воспроизведение ошибки. Сначала назови вероятную причину и недостающие сведения. Затем предложи минимальную правку и способ проверить её. Не заменяй реальные API заглушками и не меняй несвязанные файлы.
Как оценить результат
Используйте тестовую копию репозитория. Сравните диагноз с воспроизведением, проверьте diff и сборку. Не выдавайте успешный текстовый ответ за прошедший тест.
Локальный запуск
Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.
В руководстве Unsloth: UD-IQ1_S занимает около 93 ГБ, UD-IQ3_XXS около 120 ГБ, UD-Q4_K_XL около 200 ГБ. Для 128 ГБ устройств есть 3-битный рецепт, но запас мал. Более свободный вариант: 256 ГБ памяти и 4-битные веса.
Как рассчитать память: KV-кэш, буферы и запас
Объём весов на диске не равен полной памяти процесса. Добавьте KV-кэш для выбранного контекста, рабочие буферы, память ОС и запас. В MoE неиспользуемые на текущем токене эксперты всё равно нужно где-то хранить. RAM и VRAM нельзя механически складывать, если runtime не поддерживает нужный offload.
Скорость по опубликованным тестам
AA публикует 94.9 токена/с и TTFT 2.49 с для GLM-5.3 Flash (max). Источник и методика.
Это внешний замер API. Генерация после начала потока не равна времени до готового ответа. Ожидание, рассуждение, инструменты и повторы могут занимать больше времени. Эти значения не используются как обещание скорости Mac Studio, ПК или DGX Spark.
Конфигурации, скорость и инструкции
Минимальный эксперимент: 128 ГБUD-IQ3_XXSНет замера для этого профиляРасчётная оценка
- Квантизация
- UD-IQ3_XXS
- Контекст
- Начните с 8 192 токенов; это выбранный старт пилота
- Среда и версия
- llama.cpp: поддержка PR 27754 / Unsloth
- RAM
- 128 ГБ общей памяти; нужен почти весь объём
- Накопитель
- 150 ГБ свободно, оценка
- Одновременные запросы
- Один запрос
- Скорость и единица
- Для этой полной конфигурации воспроизводимый замер не подтверждён
- Условия теста / ограничения
- Опубликован рецепт для Mac и DGX Spark. Большой контекст и фоновые приложения способны вывести за предел памяти. Скорость API сюда не переносится.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
- Установите совместимую сборку runtime по источнику.
- Скачайте все части указанной квантизации.
- Начните с короткого контекста и проверьте фактическую память и корректность ответа.
- Увеличивайте нагрузку только после успешной проверки.
Больше запаса: 256 ГБUD-Q4_K_XLНет замера для этого профиляРасчётная оценка
- Квантизация
- UD-Q4_K_XL
- Контекст
- Начните с 8 192 токенов; это выбранный старт пилота
- Среда и версия
- Совместимая сборка llama.cpp / Unsloth
- RAM
- 256 ГБ
- Накопитель
- 250 ГБ свободно, оценка
- Одновременные запросы
- Один запрос
- Скорость и единица
- Для этой полной конфигурации воспроизводимый замер не подтверждён
- Условия теста / ограничения
- Оценка для файла около 200 ГБ. Запас не гарантирует миллионный контекст.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
- Установите совместимую сборку runtime по источнику.
- Скачайте все части указанной квантизации.
- Начните с короткого контекста и проверьте фактическую память и корректность ответа.
- Увеличивайте нагрузку только после успешной проверки.
Покупка и наличие
Из готовых компьютеров можно рассмотреть Mac Studio с достаточной общей памятью или DGX Spark 128 ГБ под опубликованный 3-битный рецепт. Перед покупкой уточните точную комплектацию карточки. RTX 5090 с 32 ГБ не вмещает эти веса целиком.
Как выбирать оборудование и проверять цены
До оплаты попросите показать точную конфигурацию, ОС, версию runtime, имя кванта и контекст. Замерьте короткий и длинный запрос, затем несколько одновременных. Цена компьютера и наличие в России зависят от комплектации и поставщика; неподтверждённая цена не публикуется.
API и стоимость
| Standard / указанный источник, USD за 1 млн токенов | Цена |
|---|---|
| Вход без кэша | $0.15 |
| Выход | $0.5 |
| Чтение кэша | $0.03 |
Обычный тариф Z.ai: $0,15 / $0,50; чтение кэша $0,03 за 1 млн токенов. Встречающиеся в ранних отзывах $0,07 / $0,25 не используются как текущая официальная цена. Источник цены.
Пример бюджета
10 000 входных и 2 000 оплачиваемых выходных токенов без кэша стоят $0.0025 по указанным базовым ставкам. Тысяча таких запросов: $2.5. Это арифметический пример, не замер расхода агента.
В рабочем бюджете учитывайте все попытки, токены рассуждения, инструменты и повышенные тарифы. Сохраняйте usage из API. Для повторяющихся задач считайте стоимость принятого результата, а не только цену миллиона токенов.
Подходит ли российской компании?
Собственное размещение позволяет построить обработку внутри инфраструктуры компании. Но пригодность GLM-5.3 Flash определяется лицензией, оборудованием и всей схемой передачи данных, а не одним словом «локально».
Где будут обрабатываться данные
Проверьте исходящие подключения runtime, телеметрию, журналирование, резервные копии и внешние инструменты агента. Локальная модель с облачным поиском или удалённым MCP всё ещё может передавать данные наружу.
Для пилота используйте синтетические данные. Перед рабочим запуском зафиксируйте схему движения данных и ответственного за проверку. Не считайте наличие посредника подтверждением официальной доступности в России.
Российское законодательство: что учесть
Проверяйте применимость требований к локализации и трансграничной передаче: 152-ФЗ, статьи 18 и 12.
Условия лицензии модели нужно проверить до внешнего коммерческого сервиса. Разрешение использовать веса не заменяет проверку обработки данных.
Что проверить до рабочего запуска
Возьмите небольшой набор характерных задач и заранее определите условия приёмки. В журнале сохраняйте точную модель, дату, настройки, время и расход. Проверьте удаление тестовых данных и отказ внешнего сервиса. Для русского текста оцените, сколько правок требуется редактору. Для кода обязательны сборка и ревью.
Технические характеристики
Паспорт модели · все 18 параметров
| Разработчик | Z.ai |
|---|---|
| Точная версия | GLM-5.3 Flash |
| Тип модели | Текстовая модель |
| Доступность весов | Открытые веса |
| Лицензия | MIT |
| Всего параметров | 320 млрд |
| Активных параметров (MoE) | 18 млрд |
| Архитектура | MoE |
| Контекстное окно | 1 048 576 токенов |
| Максимальный вывод | Зависит от сервера |
| Модальности | Текст, изображения → текст |
| Работа с инструментами | Вызов инструментов; зависит от клиента и шаблона |
| Цена API и единица тарификации | $0.15 / $0.5 за 1 млн токенов; условия ниже |
| Подписка | Отдельные планы сервиса; API оплачивается отдельно |
| Дата выпуска | 26.08.2026 |
| Форматы весов | FP8 / BF16; сторонние GGUF |
| Среды запуска | SGLang, vLLM; llama.cpp с поддержкой GLM-5.3-Flash |
| Региональная доступность | Проверяйте условия поставщика и схему обработки данных; подробнее в разделе для РФ |
Устройство модели · архитектура
MoE, 320 млрд параметров и 18 млрд активных. Гибрид разреженного и линейного внимания, mHC. Открытый паспорт описывает мультимодальное обучение и варианты FP8/BF16. Число активных параметров определяет часть вычислений, но не объём всех хранимых весов.
Вопросы и источники
Можно ли использовать GLM-5.3 Flash без интернета?
Да, если веса и совместимая среда установлены в собственном контуре, а внешние инструменты отключены. Требования и ограничения перечислены в локальном разделе.
Большой контекст гарантирует точный ответ?
Нет. Окно задаёт вместимость запроса. Проверяйте поиск деталей, отсутствие домыслов и ссылки на исходные фрагменты.
Это личный тест Фабио?
Это обзор документации, независимых измерений и доступных первичных отзывов. Собственные аппаратные замеры и личное мнение не добавлены без фактического испытания.
Как сравнить с уже опубликованной моделью?
Выберите вторую модель в форме сравнения. Таблица сопоставит паспорта; итоговый выбор сделайте по своим заданиям, тарифу и условиям размещения.
Источники данных
- Паспорт модели и описание возможностейhuggingface.co
- Artificial Analysis: режим и измерения, снимок 12.09.2026artificialanalysis.ai
- Источник тарифа, проверено 12.09.2026docs.z.ai
- Первичный пользовательский опыт; субъективная оценкаwww.reddit.com
- Локальное размещение и ограничения runtimeunsloth.ai
- 152-ФЗ: действующая редакция, проверьте применимостьwww.consultant.ru