AI ДЛЯ ВАШИХ ЗАДАЧ

Qwen3.8-27B: обзор, характеристики и требования к ПК

Разбор Qwen3.8-27B: возможности, бенчмарки, API, память для Q4/Q8/BF16 и компьютеры для запуска — Mac Studio, RTX 5090 и DGX Spark.

Фабио Де Лука · Проверено 10.09.2026

Характеристики

Разработчик
Alibaba · Qwen
Размер модели
27 млрд — языковая часть; vision encoder отдельно
Лицензия
Apache 2.0
Дата релиза
14.08.2026
Все технические характеристики 18 параметров
РазработчикAlibaba · Qwen
Точная версияQwen/Qwen3.8-27B
Тип моделиМультимодальная
Доступность весовОткрытые веса; локальный запуск
ЛицензияApache 2.0
Всего параметров27 млрд — языковая часть; vision encoder отдельно
Активных параметров (MoE)Плотная модель: нет выбора подмножества MoE-экспертов
Архитектура64 слоя: 48 Gated DeltaNet + 16 полного внимания; vision encoder
Контекстное окно262 144 нативно; расширение до 1 млн при поддержке runtime; QwenCloud — 1 млн
Максимальный выводЛокально — в пределах выделенного контекста и runtime; QwenCloud: финал до 131K, reasoning до 262K
МодальностиВход: текст, изображения, видео. Выход: текст
Работа с инструментамиДа, через приложение и совместимый parser; инструменты подключаются отдельно
Цена API и единица тарификацииQwenCloud: $0,50 вход / $3,00 выход за 1 млн токенов; 10.09.2026
ПодпискаВеса без подписки; API оплачивается по использованию
Дата выпуска14.08.2026
Форматы весовОригинал BF16 / Safetensors; GGUF Q4/Q8; runtime-сборки NVFP4
Среды запускаTransformers ≥ 5.8.0; совместимые vLLM, SGLang, llama.cpp (для bartowski ≥ b10419)
Региональная доступностьHugging Face / ModelScope; QwenCloud API. Доступность оплаты в РФ не проверена

Qwen3.8-27B: что это и кому подходит

Qwen3.8-27B — открытая модель Alibaba для работы с текстом, кодом, изображениями и видео. Эта страница посвящена конкретному checkpoint Qwen/Qwen3.8-27B. Дата проверки материалов — 10 сентября 2026 года.

Выбор для локального запуска: начните с Q4 и короткого контекста. Практический ориентир — 32 ГБ системной памяти для экспериментов на CPU, 24–32 ГБ видеопамяти для GPU или 64 ГБ объединённой памяти Mac для запаса. Это расчётные рекомендации, а не результаты нашего тестового стенда.

Для первого внедрения полезнее проверить десять собственных документов и задач, чем покупать компьютер по месту модели в рейтинге. Успешная генерация одного ответа ещё не подтверждает приемлемую задержку, качество русского языка или устойчивую работу нескольких сотрудников.

Какие версии нельзя смешивать

Вариант Что важно при выборе
Qwen3.8-27B Плотная мультимодальная модель; основной предмет этой статьи. Релиз 14 августа 2026 года.
Qwen3.8-2.4T-A95B MoE: 2,4 трлн параметров, 95 млрд активных. Открытый checkpoint ориентирован на текст; это другой класс оборудования.
Qwen3.8-Flash-Next Отдельная архитектура и отдельный релиз. Требования 27B на неё не распространяются.

Даты сверены с репозиторием Qwen. Отличия крупной версии — в её карточке модели, Flash-Next — в анонсе разработчика. Для 2.4T даже идеализированное хранение всех весов в 4 битах даёт около 1,2 ТБ до накладных расходов: активные параметры не заменяют полный объём весов при расчёте памяти. Один Mac Studio или DGX Spark 128 ГБ для этого не подходит.

Возможности и ограничения

Задача Как использовать Что проверять на своих данных
Документы и знания компании Ответы с поиском по документам, извлечение полей Ссылки на исходные фрагменты, пропуски и выдуманные факты
Программирование Объяснение кода, исправления, подготовка тестов Сборку, тесты и изменения поведения приложения
Изображения и видео Разбор схем, страниц и кадров Мелкий текст, порядок страниц, стоимость обработки кадров
Агенты и инструменты Планирование и вызов подключённых функций Валидность аргументов и реальные результаты каждого действия
Русскоязычный помощник Проверка терминологии и инструкций на русском Собственный набор вопросов: отдельного нашего RU-бенчмарка нет

Модель выдаёт текст. Понимание изображения не означает генерацию изображений; просмотр видео не означает создание ролика. Браузер, поиск и исполнение кода нужно подключать в приложении. Для локальных файлов и внешних инструментов полезно заранее определить, какие действия требуют участия человека.

Thinking включён по умолчанию и допускает отключение; глубина рассуждения настраивается. Возможности и режимы описаны в официальной карточке 27B. Длинное рассуждение увеличивает задержку и расход токенов. Для извлечения короткого поля сначала сравните качество с reasoning и без него.

Что известно об архитектуре

Параметр конфигурации Значение
Класс Qwen3_5ForConditionalGeneration
Слои 64: 48 Gated DeltaNet и 16 полного внимания
Hidden size / intermediate size 5 120 / 17 408
Attention heads / KV heads 24 / 4 для полного внимания
Head dimension 256 для полного внимания
Словарь 248 320
Исходная точность BF16
Нативный предел позиции 262 144 токена
Vision encoder 27 слоёв; hidden size 1 152

Значения взяты из config.json. Идентификатор qwen3_5 обозначает семейство реализации архитектуры: он не означает, что вы скачали другую версию. Плотная архитектура не имеет отдельного малого набора активных экспертов, характерного для MoE.

Результаты тестов: показатели разработчика

Бенчмарк Результат Qwen3.8-27B
GPQA Diamond 89,2
Humanity’s Last Exam 30,8
LiveCodeBench v6 90,3
SWE-bench Pro 61,7
Terminal Bench 2.1, Terminus 73,0
OSWorld-Verified 84,3
OmniDocBench 1.5 91,1
RealWorldQA 85,9

Источник — таблицы Qwen. Это опубликованные авторами значения в шкалах соответствующих тестов, не наши измерения и не обещание той же точности в Q4. Результаты разных тестов нельзя усреднять в единый «процент интеллекта». Для SWE-bench Pro важны использованный агентный harness и исправленный набор заданий: сравнение с другой таблицей без совпадающей методики может вводить в заблуждение.

Сколько памяти нужно для Qwen3.8-27B

Размер файлов — только начало расчёта

Файл из сборки ggml-org Размер скачивания
Основная модель Q4_K_M 19,0 ГБ
Основная модель Q8_0 28,6 ГБ
Основная модель BF16 53,8 ГБ
Vision projector Q8_0 Дополнительно 629 МБ
Vision projector BF16 Дополнительно 931 МБ

Размеры относятся к конкретным файлам ggml-org, в десятичных ГБ. Общий размер репозитория складывает альтернативные файлы: скачивать все варианты не нужно. У другого конвертера даже Q4_K_M может иметь иной размер. Дополнительные MTP-веса в этот бюджет не включены.

Бюджет памяти = веса + KV-кэш + состояния модели + рабочие буферы + запас для ОС. Для изображений добавляются encoder/projector и обработка входа. Системная RAM и VRAM дискретной карты — разные пулы. На Mac и Spark память общая, и её часть занимает система.

Для полного внимания этой конфигурации расчёт BF16 KV-кэша составляет примерно 64 КиБ на токен одной последовательности: 16 слоёв × 4 KV-головы × 256 × 2 × 2 байта. Это даёт около 0,5 ГиБ при 8 192 токенах, 2 ГиБ при 32 768 и 16 ГиБ при 262 144. Здесь не учтены состояния DeltaNet, дополнительные запросы и служебные буферы. Размеры и особенности recurrent-state pool разобраны в документации SGLang.

Практический минимум и рекомендуемый запас

Все оценки ниже предполагают одного пользователя, текстовый запрос и отключённое дополнительное speculative decoding.

Сценарий Память Контекст для старта Статус рекомендации
CPU, Q4_K_M 32 ГБ RAM; современный CPU 6–8 ядер как ориентир 8 192 Расчётный минимум для эксперимента; скорость не измерена
Дискретная GPU, Q4_K_M 24 ГБ VRAM + 32 ГБ RAM; лучше 64 ГБ RAM 8 192 Оценка; запас зависит от runtime и vision
RTX 5090, NVFP4 32 ГБ VRAM + рекомендуемые 64 ГБ RAM 32 768 Запуск подтверждён авторами рецепта vLLM с особыми флагами
Apple Silicon, Q4 От 32–36 ГБ unified для коротких запросов; рекомендуем 64 ГБ 8 192 Оценка памяти; точную связку ОС и runtime нужно проверить
Q8 на машине с общей памятью Рекомендуем 64 ГБ unified 8 192–32 768 Оценка, без гарантии скорости
BF16 на машине с общей памятью Рекомендуем 96–128 ГБ unified Начать с 8 192 Оценка запаса; Spark отдельно проверялся проектом SGLang

Для Q4 оставьте минимум 40 ГБ свободного SSD, для Q8 — 60 ГБ, для BF16 — 100 ГБ. Это наш запас на загрузку, временные файлы и служебные данные, а не размер весов. Для нескольких форматов и документов удобнее SSD от 1 ТБ.

16 ГБ VRAM недостаточно для полного размещения выбранного 19-ГБ Q4-файла. Частичная выгрузка на CPU возможна при достаточной RAM, но требует отдельной проверки задержек. Контекст 1 млн не следует выбирать по умолчанию: сначала измерьте короткий запрос, затем увеличивайте длину и число одновременных обращений.

Как запустить

Mac или обычный ПК: GGUF

Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.

llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
  --ctx-size 8192 --host 127.0.0.1 --port 8080

После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.

RTX 5090: рецепт vLLM

Официальный рецепт vLLM проверен на версии 0.26.1rc1.dev608+g99a10304d; требуется Transformers ≥ 5.8.0. Для одной RTX 5090 приведён следующий вариант:

vllm serve Inferact/Qwen3.8-27B-NVFP4 \
  --tensor-parallel-size 1 \
  --max-model-len 32768 \
  --kv-cache-dtype fp8 \
  --enforce-eager \
  --reasoning-parser qwen3 \
  --host 127.0.0.1

--enforce-eager отключает CUDA graphs: без него авторы рецепта получили нехватку памяти при старте. Это подтверждение текстового serving на указанной связке, а не универсальный тест всех мультимодальных режимов. Используйте совместимое Linux-окружение с драйвером NVIDIA; предустановленная Windows на готовом ПК сама по себе не означает готовность vLLM.

API и стоимость

QwenCloud, USD за 1 млн токенов Тариф на 10.09.2026
Обычный вход $0,50
Выход $3,00
Вход с implicit cache $0,10
Создание explicit cache $0,625
Чтение explicit cache $0,05

Идентификатор API — qwen3.8-27b, совместимый endpoint — https://dashscope-intl.aliyuncs.com/compatible-mode/v1. В текущей карточке QwenCloud указаны контекст 1 млн, максимальный финальный вывод 131K и reasoning-бюджет 262K. Лимиты конкретного запроса нужно сверять с режимом и входом; это не гарантии для локального GGUF.

Пример расчёта: 1 млн обычных входных и 100 тыс. оплачиваемых выходных токенов стоят $0,80 без дополнительных инструментов и налогов. Итог зависит от reasoning и правил тарификации. Локальный запуск не имеет платы за токен со стороны владельца весов, но требует оборудования, электричества и сопровождения. Доступность аккаунта, оплаты и поставки в России здесь не проверялась; долларовые цены не являются российским предложением.

Какой готовый компьютер выбрать

Компьютер и точная конфигурация Для чего рассматривать Ограничение
Mac Studio M5 Max, 18 CPU / 40 GPU, 64 ГБ, SSD 1 ТБ Рабочее место на macOS; Q4/Q8 с запасом общей памяти На дату статьи предзаказ, старт продаж 22 сентября; собственных тестов нет
CORSAIR VENGEANCE a7500, Ryzen 9 9900X3D, RTX 5090 32 ГБ, RAM 64 ГБ, SSD 4 ТБ CUDA и локальный API; NVFP4 по рецепту vLLM Для серверного стека потребуется настройка Linux; не BF16 целиком в GPU
NVIDIA DGX Spark, GB10, 128 ГБ unified, SSD 4 ТБ Компактная Linux-машина с большим объёмом общей памяти SGLang подтвердил запуск, но не опубликовал для этой проверки throughput

Это подбор по памяти, программной совместимости и сценарию, а не рейтинг скорости. Переход с Q4 на BF16 не оправдывает покупку сам по себе: сначала сравните ответы на своём наборе задач. Ссылки на отдельные карточки конфигураций находятся ниже.

Mac: официальная конфигурация и дата доступности. ПК: спецификация CORSAIR. Spark: характеристики NVIDIA и US-магазин: $4 699. Цены остальных выбранных конфигураций не удалось надёжно подтвердить; они намеренно не подменены ценами базовых моделей.

Частые вопросы

Qwen3.8-27B бесплатна и разрешена для коммерческого проекта?

Веса опубликованы под Apache 2.0. Лицензия предусматривает коммерческое использование при соблюдении её условий, включая необходимые уведомления. Платный API — отдельная услуга. Открытые веса не означают публикацию полного обучающего корпуса.

Будет ли работать без интернета?

После скачивания весов и зависимостей локальный inference может работать без облачного API. Поиск в интернете, внешние инструменты и обновления — отдельные подключения. Если важна автономность, проверьте её с отключённой сетью на всей цепочке обработки документов.

Почему нет обещания «токенов в секунду»?

Мы не измеряли эту модель на перечисленных компьютерах. Скорость зависит от формата, длины входа, обработки изображений, reasoning, кэша и числа пользователей. Для сравнения фиксируйте время до первого токена, скорость продолжения и пиковую память, а не только одну цифру из короткого запроса.

Что выбрать первым для компании?

Подготовьте контрольный набор реальных задач и эталонных ответов. Проверьте облачную или имеющуюся локальную конфигурацию, измерьте качество и задержки, затем оцените нужный объём оборудования. Для локального пилота начинайте с одного пользователя и 8K контекста; увеличивайте нагрузку после замеров.

Как поддерживается актуальность этой страницы?

Характеристики, deployment-профили и связанные компьютеры сохранены отдельно в AI Models и доступны автоматическому сравнению. Текст объясняет ограничения этих цифр. Дата проверки относится к источникам; она не означает проведение аппаратного теста. Неизвестные показатели явно отмечены, расчётные требования отделены от подтверждений разработчиков runtime.

Локальный запуск

Требования относятся к указанной квантизации, контексту и среде запуска. RAM, VRAM и объединённая память не взаимозаменяемы.

Расчётная оценка

CPU: практический старт

Формат весов
GGUF Q4_K_M, ggml-org 19 ГБ
Контекст
8 192
Память и условия запуска
Среда и версия
Совместимая llama.cpp
RAM
32 ГБ минимум для эксперимента; 64 ГБ с запасом
VRAM
Не требуется
Объединённая память
Не применяется
Накопитель
40 ГБ свободно
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Текст, один пользователь; CPU 6–8 ядер — рекомендация, не абсолютный минимум. Не обещаем интерактивную скорость.
Расчётная оценка

GPU 24 ГБ: расчётный минимум

Формат весов
GGUF Q4_K_M
Контекст
8 192
Память и условия запуска
Среда и версия
llama.cpp / CUDA
RAM
32 ГБ минимум; рекомендуем 64 ГБ
VRAM
24 ГБ, запас зависит от backend
Объединённая память
Не применяется
Накопитель
40 ГБ свободно
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Текст без MTP; при vision или большом контексте проверить память, уменьшить контекст или offload.
Подтверждено источником

RTX 5090: подтверждённый рецепт

Формат весов
Inferact NVFP4
Контекст
32 768
Память и условия запуска
Среда и версия
vLLM 0.26.1rc1.dev608+g99a10304d
RAM
Рекомендуем 64 ГБ
VRAM
32 ГБ
Объединённая память
Не применяется
Накопитель
Рекомендуем 60 ГБ свободно
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Подтверждение авторов vLLM для GPU, не нашего готового ПК. --enforce-eager, KV fp8; текстовый serving.
Расчётная оценка

Mac Studio: запас под Q4/Q8

Формат весов
GGUF Q4_K_M или Q8_0
Контекст
Начать с 8 192
Память и условия запуска
Среда и версия
Совместимая llama.cpp / Metal
RAM
Общая с GPU
VRAM
Отдельной нет
Объединённая память
64 ГБ рекомендуем
Накопитель
60 ГБ свободно для Q8
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Оценка объёма; M5 Max в предзаказе, работу точного runtime на новом чипе и скорость не тестировали.
Подтверждено источником

DGX Spark: BF16 и короткий контекст

Формат весов
BF16
Контекст
8 192 вход / 1 024 выход
Память и условия запуска
Среда и версия
SGLang; рецепт commit 1cf2b8c54d81802abc15dcf23a29b9cc687bc01e
RAM
Общая с GPU
VRAM
Отдельной нет
Объединённая память
128 ГБ установленной памяти
Накопитель
100 ГБ свободно рекомендуем
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
SGLang подтвердил boot-and-serve; throughput не опубликован. Диск — наша рекомендация. Не переносить результат на контекст 1 млн.

ОБОРУДОВАНИЕ

Компьютер под вашу задачу

Выберите платформу и откройте точную конфигурацию. Условия запуска и ограничения — в каждой карточке.

Mac Studio, вид спереди

РАБОЧЕЕ МЕСТО НА macOS

Mac Studio M5 Max

64 ГБ памяти для Q4/Q8. Предзаказ: доступность с 22 сентября. Скорость на этой конфигурации не измеряли.

Графика
Встроенный Apple GPU, 40 ядер
Общая память
64 ГБ; часть занимает ОС
SSD
SSD 1 ТБ
Конфигурация и ограничения
NVIDIA DGX Spark рядом с ноутбуком; ноутбук не входит в конфигурацию

КОМПАКТНАЯ AI-СТАНЦИЯ

NVIDIA DGX Spark

128 ГБ общей памяти и DGX OS. Запуск подтверждён SGLang; скорость не измерена. Ноутбук на фото не входит в комплект.

Графика
Blackwell в GB10 Grace Blackwell
Общая память
128 ГБ LPDDR5x; 273 ГБ/с
SSD
4 ТБ NVMe M.2
Конфигурация и ограничения
Источники и проверка данных9 источников · Проверено 10.09.2026

Официальные характеристики и документация. Расчётные требования обозначены отдельно от результатов испытаний.

  1. Qwen — релизыgithub.com ↗
  2. Qwen3.8-27B — модель и бенчмаркиhuggingface.co ↗
  3. Архитектура — config.jsonhuggingface.co ↗
  4. Лицензия Apache 2.0huggingface.co ↗
  5. GGUF — размеры файлов ggml-orghuggingface.co ↗
  6. llama.cpp — сборка bartowskihuggingface.co ↗
  7. vLLM — проверенные конфигурацииrecipes.vllm.ai ↗
  8. SGLang — конфигурации и проверка Sparkdocs.sglang.io ↗
  9. QwenCloud — API и ценыwww.qwencloud.com ↗

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.