AI ДЛЯ ВАШИХ ЗАДАЧ

Qwen3.8-27B vs Qwen3.6-27B: код, память и стоит ли обновляться

Сравнение двух поколений Qwen: одинаковые версии тестов, ограничения измерений и план проверки перед переходом.

Фабио Де Лука · Проверено 10.09.2026

Главные различия

Характеристики выбранных моделей
ХарактеристикаQwen3.8-27B: обзор, характеристики и требования к ПКQwen3.6-27B: характеристики, локальный запуск и выбор версии
РазработчикAlibaba · QwenAlibaba · Qwen
Точная версияQwen/Qwen3.8-27BQwen/Qwen3.6-27B
Тип моделиМультимодальнаяМультимодальная
Доступность весовОткрытые веса; локальный запускОткрытые веса; локальный запуск
ЛицензияApache 2.0Apache 2.0
Всего параметров27 млрд — языковая часть; vision encoder отдельно27 млрд — языковая часть; vision encoder отдельно
Активных параметров (MoE)Плотная модель: нет выбора подмножества MoE-экспертовПлотная модель; не MoE
Архитектура64 слоя: 48 Gated DeltaNet + 16 полного внимания; vision encoder64 слоя: 48 Gated DeltaNet + 16 полного внимания
Контекстное окно262 144 нативно; расширение до 1 млн при поддержке runtime; QwenCloud — 1 млн262 144 нативно; расширение до 1 010 000 при поддержке runtime
Максимальный выводЛокально — в пределах выделенного контекста и runtime; QwenCloud: финал до 131K, reasoning до 262KОграничивается контекстом, памятью и настройками сервера
МодальностиВход: текст, изображения, видео. Выход: текстВход: текст, изображения, видео. Выход: текст
Работа с инструментамиДа, через приложение и совместимый parser; инструменты подключаются отдельноДа; нужен совместимый parser и приложение с инструментами
Цена API и единица тарификацииQwenCloud: $0,50 вход / $3,00 выход за 1 млн токенов; 10.09.2026Тариф конкретного провайдера для этой версии не подтверждён
ПодпискаВеса без подписки; API оплачивается по использованиюВеса без подписки; инфраструктура оплачивается отдельно
Дата выпуска14.08.2026Апрель 2026; точный день здесь не подтверждён
Форматы весовОригинал BF16 / Safetensors; GGUF Q4/Q8; runtime-сборки NVFP4Safetensors; GGUF BF16 / Q4_K_M / Q8_0
Среды запускаTransformers ≥ 5.8.0; совместимые vLLM, SGLang, llama.cpp (для bartowski ≥ b10419)Transformers, vLLM, SGLang; GGUF — llama.cpp
Региональная доступностьHugging Face / ModelScope; QwenCloud API. Доступность оплаты в РФ не проверенаВеса на Hugging Face; оплату внешних API из РФ проверять у провайдера

Qwen/Qwen3.8-27B: локальный запуск

CPU: практический стартGGUF Q4_K_M, ggml-org 19 ГБНет замера для этого профиляРасчётная оценка
Квантизация
GGUF Q4_K_M, ggml-org 19 ГБ
Контекст
8 192
Среда и версия
Совместимая llama.cpp
RAM
32 ГБ минимум для эксперимента; 64 ГБ с запасом
VRAM
Не требуется
Объединённая память
Не применяется
Накопитель
40 ГБ свободно
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Текст, один пользователь; CPU 6–8 ядер — рекомендация, не абсолютный минимум. Не обещаем интерактивную скорость.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.

llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
  --ctx-size 8192 --host 127.0.0.1 --port 8080

После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.

GPU 24 ГБ: расчётный минимумGGUF Q4_K_MНет замера для этого профиляРасчётная оценка
Квантизация
GGUF Q4_K_M
Контекст
8 192
Среда и версия
llama.cpp / CUDA
RAM
32 ГБ минимум; рекомендуем 64 ГБ
VRAM
24 ГБ, запас зависит от backend
Объединённая память
Не применяется
Накопитель
40 ГБ свободно
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Текст без MTP; при vision или большом контексте проверить память, уменьшить контекст или offload.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.

llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
  --ctx-size 8192 --host 127.0.0.1 --port 8080

После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.

RTX 5090: подтверждённый рецептInferact NVFP4Нет замера для этого профиляПодтверждено источником
Квантизация
Inferact NVFP4
Контекст
32 768
Среда и версия
vLLM 0.26.1rc1.dev608+g99a10304d
RAM
Рекомендуем 64 ГБ
VRAM
32 ГБ
Объединённая память
Не применяется
Накопитель
Рекомендуем 60 ГБ свободно
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Подтверждение авторов vLLM для GPU, не нашего готового ПК. --enforce-eager, KV fp8; текстовый serving.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Официальный рецепт vLLM проверен на версии 0.26.1rc1.dev608+g99a10304d; требуется Transformers ≥ 5.8.0. Для одной RTX 5090 приведён следующий вариант:

vllm serve Inferact/Qwen3.8-27B-NVFP4 \
  --tensor-parallel-size 1 \
  --max-model-len 32768 \
  --kv-cache-dtype fp8 \
  --enforce-eager \
  --reasoning-parser qwen3 \
  --host 127.0.0.1

--enforce-eager отключает CUDA graphs: без него авторы рецепта получили нехватку памяти при старте. Это подтверждение текстового serving на указанной связке, а не универсальный тест всех мультимодальных режимов. Используйте совместимое Linux-окружение с драйвером NVIDIA; предустановленная Windows на готовом ПК сама по себе не означает готовность vLLM.

Mac Studio: запас под Q4/Q8GGUF Q4_K_M или Q8_0Нет замера для этого профиляРасчётная оценка
Квантизация
GGUF Q4_K_M или Q8_0
Контекст
Начать с 8 192
Среда и версия
Совместимая llama.cpp / Metal
RAM
Общая с GPU
VRAM
Отдельной нет
Объединённая память
64 ГБ рекомендуем
Накопитель
60 ГБ свободно для Q8
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
Оценка объёма; M5 Max в предзаказе, работу точного runtime на новом чипе и скорость не тестировали.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.

llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
  --ctx-size 8192 --host 127.0.0.1 --port 8080

После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.

DGX Spark: BF16 и короткий контекстBF16Нет замера для этого профиляПодтверждено источником
Квантизация
BF16
Контекст
8 192 вход / 1 024 выход
Среда и версия
SGLang; рецепт commit 1cf2b8c54d81802abc15dcf23a29b9cc687bc01e
RAM
Общая с GPU
VRAM
Отдельной нет
Объединённая память
128 ГБ установленной памяти
Накопитель
100 ГБ свободно рекомендуем
Одновременные запросы
1 запрос
Скорость и единица
Не измеряли; численная скорость не заявляется
Условия теста / ограничения
SGLang подтвердил boot-and-serve; throughput не опубликован. Диск — наша рекомендация. Не переносить результат на контекст 1 млн.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

RTX 5090 · Q4_K_M · внешний тестGGUF Q4_K_MВнешний тест: 65.4–65.7 ток/сПамять: оценка
Квантизация
GGUF Q4_K_M
Контекст
16 384 настроено; тест 114 вход / 256 выход
Среда и версия
llama.cpp 9725a31 · CUDA
RAM
32 ГБ минимум; у автора 30 ГБ доступны WSL
VRAM
32 ГБ RTX 5090
Объединённая память
Не применяется
Накопитель
40 ГБ свободно — расчётный запас
Одновременные запросы
1
Скорость и единица
Внешний тест: 65,4–65,7 ток/с; полные условия ниже
Условия теста / ограничения
Измерение на Ryzen 7 9850X3D, не на готовом CORSAIR. Требования памяти/диска для подбора — оценка.

Скорость и условия измерения

Генерация
Внешний тест: 65.4–65.7 ток/с
Время до первого токена, с
0.1175
Вход в измерении, токенов
114
Выход в измерении, токенов
256
Размещение на GPU / offload
65/65 слоёв на GPU
Условия измерения
3 повтора; медиана 65,7. Модель прогрета, thinking/cache выключены, temperature 0, seed 42. Артефакт 0669b98607d47046c7c2b3f801011d54a08cfccf. Клиент llm-speed 0.0.5 с описанными автором исправлениями.
Основание
Внешнее измерение
Источник скорости ↗

Дата данных: 2026-09-05

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Настройки сервера и результаты повторов: протокол автора. Число относится только к указанному Q4-профилю; NVFP4 — другой запуск.

DGX Spark · FP8 · внешний тестQwen/Qwen3.8-27B-FP8 · 017b9c7aВнешний тест: 8.2 ток/сПамять: оценка
Квантизация
Qwen/Qwen3.8-27B-FP8 · 017b9c7a
Контекст
2 048 вход / 128 выход; depth 0
Среда и версия
vLLM spark-arena nightly 0.27.2rc1
RAM
Общая с GPU
VRAM
Отдельной нет
Объединённая память
128 ГБ установленной памяти
Накопитель
100 ГБ свободно рекомендуем
Одновременные запросы
1
Скорость и единица
Внешний тест: 8,2 ток/с; полные условия ниже
Условия теста / ограничения
DGX Spark GB10 128 ГБ. Запас памяти/диска в подборе — консервативная оценка, не минимальный измеренный порог.

Скорость и условия измерения

Генерация
Внешний тест: 8.2 ток/с
Вход в измерении, токенов
2048
Выход в измерении, токенов
128
Размещение на GPU / offload
GB10 · объединённая память
Условия измерения
llama-benchy 0.4.0; один запрос, depth 0. DGX OS, driver 580.159.03. Это скорость генерации на FP8, не BF16 и не суммарная пропускная способность нескольких пользователей.
Основание
Внешнее измерение
Источник скорости ↗

Дата данных: 2026-08-15

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Команды и таблица автора. Не переносите скорость на профиль BF16/SGLang.

Готовые компьютеры

Qwen/Qwen3.6-27B: локальный запуск

CPU · расчётный минимумGGUF Q4_K_M · ggml-orgНет замера для этого профиляРасчётная оценка
Квантизация
GGUF Q4_K_M · ggml-org
Контекст
8 192 · стартовая оценка
Среда и версия
Совместимая сборка llama.cpp; версия при запуске требует проверки
RAM
32 ГБ
VRAM
Не требуется отдельно
Объединённая память
Не используется
Накопитель
40 ГБ свободно
Одновременные запросы
1
Условия теста / ограничения
Расчёт по размеру файла 19,1 ГБ с запасом для runtime. Это не аппаратный тест и не гарантия полного GPU offload.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Выберите Qwen3.6-27B Q4_K_M из репозитория ggml-org, ограничьте контекст 8192 и начните с текстового запроса. Проверьте журнал размещения слоёв и пиковую память. Для изображений загрузите совместимый mmproj; требования вырастут.

NVIDIA GPU · расчётный минимумGGUF Q4_K_M · ggml-orgНет замера для этого профиляРасчётная оценка
Квантизация
GGUF Q4_K_M · ggml-org
Контекст
8 192 · стартовая оценка
Среда и версия
Совместимая сборка llama.cpp; версия при запуске требует проверки
RAM
32 ГБ
VRAM
24 ГБ
Объединённая память
Не используется
Накопитель
40 ГБ свободно
Одновременные запросы
1
Условия теста / ограничения
Расчёт по размеру файла 19,1 ГБ с запасом для runtime. Это не аппаратный тест и не гарантия полного GPU offload.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Выберите Qwen3.6-27B Q4_K_M из репозитория ggml-org, ограничьте контекст 8192 и начните с текстового запроса. Проверьте журнал размещения слоёв и пиковую память. Для изображений загрузите совместимый mmproj; требования вырастут.

Apple Silicon · расчётный запасGGUF Q4_K_M · ggml-orgНет замера для этого профиляРасчётная оценка
Квантизация
GGUF Q4_K_M · ggml-org
Контекст
8 192 · стартовая оценка
Среда и версия
Совместимая сборка llama.cpp; версия при запуске требует проверки
RAM
Общая память
VRAM
Не требуется отдельно
Объединённая память
48 ГБ
Накопитель
40 ГБ свободно
Одновременные запросы
1
Условия теста / ограничения
Расчёт по размеру файла 19,1 ГБ с запасом для runtime. Это не аппаратный тест и не гарантия полного GPU offload.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Выберите Qwen3.6-27B Q4_K_M из репозитория ggml-org, ограничьте контекст 8192 и начните с текстового запроса. Проверьте журнал размещения слоёв и пиковую память. Для изображений загрузите совместимый mmproj; требования вырастут.

Стоит ли переходить на Qwen3.8-27B?

Для нового локального проекта Qwen3.8-27B — разумный первый кандидат на испытание. Если Qwen3.6 уже обслуживает рабочий процесс, обновление стоит принимать по результатам контрольного набора, а не только по таблице разработчика. Это редакционная рекомендация, не результат нашего парного аппаратного теста.

Что показывает сопоставимая таблица

Тест Qwen3.6-27B Qwen3.8-27B Разница, п.п.
Terminal-Bench 2.1 · Terminus 63,4 73,0 +9,6
SWE-bench Pro 53,5 61,7 +8,2
NL2Repo-Bench 36,2 42,3 +6,1
DeepSWE 1.1 13,3 42,2 +28,9

Все числа взяты из одной таблицы Qwen3.8. Это результаты разработчика в его окружении. Разница относится к этим тестам, а не к проценту улучшения любой задачи. Старое значение Terminal-Bench 2.0 из карточки Qwen3.6 сюда не подмешивается.

Одинаковые 27B — не одинаковая работа

Обе модели относятся к плотным мультимодальным моделям с открытыми весами. Совпадение размера не гарантирует одинаковую скорость, качество квантования или совместимость шаблонов чата. При смене версии проверьте reasoning, parser инструментов и обработку изображений.

Ваша ситуация Что делать
Первый локальный помощник для кода Испытать 3.8 и сохранить 3.6 как контрольную модель
Рабочий сервис уже стабилен на 3.6 Сравнить на тех же запросах, затем обновлять с возможностью отката
Главное — скорость на текущем ПК Провести парный тест в одинаковой среде; измерения только 3.8 недостаточны
Важны документы на русском Проверить терминологию, реквизиты и выдуманные факты на собственных примерах

Память и скорость

Для планирования Q4 смотрите размер конкретного файла и запас под контекст. В обзоре 3.6 приведены расчётные конфигурации; в обзоре 3.8 — также внешние аппаратные измерения. Это разные уровни доказательности. Мы не заявляем, что одна версия быстрее другой: сопоставимого парного теста здесь нет.

Как провести собственное сравнение

Зафиксируйте одинаковую квантизацию, runtime, длины входа и ответа, reasoning и число пользователей. Сначала оцените ответы вслепую, затем время до первого токена, скорость продолжения и пиковую память. В задачах с инструментами считайте успешное завершение, а не только корректный JSON. Несколько повторов помогут заметить нестабильные результаты.

Для российской компании

Юридическая оценка зависит от размещения и потоков данных, а не номера версии. Локальный сервер в РФ помогает контролировать обработку, но не отменяет обязанности оператора. Практические вопросы разобраны в разделе для бизнеса РФ.

Вывод для выбора

Проверяйте 3.8 как кандидат на улучшение сложных задач с кодом. Сохраняйте 3.6, если её качество и задержки уже отвечают требованиям, а переход ещё не прошёл приёмку. Автоматическая таблица характеристик ниже помогает сверить паспорт; эта статья объясняет, как принять решение.

Источники и проверка данных2 источников · Проверено 10.09.2026

Официальные характеристики и документация. Расчётные требования обозначены отдельно от результатов испытаний.

  1. Qwen3.8 — сравнительная таблицаhuggingface.co ↗
  2. Qwen3.6 — модель и ограниченияhuggingface.co ↗

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.