Главные различия
| Характеристика | Qwen3.8-27B: обзор, характеристики и требования к ПК | Qwen3.6-27B: характеристики, локальный запуск и выбор версии |
|---|---|---|
| Разработчик | Alibaba · Qwen | Alibaba · Qwen |
| Точная версия | Qwen/Qwen3.8-27B | Qwen/Qwen3.6-27B |
| Тип модели | Мультимодальная | Мультимодальная |
| Доступность весов | Открытые веса; локальный запуск | Открытые веса; локальный запуск |
| Лицензия | Apache 2.0 | Apache 2.0 |
| Всего параметров | 27 млрд — языковая часть; vision encoder отдельно | 27 млрд — языковая часть; vision encoder отдельно |
| Активных параметров (MoE) | Плотная модель: нет выбора подмножества MoE-экспертов | Плотная модель; не MoE |
| Архитектура | 64 слоя: 48 Gated DeltaNet + 16 полного внимания; vision encoder | 64 слоя: 48 Gated DeltaNet + 16 полного внимания |
| Контекстное окно | 262 144 нативно; расширение до 1 млн при поддержке runtime; QwenCloud — 1 млн | 262 144 нативно; расширение до 1 010 000 при поддержке runtime |
| Максимальный вывод | Локально — в пределах выделенного контекста и runtime; QwenCloud: финал до 131K, reasoning до 262K | Ограничивается контекстом, памятью и настройками сервера |
| Модальности | Вход: текст, изображения, видео. Выход: текст | Вход: текст, изображения, видео. Выход: текст |
| Работа с инструментами | Да, через приложение и совместимый parser; инструменты подключаются отдельно | Да; нужен совместимый parser и приложение с инструментами |
| Цена API и единица тарификации | QwenCloud: $0,50 вход / $3,00 выход за 1 млн токенов; 10.09.2026 | Тариф конкретного провайдера для этой версии не подтверждён |
| Подписка | Веса без подписки; API оплачивается по использованию | Веса без подписки; инфраструктура оплачивается отдельно |
| Дата выпуска | 14.08.2026 | Апрель 2026; точный день здесь не подтверждён |
| Форматы весов | Оригинал BF16 / Safetensors; GGUF Q4/Q8; runtime-сборки NVFP4 | Safetensors; GGUF BF16 / Q4_K_M / Q8_0 |
| Среды запуска | Transformers ≥ 5.8.0; совместимые vLLM, SGLang, llama.cpp (для bartowski ≥ b10419) | Transformers, vLLM, SGLang; GGUF — llama.cpp |
| Региональная доступность | Hugging Face / ModelScope; QwenCloud API. Доступность оплаты в РФ не проверена | Веса на Hugging Face; оплату внешних API из РФ проверять у провайдера |
Qwen/Qwen3.8-27B: локальный запуск
CPU: практический стартGGUF Q4_K_M, ggml-org 19 ГБНет замера для этого профиляРасчётная оценка
- Квантизация
- GGUF Q4_K_M, ggml-org 19 ГБ
- Контекст
- 8 192
- Среда и версия
- Совместимая llama.cpp
- RAM
- 32 ГБ минимум для эксперимента; 64 ГБ с запасом
- VRAM
- Не требуется
- Объединённая память
- Не применяется
- Накопитель
- 40 ГБ свободно
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Текст, один пользователь; CPU 6–8 ядер — рекомендация, не абсолютный минимум. Не обещаем интерактивную скорость.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.
llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
--ctx-size 8192 --host 127.0.0.1 --port 8080
После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.
GPU 24 ГБ: расчётный минимумGGUF Q4_K_MНет замера для этого профиляРасчётная оценка
- Квантизация
- GGUF Q4_K_M
- Контекст
- 8 192
- Среда и версия
- llama.cpp / CUDA
- RAM
- 32 ГБ минимум; рекомендуем 64 ГБ
- VRAM
- 24 ГБ, запас зависит от backend
- Объединённая память
- Не применяется
- Накопитель
- 40 ГБ свободно
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Текст без MTP; при vision или большом контексте проверить память, уменьшить контекст или offload.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.
llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
--ctx-size 8192 --host 127.0.0.1 --port 8080
После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.
RTX 5090: подтверждённый рецептInferact NVFP4Нет замера для этого профиляПодтверждено источником
- Квантизация
- Inferact NVFP4
- Контекст
- 32 768
- Среда и версия
- vLLM 0.26.1rc1.dev608+g99a10304d
- RAM
- Рекомендуем 64 ГБ
- VRAM
- 32 ГБ
- Объединённая память
- Не применяется
- Накопитель
- Рекомендуем 60 ГБ свободно
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Подтверждение авторов vLLM для GPU, не нашего готового ПК. --enforce-eager, KV fp8; текстовый serving.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Официальный рецепт vLLM проверен на версии 0.26.1rc1.dev608+g99a10304d; требуется Transformers ≥ 5.8.0. Для одной RTX 5090 приведён следующий вариант:
vllm serve Inferact/Qwen3.8-27B-NVFP4 \
--tensor-parallel-size 1 \
--max-model-len 32768 \
--kv-cache-dtype fp8 \
--enforce-eager \
--reasoning-parser qwen3 \
--host 127.0.0.1
--enforce-eager отключает CUDA graphs: без него авторы рецепта получили нехватку памяти при старте. Это подтверждение текстового serving на указанной связке, а не универсальный тест всех мультимодальных режимов. Используйте совместимое Linux-окружение с драйвером NVIDIA; предустановленная Windows на готовом ПК сама по себе не означает готовность vLLM.
Mac Studio: запас под Q4/Q8GGUF Q4_K_M или Q8_0Нет замера для этого профиляРасчётная оценка
- Квантизация
- GGUF Q4_K_M или Q8_0
- Контекст
- Начать с 8 192
- Среда и версия
- Совместимая llama.cpp / Metal
- RAM
- Общая с GPU
- VRAM
- Отдельной нет
- Объединённая память
- 64 ГБ рекомендуем
- Накопитель
- 60 ГБ свободно для Q8
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Оценка объёма; M5 Max в предзаказе, работу точного runtime на новом чипе и скорость не тестировали.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.
llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
--ctx-size 8192 --host 127.0.0.1 --port 8080
После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.
DGX Spark: BF16 и короткий контекстBF16Нет замера для этого профиляПодтверждено источником
- Квантизация
- BF16
- Контекст
- 8 192 вход / 1 024 выход
- Среда и версия
- SGLang; рецепт commit 1cf2b8c54d81802abc15dcf23a29b9cc687bc01e
- RAM
- Общая с GPU
- VRAM
- Отдельной нет
- Объединённая память
- 128 ГБ установленной памяти
- Накопитель
- 100 ГБ свободно рекомендуем
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- SGLang подтвердил boot-and-serve; throughput не опубликован. Диск — наша рекомендация. Не переносить результат на контекст 1 млн.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
RTX 5090 · Q4_K_M · внешний тестGGUF Q4_K_MВнешний тест: 65.4–65.7 ток/сПамять: оценка
- Квантизация
- GGUF Q4_K_M
- Контекст
- 16 384 настроено; тест 114 вход / 256 выход
- Среда и версия
- llama.cpp 9725a31 · CUDA
- RAM
- 32 ГБ минимум; у автора 30 ГБ доступны WSL
- VRAM
- 32 ГБ RTX 5090
- Объединённая память
- Не применяется
- Накопитель
- 40 ГБ свободно — расчётный запас
- Одновременные запросы
- 1
- Скорость и единица
- Внешний тест: 65,4–65,7 ток/с; полные условия ниже
- Условия теста / ограничения
- Измерение на Ryzen 7 9850X3D, не на готовом CORSAIR. Требования памяти/диска для подбора — оценка.
Скорость и условия измерения
- Генерация
- Внешний тест: 65.4–65.7 ток/с
- Время до первого токена, с
- 0.1175
- Вход в измерении, токенов
- 114
- Выход в измерении, токенов
- 256
- Размещение на GPU / offload
- 65/65 слоёв на GPU
- Условия измерения
- 3 повтора; медиана 65,7. Модель прогрета, thinking/cache выключены, temperature 0, seed 42. Артефакт 0669b98607d47046c7c2b3f801011d54a08cfccf. Клиент llm-speed 0.0.5 с описанными автором исправлениями.
- Основание
- Внешнее измерение
Инструкция запуска
Настройки сервера и результаты повторов: протокол автора. Число относится только к указанному Q4-профилю; NVFP4 — другой запуск.
DGX Spark · FP8 · внешний тестQwen/Qwen3.8-27B-FP8 · 017b9c7aВнешний тест: 8.2 ток/сПамять: оценка
- Квантизация
- Qwen/Qwen3.8-27B-FP8 · 017b9c7a
- Контекст
- 2 048 вход / 128 выход; depth 0
- Среда и версия
- vLLM spark-arena nightly 0.27.2rc1
- RAM
- Общая с GPU
- VRAM
- Отдельной нет
- Объединённая память
- 128 ГБ установленной памяти
- Накопитель
- 100 ГБ свободно рекомендуем
- Одновременные запросы
- 1
- Скорость и единица
- Внешний тест: 8,2 ток/с; полные условия ниже
- Условия теста / ограничения
- DGX Spark GB10 128 ГБ. Запас памяти/диска в подборе — консервативная оценка, не минимальный измеренный порог.
Скорость и условия измерения
- Генерация
- Внешний тест: 8.2 ток/с
- Вход в измерении, токенов
- 2048
- Выход в измерении, токенов
- 128
- Размещение на GPU / offload
- GB10 · объединённая память
- Условия измерения
- llama-benchy 0.4.0; один запрос, depth 0. DGX OS, driver 580.159.03. Это скорость генерации на FP8, не BF16 и не суммарная пропускная способность нескольких пользователей.
- Основание
- Внешнее измерение
Инструкция запуска
Команды и таблица автора. Не переносите скорость на профиль BF16/SGLang.
Готовые компьютеры
Qwen/Qwen3.6-27B: локальный запуск
CPU · расчётный минимумGGUF Q4_K_M · ggml-orgНет замера для этого профиляРасчётная оценка
- Квантизация
- GGUF Q4_K_M · ggml-org
- Контекст
- 8 192 · стартовая оценка
- Среда и версия
- Совместимая сборка llama.cpp; версия при запуске требует проверки
- RAM
- 32 ГБ
- VRAM
- Не требуется отдельно
- Объединённая память
- Не используется
- Накопитель
- 40 ГБ свободно
- Одновременные запросы
- 1
- Условия теста / ограничения
- Расчёт по размеру файла 19,1 ГБ с запасом для runtime. Это не аппаратный тест и не гарантия полного GPU offload.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Выберите Qwen3.6-27B Q4_K_M из репозитория ggml-org, ограничьте контекст 8192 и начните с текстового запроса. Проверьте журнал размещения слоёв и пиковую память. Для изображений загрузите совместимый mmproj; требования вырастут.
NVIDIA GPU · расчётный минимумGGUF Q4_K_M · ggml-orgНет замера для этого профиляРасчётная оценка
- Квантизация
- GGUF Q4_K_M · ggml-org
- Контекст
- 8 192 · стартовая оценка
- Среда и версия
- Совместимая сборка llama.cpp; версия при запуске требует проверки
- RAM
- 32 ГБ
- VRAM
- 24 ГБ
- Объединённая память
- Не используется
- Накопитель
- 40 ГБ свободно
- Одновременные запросы
- 1
- Условия теста / ограничения
- Расчёт по размеру файла 19,1 ГБ с запасом для runtime. Это не аппаратный тест и не гарантия полного GPU offload.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Выберите Qwen3.6-27B Q4_K_M из репозитория ggml-org, ограничьте контекст 8192 и начните с текстового запроса. Проверьте журнал размещения слоёв и пиковую память. Для изображений загрузите совместимый mmproj; требования вырастут.
Apple Silicon · расчётный запасGGUF Q4_K_M · ggml-orgНет замера для этого профиляРасчётная оценка
- Квантизация
- GGUF Q4_K_M · ggml-org
- Контекст
- 8 192 · стартовая оценка
- Среда и версия
- Совместимая сборка llama.cpp; версия при запуске требует проверки
- RAM
- Общая память
- VRAM
- Не требуется отдельно
- Объединённая память
- 48 ГБ
- Накопитель
- 40 ГБ свободно
- Одновременные запросы
- 1
- Условия теста / ограничения
- Расчёт по размеру файла 19,1 ГБ с запасом для runtime. Это не аппаратный тест и не гарантия полного GPU offload.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Выберите Qwen3.6-27B Q4_K_M из репозитория ggml-org, ограничьте контекст 8192 и начните с текстового запроса. Проверьте журнал размещения слоёв и пиковую память. Для изображений загрузите совместимый mmproj; требования вырастут.
Стоит ли переходить на Qwen3.8-27B?
Для нового локального проекта Qwen3.8-27B — разумный первый кандидат на испытание. Если Qwen3.6 уже обслуживает рабочий процесс, обновление стоит принимать по результатам контрольного набора, а не только по таблице разработчика. Это редакционная рекомендация, не результат нашего парного аппаратного теста.
Что показывает сопоставимая таблица
| Тест | Qwen3.6-27B | Qwen3.8-27B | Разница, п.п. |
|---|---|---|---|
| Terminal-Bench 2.1 · Terminus | 63,4 | 73,0 | +9,6 |
| SWE-bench Pro | 53,5 | 61,7 | +8,2 |
| NL2Repo-Bench | 36,2 | 42,3 | +6,1 |
| DeepSWE 1.1 | 13,3 | 42,2 | +28,9 |
Все числа взяты из одной таблицы Qwen3.8. Это результаты разработчика в его окружении. Разница относится к этим тестам, а не к проценту улучшения любой задачи. Старое значение Terminal-Bench 2.0 из карточки Qwen3.6 сюда не подмешивается.
Одинаковые 27B — не одинаковая работа
Обе модели относятся к плотным мультимодальным моделям с открытыми весами. Совпадение размера не гарантирует одинаковую скорость, качество квантования или совместимость шаблонов чата. При смене версии проверьте reasoning, parser инструментов и обработку изображений.
| Ваша ситуация | Что делать |
|---|---|
| Первый локальный помощник для кода | Испытать 3.8 и сохранить 3.6 как контрольную модель |
| Рабочий сервис уже стабилен на 3.6 | Сравнить на тех же запросах, затем обновлять с возможностью отката |
| Главное — скорость на текущем ПК | Провести парный тест в одинаковой среде; измерения только 3.8 недостаточны |
| Важны документы на русском | Проверить терминологию, реквизиты и выдуманные факты на собственных примерах |
Память и скорость
Для планирования Q4 смотрите размер конкретного файла и запас под контекст. В обзоре 3.6 приведены расчётные конфигурации; в обзоре 3.8 — также внешние аппаратные измерения. Это разные уровни доказательности. Мы не заявляем, что одна версия быстрее другой: сопоставимого парного теста здесь нет.
Как провести собственное сравнение
Зафиксируйте одинаковую квантизацию, runtime, длины входа и ответа, reasoning и число пользователей. Сначала оцените ответы вслепую, затем время до первого токена, скорость продолжения и пиковую память. В задачах с инструментами считайте успешное завершение, а не только корректный JSON. Несколько повторов помогут заметить нестабильные результаты.
Для российской компании
Юридическая оценка зависит от размещения и потоков данных, а не номера версии. Локальный сервер в РФ помогает контролировать обработку, но не отменяет обязанности оператора. Практические вопросы разобраны в разделе для бизнеса РФ.
Вывод для выбора
Проверяйте 3.8 как кандидат на улучшение сложных задач с кодом. Сохраняйте 3.6, если её качество и задержки уже отвечают требованиям, а переход ещё не прошёл приёмку. Автоматическая таблица характеристик ниже помогает сверить паспорт; эта статья объясняет, как принять решение.