Характеристики
- Разработчик
- Alibaba · Qwen
- Размер модели
- 27 млрд — языковая часть; vision encoder отдельно
- Лицензия
- Apache 2.0
- Дата релиза
- 14.08.2026
Все технические характеристики 18 параметров
| Разработчик | Alibaba · Qwen |
|---|---|
| Точная версия | Qwen/Qwen3.8-27B |
| Тип модели | Мультимодальная |
| Доступность весов | Открытые веса; локальный запуск |
| Лицензия | Apache 2.0 |
| Всего параметров | 27 млрд — языковая часть; vision encoder отдельно |
| Активных параметров (MoE) | Плотная модель: нет выбора подмножества MoE-экспертов |
| Архитектура | 64 слоя: 48 Gated DeltaNet + 16 полного внимания; vision encoder |
| Контекстное окно | 262 144 нативно; расширение до 1 млн при поддержке runtime; QwenCloud — 1 млн |
| Максимальный вывод | Локально — в пределах выделенного контекста и runtime; QwenCloud: финал до 131K, reasoning до 262K |
| Модальности | Вход: текст, изображения, видео. Выход: текст |
| Работа с инструментами | Да, через приложение и совместимый parser; инструменты подключаются отдельно |
| Цена API и единица тарификации | QwenCloud: $0,50 вход / $3,00 выход за 1 млн токенов; 10.09.2026 |
| Подписка | Веса без подписки; API оплачивается по использованию |
| Дата выпуска | 14.08.2026 |
| Форматы весов | Оригинал BF16 / Safetensors; GGUF Q4/Q8; runtime-сборки NVFP4 |
| Среды запуска | Transformers ≥ 5.8.0; совместимые vLLM, SGLang, llama.cpp (для bartowski ≥ b10419) |
| Региональная доступность | Hugging Face / ModelScope; QwenCloud API. Доступность оплаты в РФ не проверена |
Qwen3.8-27B: что это и кому подходит
Qwen3.8-27B — открытая модель Alibaba для работы с текстом, кодом, изображениями и видео. Эта страница посвящена конкретному checkpoint Qwen/Qwen3.8-27B. Дата проверки материалов — 10 сентября 2026 года.
Выбор для локального запуска: начните с Q4 и короткого контекста. Практический ориентир — 32 ГБ системной памяти для экспериментов на CPU, 24–32 ГБ видеопамяти для GPU или 64 ГБ объединённой памяти Mac для запаса. Это расчётные рекомендации, а не результаты нашего тестового стенда.
Для первого внедрения полезнее проверить десять собственных документов и задач, чем покупать компьютер по месту модели в рейтинге. Успешная генерация одного ответа ещё не подтверждает приемлемую задержку, качество русского языка или устойчивую работу нескольких сотрудников.
Какие версии нельзя смешивать
| Вариант | Что важно при выборе |
|---|---|
| Qwen3.8-27B | Плотная мультимодальная модель; основной предмет этой статьи. Релиз 14 августа 2026 года. |
| Qwen3.8-2.4T-A95B | MoE: 2,4 трлн параметров, 95 млрд активных. Открытый checkpoint ориентирован на текст; это другой класс оборудования. |
| Qwen3.8-Flash-Next | Отдельная архитектура и отдельный релиз. Требования 27B на неё не распространяются. |
Даты сверены с репозиторием Qwen. Отличия крупной версии — в её карточке модели, Flash-Next — в анонсе разработчика. Для 2.4T даже идеализированное хранение всех весов в 4 битах даёт около 1,2 ТБ до накладных расходов: активные параметры не заменяют полный объём весов при расчёте памяти. Один Mac Studio или DGX Spark 128 ГБ для этого не подходит.
Возможности и ограничения
| Задача | Как использовать | Что проверять на своих данных |
|---|---|---|
| Документы и знания компании | Ответы с поиском по документам, извлечение полей | Ссылки на исходные фрагменты, пропуски и выдуманные факты |
| Программирование | Объяснение кода, исправления, подготовка тестов | Сборку, тесты и изменения поведения приложения |
| Изображения и видео | Разбор схем, страниц и кадров | Мелкий текст, порядок страниц, стоимость обработки кадров |
| Агенты и инструменты | Планирование и вызов подключённых функций | Валидность аргументов и реальные результаты каждого действия |
| Русскоязычный помощник | Проверка терминологии и инструкций на русском | Собственный набор вопросов: отдельного нашего RU-бенчмарка нет |
Модель выдаёт текст. Понимание изображения не означает генерацию изображений; просмотр видео не означает создание ролика. Браузер, поиск и исполнение кода нужно подключать в приложении. Для локальных файлов и внешних инструментов полезно заранее определить, какие действия требуют участия человека.
Thinking включён по умолчанию и допускает отключение; глубина рассуждения настраивается. Возможности и режимы описаны в официальной карточке 27B. Длинное рассуждение увеличивает задержку и расход токенов. Для извлечения короткого поля сначала сравните качество с reasoning и без него.
Что известно об архитектуре
| Параметр конфигурации | Значение |
|---|---|
| Класс | Qwen3_5ForConditionalGeneration |
| Слои | 64: 48 Gated DeltaNet и 16 полного внимания |
| Hidden size / intermediate size | 5 120 / 17 408 |
| Attention heads / KV heads | 24 / 4 для полного внимания |
| Head dimension | 256 для полного внимания |
| Словарь | 248 320 |
| Исходная точность | BF16 |
| Нативный предел позиции | 262 144 токена |
| Vision encoder | 27 слоёв; hidden size 1 152 |
Значения взяты из config.json. Идентификатор qwen3_5 обозначает семейство реализации архитектуры: он не означает, что вы скачали другую версию. Плотная архитектура не имеет отдельного малого набора активных экспертов, характерного для MoE.
Результаты тестов: показатели разработчика
| Бенчмарк | Результат Qwen3.8-27B |
|---|---|
| GPQA Diamond | 89,2 |
| Humanity’s Last Exam | 30,8 |
| LiveCodeBench v6 | 90,3 |
| SWE-bench Pro | 61,7 |
| Terminal Bench 2.1, Terminus | 73,0 |
| OSWorld-Verified | 84,3 |
| OmniDocBench 1.5 | 91,1 |
| RealWorldQA | 85,9 |
Источник — таблицы Qwen. Это опубликованные авторами значения в шкалах соответствующих тестов, не наши измерения и не обещание той же точности в Q4. Результаты разных тестов нельзя усреднять в единый «процент интеллекта». Для SWE-bench Pro важны использованный агентный harness и исправленный набор заданий: сравнение с другой таблицей без совпадающей методики может вводить в заблуждение.
Сколько памяти нужно для Qwen3.8-27B
Размер файлов — только начало расчёта
| Файл из сборки ggml-org | Размер скачивания |
|---|---|
| Основная модель Q4_K_M | 19,0 ГБ |
| Основная модель Q8_0 | 28,6 ГБ |
| Основная модель BF16 | 53,8 ГБ |
| Vision projector Q8_0 | Дополнительно 629 МБ |
| Vision projector BF16 | Дополнительно 931 МБ |
Размеры относятся к конкретным файлам ggml-org, в десятичных ГБ. Общий размер репозитория складывает альтернативные файлы: скачивать все варианты не нужно. У другого конвертера даже Q4_K_M может иметь иной размер. Дополнительные MTP-веса в этот бюджет не включены.
Бюджет памяти = веса + KV-кэш + состояния модели + рабочие буферы + запас для ОС. Для изображений добавляются encoder/projector и обработка входа. Системная RAM и VRAM дискретной карты — разные пулы. На Mac и Spark память общая, и её часть занимает система.
Для полного внимания этой конфигурации расчёт BF16 KV-кэша составляет примерно 64 КиБ на токен одной последовательности: 16 слоёв × 4 KV-головы × 256 × 2 × 2 байта. Это даёт около 0,5 ГиБ при 8 192 токенах, 2 ГиБ при 32 768 и 16 ГиБ при 262 144. Здесь не учтены состояния DeltaNet, дополнительные запросы и служебные буферы. Размеры и особенности recurrent-state pool разобраны в документации SGLang.
Практический минимум и рекомендуемый запас
Все оценки ниже предполагают одного пользователя, текстовый запрос и отключённое дополнительное speculative decoding.
| Сценарий | Память | Контекст для старта | Статус рекомендации |
|---|---|---|---|
| CPU, Q4_K_M | 32 ГБ RAM; современный CPU 6–8 ядер как ориентир | 8 192 | Расчётный минимум для эксперимента; скорость не измерена |
| Дискретная GPU, Q4_K_M | 24 ГБ VRAM + 32 ГБ RAM; лучше 64 ГБ RAM | 8 192 | Оценка; запас зависит от runtime и vision |
| RTX 5090, NVFP4 | 32 ГБ VRAM + рекомендуемые 64 ГБ RAM | 32 768 | Запуск подтверждён авторами рецепта vLLM с особыми флагами |
| Apple Silicon, Q4 | От 32–36 ГБ unified для коротких запросов; рекомендуем 64 ГБ | 8 192 | Оценка памяти; точную связку ОС и runtime нужно проверить |
| Q8 на машине с общей памятью | Рекомендуем 64 ГБ unified | 8 192–32 768 | Оценка, без гарантии скорости |
| BF16 на машине с общей памятью | Рекомендуем 96–128 ГБ unified | Начать с 8 192 | Оценка запаса; Spark отдельно проверялся проектом SGLang |
Для Q4 оставьте минимум 40 ГБ свободного SSD, для Q8 — 60 ГБ, для BF16 — 100 ГБ. Это наш запас на загрузку, временные файлы и служебные данные, а не размер весов. Для нескольких форматов и документов удобнее SSD от 1 ТБ.
16 ГБ VRAM недостаточно для полного размещения выбранного 19-ГБ Q4-файла. Частичная выгрузка на CPU возможна при достаточной RAM, но требует отдельной проверки задержек. Контекст 1 млн не следует выбирать по умолчанию: сначала измерьте короткий запрос, затем увеличивайте длину и число одновременных обращений.
Как запустить
Mac или обычный ПК: GGUF
Используйте сборку llama.cpp с поддержкой Qwen3.8. Для конвертации bartowski указан минимум b10419. Этот пример намеренно использует её собственный репозиторий; таблица размеров выше относится к ggml-org.
llama-server -hf bartowski/Qwen3.8-27B-GGUF:Q4_K_M \
--ctx-size 8192 --host 127.0.0.1 --port 8080
После установки подходящей сборки откройте http://127.0.0.1:8080. При первом запуске скачиваются веса. Проверьте журнал: какой backend выбран, сколько слоёв размещено на GPU и загружен ли vision projector. Для CPU будет иной профиль скорости. Вручную скачанные мультимодальные файлы требуют корректного --mmproj; один языковой GGUF не обеспечивает обработку картинок.
RTX 5090: рецепт vLLM
Официальный рецепт vLLM проверен на версии 0.26.1rc1.dev608+g99a10304d; требуется Transformers ≥ 5.8.0. Для одной RTX 5090 приведён следующий вариант:
vllm serve Inferact/Qwen3.8-27B-NVFP4 \
--tensor-parallel-size 1 \
--max-model-len 32768 \
--kv-cache-dtype fp8 \
--enforce-eager \
--reasoning-parser qwen3 \
--host 127.0.0.1
--enforce-eager отключает CUDA graphs: без него авторы рецепта получили нехватку памяти при старте. Это подтверждение текстового serving на указанной связке, а не универсальный тест всех мультимодальных режимов. Используйте совместимое Linux-окружение с драйвером NVIDIA; предустановленная Windows на готовом ПК сама по себе не означает готовность vLLM.
API и стоимость
| QwenCloud, USD за 1 млн токенов | Тариф на 10.09.2026 |
|---|---|
| Обычный вход | $0,50 |
| Выход | $3,00 |
| Вход с implicit cache | $0,10 |
| Создание explicit cache | $0,625 |
| Чтение explicit cache | $0,05 |
Идентификатор API — qwen3.8-27b, совместимый endpoint — https://dashscope-intl.aliyuncs.com/compatible-mode/v1. В текущей карточке QwenCloud указаны контекст 1 млн, максимальный финальный вывод 131K и reasoning-бюджет 262K. Лимиты конкретного запроса нужно сверять с режимом и входом; это не гарантии для локального GGUF.
Пример расчёта: 1 млн обычных входных и 100 тыс. оплачиваемых выходных токенов стоят $0,80 без дополнительных инструментов и налогов. Итог зависит от reasoning и правил тарификации. Локальный запуск не имеет платы за токен со стороны владельца весов, но требует оборудования, электричества и сопровождения. Доступность аккаунта, оплаты и поставки в России здесь не проверялась; долларовые цены не являются российским предложением.
Какой готовый компьютер выбрать
| Компьютер и точная конфигурация | Для чего рассматривать | Ограничение |
|---|---|---|
| Mac Studio M5 Max, 18 CPU / 40 GPU, 64 ГБ, SSD 1 ТБ | Рабочее место на macOS; Q4/Q8 с запасом общей памяти | На дату статьи предзаказ, старт продаж 22 сентября; собственных тестов нет |
| CORSAIR VENGEANCE a7500, Ryzen 9 9900X3D, RTX 5090 32 ГБ, RAM 64 ГБ, SSD 4 ТБ | CUDA и локальный API; NVFP4 по рецепту vLLM | Для серверного стека потребуется настройка Linux; не BF16 целиком в GPU |
| NVIDIA DGX Spark, GB10, 128 ГБ unified, SSD 4 ТБ | Компактная Linux-машина с большим объёмом общей памяти | SGLang подтвердил запуск, но не опубликовал для этой проверки throughput |
Это подбор по памяти, программной совместимости и сценарию, а не рейтинг скорости. Переход с Q4 на BF16 не оправдывает покупку сам по себе: сначала сравните ответы на своём наборе задач. Ссылки на отдельные карточки конфигураций находятся ниже.
Mac: официальная конфигурация и дата доступности. ПК: спецификация CORSAIR. Spark: характеристики NVIDIA и US-магазин: $4 699. Цены остальных выбранных конфигураций не удалось надёжно подтвердить; они намеренно не подменены ценами базовых моделей.
Частые вопросы
Qwen3.8-27B бесплатна и разрешена для коммерческого проекта?
Веса опубликованы под Apache 2.0. Лицензия предусматривает коммерческое использование при соблюдении её условий, включая необходимые уведомления. Платный API — отдельная услуга. Открытые веса не означают публикацию полного обучающего корпуса.
Будет ли работать без интернета?
После скачивания весов и зависимостей локальный inference может работать без облачного API. Поиск в интернете, внешние инструменты и обновления — отдельные подключения. Если важна автономность, проверьте её с отключённой сетью на всей цепочке обработки документов.
Почему нет обещания «токенов в секунду»?
Мы не измеряли эту модель на перечисленных компьютерах. Скорость зависит от формата, длины входа, обработки изображений, reasoning, кэша и числа пользователей. Для сравнения фиксируйте время до первого токена, скорость продолжения и пиковую память, а не только одну цифру из короткого запроса.
Что выбрать первым для компании?
Подготовьте контрольный набор реальных задач и эталонных ответов. Проверьте облачную или имеющуюся локальную конфигурацию, измерьте качество и задержки, затем оцените нужный объём оборудования. Для локального пилота начинайте с одного пользователя и 8K контекста; увеличивайте нагрузку после замеров.
Как поддерживается актуальность этой страницы?
Характеристики, deployment-профили и связанные компьютеры сохранены отдельно в AI Models и доступны автоматическому сравнению. Текст объясняет ограничения этих цифр. Дата проверки относится к источникам; она не означает проведение аппаратного теста. Неизвестные показатели явно отмечены, расчётные требования отделены от подтверждений разработчиков runtime.
Локальный запуск
Требования относятся к указанной квантизации, контексту и среде запуска. RAM, VRAM и объединённая память не взаимозаменяемы.
CPU: практический старт
- Формат весов
- GGUF Q4_K_M, ggml-org 19 ГБ
- Контекст
- 8 192
Память и условия запуска
- Среда и версия
- Совместимая llama.cpp
- RAM
- 32 ГБ минимум для эксперимента; 64 ГБ с запасом
- VRAM
- Не требуется
- Объединённая память
- Не применяется
- Накопитель
- 40 ГБ свободно
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Текст, один пользователь; CPU 6–8 ядер — рекомендация, не абсолютный минимум. Не обещаем интерактивную скорость.
GPU 24 ГБ: расчётный минимум
- Формат весов
- GGUF Q4_K_M
- Контекст
- 8 192
Память и условия запуска
- Среда и версия
- llama.cpp / CUDA
- RAM
- 32 ГБ минимум; рекомендуем 64 ГБ
- VRAM
- 24 ГБ, запас зависит от backend
- Объединённая память
- Не применяется
- Накопитель
- 40 ГБ свободно
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Текст без MTP; при vision или большом контексте проверить память, уменьшить контекст или offload.
RTX 5090: подтверждённый рецепт
- Формат весов
- Inferact NVFP4
- Контекст
- 32 768
Память и условия запуска
- Среда и версия
- vLLM 0.26.1rc1.dev608+g99a10304d
- RAM
- Рекомендуем 64 ГБ
- VRAM
- 32 ГБ
- Объединённая память
- Не применяется
- Накопитель
- Рекомендуем 60 ГБ свободно
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Подтверждение авторов vLLM для GPU, не нашего готового ПК. --enforce-eager, KV fp8; текстовый serving.
Mac Studio: запас под Q4/Q8
- Формат весов
- GGUF Q4_K_M или Q8_0
- Контекст
- Начать с 8 192
Память и условия запуска
- Среда и версия
- Совместимая llama.cpp / Metal
- RAM
- Общая с GPU
- VRAM
- Отдельной нет
- Объединённая память
- 64 ГБ рекомендуем
- Накопитель
- 60 ГБ свободно для Q8
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- Оценка объёма; M5 Max в предзаказе, работу точного runtime на новом чипе и скорость не тестировали.
DGX Spark: BF16 и короткий контекст
- Формат весов
- BF16
- Контекст
- 8 192 вход / 1 024 выход
Память и условия запуска
- Среда и версия
- SGLang; рецепт commit 1cf2b8c54d81802abc15dcf23a29b9cc687bc01e
- RAM
- Общая с GPU
- VRAM
- Отдельной нет
- Объединённая память
- 128 ГБ установленной памяти
- Накопитель
- 100 ГБ свободно рекомендуем
- Одновременные запросы
- 1 запрос
- Скорость и единица
- Не измеряли; численная скорость не заявляется
- Условия теста / ограничения
- SGLang подтвердил boot-and-serve; throughput не опубликован. Диск — наша рекомендация. Не переносить результат на контекст 1 млн.
ОБОРУДОВАНИЕ
Компьютер под вашу задачу
Выберите платформу и откройте точную конфигурацию. Условия запуска и ограничения — в каждой карточке.
РАБОЧЕЕ МЕСТО НА macOS
Mac Studio M5 Max
64 ГБ памяти для Q4/Q8. Предзаказ: доступность с 22 сентября. Скорость на этой конфигурации не измеряли.
- Графика
- Встроенный Apple GPU, 40 ядер
- Общая память
- 64 ГБ; часть занимает ОС
- SSD
- SSD 1 ТБ
CUDA И ЛОКАЛЬНЫЙ API
CORSAIR VENGEANCE a7500
RTX 5090 с 32 ГБ VRAM для NVFP4. Для рецепта vLLM понадобится совместимое Linux-окружение.
- Графика
- NVIDIA GeForce RTX 5090, настольная
- RAM
- 64 ГБ DDR5
- SSD
- 4 ТБ, два M.2 SSD по 2 ТБ
КОМПАКТНАЯ AI-СТАНЦИЯ
NVIDIA DGX Spark
128 ГБ общей памяти и DGX OS. Запуск подтверждён SGLang; скорость не измерена. Ноутбук на фото не входит в комплект.
- Графика
- Blackwell в GB10 Grace Blackwell
- Общая память
- 128 ГБ LPDDR5x; 273 ГБ/с
- SSD
- 4 ТБ NVMe M.2
Источники и проверка данных9 источников · Проверено 10.09.2026
- Qwen — релизыgithub.com ↗
- Qwen3.8-27B — модель и бенчмаркиhuggingface.co ↗
- Архитектура — config.jsonhuggingface.co ↗
- Лицензия Apache 2.0huggingface.co ↗
- GGUF — размеры файлов ggml-orghuggingface.co ↗
- llama.cpp — сборка bartowskihuggingface.co ↗
- vLLM — проверенные конфигурацииrecipes.vllm.ai ↗
- SGLang — конфигурации и проверка Sparkdocs.sglang.io ↗
- QwenCloud — API и ценыwww.qwencloud.com ↗