ОБЗОР AI-МОДЕЛИ
Qwen3.8 2.4T A95B
Возможности, стоимость и компьютер для локального запуска
Самая крупная Qwen в этой подборке. Открытый checkpoint текстовый, а локальный запуск требует серверной памяти или серьёзных компромиссов. Для обычного рабочего компьютера сначала стоит посмотреть на Qwen3.8-27B.
- Разработчик
- Alibaba · Qwen
- Параметры
- 2 400 млрд
- Лицензия
- Qwen3.8-Max License
- Вход → выход
- Открытый checkpoint: текст → текст
- Контекст
- 262 144; расширение до 1 010 000 токенов
- API · вход / выход
- $2 / $6 за 1 млн токенов; условия ниже
На этой странице
Кому подходит
Где стоит попробовать модель
Серверная обработка сложных текстовых задачСтоит попробовать
Самая крупная Qwen в этой подборке. Открытый checkpoint текстовый, а локальный запуск требует серверной памяти или серьёзных компромиссов. Для обычного рабочего компьютера сначала стоит посмотреть на Qwen3.8-27B.
Что проверить: Примите результат только после проверки фактов, формата и выполнения задания.
Основание оценки ↗Русские деловые текстыС условиями
Отдельная подтверждённая оценка русской редакторской работы отсутствует.
Что проверить: Дайте исходник и сравните смысл, тон и число ручных исправлений.
Основание оценки ↗Полностью автономная работаС условиями
Нужны совместимые веса, runtime и оборудование.
Что проверить: Проверьте исходящие соединения и внешние инструменты.
Основание оценки ↗Сравнить с другой моделью
Самая крупная Qwen в этой подборке. Открытый checkpoint текстовый, а локальный запуск требует серверной памяти или серьёзных компромиссов. Для обычного рабочего компьютера сначала стоит посмотреть на Qwen3.8-27B.
Перед выбором Qwen3.8 2.4T A95B определите, какой результат будет принят: исправление, прошедшее тесты, точное извлечение полей или текст, который редактор готов публиковать. Ни общий рейтинг, ни большой контекст не отвечают на этот вопрос за вашу команду.
официальный паспорт. Данные и тарифы проверены 12.09.2026 по московскому времени.
Другие версии: что нельзя смешивать
Открытые веса и hosted Qwen3.8-Max нельзя смешивать. В model card у Max отдельно описаны визуальный вход, инструменты и контекст 1 млн по умолчанию. Здесь паспорт относится к текстовому checkpoint 2.4T A95B. Qwen3.8-27B имеет другой размер и лицензию.
Качество и возможности
Эта Qwen нужна прежде всего там, где команда готова обслуживать очень крупную модель и проверять её на собственном наборе задач. Для пилота подойдут разбор репозитория, извлечение сведений из длинного документа и многошаговая работа с инструментами.
Домашний запуск ради эксперимента и удобный ежедневный помощник предъявляют разные требования. Если один ответ занимает несколько минут, локальность сама по себе не компенсирует потерю рабочего времени. Сравните точность выбранной квантизации с доступом к полноразмерной версии, прежде чем покупать память.
Результаты тестов
| Независимый замер | Значение |
|---|---|
| Intelligence Index v4.3 | 40 |
| Режим | режим из карточки AA |
| Генерация | 38.4 токена/с |
| TTFT | 2.84 с |
Источник: Artificial Analysis. Снимок 12 сентября 2026 года. Балл относится к составному набору задач и указанному режиму. Это не процент правильных ответов и не отдельная оценка русского языка.
Мы не переносим цифры производителя из другого harness в эту таблицу. Для сравнения моделей используйте одинаковую версию теста, инструменты и бюджет рассуждения.
Независимые проверки
Опыт пользователей
Автор локального эксперимента от 13 августа сообщает примерно 0,80 токена/с на RTX 5090 + RTX 5060 Ti, 128 ГБ RAM и 350 ГБ swap. Использовались тяжёлая квантизация UD-Q1_0 и сборка Unsloth 10360. Это демонстрация запуска с дисковым обменом, а не рекомендация покупать такой компьютер для комфортной работы. Первичное обсуждение.
Работа на русском языке
Полноценного слепого теста этой точной версии на русской редактуре в проверенных источниках нет. Русскоязычный комментарий о коде не оценивает склонения, деловой тон или точность пересказа. До внедрения проверьте письма клиентам, сокращение текста и извлечение реквизитов.
Сохраните исходные задания и ответы. Попросите редактора оценить их без названия модели: смысл, фактические ошибки, естественность речи и объём ручных исправлений. Ниже есть запросы для такого пилота; это не выдуманные результаты запуска.
Примеры и задачи для проверки
Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.
Русское письмо без выдуманных обещанийЗапрос для самостоятельной проверки
Запрос
Перепиши письмо клиенту простым деловым русским языком, до 80 слов. Не добавляй новых фактов и обещаний. Сохрани дату и причину задержки. Исходник: «В связи с необходимостью проведения дополнительной проверки сообщаем, что макет будет направлен 18 сентября. Задержка связана с проверкой мобильной версии. Стоимость не меняется».
Как оценить результат
Должны сохраниться 18 сентября, проверка мобильной версии и неизменная стоимость. Не должно появиться скидки, оправданий или гарантии, которой нет в исходнике.
Извлечение данных с проверяемым ответомЗапрос для самостоятельной проверки
Запрос
Верни только JSON с полями amount, currency, due_date и contract_id. Неизвестное значение обозначь null. Текст: «Оплатить 12 500 рублей до 20.09.2026. Номер договора в письме не указан». Не придумывай номер договора.
Как оценить результат
Ожидаются amount 12500, currency RUB, due_date 2026-09-20 и contract_id null. Проверьте JSON парсером. Это заданный критерий, не записанный ответ модели.
Проверка рабочего кодаЗапрос для самостоятельной проверки
Запрос
Прочитай приложенные файлы проекта и воспроизведение ошибки. Сначала назови вероятную причину и недостающие сведения. Затем предложи минимальную правку и способ проверить её. Не заменяй реальные API заглушками и не меняй несвязанные файлы.
Как оценить результат
Используйте тестовую копию репозитория. Сравните диагноз с воспроизведением, проверьте diff и сборку. Не выдавайте успешный текстовый ответ за прошедший тест.
Локальный запуск
Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.
Для 2400 млрд параметров арифметический нижний ориентир при ровно 4 битах составляет 1200 ГБ только под веса. Это не размер опубликованного файла и не минимальная рабочая конфигурация. Реальные форматы добавляют метаданные и другие тензоры; KV-кэш, буферы и среда требуют отдельной памяти. Известен эксперимент с очень тяжёлой квантизацией и swap на обычном ПК; подробности и ограничения приведены в отзывах. Такой запуск не равен загрузке всех весов в быструю память.
Как рассчитать память: KV-кэш, буферы и запас
Объём весов на диске не равен полной памяти процесса. Добавьте KV-кэш для выбранного контекста, рабочие буферы, память ОС и запас. В MoE неиспользуемые на текущем токене эксперты всё равно нужно где-то хранить. RAM и VRAM нельзя механически складывать, если runtime не поддерживает нужный offload.
Скорость по опубликованным тестам
AA публикует 38.4 токена/с и TTFT 2.84 с для Qwen3.8 2.4T A95B (режим из карточки AA). Источник и методика.
Это внешний замер API. Генерация после начала потока не равна времени до готового ответа. Ожидание, рассуждение, инструменты и повторы могут занимать больше времени. Эти значения не используются как обещание скорости Mac Studio, ПК или DGX Spark.
Конфигурации, скорость и инструкции
Серверное размещение: расчёт до закупкиФормат из официального репозиторияНет замера для этого профиляРасчётная оценка
- Квантизация
- Формат из официального репозитория
- Контекст
- Начните с 8 192 токенов; это выбранный старт пилота
- Среда и версия
- Серверные runtime; llama.cpp для совместимых GGUF
- RAM
- Точный минимум для полного запуска не подтверждён
- Накопитель
- Размер выбранного checkpoint + временные файлы
- Одновременные запросы
- Один запрос
- Скорость и единица
- Для этой полной конфигурации воспроизводимый замер не подтверждён
- Условия теста / ограничения
- Не профиль совместимости для домашнего ПК. Нужны архитектура сервера, поддерживаемые GPU, interconnect и испытание на заданном контексте.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
- Установите совместимую сборку runtime по источнику.
- Скачайте все части указанной квантизации.
- Начните с короткого контекста и проверьте фактическую память и корректность ответа.
- Увеличивайте нагрузку только после успешной проверки.
Покупка и наличие
Mac Studio, один DGX Spark и одна RTX 5090 не рекомендуются здесь как подтверждённый готовый вариант. Запросите у интегратора запуск точного checkpoint на вашем тесте и замер полной задержки, потребления памяти и числа одновременных запросов.
Как выбирать оборудование и проверять цены
До оплаты попросите показать точную конфигурацию, ОС, версию runtime, имя кванта и контекст. Замерьте короткий и длинный запрос, затем несколько одновременных. Цена компьютера и наличие в России зависят от комплектации и поставщика; неподтверждённая цена не публикуется.
API и стоимость
| Standard / указанный источник, USD за 1 млн токенов | Цена |
|---|---|
| Вход без кэша | $2 |
| Выход | $6 |
| Чтение кэша | Не включено в расчёт: ставка не подтверждена |
Цена $2 / $6 приведена как снимок измеряемого Alibaba API из Artificial Analysis. Она не является отдельным официально подтверждённым прайсом скачиваемого checkpoint. Перед интеграцией уточните API ID, режим и модальности у поставщика. Источник цены.
Пример бюджета
10 000 входных и 2 000 оплачиваемых выходных токенов без кэша стоят $0.032 по указанным базовым ставкам. Тысяча таких запросов: $32. Это арифметический пример, не замер расхода агента.
В рабочем бюджете учитывайте все попытки, токены рассуждения, инструменты и повышенные тарифы. Сохраняйте usage из API. Для повторяющихся задач считайте стоимость принятого результата, а не только цену миллиона токенов.
Подходит ли российской компании?
Собственное размещение позволяет построить обработку внутри инфраструктуры компании. Но пригодность Qwen3.8 2.4T A95B определяется лицензией, оборудованием и всей схемой передачи данных, а не одним словом «локально».
Где будут обрабатываться данные
Проверьте исходящие подключения runtime, телеметрию, журналирование, резервные копии и внешние инструменты агента. Локальная модель с облачным поиском или удалённым MCP всё ещё может передавать данные наружу.
Для пилота используйте синтетические данные. Перед рабочим запуском зафиксируйте схему движения данных и ответственного за проверку. Не считайте наличие посредника подтверждением официальной доступности в России.
Российское законодательство: что учесть
Проверяйте применимость требований к локализации и трансграничной передаче: 152-ФЗ, статьи 18 и 12.
Лицензия предусматривает отдельное разрешение для Model as a Service или AI Work Assistant при выручке группы свыше $50 млн за 12 месяцев. Есть условия атрибуции крупных продуктов и исключение внутреннего использования. Apache 2.0 от меньших Qwen к этому checkpoint не относится. Полный текст лицензии.
Что проверить до рабочего запуска
Возьмите небольшой набор характерных задач и заранее определите условия приёмки. В журнале сохраняйте точную модель, дату, настройки, время и расход. Проверьте удаление тестовых данных и отказ внешнего сервиса. Для русского текста оцените, сколько правок требуется редактору. Для кода обязательны сборка и ревью.
Технические характеристики
Паспорт модели · все 18 параметров
| Разработчик | Alibaba · Qwen |
|---|---|
| Точная версия | Qwen3.8 2.4T A95B |
| Тип модели | Текстовая модель |
| Доступность весов | Открытые веса |
| Лицензия | Qwen3.8-Max License |
| Всего параметров | 2 400 млрд |
| Активных параметров (MoE) | 95 млрд |
| Архитектура | MoE |
| Контекстное окно | 262 144; расширение до 1 010 000 токенов |
| Максимальный вывод | Зависит от runtime и остатка контекста |
| Модальности | Открытый checkpoint: текст → текст |
| Работа с инструментами | Вызов инструментов; зависит от клиента и шаблона |
| Цена API и единица тарификации | $2 / $6 за 1 млн токенов; условия ниже |
| Подписка | Отдельные планы сервиса; API оплачивается отдельно |
| Дата выпуска | 12.08.2026 |
| Форматы весов | BF16 Safetensors; сторонние GGUF |
| Среды запуска | Серверные runtime; llama.cpp для совместимых GGUF |
| Региональная доступность | Проверяйте условия поставщика и схему обработки данных; подробнее в разделе для РФ |
Устройство модели · архитектура
92 слоя с гибридом Gated DeltaNet и Gated Attention. MoE использует 512 экспертов, 10 выбираемых и одного общего. Для оценки памяти нужно хранить весь набор весов, а не только 95 млрд активных параметров.
Вопросы и источники
Можно ли использовать Qwen3.8 2.4T A95B без интернета?
Да, если веса и совместимая среда установлены в собственном контуре, а внешние инструменты отключены. Требования и ограничения перечислены в локальном разделе.
Большой контекст гарантирует точный ответ?
Нет. Окно задаёт вместимость запроса. Проверяйте поиск деталей, отсутствие домыслов и ссылки на исходные фрагменты.
Это личный тест Фабио?
Это обзор документации, независимых измерений и доступных первичных отзывов. Собственные аппаратные замеры и личное мнение не добавлены без фактического испытания.
Как сравнить с уже опубликованной моделью?
Выберите вторую модель в форме сравнения. Таблица сопоставит паспорта; итоговый выбор сделайте по своим заданиям, тарифу и условиям размещения.
Источники данных
- Паспорт модели и описание возможностейhuggingface.co
- Artificial Analysis: режим и измерения, снимок 12.09.2026artificialanalysis.ai
- Первичный пользовательский опыт; субъективная оценкаwww.reddit.com
- Лицензия: коммерческие условияhuggingface.co
- 152-ФЗ: действующая редакция, проверьте применимостьwww.consultant.ru