ОБЗОР AI-МОДЕЛИ

Qwen3.8 2.4T A95B

Возможности, стоимость и компьютер для локального запуска

Самая крупная Qwen в этой подборке. Открытый checkpoint текстовый, а локальный запуск требует серверной памяти или серьёзных компромиссов. Для обычного рабочего компьютера сначала стоит посмотреть на Qwen3.8-27B.

Фабио Де Лука · Проверено 11.09.2026 · Релиз 12.08.2026

Разработчик
Alibaba · Qwen
Параметры
2 400 млрд
Лицензия
Qwen3.8-Max License
Вход → выход
Открытый checkpoint: текст → текст
Контекст
262 144; расширение до 1 010 000 токенов
API · вход / выход
$2 / $6 за 1 млн токенов; условия ниже
На этой странице

Кому подходит

ВЫБОР ПО ЗАДАЧЕ

Где стоит попробовать модель

По документации · проверьте на своих данных
Серверная обработка сложных текстовых задачСтоит попробовать

Самая крупная Qwen в этой подборке. Открытый checkpoint текстовый, а локальный запуск требует серверной памяти или серьёзных компромиссов. Для обычного рабочего компьютера сначала стоит посмотреть на Qwen3.8-27B.

Что проверить: Примите результат только после проверки фактов, формата и выполнения задания.

Основание оценки ↗
Русские деловые текстыС условиями

Отдельная подтверждённая оценка русской редакторской работы отсутствует.

Что проверить: Дайте исходник и сравните смысл, тон и число ручных исправлений.

Основание оценки ↗
Полностью автономная работаС условиями

Нужны совместимые веса, runtime и оборудование.

Что проверить: Проверьте исходящие соединения и внешние инструменты.

Основание оценки ↗

Сравнить с другой моделью

Характеристики и конфигурации рядом, в одной таблице.

Самая крупная Qwen в этой подборке. Открытый checkpoint текстовый, а локальный запуск требует серверной памяти или серьёзных компромиссов. Для обычного рабочего компьютера сначала стоит посмотреть на Qwen3.8-27B.

Перед выбором Qwen3.8 2.4T A95B определите, какой результат будет принят: исправление, прошедшее тесты, точное извлечение полей или текст, который редактор готов публиковать. Ни общий рейтинг, ни большой контекст не отвечают на этот вопрос за вашу команду.

официальный паспорт. Данные и тарифы проверены 12.09.2026 по московскому времени.

Другие версии: что нельзя смешивать

Открытые веса и hosted Qwen3.8-Max нельзя смешивать. В model card у Max отдельно описаны визуальный вход, инструменты и контекст 1 млн по умолчанию. Здесь паспорт относится к текстовому checkpoint 2.4T A95B. Qwen3.8-27B имеет другой размер и лицензию.

Качество и возможности

Эта Qwen нужна прежде всего там, где команда готова обслуживать очень крупную модель и проверять её на собственном наборе задач. Для пилота подойдут разбор репозитория, извлечение сведений из длинного документа и многошаговая работа с инструментами.

Домашний запуск ради эксперимента и удобный ежедневный помощник предъявляют разные требования. Если один ответ занимает несколько минут, локальность сама по себе не компенсирует потерю рабочего времени. Сравните точность выбранной квантизации с доступом к полноразмерной версии, прежде чем покупать память.

Результаты тестов

Независимый замер Значение
Intelligence Index v4.3 40
Режим режим из карточки AA
Генерация 38.4 токена/с
TTFT 2.84 с

Источник: Artificial Analysis. Снимок 12 сентября 2026 года. Балл относится к составному набору задач и указанному режиму. Это не процент правильных ответов и не отдельная оценка русского языка.

Мы не переносим цифры производителя из другого harness в эту таблицу. Для сравнения моделей используйте одинаковую версию теста, инструменты и бюджет рассуждения.

Независимые проверки

Опыт пользователей

Автор локального эксперимента от 13 августа сообщает примерно 0,80 токена/с на RTX 5090 + RTX 5060 Ti, 128 ГБ RAM и 350 ГБ swap. Использовались тяжёлая квантизация UD-Q1_0 и сборка Unsloth 10360. Это демонстрация запуска с дисковым обменом, а не рекомендация покупать такой компьютер для комфортной работы. Первичное обсуждение.

Работа на русском языке

Полноценного слепого теста этой точной версии на русской редактуре в проверенных источниках нет. Русскоязычный комментарий о коде не оценивает склонения, деловой тон или точность пересказа. До внедрения проверьте письма клиентам, сокращение текста и извлечение реквизитов.

Сохраните исходные задания и ответы. Попросите редактора оценить их без названия модели: смысл, фактические ошибки, естественность речи и объём ручных исправлений. Ниже есть запросы для такого пилота; это не выдуманные результаты запуска.

ПРАКТИКА

Примеры и задачи для проверки

Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.

Русское письмо без выдуманных обещанийЗапрос для самостоятельной проверки

Запрос

Перепиши письмо клиенту простым деловым русским языком, до 80 слов. Не добавляй новых фактов и обещаний. Сохрани дату и причину задержки. Исходник: «В связи с необходимостью проведения дополнительной проверки сообщаем, что макет будет направлен 18 сентября. Задержка связана с проверкой мобильной версии. Стоимость не меняется».

Как оценить результат

Должны сохраниться 18 сентября, проверка мобильной версии и неизменная стоимость. Не должно появиться скидки, оправданий или гарантии, которой нет в исходнике.

Это тестовый запрос, не опубликованный результат запуска модели.

Извлечение данных с проверяемым ответомЗапрос для самостоятельной проверки

Запрос

Верни только JSON с полями amount, currency, due_date и contract_id. Неизвестное значение обозначь null. Текст: «Оплатить 12 500 рублей до 20.09.2026. Номер договора в письме не указан». Не придумывай номер договора.

Как оценить результат

Ожидаются amount 12500, currency RUB, due_date 2026-09-20 и contract_id null. Проверьте JSON парсером. Это заданный критерий, не записанный ответ модели.

Это тестовый запрос, не опубликованный результат запуска модели.

Проверка рабочего кодаЗапрос для самостоятельной проверки

Запрос

Прочитай приложенные файлы проекта и воспроизведение ошибки. Сначала назови вероятную причину и недостающие сведения. Затем предложи минимальную правку и способ проверить её. Не заменяй реальные API заглушками и не меняй несвязанные файлы.

Как оценить результат

Используйте тестовую копию репозитория. Сравните диагноз с воспроизведением, проверьте diff и сборку. Не выдавайте успешный текстовый ответ за прошедший тест.

Это тестовый запрос, не опубликованный результат запуска модели.

Локальный запуск

Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.

Для 2400 млрд параметров арифметический нижний ориентир при ровно 4 битах составляет 1200 ГБ только под веса. Это не размер опубликованного файла и не минимальная рабочая конфигурация. Реальные форматы добавляют метаданные и другие тензоры; KV-кэш, буферы и среда требуют отдельной памяти. Известен эксперимент с очень тяжёлой квантизацией и swap на обычном ПК; подробности и ограничения приведены в отзывах. Такой запуск не равен загрузке всех весов в быструю память.

Файлы и руководство запуска.

Как рассчитать память: KV-кэш, буферы и запас

Объём весов на диске не равен полной памяти процесса. Добавьте KV-кэш для выбранного контекста, рабочие буферы, память ОС и запас. В MoE неиспользуемые на текущем токене эксперты всё равно нужно где-то хранить. RAM и VRAM нельзя механически складывать, если runtime не поддерживает нужный offload.

Скорость по опубликованным тестам

AA публикует 38.4 токена/с и TTFT 2.84 с для Qwen3.8 2.4T A95B (режим из карточки AA). Источник и методика.

Это внешний замер API. Генерация после начала потока не равна времени до готового ответа. Ожидание, рассуждение, инструменты и повторы могут занимать больше времени. Эти значения не используются как обещание скорости Mac Studio, ПК или DGX Spark.

Конфигурации, скорость и инструкции

Откройте строку для всех условий. Если измерений нет, скорость не заявляется.

Серверное размещение: расчёт до закупкиФормат из официального репозиторияНет замера для этого профиляРасчётная оценка
Квантизация
Формат из официального репозитория
Контекст
Начните с 8 192 токенов; это выбранный старт пилота
Среда и версия
Серверные runtime; llama.cpp для совместимых GGUF
RAM
Точный минимум для полного запуска не подтверждён
Накопитель
Размер выбранного checkpoint + временные файлы
Одновременные запросы
Один запрос
Скорость и единица
Для этой полной конфигурации воспроизводимый замер не подтверждён
Условия теста / ограничения
Не профиль совместимости для домашнего ПК. Нужны архитектура сервера, поддерживаемые GPU, interconnect и испытание на заданном контексте.

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

  1. Установите совместимую сборку runtime по источнику.
  2. Скачайте все части указанной квантизации.
  3. Начните с короткого контекста и проверьте фактическую память и корректность ответа.
  4. Увеличивайте нагрузку только после успешной проверки.

Покупка и наличие

Mac Studio, один DGX Spark и одна RTX 5090 не рекомендуются здесь как подтверждённый готовый вариант. Запросите у интегратора запуск точного checkpoint на вашем тесте и замер полной задержки, потребления памяти и числа одновременных запросов.

Как выбирать оборудование и проверять цены

До оплаты попросите показать точную конфигурацию, ОС, версию runtime, имя кванта и контекст. Замерьте короткий и длинный запрос, затем несколько одновременных. Цена компьютера и наличие в России зависят от комплектации и поставщика; неподтверждённая цена не публикуется.

API и стоимость

Standard / указанный источник, USD за 1 млн токенов Цена
Вход без кэша $2
Выход $6
Чтение кэша Не включено в расчёт: ставка не подтверждена

Цена $2 / $6 приведена как снимок измеряемого Alibaba API из Artificial Analysis. Она не является отдельным официально подтверждённым прайсом скачиваемого checkpoint. Перед интеграцией уточните API ID, режим и модальности у поставщика. Источник цены.

Пример бюджета

10 000 входных и 2 000 оплачиваемых выходных токенов без кэша стоят $0.032 по указанным базовым ставкам. Тысяча таких запросов: $32. Это арифметический пример, не замер расхода агента.

В рабочем бюджете учитывайте все попытки, токены рассуждения, инструменты и повышенные тарифы. Сохраняйте usage из API. Для повторяющихся задач считайте стоимость принятого результата, а не только цену миллиона токенов.

Подходит ли российской компании?

Собственное размещение позволяет построить обработку внутри инфраструктуры компании. Но пригодность Qwen3.8 2.4T A95B определяется лицензией, оборудованием и всей схемой передачи данных, а не одним словом «локально».

Где будут обрабатываться данные

Проверьте исходящие подключения runtime, телеметрию, журналирование, резервные копии и внешние инструменты агента. Локальная модель с облачным поиском или удалённым MCP всё ещё может передавать данные наружу.

Для пилота используйте синтетические данные. Перед рабочим запуском зафиксируйте схему движения данных и ответственного за проверку. Не считайте наличие посредника подтверждением официальной доступности в России.

Российское законодательство: что учесть

Проверяйте применимость требований к локализации и трансграничной передаче: 152-ФЗ, статьи 18 и 12.

Лицензия предусматривает отдельное разрешение для Model as a Service или AI Work Assistant при выручке группы свыше $50 млн за 12 месяцев. Есть условия атрибуции крупных продуктов и исключение внутреннего использования. Apache 2.0 от меньших Qwen к этому checkpoint не относится. Полный текст лицензии.

Что проверить до рабочего запуска

Возьмите небольшой набор характерных задач и заранее определите условия приёмки. В журнале сохраняйте точную модель, дату, настройки, время и расход. Проверьте удаление тестовых данных и отказ внешнего сервиса. Для русского текста оцените, сколько правок требуется редактору. Для кода обязательны сборка и ревью.

Технические характеристики

Паспорт модели · все 18 параметров
РазработчикAlibaba · Qwen
Точная версияQwen3.8 2.4T A95B
Тип моделиТекстовая модель
Доступность весовОткрытые веса
ЛицензияQwen3.8-Max License
Всего параметров2 400 млрд
Активных параметров (MoE)95 млрд
АрхитектураMoE
Контекстное окно262 144; расширение до 1 010 000 токенов
Максимальный выводЗависит от runtime и остатка контекста
МодальностиОткрытый checkpoint: текст → текст
Работа с инструментамиВызов инструментов; зависит от клиента и шаблона
Цена API и единица тарификации$2 / $6 за 1 млн токенов; условия ниже
ПодпискаОтдельные планы сервиса; API оплачивается отдельно
Дата выпуска12.08.2026
Форматы весовBF16 Safetensors; сторонние GGUF
Среды запускаСерверные runtime; llama.cpp для совместимых GGUF
Региональная доступностьПроверяйте условия поставщика и схему обработки данных; подробнее в разделе для РФ
Устройство модели · архитектура

92 слоя с гибридом Gated DeltaNet и Gated Attention. MoE использует 512 экспертов, 10 выбираемых и одного общего. Для оценки памяти нужно хранить весь набор весов, а не только 95 млрд активных параметров.

Вопросы и источники

Можно ли использовать Qwen3.8 2.4T A95B без интернета?

Да, если веса и совместимая среда установлены в собственном контуре, а внешние инструменты отключены. Требования и ограничения перечислены в локальном разделе.

Большой контекст гарантирует точный ответ?

Нет. Окно задаёт вместимость запроса. Проверяйте поиск деталей, отсутствие домыслов и ссылки на исходные фрагменты.

Это личный тест Фабио?

Это обзор документации, независимых измерений и доступных первичных отзывов. Собственные аппаратные замеры и личное мнение не добавлены без фактического испытания.

Как сравнить с уже опубликованной моделью?

Выберите вторую модель в форме сравнения. Таблица сопоставит паспорта; итоговый выбор сделайте по своим заданиям, тарифу и условиям размещения.

Источники данных

Дата проверки относится к источникам, а не к испытанию оборудования.

  1. Паспорт модели и описание возможностейhuggingface.co
  2. Artificial Analysis: режим и измерения, снимок 12.09.2026artificialanalysis.ai
  3. Первичный пользовательский опыт; субъективная оценкаwww.reddit.com
  4. Лицензия: коммерческие условияhuggingface.co
  5. 152-ФЗ: действующая редакция, проверьте применимостьwww.consultant.ru

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.