ОБЗОР AI-МОДЕЛИ
MiniMax M3
Возможности, стоимость и компьютер для локального запуска
Мультимодальная модель с открытыми весами и недорогим API. Для локального запуска подходит компьютер с большим объёмом памяти; одного DGX Spark на 128 ГБ недостаточно даже для опубликованного минимального GGUF-профиля.
- Разработчик
- MiniMax
- Параметры
- 428 млрд
- Лицензия
- MiniMax Community License
- Вход → выход
- Текст, изображения, видео → текст
- Контекст
- 1 048 576 в весах; API до 1 млн токенов
- API · вход / выход
- $0.3 / $1.2 за 1 млн токенов; условия ниже
На этой странице
Кому подходит
Где стоит попробовать модель
Недорогая работа с кодом и визуальными материаламиСтоит попробовать
Мультимодальная модель с открытыми весами и недорогим API. Для локального запуска подходит компьютер с большим объёмом памяти; одного DGX Spark на 128 ГБ недостаточно даже для опубликованного минимального GGUF-профиля.
Что проверить: Примите результат только после проверки фактов, формата и выполнения задания.
Основание оценки ↗Русские деловые текстыС условиями
Отдельная подтверждённая оценка русской редакторской работы отсутствует.
Что проверить: Дайте исходник и сравните смысл, тон и число ручных исправлений.
Основание оценки ↗Полностью автономная работаС условиями
Нужны совместимые веса, runtime и оборудование.
Что проверить: Проверьте исходящие соединения и внешние инструменты.
Основание оценки ↗Сравнить с другой моделью
Мультимодальная модель с открытыми весами и недорогим API. Для локального запуска подходит компьютер с большим объёмом памяти; одного DGX Spark на 128 ГБ недостаточно даже для опубликованного минимального GGUF-профиля.
Перед выбором MiniMax M3 определите, какой результат будет принят: исправление, прошедшее тесты, точное извлечение полей или текст, который редактор готов публиковать. Ни общий рейтинг, ни большой контекст не отвечают на этот вопрос за вашу команду.
официальный паспорт. Данные и тарифы проверены 12.09.2026 по московскому времени.
Другие версии: что нельзя смешивать
MiniMax M3 не является M2.7 или M2.7-highspeed. Token Plan, обычный API и сторонние шлюзы используют разные правила квот. Отзывы о расходе подписки нельзя напрямую переводить в цену одного API-вызова.
Качество и возможности
M3 стоит проверять на задаче с длинной историей и повторным использованием контекста: сопровождение проекта, разбор документов или исправление интерфейса по скриншоту. Считайте не только новый вход и ответ, но и чтение кэша на каждом шаге.
В локальной версии важна полнота поддержки архитектуры. Если runtime использует более затратный путь внимания, большое заявленное окно перестаёт быть практическим ориентиром. Начните с короткой задачи и увеличивайте контекст после измерения памяти.
Результаты тестов
| Независимый замер | Значение |
|---|---|
| Intelligence Index v4.3 | 30 |
| Режим | режим из карточки AA |
| Генерация | 92.1 токена/с |
| TTFT | 1.9 с |
Источник: Artificial Analysis. Снимок 12 сентября 2026 года. Балл относится к составному набору задач и указанному режиму. Это не процент правильных ответов и не отдельная оценка русского языка.
Мы не переносим цифры производителя из другого harness в эту таблицу. Для сравнения моделей используйте одинаковую версию теста, инструменты и бюджет рассуждения.
Независимые проверки
Опыт пользователей
Автор разбора выгрузки расходов сообщает о 753 млн токенов за 25 дней и большой доле чтения кэша в Claude Code. У публикации есть реферальная ссылка. Это полезный пример структуры расхода, но его объём работы и подписка не предсказывают счёт другого пользователя. Первичное обсуждение.
Работа на русском языке
Полноценного слепого теста этой точной версии на русской редактуре в проверенных источниках нет. Русскоязычный комментарий о коде не оценивает склонения, деловой тон или точность пересказа. До внедрения проверьте письма клиентам, сокращение текста и извлечение реквизитов.
Сохраните исходные задания и ответы. Попросите редактора оценить их без названия модели: смысл, фактические ошибки, естественность речи и объём ручных исправлений. Ниже есть запросы для такого пилота; это не выдуманные результаты запуска.
Примеры и задачи для проверки
Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.
Русское письмо без выдуманных обещанийЗапрос для самостоятельной проверки
Запрос
Перепиши письмо клиенту простым деловым русским языком, до 80 слов. Не добавляй новых фактов и обещаний. Сохрани дату и причину задержки. Исходник: «В связи с необходимостью проведения дополнительной проверки сообщаем, что макет будет направлен 18 сентября. Задержка связана с проверкой мобильной версии. Стоимость не меняется».
Как оценить результат
Должны сохраниться 18 сентября, проверка мобильной версии и неизменная стоимость. Не должно появиться скидки, оправданий или гарантии, которой нет в исходнике.
Извлечение данных с проверяемым ответомЗапрос для самостоятельной проверки
Запрос
Верни только JSON с полями amount, currency, due_date и contract_id. Неизвестное значение обозначь null. Текст: «Оплатить 12 500 рублей до 20.09.2026. Номер договора в письме не указан». Не придумывай номер договора.
Как оценить результат
Ожидаются amount 12500, currency RUB, due_date 2026-09-20 и contract_id null. Проверьте JSON парсером. Это заданный критерий, не записанный ответ модели.
Проверка рабочего кодаЗапрос для самостоятельной проверки
Запрос
Прочитай приложенные файлы проекта и воспроизведение ошибки. Сначала назови вероятную причину и недостающие сведения. Затем предложи минимальную правку и способ проверить её. Не заменяй реальные API заглушками и не меняй несвязанные файлы.
Как оценить результат
Используйте тестовую копию репозитория. Сравните диагноз с воспроизведением, проверьте diff и сборку. Не выдавайте успешный текстовый ответ за прошедший тест.
Локальный запуск
Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.
Unsloth указывает 128 ГБ для файла UD-IQ1_M и минимум около 133 ГБ памяти с небольшим запасом. Рекомендуемый в руководстве UD-IQ3_XXS занимает 159 ГБ. UD-IQ4_XS занимает 208 ГБ, а UD-Q4_K_XL 265 ГБ. Поэтому «4 бита» без имени кванта недостаточно для выбора компьютера.
Как рассчитать память: KV-кэш, буферы и запас
Объём весов на диске не равен полной памяти процесса. Добавьте KV-кэш для выбранного контекста, рабочие буферы, память ОС и запас. В MoE неиспользуемые на текущем токене эксперты всё равно нужно где-то хранить. RAM и VRAM нельзя механически складывать, если runtime не поддерживает нужный offload.
Скорость по опубликованным тестам
AA публикует 92.1 токена/с и TTFT 1.9 с для MiniMax M3 (режим из карточки AA). Источник и методика.
Это внешний замер API. Генерация после начала потока не равна времени до готового ответа. Ожидание, рассуждение, инструменты и повторы могут занимать больше времени. Эти значения не используются как обещание скорости Mac Studio, ПК или DGX Spark.
Конфигурации, скорость и инструкции
Практический старт: 256 ГБUD-IQ3_XXSНет замера для этого профиляРасчётная оценка
- Квантизация
- UD-IQ3_XXS
- Контекст
- Начните с 8 192 токенов; это выбранный старт пилота
- Среда и версия
- llama.cpp с поддержкой M3 / Unsloth
- RAM
- 256 ГБ; файл около 159 ГБ
- Накопитель
- 200 ГБ свободно, оценка
- Одновременные запросы
- Один запрос
- Скорость и единица
- Для этой полной конфигурации воспроизводимый замер не подтверждён
- Условия теста / ограничения
- В руководстве отмечено отсутствие MSA в рассматриваемом пути llama.cpp. Длинный контекст потребляет больше памяти; начинайте с малого.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
- Установите совместимую сборку runtime по источнику.
- Скачайте все части указанной квантизации.
- Начните с короткого контекста и проверьте фактическую память и корректность ответа.
- Увеличивайте нагрузку только после успешной проверки.
Более качественный квант: 512 ГБUD-Q4_K_XLНет замера для этого профиляРасчётная оценка
- Квантизация
- UD-Q4_K_XL
- Контекст
- Начните с 8 192 токенов; это выбранный старт пилота
- Среда и версия
- Совместимая сборка llama.cpp
- RAM
- 512 ГБ; файл около 265 ГБ
- Накопитель
- 350 ГБ свободно, оценка
- Одновременные запросы
- Один запрос
- Скорость и единица
- Для этой полной конфигурации воспроизводимый замер не подтверждён
- Условия теста / ограничения
- Расчётная рекомендация с запасом. Ни скорость, ни полный контекст на этом компьютере редакцией не измерены.
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
- Установите совместимую сборку runtime по источнику.
- Скачайте все части указанной квантизации.
- Начните с короткого контекста и проверьте фактическую память и корректность ответа.
- Увеличивайте нагрузку только после успешной проверки.
Покупка и наличие
Mac Studio 256 или 512 ГБ соответствует классу памяти этих профилей. Один DGX Spark 128 ГБ меньше опубликованного минимального ориентира. ПК с большим объёмом RAM и частичным GPU offload возможен, но скорость придётся измерять отдельно.
Как выбирать оборудование и проверять цены
До оплаты попросите показать точную конфигурацию, ОС, версию runtime, имя кванта и контекст. Замерьте короткий и длинный запрос, затем несколько одновременных. Цена компьютера и наличие в России зависят от комплектации и поставщика; неподтверждённая цена не публикуется.
API и стоимость
| Standard / указанный источник, USD за 1 млн токенов | Цена |
|---|---|
| Вход без кэша | $0.3 |
| Выход | $1.2 |
| Чтение кэша | $0.06 |
При контексте до 512K тариф $0,30 / $1,20, кэш $0,06. В диапазоне 512K–1M: $0,60 / $2,40, кэш $0,12. Это Standard API. Подписка Token Plan имеет собственный общий бюджет и ограничения одновременных агентов. Источник цены.
Пример бюджета
10 000 входных и 2 000 оплачиваемых выходных токенов без кэша стоят $0.0054 по указанным базовым ставкам. Тысяча таких запросов: $5.4. Это арифметический пример, не замер расхода агента.
В рабочем бюджете учитывайте все попытки, токены рассуждения, инструменты и повышенные тарифы. Сохраняйте usage из API. Для повторяющихся задач считайте стоимость принятого результата, а не только цену миллиона токенов.
Подходит ли российской компании?
Собственное размещение позволяет построить обработку внутри инфраструктуры компании. Но пригодность MiniMax M3 определяется лицензией, оборудованием и всей схемой передачи данных, а не одним словом «локально».
Где будут обрабатываться данные
Проверьте исходящие подключения runtime, телеметрию, журналирование, резервные копии и внешние инструменты агента. Локальная модель с облачным поиском или удалённым MCP всё ещё может передавать данные наружу.
Для пилота используйте синтетические данные. Перед рабочим запуском зафиксируйте схему движения данных и ответственного за проверку. Не считайте наличие посредника подтверждением официальной доступности в России.
Российское законодательство: что учесть
Проверяйте применимость требований к локализации и трансграничной передаче: 152-ФЗ, статьи 18 и 12.
Для коммерческого использования лицензия требует атрибуцию Built with MiniMax M3 и разовое уведомление. При годовой выручке соответствующих продуктов и услуг свыше $20 млн нужно предварительное письменное разрешение. Определение Commercial Use широкое; перед внедрением проверьте его полностью. Полный текст лицензии.
Что проверить до рабочего запуска
Возьмите небольшой набор характерных задач и заранее определите условия приёмки. В журнале сохраняйте точную модель, дату, настройки, время и расход. Проверьте удаление тестовых данных и отказ внешнего сервиса. Для русского текста оцените, сколько правок требуется редактору. Для кода обязательны сборка и ревью.
Технические характеристики
Паспорт модели · все 18 параметров
| Разработчик | MiniMax |
|---|---|
| Точная версия | MiniMax M3 |
| Тип модели | Текстовая модель |
| Доступность весов | Открытые веса |
| Лицензия | MiniMax Community License |
| Всего параметров | 428 млрд |
| Активных параметров (MoE) | 23 млрд |
| Архитектура | MoE |
| Контекстное окно | 1 048 576 в весах; API до 1 млн токенов |
| Максимальный вывод | Не подтверждён единый предел |
| Модальности | Текст, изображения, видео → текст |
| Работа с инструментами | Вызов инструментов; зависит от клиента и шаблона |
| Цена API и единица тарификации | $0.3 / $1.2 за 1 млн токенов; условия ниже |
| Подписка | Отдельные планы сервиса; API оплачивается отдельно |
| Дата выпуска | 01.06.2026 |
| Форматы весов | BF16; сторонние GGUF |
| Среды запуска | SGLang, vLLM; llama.cpp с поддержкой M3 |
| Региональная доступность | Проверяйте условия поставщика и схему обработки данных; подробнее в разделе для РФ |
Устройство модели · архитектура
Около 428 млрд параметров, 23 млрд активных, MoE и MiniMax Sparse Attention. Поддерживаются текст, изображения и видео на входе. Выход текстовый; генераторы видео MiniMax являются отдельными моделями.
Вопросы и источники
Можно ли использовать MiniMax M3 без интернета?
Да, если веса и совместимая среда установлены в собственном контуре, а внешние инструменты отключены. Требования и ограничения перечислены в локальном разделе.
Большой контекст гарантирует точный ответ?
Нет. Окно задаёт вместимость запроса. Проверяйте поиск деталей, отсутствие домыслов и ссылки на исходные фрагменты.
Это личный тест Фабио?
Это обзор документации, независимых измерений и доступных первичных отзывов. Собственные аппаратные замеры и личное мнение не добавлены без фактического испытания.
Как сравнить с уже опубликованной моделью?
Выберите вторую модель в форме сравнения. Таблица сопоставит паспорта; итоговый выбор сделайте по своим заданиям, тарифу и условиям размещения.
Источники данных
- Паспорт модели и описание возможностейhuggingface.co
- Artificial Analysis: режим и измерения, снимок 12.09.2026artificialanalysis.ai
- Источник тарифа, проверено 12.09.2026platform.minimax.io
- Первичный пользовательский опыт; субъективная оценкаwww.reddit.com
- Локальное размещение и ограничения runtimeunsloth.ai
- Лицензия: коммерческие условияhuggingface.co
- 152-ФЗ: действующая редакция, проверьте применимостьwww.consultant.ru