ОБЗОР AI-МОДЕЛИ

Gemma 4 12B

Возможности, стоимость и компьютер для локального запуска

Открытая модель Google для локального ассистента, обработки документов и текстовых задач. Вариант 12B можно рассмотреть для компьютера с ограниченной памятью; размер контекста и число запросов заметно влияют на требования.

Фабио Де Лука · Проверено 04.10.2026 · Релиз 03.06.2026

Разработчик
Google DeepMind
Параметры
11.95 млрд
Лицензия
Apache 2.0
Вход → выход
Текст, изображения, аудио и видео на входе; текст на выходе
Контекст
256K токенов по паспорту
API · вход / выход
Единого тарифа API для весов нет; зависит от размещения
На этой странице

Кому подходит

ВЫБОР ПО ЗАДАЧЕ

Где стоит попробовать модель

По документации · проверьте на своих данных
Русские рабочие текстыС условиями

Проверяемый исходник и понятные критерии помогут оценить модель на задаче вашей команды.

Что проверить: Сравните смысл, факты и объём ручных исправлений.

Основание оценки ↗
Работа без внешнего APIС условиями

Доступны веса для собственного размещения.

Что проверить: Проверьте оборудование, лицензию и исходящие подключения.

Основание оценки ↗

Сравнить с другой моделью

Характеристики и конфигурации рядом, в одной таблице.

Gemma 4 12B полезно рассмотреть для ассистента, которому нужно работать с внутренними материалами без отправки запросов во внешний API. Здесь важны управляемость данных и возможность подобрать размер модели под оборудование.

Начните с коротких текстов и одного запроса одновременно. Затем увеличивайте документы и нагрузку. Так будет видно, где не хватает качества, а где памяти или времени.

Другие версии: что нельзя смешивать

Для диалога рассматривается google/gemma-4-12B-it. Суффикс it обозначает вариант, обученный следовать инструкциям. Предварительно обученные веса, 26B A4B и 31B имеют другие свойства. Gemma и Gemini также нельзя смешивать: у Gemma доступны веса, у рассматриваемых Gemini только облачный сервис.

Качество и возможности

12B принимает текст и мультимодальные материалы, но генерирует текст. В этом обзоре основной сценарий: письма, краткие ответы по документам и извлечение полей. Генерации изображений здесь нет.

Для внутренней базы знаний нужно добавить поиск по источникам. Попросите ассистента указывать фрагмент, на который он опирается, и отвечать «в источнике не найдено», когда подходящего текста нет.

Результаты тестов

Google публикует тесты семейства в карточке модели. У разных размеров отдельные столбцы и условия. Результат 31B нельзя приписывать 12B. Аппаратную скорость и отдельный балл русской деловой речи без замера в этой статье не указываем. Карточка и методика оценок.

Независимые проверки

Отдельный сопоставимый тест этой версии на русских деловых текстах в изученных источниках не найден. Для пилота возьмите письма клиентам, выдержки из регламентов и договоров. Попросите редактора проверить сохранение смысла, естественность речи и количество ручных исправлений, не показывая название модели.

Этот обзор составлен по документации. Собственные ответы модели и аппаратные замеры здесь не выдаются за проведённый тест.

ПРАКТИКА

Примеры и задачи для проверки

Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.

Ответ только по регламентуЗапрос для самостоятельной проверки

Запрос

Ответь на вопрос сотрудника, используя только приложенный регламент. Назови пункт и короткую цитату. Если ответа нет, скажи «В регламенте не найдено». Не придумывай правило.

Как оценить результат

Сверьте цитату и пункт. На вопрос без ответа ассистент должен сообщить об отсутствии данных.

Это тестовый запрос, не опубликованный результат запуска модели.

Извлечение реквизитовЗапрос для самостоятельной проверки

Запрос

Верни JSON с amount, currency и contract_id. Исходник: «К оплате 12 500 рублей. Номер договора не указан». Для неизвестного поля используй null. Никаких пояснений.

Как оценить результат

Проверьте JSON парсером: amount 12500, currency RUB, contract_id null. Это критерий приёмки, а не сохранённый ответ.

Это тестовый запрос, не опубликованный результат запуска модели.

Локальный запуск

Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.

Разработчик описывает запуск на ноутбуке с 16 ГБ памяти. Это ориентир для компактного режима, а не обещание полного контекста 256K. Конкретный расход зависит от формата весов, runtime, кэша и входных материалов.

В документации приведены примерные объёмы загрузки: BF16 26.7 ГБ, SFP8 13.4 ГБ, Q4_0 6.7 ГБ. В этих оценках есть 20% накладных расходов загрузки. Дополнительный расход длинного контекста и параллельных сессий нужно проверять отдельно. Таблица Google.

Как рассчитать память: KV-кэш, буферы и запас

Установите совместимый runtime и загрузите точную инструкционную версию. Сохраните имя файла, квантизацию и версию программы. Проверьте сначала один короткий запрос, затем ваш обычный документ.

Оценки памяти в таблице описывают загрузку. Они не доказывают, что на том же устройстве поместится контекст максимального размера. Для полного рабочего сценария оставьте запас системе и измерьте пик потребления.

Конфигурации, скорость и инструкции

Откройте строку для всех условий. Если измерений нет, скорость не заявляется.

Компактный локальный пилот по ориентиру GoogleКвантизованная версия; точный формат сверить с runtimeНет замера для этого профиляПодтверждено источником
Квантизация
Квантизованная версия; точный формат сверить с runtime
Контекст
Короткий текстовый запрос; полный 256K не обещается
Среда и версия
Совместимый runtime с поддержкой Gemma 4 12B
Объединённая память
16 ГБ: ориентир разработчика для ноутбука, не универсальный минимум
Условия теста / ограничения
Один запрос; измерить запас памяти и пик на своих документах

Скорость и условия измерения

Генерация
Нет замера для этого профиля

Длина входа в измерении отличается от максимального контекста конфигурации. Подтверждение запуска не является тестом скорости.

Инструкция запуска

Загрузите инструкционный вариант Gemma 4 12B в совместимой среде. Начните с одного короткого текстового запроса. Сохраните точный формат весов и настройки, измерьте расход памяти, затем проверьте рабочие документы. Этот ориентир не используется как гарантированный результат аппаратного теста.

API и стоимость

У открытых весов нет единой цены за миллион токенов. При собственном запуске расходы складываются из оборудования или аренды, электричества и обслуживания. Разрешение скачать модель не делает инфраструктуру бесплатной.

Если используете сторонний API, проверьте точную версию и тариф поставщика. Не переносите цену Gemini на Gemma. Для расчёта проекта полезнее стоимость принятого документа или часа обработки при вашей нагрузке.

Подходит ли российской компании?

Gemma 4 12B можно разместить внутри компании или на выбранном сервере в России. Лицензия Apache 2.0 допускает использование с соблюдением своих условий. Для коммерческого продукта отдельно проверьте все компоненты приложения и работу с данными клиентов.

Где будут обрабатываться данные

При собственном размещении запросы могут оставаться внутри выбранной инфраструктуры. Для этого отключите ненужную телеметрию и проверьте поиск, плагины, журналы и резервные копии: каждый из них может обращаться к внешнему сервису.

Лицензия разрешает определённые способы использования весов, но сама по себе не подтверждает соблюдение требований к данным клиентов. Зафиксируйте, кто имеет доступ к запросам и где хранится история.

Что проверить до рабочего запуска

Заранее задайте критерии приёмки: какие факты должны сохраниться, какие действия разрешены и когда нужна помощь человека. Сохраняйте точный идентификатор модели, настройки, расход и время до принятого результата. Проверьте также отказ сервиса, повторный запрос и удаление тестовой истории.

Технические характеристики

Паспорт модели · все 18 параметров
РазработчикGoogle DeepMind
Точная версияGemma 4 12B
Тип моделиТекстовая модель
Доступность весовОткрытые веса; инструкция и предварительно обученные варианты
ЛицензияApache 2.0
Всего параметров11.95 млрд
Активных параметров (MoE)Плотная модель; MoE не используется
АрхитектураDense, 48 слоёв; гибрид локального и глобального внимания
Контекстное окно256K токенов по паспорту
Максимальный выводЗадаётся средой; отдельный предел не подтверждён
МодальностиТекст, изображения, аудио и видео на входе; текст на выходе
Работа с инструментамиНативная поддержка вызова функций; исполнение в приложении
Цена API и единица тарификацииЕдиного тарифа API для весов нет; зависит от размещения
ПодпискаЗа собственный запуск нет тарифа Google за токены; инфраструктура оплачивается отдельно
Дата выпуска03.06.2026
Форматы весовSafetensors; совместимые квантизованные варианты отдельно
Среды запускаTransformers; совместимые llama.cpp, MLX, vLLM и другие среды
Региональная доступностьМожно размещать на собственной инфраструктуре с соблюдением лицензии
Устройство модели · архитектура

12B Unified содержит 11.95 млрд параметров и 48 слоёв. Модель использует локальное и глобальное внимание; для обработки визуального и аудиовхода у 12B нет отдельных внешних энкодеров. Контекст по паспорту 256K. Архитектура точной версии.

Вопросы и источники

Достаточно ли 16 ГБ для любой задачи?

Нет. Размер весов, длина запроса и число сессий меняют расход. Ориентир разработчика нужно проверить на вашем формате и нагрузке.

Нужен ли интернет после установки?

Для вычислений с локальными весами внешний API не нужен. Но поиск, телеметрия и инструменты приложения могут использовать сеть.

Можно ли считать рейтинг гарантией качества?

Нет. Сравните модели на одинаковых заданиях, с одинаковыми инструментами и лимитами. Для текстов считайте объём редакторской правки, для кода проверяйте сборку и тесты.

Как сопоставить с другой моделью?

Выберите две модели в каталоге. Таблица сравнения покажет их характеристики и условия доступа. Для окончательного выбора понадобится короткий пилот на ваших задачах.

Источники данных

Дата проверки относится к источникам, а не к испытанию оборудования.

  1. Официальный выпуск 12Bblog.google
  2. Карточка точного checkpointhuggingface.co
  3. Память и размеры моделейai.google.dev
  4. История выпусков Gemmaai.google.dev
  5. Лицензия Apache 2.0ai.google.dev

Расскажите о задаче

Начнём с короткого разговора

Оставьте имя и телефон — мы свяжемся с вами и уточним детали.

Форма защищена Yandex SmartCaptcha. Сервис обрабатывает технические данные для защиты от автоматических отправок.

Фабио Де Лука · AI

AI-ассистент

Расскажите, что вы хотите улучшить или автоматизировать. Я отвечу по услугам, ценам и AI-интеграциям.