ОБЗОР AI-МОДЕЛИ
Gemma 4 12B
Возможности, стоимость и компьютер для локального запуска
Открытая модель Google для локального ассистента, обработки документов и текстовых задач. Вариант 12B можно рассмотреть для компьютера с ограниченной памятью; размер контекста и число запросов заметно влияют на требования.
- Разработчик
- Google DeepMind
- Параметры
- 11.95 млрд
- Лицензия
- Apache 2.0
- Вход → выход
- Текст, изображения, аудио и видео на входе; текст на выходе
- Контекст
- 256K токенов по паспорту
- API · вход / выход
- Единого тарифа API для весов нет; зависит от размещения
На этой странице
Кому подходит
Где стоит попробовать модель
Русские рабочие текстыС условиями
Проверяемый исходник и понятные критерии помогут оценить модель на задаче вашей команды.
Что проверить: Сравните смысл, факты и объём ручных исправлений.
Основание оценки ↗Работа без внешнего APIС условиями
Доступны веса для собственного размещения.
Что проверить: Проверьте оборудование, лицензию и исходящие подключения.
Основание оценки ↗Сравнить с другой моделью
Gemma 4 12B полезно рассмотреть для ассистента, которому нужно работать с внутренними материалами без отправки запросов во внешний API. Здесь важны управляемость данных и возможность подобрать размер модели под оборудование.
Начните с коротких текстов и одного запроса одновременно. Затем увеличивайте документы и нагрузку. Так будет видно, где не хватает качества, а где памяти или времени.
Другие версии: что нельзя смешивать
Для диалога рассматривается google/gemma-4-12B-it. Суффикс it обозначает вариант, обученный следовать инструкциям. Предварительно обученные веса, 26B A4B и 31B имеют другие свойства. Gemma и Gemini также нельзя смешивать: у Gemma доступны веса, у рассматриваемых Gemini только облачный сервис.
Качество и возможности
12B принимает текст и мультимодальные материалы, но генерирует текст. В этом обзоре основной сценарий: письма, краткие ответы по документам и извлечение полей. Генерации изображений здесь нет.
Для внутренней базы знаний нужно добавить поиск по источникам. Попросите ассистента указывать фрагмент, на который он опирается, и отвечать «в источнике не найдено», когда подходящего текста нет.
Результаты тестов
Google публикует тесты семейства в карточке модели. У разных размеров отдельные столбцы и условия. Результат 31B нельзя приписывать 12B. Аппаратную скорость и отдельный балл русской деловой речи без замера в этой статье не указываем. Карточка и методика оценок.
Независимые проверки
Отдельный сопоставимый тест этой версии на русских деловых текстах в изученных источниках не найден. Для пилота возьмите письма клиентам, выдержки из регламентов и договоров. Попросите редактора проверить сохранение смысла, естественность речи и количество ручных исправлений, не показывая название модели.
Этот обзор составлен по документации. Собственные ответы модели и аппаратные замеры здесь не выдаются за проведённый тест.
Примеры и задачи для проверки
Опубликованные результаты, проекты авторов и тестовые запросы отмечены отдельно.
Ответ только по регламентуЗапрос для самостоятельной проверки
Запрос
Ответь на вопрос сотрудника, используя только приложенный регламент. Назови пункт и короткую цитату. Если ответа нет, скажи «В регламенте не найдено». Не придумывай правило.
Как оценить результат
Сверьте цитату и пункт. На вопрос без ответа ассистент должен сообщить об отсутствии данных.
Извлечение реквизитовЗапрос для самостоятельной проверки
Запрос
Верни JSON с amount, currency и contract_id. Исходник: «К оплате 12 500 рублей. Номер договора не указан». Для неизвестного поля используй null. Никаких пояснений.
Как оценить результат
Проверьте JSON парсером: amount 12500, currency RUB, contract_id null. Это критерий приёмки, а не сохранённый ответ.
Локальный запуск
Требования относятся к конкретному формату, контексту и среде. RAM, VRAM и общая память не взаимозаменяемы.
Разработчик описывает запуск на ноутбуке с 16 ГБ памяти. Это ориентир для компактного режима, а не обещание полного контекста 256K. Конкретный расход зависит от формата весов, runtime, кэша и входных материалов.
В документации приведены примерные объёмы загрузки: BF16 26.7 ГБ, SFP8 13.4 ГБ, Q4_0 6.7 ГБ. В этих оценках есть 20% накладных расходов загрузки. Дополнительный расход длинного контекста и параллельных сессий нужно проверять отдельно. Таблица Google.
Как рассчитать память: KV-кэш, буферы и запас
Установите совместимый runtime и загрузите точную инструкционную версию. Сохраните имя файла, квантизацию и версию программы. Проверьте сначала один короткий запрос, затем ваш обычный документ.
Оценки памяти в таблице описывают загрузку. Они не доказывают, что на том же устройстве поместится контекст максимального размера. Для полного рабочего сценария оставьте запас системе и измерьте пик потребления.
Конфигурации, скорость и инструкции
Компактный локальный пилот по ориентиру GoogleКвантизованная версия; точный формат сверить с runtimeНет замера для этого профиляПодтверждено источником
- Квантизация
- Квантизованная версия; точный формат сверить с runtime
- Контекст
- Короткий текстовый запрос; полный 256K не обещается
- Среда и версия
- Совместимый runtime с поддержкой Gemma 4 12B
- Объединённая память
- 16 ГБ: ориентир разработчика для ноутбука, не универсальный минимум
- Условия теста / ограничения
- Один запрос; измерить запас памяти и пик на своих документах
Скорость и условия измерения
- Генерация
- Нет замера для этого профиля
Инструкция запуска
Загрузите инструкционный вариант Gemma 4 12B в совместимой среде. Начните с одного короткого текстового запроса. Сохраните точный формат весов и настройки, измерьте расход памяти, затем проверьте рабочие документы. Этот ориентир не используется как гарантированный результат аппаратного теста.
API и стоимость
У открытых весов нет единой цены за миллион токенов. При собственном запуске расходы складываются из оборудования или аренды, электричества и обслуживания. Разрешение скачать модель не делает инфраструктуру бесплатной.
Если используете сторонний API, проверьте точную версию и тариф поставщика. Не переносите цену Gemini на Gemma. Для расчёта проекта полезнее стоимость принятого документа или часа обработки при вашей нагрузке.
Подходит ли российской компании?
Gemma 4 12B можно разместить внутри компании или на выбранном сервере в России. Лицензия Apache 2.0 допускает использование с соблюдением своих условий. Для коммерческого продукта отдельно проверьте все компоненты приложения и работу с данными клиентов.
Где будут обрабатываться данные
При собственном размещении запросы могут оставаться внутри выбранной инфраструктуры. Для этого отключите ненужную телеметрию и проверьте поиск, плагины, журналы и резервные копии: каждый из них может обращаться к внешнему сервису.
Лицензия разрешает определённые способы использования весов, но сама по себе не подтверждает соблюдение требований к данным клиентов. Зафиксируйте, кто имеет доступ к запросам и где хранится история.
Что проверить до рабочего запуска
Заранее задайте критерии приёмки: какие факты должны сохраниться, какие действия разрешены и когда нужна помощь человека. Сохраняйте точный идентификатор модели, настройки, расход и время до принятого результата. Проверьте также отказ сервиса, повторный запрос и удаление тестовой истории.
Технические характеристики
Паспорт модели · все 18 параметров
| Разработчик | Google DeepMind |
|---|---|
| Точная версия | Gemma 4 12B |
| Тип модели | Текстовая модель |
| Доступность весов | Открытые веса; инструкция и предварительно обученные варианты |
| Лицензия | Apache 2.0 |
| Всего параметров | 11.95 млрд |
| Активных параметров (MoE) | Плотная модель; MoE не используется |
| Архитектура | Dense, 48 слоёв; гибрид локального и глобального внимания |
| Контекстное окно | 256K токенов по паспорту |
| Максимальный вывод | Задаётся средой; отдельный предел не подтверждён |
| Модальности | Текст, изображения, аудио и видео на входе; текст на выходе |
| Работа с инструментами | Нативная поддержка вызова функций; исполнение в приложении |
| Цена API и единица тарификации | Единого тарифа API для весов нет; зависит от размещения |
| Подписка | За собственный запуск нет тарифа Google за токены; инфраструктура оплачивается отдельно |
| Дата выпуска | 03.06.2026 |
| Форматы весов | Safetensors; совместимые квантизованные варианты отдельно |
| Среды запуска | Transformers; совместимые llama.cpp, MLX, vLLM и другие среды |
| Региональная доступность | Можно размещать на собственной инфраструктуре с соблюдением лицензии |
Устройство модели · архитектура
12B Unified содержит 11.95 млрд параметров и 48 слоёв. Модель использует локальное и глобальное внимание; для обработки визуального и аудиовхода у 12B нет отдельных внешних энкодеров. Контекст по паспорту 256K. Архитектура точной версии.
Вопросы и источники
Достаточно ли 16 ГБ для любой задачи?
Нет. Размер весов, длина запроса и число сессий меняют расход. Ориентир разработчика нужно проверить на вашем формате и нагрузке.
Нужен ли интернет после установки?
Для вычислений с локальными весами внешний API не нужен. Но поиск, телеметрия и инструменты приложения могут использовать сеть.
Можно ли считать рейтинг гарантией качества?
Нет. Сравните модели на одинаковых заданиях, с одинаковыми инструментами и лимитами. Для текстов считайте объём редакторской правки, для кода проверяйте сборку и тесты.
Как сопоставить с другой моделью?
Выберите две модели в каталоге. Таблица сравнения покажет их характеристики и условия доступа. Для окончательного выбора понадобится короткий пилот на ваших задачах.
Источники данных
- Официальный выпуск 12Bblog.google
- Карточка точного checkpointhuggingface.co
- Память и размеры моделейai.google.dev
- История выпусков Gemmaai.google.dev
- Лицензия Apache 2.0ai.google.dev