Изучаю и тестирую нейросети более 2 лет. Основатель Shtruzel — помогаю разобраться в мире ИИ простым языком.
Комментариев пока нет. Будьте первым!
| блок 256 токенов параллельно |
| Память (в квантованном виде) | ~18 ГБ VRAM |
| Лицензия | Apache 2.0 (открытая, можно в коммерции) |
| Основа | семейство Gemma 4 + исследование Gemini Diffusion |
| Где лежат веса | Hugging Face (google/diffusiongemma-26B-A4B-it) |
Благодаря MoE-архитектуре из 26 млрд параметров на каждом шаге работают только 3,8 млрд — поэтому в квантованном виде модель помещается в 18 ГБ видеопамяти топовых потребительских видеокарт.
Главная цифра релиза — скорость. Вот честное сравнение диффузионной модели с её же «классическим» ровесником Gemma 4 26B (данные из бенчмарков Google и Nvidia):
| Что меряем | DiffusionGemma 26B | Gemma 4 26B (обычная) |
|---|---|---|
| Подход | диффузия, блок сразу | токен за токеном |
| Скорость на H100 | ~1107 ток/сек | ~303 ток/сек |
| Во сколько быстрее | ~3,5–4× | базовая |
| Качество (тесты MMLU Pro, GPQA, AIME, код) | ниже | выше |
| Сильна в | вставка текста, инфиллинг кода, нелинейные задачи | общее качество, продакшн |
А вот скорость на разном железе — чтобы понять, на чём её реально гонять:
| Железо | Скорость генерации |
|---|---|
| NVIDIA H100 (сервер) | ~1000 ток/сек |
| NVIDIA RTX 5090 (домашняя) | 700+ ток/сек |
| NVIDIA DGX Station | до 800 ток/сек |
| NVIDIA DGX Spark (мини-ПК) | ~150 ток/сек |

Главная фишка — модель видит весь блок целиком, а не только то, что слева. Каждый токен «смотрит» на все остальные, включая те, что идут после него (двунаправленное внимание). Классические модели так не умеют. Отсюда сильные стороны:
Сразу честно: это не «открыл сайт и пользуешься». Нужна видеокарта или облако. Вот три реальных пути:
1. Локально на своей видеокарте. Нужна NVIDIA с ~18+ ГБ VRAM (RTX 4090/5090 — Nvidia уже сделала под них квантованные версии). Веса берёте с Hugging Face, запускаете через один из инструментов:
| 1 | # модель на Hugging Face: |
| 2 | google/diffusiongemma-26B-A4B-it |
| 3 | |
| 4 | # поддерживается из коробки: |
| 5 | # - Hugging Face Transformers |
| 6 | # - vLLM(с интеграцией от Red Hat) |
| 7 | # - MLX(для Mac на Apple Silicon) |
| 8 | # llama.cpp — обещают поддержку «скоро» |
🖥️ Для владельцев Mac: на Apple Silicon модель тоже пойдёт через MLX, но прироста в 4 раза не ждите. Из-за архитектуры с общей памятью Mac упирается в пропускную способность памяти, и разрыв с обычными моделями будет меньше.
2. Через облако. Модель доступна в Gemini Enterprise Agent Platform Model Garden и через NVIDIA NIM — если своей мощной видеокарты нет.
3. Дообучить под себя. Для файнтюна Google выпустила JAX-инструмент Hackable Diffusion, плюс поддержка есть в Unsloth и NVIDIA NeMo.
Точные команды и код — в официальном гайде разработчика DiffusionGemma. Из РФ для скачивания весов с Hugging Face может понадобиться VPN.
И да, и нет. Сама идея диффузии для текста в исследованиях не нова, но применить её к большим моделям долго не удавалось. Раньше Google показывала демо Gemini Diffusion, а стартап Inception в начале 2026 года выпустил Mercury 2 — первую, по их словам, диффузионную модель с рассуждениями. Но DiffusionGemma — первая такая модель с открытыми весами от Google, которую может скачать каждый. В этом её ценность.
Что такое DiffusionGemma простыми словами? Это открытая нейросеть Google, которая генерирует текст методом диффузии — не слово за словом, а целым блоком из 256 токенов, «проявляя» его из случайного шума. За счёт этого она до 4 раз быстрее на видеокарте.
Чем DiffusionGemma отличается от обычной Gemma 4? Скоростью и подходом: диффужнгемма быстрее в 3,5–4 раза, но качество ответов ниже. Обычную Gemma 4 Google советует там, где важно качество, а DiffusionGemma — для быстрых интерактивных задач и вставки текста.
Где скачать DiffusionGemma и сколько стоит? Веса бесплатны и лежат на Hugging Face под лицензией Apache 2.0 (модель google/diffusiongemma-26B-A4B-it). Платить не нужно, но из России для скачивания может понадобиться VPN.
Какая видеокарта нужна для DiffusionGemma? В квантованном виде модель помещается в ~18 ГБ видеопамяти — то есть нужна топовая NVIDIA вроде RTX 4090 или 5090. Без своей видеокарты можно запустить в облаке через Model Garden или NVIDIA NIM.
Можно ли использовать DiffusionGemma в коммерческих проектах? Да. Лицензия Apache 2.0 разрешает коммерческое использование, что для открытой модели большой плюс.
DiffusionGemma лучше ChatGPT? Нет, это не конкурент ChatGPT по качеству. Это экспериментальный инструмент про скорость и локальный запуск. Для обычных вопросов качество ответов у неё ниже.
Источники:
google/diffusiongemma-26B-A4B-itStable Diffusion 3.5 — последняя официальная версия SD. Разбираю без хайпа: что нового против SDXL, чем отличаются Large и Medium, сколько нужно видеопамяти и кому реально стоит переходить в 2026.
FLUX — один из лучших генераторов картинок: фотореализм и связный текст на изображении. Разбираем, что это, чем версии Schnell, Dev, Pro и новая FLUX.2 отличаются, как пользоваться бесплатно из России и почему официального сайта-кнопки у FLUX нет.
Сравнили DeepSeek и ChatGPT по актуальным данным 2026: DeepSeek V4 против GPT-5.5. Где больше бесплатного, кто умнее, что работает в России без VPN и за что всё-таки придётся платить. Без воды и устаревших цифр.