Google представила DiffusionGemma: новую модель, генерирующую текст в четыре раза быстрее
Google разработала и представила экспериментальную модель с открытым исходным кодом DiffusionGemma, способную создавать целые текстовые фрагменты одновременно, используя технику диффузии. Это позволяет значительно ускорить процесс генерации текста – до четырёх раз быстрее, чем у традиционных авторегрессивных моделей.
Решение проблемы последовательной обработки
Современные мощные крупные языковые модели (КЯМ) до сих пор работают по принципу “пишущей машинки”, обрабатывая информацию последовательно, слева направо. Такая линейная обработка может приводить к недоиспользованию ресурсов графических (GPU) и тензорных (TPU) процессоров, особенно в сценариях локального использования одним пользователем.
В Google убеждены, что DiffusionGemma способен обойти это узкое место. Новая экспериментальная модель генерирует текст “исключительно быстро”, создавая целые блоки текста одновременно благодаря методам диффузии, а не поочередной обработке токенов (неделимых единиц текста). По заявлению компании, такой подход обеспечивает до четырёхкратного ускорения инференса (процесса получения вывода модели) по сравнению с авторегрессивными моделями.
По словам технологического аналитика Карми Леви, DiffusionGemma также может помочь пользователям экономить средства. Он отметил, что существующие модели монетизации с оплатой за токены “наказывают за использование менее эффективных ИИ-решений”. Леви считает, что DiffusionGemma “может предвещать новое поколение эффективных решений, ориентированных на конкретные задачи, которые позволят расширить вычислительные возможности без истощения операционного бюджета”.
Принцип работы и преимущества
Модель DiffusionGemma построена на основе семейства Google Gemma 4 и исследованиях Gemini Diffusion. Это модель с архитектурой “смесь экспертов” (MoE) и 26 миллиардами параметров, разработанная для максимального ускорения генерации текстового вывода.
По сути, она меняет подход моделей к использованию аппаратного обеспечения, предоставляя процессорам больший объем работы за каждый цикл. Это позволяет ей создавать целые абзацы из 256 токенов за раз. По данным Google, такой подход позволяет модели генерировать текст до четырёх раз быстрее на GPU. В процессе инференса активируется только 3,8 миллиарда параметров, и при квантовании модель может поместиться в 18 ГБ видеопамяти на высокопроизводительных потребительских GPU, таких как Nvidia RTX 5090.
“Она превращает инференс вашей модели из одиночной, последовательной пишущей машинки в огромный печатный станок, который штампует весь текстовый блок одновременно”, — написали в блоге исследователи Google Брендан О’Донохью и Себастьян Фленнерхаг.
Принцип работы DiffusionGemma схож с ИИ-генераторами изображений, которые начинают с чистого, случайного “визуального шума” и итеративно преобразуют его в финальное изображение (процесс, известный как “диффузия”). DiffusionGemma применяет тот же процесс к тексту. Она не генерирует токены по порядку, а начинает с “холста” из случайных токенов-заполнителей, обрабатывая их в несколько проходов, выявляя наиболее релевантные контекстные токены и используя их для уточнения остального.
Модель обладает способностью к самокоррекции, используя оценку уверенности для переоценки токенов в следующем проходе. “Модель итеративно уточняет свой собственный вывод, позволяя ей оценивать весь текстовый блок целиком, чтобы исправлять ошибки в реальном времени”, — пояснили О’Донохью и Фленнерхаг.
DiffusionGemma также обладает двунаправленным вниманием. “Генерация 256 токенов параллельно при каждом прямом проходе позволяет каждому токену учитывать все остальные”, — отметили исследователи. Это может быть особенно полезно в нелинейных областях, таких как математические графы, заполнение пропусков в коде и оперативное редактирование, заявили они.
DiffusionGemma оптимизирована для всей аппаратной платформы Nvidia, что делает её совместимой как с потребительскими конфигурациями, так и с высокопроизводительными корпоративными системами, такими как Hopper и Blackwell.
Будучи выпущенной под лицензией Apache 2.0, разработчики могут свободно использовать, модифицировать, распространять и коммерциализировать программное обеспечение, используя свои предпочтительные инструменты. Её можно запускать на GPU или в облаке через Google Cloud Model Garden или Nvidia NIM. Модель доступна на платформах Hugging Face, GitHub и vLLM, а поддержка библиотеки с открытым исходным кодом llama.cpp появится в ближайшее время.
Ключевые сценарии использования
Модель особенно полезна в локальных рабочих процессах, критически важных по скорости, таких как генерация нелинейных текстовых структур. Она открывает “новые модели поведения модели”, как их называют в Google, например, мультимодальное понимание, а также генерацию и рендеринг кода практически в реальном времени.
Леви пояснил, что DiffusionGemma “особенно хорошо подходит для интерактивного кодирования и редактирования, где её эффективность обеспечивает быструю обработку и итерации”. Он также отметил, что способность модели помещаться в 18 ГБ видеопамяти и её развёртывание на общедоступных локальных GPU потенциально могут принести пользу рабочим нагрузкам, связанным с обслуживанием клиентов, которые сильно зависят от взаимодействия в реальном времени и локальной обработки.
“DiffusionGemma также включает режим ‘мышления’, который особенно хорошо справляется с решением проблем”, — добавил аналитик. Например, модель была доработана для игры в Судоку — обычно сложная задача для авторегрессивных моделей, поскольку каждый токен зависит от будущих токенов. Леви отметил, что это “довольно ловко” иллюстрирует способность модели решать более сложные проблемы.
Ограничения
В Google открыто признают, что DiffusionGemma ориентирована на конкретные рабочие процессы, и существуют “ключевые компромиссы”.
Модель разработана для инференса с небольшими размерами пакетов, а также для высокоскоростной генерации с низкой задержкой при малых и средних размерах пакетов на “одном мощном ускорителе”.
В облачных средах с высокой частотой запросов в секунду (QPS), где инфраструктура спроектирована для обработки десятков или сотен тысяч запросов в секунду с ультранизкой задержкой, параллельное кодирование DiffusionGemma “даёт уменьшающуюся отдачу” и может даже приводить к более высоким затратам на обслуживание, признали в Google. Кроме того, общее качество её вывода ниже, чем у стандартной Gemma 4, которая создана для приложений, требующих максимального качества.
Однако Леви отметил, что, хотя DiffusionGemma “может быть менее точной, чем другие модели, в определённых рабочих нагрузках”, последующие циклы уточнения могут преодолеть это ограничение.
Хотя Google не раскрывает стоимость выполнения, очевидно, что это игра на эффективность, добавил он. “При развёртывании в тех рабочих нагрузках, которые оптимально подходят для её архитектуры, DiffusionGemma, похоже, имеет потенциал для сокращения затрат на обработку и связанных с этим расходов”, — заключил Леви.

