Google представила Gemini 3.5 Flash: быстрый и экономичный ИИ меняет правила игры
Главная»Женские секреты»Google представила Gemini 3.5 Flash: быстрый и экономичный ИИ меняет правила игры

Google представила Gemini 3.5 Flash: быстрый и экономичный ИИ меняет правила игры

На ежегодной конференции для разработчиков Google I/O компания представила Gemini 3.5 Flash — новую модель искусственного интеллекта. Запуск этой разработки бросает вызов, казалось бы, нерушимому правилу ИИ-индустрии: самые мощные модели обязательно должны быть медленными и дорогими в эксплуатации. Flash призвана изменить этот парадигмальный подход.

Flash как ключевой элемент обширных инноваций

Модель Gemini 3.5 Flash занимает центральное место в ряде значимых анонсов, среди которых “мировая модель” Gemini Omni для генерации видео и круглосуточный персональный ИИ-агент Gemini Spark. Однако именно Flash, по оценкам экспертов, имеет наиболее непосредственное значение для корпоративного сектора, инвестирующего миллиарды долларов в инфраструктуру ИИ. Сундар Пичаи, генеральный директор Google, в ходе пресс-брифинга сообщил, что компании, обрабатывающие около одного триллиона токенов в день в Google Cloud, могут ежегодно экономить более 1 миллиарда долларов, переведя 80 процентов своих рабочих нагрузок на комбинацию Flash и других передовых моделей.

По словам Пичаи, ИТ-директора многих компаний уже к маю сталкиваются с исчерпанием годовых бюджетов на токены. В этом контексте Gemini 3.5 Flash позиционируется не только как техническое достижение, но и как финансовая поддержка для организаций, борющихся с безудержным ростом затрат на масштабное внедрение ИИ. Если это заявление подтвердится, оно станет одним из самых значительных изменений в экономике корпоративного ИИ с момента появления больших языковых моделей в бизнес-вычислениях.

Преодоление компромисса между качеством и скоростью ИИ

Последние три года организации, внедряющие генеративный ИИ, сталкивались со сложным выбором: самые мощные модели, способные решать комплексные многоступенчатые задачи, писать надёжный код и анализировать объёмные финансовые документы, обычно были большими, медленными и дорогими в использовании. Быстрые и дешёвые модели, в свою очередь, жертвовали точностью. Руководителям ИТ-отделов приходилось выстраивать своеобразное “портфельное управление ИИ”, направляя простые запросы на облегчённые модели, а высокоответственные задачи резервируя для мощных аналитических движков. Такая система часто оказывалась сложной, негибкой, увеличивала инженерные затраты и приводила к нестабильному пользовательскому опыту.

Gemini 3.5 Flash напрямую решает эту проблему. Согласно внутренним тестам Google и стороннему анализу Artificial Analysis, модель превосходит собственную Gemini 3.1 Pro — которую Google позиционировала как флагманскую всего четыре-пять месяцев назад — почти по всем основным показателям. Она демонстрирует 76,2% на Terminal-Bench 2.1, достигает 1656 Elo на GDPval-AA, набирает 83,6% на MCP Atlas и лидирует в мультимодальном понимании с 84,2% на CharXiv Reasoning.

При этом модель генерирует выходные токены в четыре раза быстрее, чем сопоставимые передовые модели конкурентов. Корай Кавукчуоглу, технический директор Google DeepMind и главный ИИ-архитектор Google, сообщил журналистам, что команда пошла ещё дальше: “Мы разработали ещё более оптимизированную версию Flash, которая не просто в четыре, а фактически в 12 раз быстрее при том же качестве”. Этот турбо-вариант доступен уже сейчас в Antigravity — платформе Google для разработки ИИ-агентов.

Пичаи чётко обозначил разрыв в производительности: “Gemini 3.5 Flash лучше Gemini 3.1 Pro, выпущенной всего четыре месяца назад, и обеспечивает почти 90% производительности передовых моделей, работая в четыре раза быстрее, а в Antigravity, возможно, даже в 12 раз. При этом стоимость её использования составляет от одной трети до половины от таковой у конкурентов.” По данным Artificial Analysis, Flash занимает “верхний правый квадрант” их индекса интеллекта и скорости, будучи единственной моделью, достигшей такого положения.

Математика триллионов токенов и миллиарды экономии

Чтобы понять, почему Flash так важен для корпоративных клиентов, необходимо осознать экономику токенов — фундаментальных единиц данных, которые обрабатывают модели ИИ. Каждый запрос, обрабатываемый чат-ботом поддержки, каждый юридический документ, резюмируемый ИИ, каждая строка кода, написанная агентом, потребляет токены. И при ценах на передовые модели эти токены быстро накапливаются.

Google заявляет, что её API-интерфейсы моделей обрабатывают около 19 миллиардов токенов в минуту. В целом по всем продуктам Google — Поиск, приложение Gemini, Workspace и другие — компания обрабатывает более 3,2 квадриллиона токенов в месяц, что в семь раз больше, чем год назад. Два года назад, на I/O 2024, эта цифра составляла 9,7 триллиона в месяц.

Взрывной рост потребления токенов не является уникальным для Google. Компании во всех отраслях обнаруживают, что чем более мощными становятся их внедрения ИИ, тем больше токенов они расходуют. Агентские рабочие процессы, где системы ИИ автономно выполняют многоступенчатые задачи, используют различные инструменты, пишут и запускают код, а также итеративно улучшают свои собственные результаты, особенно “прожорливы” в отношении токенов. Одна агентская сессия кодирования может потреблять на порядки больше токенов, чем простой обмен вопросами и ответами.

Именно здесь преимущество Flash в стоимости становится преобразующим. Модель обеспечивает возможности “передового уровня”, по описанию Google, при цене, которая составляет менее половины, а в некоторых случаях почти треть от стоимости сопоставимых передовых моделей. Для гипотетического предприятия, обрабатывающего один триллион токенов в день в Google Cloud (масштаб, которого, по словам Пичаи, уже достигают ведущие клиенты), экономия от переноса 80 процентов рабочих нагрузок на комбинацию Flash и других передовых моделей превысит 1 миллиард долларов в год.

Эта цифра не является статистической погрешностью. Это сумма, способная изменить решения о закупках, ускорить сроки внедрения и коренным образом перестроить расчёт окупаемости инвестиций в ИИ-инициативы, которые многие советы директоров изучают с растущим нетерпением.

«Маховик данных» Google, который конкурентам трудно скопировать

Возможно, самая стратегически значимая деталь, которой поделилась Google, — это не оценка производительности и не цена. Это был график, демонстрирующий внутреннее потребление токенов компанией на Antigravity 2.0, её переработанной платформе для разработки ИИ-агентов.

В марте 2026 года разработчики Google обрабатывали около полтриллиона токенов в день внутри Antigravity. К моменту пресс-брифинга I/O в середине мая эта цифра превысила три триллиона — шестикратный рост примерно за десять недель, при этом использование удваивалось “буквально каждые несколько недель”, по словам Пичаи.

Такое внутреннее использование создаёт то, что исследователи ИИ называют “маховиком данных”: чем больше собственные инженеры Google используют 3.5 Flash для создания продуктов, тем больше реальных данных о сильных и слабых сторонах модели команда разработчиков получает. Эти данные используются для улучшения модели, что делает её более полезной, что стимулирует большее использование, что, в свою очередь, генерирует ещё больше данных. Это добродетельный цикл, который конкурирующие ИИ-лаборатории, полагающиеся в основном на внешнее использование разработчиками и синтетические тесты, не могут легко воспроизвести с такой же скоростью или точностью.

“Этот масштаб создаёт мощную обратную связь, и именно это позволило нам постоянно улучшать модели серии 3.5″, — отметил Пичаи.

Когда во время вопросов и ответов Пичаи задали вопрос о конкурентной среде, особенно в свете недавних достижений конкурирующих лабораторий, он признал, что ландшафт “очень динамичен” и “быстро меняется”, но выразил уверенность в широте возможностей Google. Он добавил, что основное внимание компании в серии 3.5 уделялось “повышению интеллектуальных возможностей модели, обеспечению эффективного использования инструментов, следованию инструкциям, долгосрочным сценариям использования и декодированию агентов”.

Кавукчуоглу подчеркнул акцент на агентских возможностях, отметив, что 3.5 Flash “теперь может обрабатывать многочасовые автономные сессии” и “может самостоятельно выполнять сложные конвейеры кодирования или управлять итерационными исследовательскими проектами полностью самостоятельно”. По его словам, команда даже протестировала модель, поручив агентам создать полностью работоспособную операционную систему с нуля.

Antigravity 2.0: центр управления ИИ-агентами

Появление 3.5 Flash тесно связано с запуском Antigravity 2.0 — значительного расширения платформы для разработки ИИ-агентов, которую Google впервые представила шесть месяцев назад. То, что начиналось как среда для кодирования, превратилось в то, что Google описывает как полноценную платформу для разработки и управления командами автономных ИИ-агентов, и, по заявлению компании, миллионы разработчиков уже используют её.

Antigravity 2.0 поставляется как новое отдельное настольное приложение, служащее центральным хабом для одновременной оркестровки нескольких агентов. Google привела пример запуска одного агента для кодирования веб-сайта, второго для генерации брендовых активов и третьего для планирования архитектуры продукта — всё параллельно, всё управляется из единого интерфейса. Для разработчиков, предпочитающих рабочие процессы командной строки, предусмотрен Antigravity CLI. А для тех, кто создаёт программные интеграции, новый Antigravity SDK предоставляет прямой доступ к той же системе агентов, которая лежит в основе собственных продуктов Google.

Совместная разработка 3.5 Flash и Antigravity 2.0 не случайна. “Мы разрабатывали 3.5 Flash совместно с Google Antigravity, нашей платформой для агентской разработки”, — отметил Кавукчуоглу. Эта тесная интеграция означает, что сильные стороны Flash — скорость, использование инструментов, обработка длинных контекстов и генерация кода — специально настроены для тех типов рабочих нагрузок, которые разработчики выполняют внутри платформы.

Google также запускает управляемые агенты (Managed Agents) в API Gemini, позволяя разработчикам запускать агента одним вызовом API, который рассуждает, использует инструменты и выполняет код в изолированной среде Linux. Компания представила CodeMender, ИИ-агента по безопасности, который использует расширенные возможности Gemini для автоматического поиска и исправления критических уязвимостей в коде — возможность, которую Кавукчуоглу назвал необходимой, поскольку агентские системы пишут всё большую долю мирового кода.

Инфраструктурные инвестиции Google и специализированные чипы

Представленные модели и платформы базируются на колоссальных инвестициях в инфраструктуру, о которых Пичаи рассказал во время брифинга: Google ожидает капитальных затрат в размере от 180 до 190 миллиардов долларов в 2026 году — это примерно в шесть раз больше 31 миллиарда долларов, которые компания потратила в 2022 году, всего четыре года назад.

Ключевым компонентом этих расходов являются специализированные чипы. Недавно компания представила восьмое поколение своих тензорных процессоров (Tensor Processing Units, TPU), впервые применив двучиповую архитектуру со специализированными проектами для обучения (TPU 8o) и инференса (TPU 8i). Google заявляет, что теперь она может распределять обучение моделей по нескольким центрам обработки данных, используя систему Pathways, масштабируя до более чем одного миллиона TPU по всему миру — установка, которая, по утверждению компании, является крупнейшим в мире кластером для обучения ИИ.

“Это означает обучение более крупных и мощных моделей за недели, а не за месяцы”, — подчеркнул Пичаи. Инфраструктурное преимущество имеет огромное значение для экономики Flash. Специализированные чипы, оптимизированные для инференса, означают, что Google может запускать Flash с меньшими затратами на токен, чем конкуренты, полагающиеся на универсальные графические процессоры, и эта экономия, по крайней мере частично, передаётся клиентам.

Цифра капитальных затрат также сигнализирует о стратегической долгосрочной позиции Google. В то время как некоторые инвесторы нервничают из-за астрономических сумм, которые облачные провайдеры тратят на инфраструктуру ИИ, Google позиционирует эти расходы как конкурентное преимущество. Чем больше инфраструктуры она строит, тем дешевле она может запускать инференс, тем привлекательнее становятся её модели, и тем больше использования она получает для улучшения следующего поколения. Это снова логика “маховика”, распространённая от программного обеспечения до самого “железа”.

Gemini Omni, Spark и потребительские продукты на Flash

Хотя основное внимание в рассказе о Flash уделяется корпоративной экономии, Google также предприняла масштабные шаги в потребительском сегменте, задействовав модель в продуктах, охватывающих миллиарды людей. Flash теперь является моделью по умолчанию для приложения Gemini, которое превысило 900 миллионов активных пользователей в месяц, более чем удвоившись с 400 миллионов год назад. Также модель лежит в основе режима ИИ в Google Поиске, который за первый год достиг одного миллиарда пользователей в месяц.

Google представила Gemini Spark, круглосуточного персонального ИИ-агента, который работает на выделенных виртуальных машинах в Google Cloud и функционирует в фоновом режиме, даже когда устройство пользователя выключено. Работая на 3.5 Flash с полной системой Antigravity, Spark интегрируется с Gmail, Docs, Sheets и Slides. Джош Вудворд, руководитель Google Labs и приложения Gemini, ярко описал этот опыт: “Когда вы им пользуетесь, кажется, будто вы просто перебрасываете задачи через плечо, а Spark их ловит и выполняет”. В вопросах безопасности Spark требует явного одобрения пользователя перед выполнением высокорисковых действий. Google также анонсировала Agent Payments Protocol, который позволяет пользователям устанавливать строгие ограничения — одобренные бренды, лимиты расходов, конкретные продавцы — прежде чем агент сможет потратить деньги от их имени. Вудворд сравнил этот подход с “выдачей подростку первой дебетовой карты, где есть определённые лимиты и ограничения”.

Наряду с Flash, Google представила Gemini Omni — модель, способную генерировать любой вывод из любого ввода, начиная с видео. Кавукчуоглу провёл чёткое различие с существующей моделью Google Veo: “Veo — это модель для преобразования текста в видео. Omni — это настоящая мультимодальная модель, способная работать с различными типами ввода и вывода.” Весь контент, сгенерированный Omni, имеет водяной знак SynthID от Google, и компания объявила, что OpenAI, Kakao и ElevenLabs также принимают SynthID.

Компания также переосмыслила свою поисковую строку впервые за более чем 25 лет, представила информационных агентов, которые круглосуточно отслеживают веб-пространство на предмет заданных пользователем условий, и запустила Universal Cart — универсальную корзину для покупок между продавцами на базе Google Wallet. Лиз Рейд, руководитель Google Поиска, назвала новую поисковую строку “самым значительным обновлением нашей культовой поисковой строки с момента её появления”.

Цикл обновлений Google и кривая стоимости ИИ

Google дала понять, что 3.5 Flash — это лишь первый шаг в серии 3.5. Gemini 3.5 Pro в настоящее время находится на внутреннем тестировании и будет доступен всем в следующем месяце. Кавукчуоглу отметил, что компания придерживается примерно шестимесячного цикла для крупных обновлений моделей — Gemini 3 в ноябре, 3.5 в мае — и ожидает, что этот ритм сохранится.

Когда репортёр The New York Times спросил, как Google определяет, заслуживает ли выпуск полного числового скачка или промежуточного шага, Кавукчуоглу сказал, что нумерация отражает величину исследовательского прогресса: “Обновление нумерации определяется прогрессом, который мы видим в наших исследованиях, и тем, как это отражается в моделях и их влиянии”.

Для корпоративных покупателей этот цикл несёт важное следствие: кривая соотношения затрат и производительности не просто улучшается — она улучшается по предсказуемому графику. Модель, которая каждые шесть месяцев превосходит предыдущий флагман при трети стоимости, принципиально меняет горизонт планирования инвестиций в ИИ. Это означает, что бюджеты на токены, которые компании сегодня исчерпывают, могут показаться незначительными уже к концу года.

Анонсы Google приходят в момент острой конкуренции. OpenAI, Anthropic, Meta*, а также множество более мелких лабораторий соревнуются за создание моделей, которые сбалансируют возможности с затратами. Microsoft агрессивно интегрирует модели OpenAI в Azure и Copilot. Но Google выигрывает от структурного преимущества, которое легко упустить из виду: дистрибуция. Имея 13 продуктов, каждый из которых обслуживает более миллиарда пользователей — пять из них превышают три миллиарда — Google может развернуть Flash для аудитории, которую не может сравниться ни одна специализированная ИИ-лаборатория. Каждое улучшение немедленно приносит пользу Поиску, Gmail, Docs, Картам и YouTube. А данные об использовании, поступающие от этих миллиардов взаимодействий, питают тот самый “маховик”, который делает следующую модель ещё лучше.

Теперь вопрос заключается в том, выдержит ли заявленная экономия в 1 миллиард долларов — привлекательная проекция, основанная на конкретном наборе рабочих нагрузок — столкновение с суровой реальностью корпоративных внедрений ИИ, где устаревшие системы, требования соответствия и организационная инерция способны ослабить даже самые убедительные кривые затрат. Но если судить по собственному внутреннему использованию Google — три триллиона токенов в день и рост, удваивающийся каждые несколько недель без признаков замедления — компания не просто делает ставку. Она делает ставку сама, со своими инженерами, на своей инфраструктуре, в масштабе, который ещё не пытался достичь ни один клиент. В войне за снижение стоимости ИИ самым убедительным аргументом может быть просто: мы сделали это первыми.

* — деятельность компании запрещена на территории РФ

Вам понравилась статья?
Поделитесь информацией с вашими друзьями!
19.05.2026
Комментарии: на сайте (0)
Добавить комментарий

Похожие статьи
Наверх