Gemini 3.5 Flash: пять тестов, подтверждающих превосходство новой ИИ-модели Google
На конференции Google I/O 2026 компания представила множество новых функций и инструментов Gemini, включая мощный видеоредактор Google Omni. Однако настоящей «рабочей лошадкой» в линейке, по заявлению Google, должна стать модель Gemini 3.5 Flash. Разработчики позиционируют её как более быструю и мощную в задачах программирования, обработке длинных контекстов, мультимодальном понимании (способность анализировать и интерпретировать информацию из нескольких источников, таких как текст, изображения, аудио) и многом другом. Главное, как утверждается, она способна справляться со сложными и запутанными запросами, которые пользователи предъявляют к искусственному интеллекту.
Чтобы оценить реальные возможности Gemini 3.5 Flash, обозреватели предложили ей пять различных запросов, предназначенных для проверки разных сильных сторон. Некоторые задачи были практичными, другие — намеренно абсурдными. Все они подчеркнули способности, которые Google выделяет как ключевые в эволюции Gemini 3.5 Flash по сравнению с предыдущими моделями Flash и Gemini 3.1.
1. Моделирование космического мусора
В первом тесте была предпринята попытка проверить мультимодальное мышление, понимание длинного контекста и генерацию технического кода. От Gemini 3.5 Flash ожидалось, что она сможет обрабатывать сложную информацию и плавно переходить к практическому исполнению. Модели был предоставлен подробный аэрокосмический отчет о космическом мусоре с запросом создать дружелюбный симулятор. Конкретная формулировка задачи звучала так: «Используйте приложенный отчет IADC (Межагентский координационный комитет по космическому мусору) о состоянии космической мусорной среды, чтобы создать интерактивный симулятор, показывающий, как будет накапливаться мусор и орбитальный трафик, а также потенциальную опасность для объектов на орбите».
Gemini сгенерировала длинный, сложный фрагмент кода, используя данные из отчета. В результате был создан впечатляющий визуальный симулятор. Концепция интерфейса была построена вокруг повествования, а не просто демонстрации чисел.
Наиболее впечатляющей оказалась ясность, с которой ИИ объяснила свои решения. «Панель управления должна помочь пользователям понять не просто, что количество мусора со временем увеличивается, но и как поведение при запусках и решения по его сокращению влияют на долгосрочные результаты», — указала Gemini.
2. Планировщик выходных
Планирование поездок часто используется в качестве теста для ИИ, так как оно позволяет выявить как сильные стороны, так и недостатки в обработке сложных переменных. Gemini 3.5 Flash делает акцент на агентном планировании (способности планировать и выполнять задачи, требующие нескольких шагов и принятия решений) и многоэтапном мышлении, поэтому следующая задача была направлена на проверку её способности обрабатывать множество дополнительных деталей.
Модель получила указание: «Спланируйте 4-дневное автомобильное путешествие по долине реки Гудзон и горам Катскилл. Создайте подробный многоступенчатый маршрут, который координирует утренние пешеходные маршруты, дневные остановки для дегустации ремесленных продуктов и живописные автомобильные маршруты, с встроенной опцией „запасного варианта на случай дождя“ для каждого дня».
Gemini 3.5 Flash подошла к заданию с удивительной продуманностью. Первый день включал в себя речные виды и прогулки без немедленного утомления путешественника. Живописные маршруты соединялись естественно, а не петляли непредсказуемо по карте. Рекомендации по питанию хорошо соответствовали географии, а варианты действий на случай непогоды были вполне логичными, как отметила Gemini:
«Альтернативы на случай дождя должны сохранять эмоциональную цель первоначальной деятельности. Замена пешей прогулки посещением несвязанных торговых точек создает разрыв, а не преемственность».
3. Логика переплетного дела
Далее была проверена процедурная логика — тип структурированного планирования, в котором Gemini 3.5 Flash, как ожидается, должна быть сильна. В рамках планирования проекта, перед Gemini была поставлена задача «выступить в роли эксперта по реставрации книг и предоставить строгое пошаговое руководство для любителей по переплетению обложки для блокнота в домашних условиях».
Инструкции по рукоделию быстро выявляют недостатки: слишком расплывчатые — новички терпят неудачу, слишком технические — люди бросают на полпути. Gemini 3.5 Flash нашла золотую середину, установив ожидания и разделив основные шаги от необязательных доработок. Модель учла вероятные ошибки, не звуча при этом покровительственно.
«Ваша цель — не качество музейной реставрации, а создание долговечного блокнота при освоении фундаментальных принципов переплета, — отметила она. — Время сушки — это часть процесса, а не просто пауза между шагами».
4. Быстрая уборка
Следующий тест был направлен на оценку улучшений Gemini 3.5 Flash в области визуального мышления и заявлений о лучшем планировании действий. Модели предоставили изображение комнаты, нуждающейся в организации и уборке, и попросили «создать план уборки на 25 минут, указать, что делать в первую очередь, что игнорировать и как сделать комнату на 80% лучше с минимальными усилиями».
Советы по уборке кажутся тривиальными, пока не осознаешь, что большинство людей терпят неудачу в попытках убраться по стратегическим, а не мотивационным причинам. Старые системы ИИ часто рекомендуют заниматься всем одинаково, что не помогает. Gemini 3.5 Flash продемонстрировала понимание принципов приоритезации. Она заявила, что будет уделять первостепенное внимание визуальному эффекту и импульсу.
«Сначала сосредоточьтесь на наиболее заметном беспорядке, а не на скрытых проблемах организации, — посоветовала Gemini. — Видимый прогресс создает импульс, быстро улучшая воспринимаемую чистоту. Избегайте открывания ящиков или начала глубоких задач по организации во время коротких сессий уборки».
5. Загадочные пингвины
Для заключительного теста была предпринята попытка проверить параллельное мышление Gemini 3.5 Flash, когда модель разбивает большую проблему на более мелкие части и одновременно обрабатывает несколько линий рассуждений, вместо того чтобы решать все пошагово.
Ради эксперимента была предложена заведомо абсурдная задача, призванная вознаградить структурированное расследование. Модели предложили «провести глубокую проверку предполагаемого соседа по комнате, который утверждает, что он „обычный человек“, но, очевидно, является тремя пингвинами, стоящими друг на друге в плаще».
Ответ ИИ подхватил шутку и выполнил задачу, разделив её на параллельные направления расследования, которые были названы как реальные разведывательные операции. Один «суб-агент» занимался поведенческим анализом. Другой сосредоточился на экологических доказательствах. Третий исследовал признаки социальной согласованности. Gemini отслеживала каждый поток независимо, периодически объединяя результаты в развивающееся резюме оценки.
- «Суб-агент 1: Анализ мобильности. Наблюдаемые индикаторы включают необычные изменения равновесия, синхронизированные движения нижней части тела и повышенную вероятность координации передвижения нескольких организмов».
- Другой раздел гласил: «Суб-агент 3: Анализ социальных паттернов. Утверждение о „обычном человеке“ остается неподтвержденным. Запрошены дополнительные доказательства относительно частоты покупки рыбы, необъяснимого накопления льда и подозрительной непереносимости теплых климатических условий».
Gemini продолжила игру и продемонстрировала, как параллельное агентное мышление меняет форму решения проблем с помощью ИИ. Более ранние системы часто обрабатывали сложные запросы последовательно, что могло делать большие задачи более медленными или менее организованными. Gemini 3.5 Flash же подошла к вымышленному расследованию как к сотрудничеству нескольких специалистов одновременно.
Gemini 3.5 Flash последовательно демонстрировала способность сохранять ориентированность на своих задачах, с чем иногда сталкивались более ранние быстрые модели. Независимо от того, анализировала ли она тенденции космического мусора, планировала автомобильные поездки или расследовала дело о подозрительных пингвинах, модель сохраняла контекст, адаптируя свой стиль рассуждений к заданию.
Главным достижением может быть то, насколько естественно её сильные стороны сливаются в единую модель. Этот сдвиг меняет потенциал Gemini 3.5 Flash в повседневной жизни, при условии, что пользователи готовы к компромиссам, таким как предоставление большого объема информации для максимального использования её возможностей.