Стартап Decart представил Oasis 3 — ИИ-генератор фотореалистичных симуляций для беспилотников
ИИ-стартап Decart официально презентовал Oasis 3 — свою новейшую интерактивную модель мира, способную генерировать фотореалистичную дорожную обстановку в режиме реального времени. На данный момент инструмент уже доступен разработчикам через интерфейс программирования приложений (API).
Виртуальные полигоны для беспилотного транспорта
Основной целевой аудиторией нового продукта разработчики видят производителей беспилотных автомобилей, которым требуются масштабные и точные симуляции редких дорожных ситуаций. В дальнейшем компания планирует адаптировать технологию для робототехники и других сфер физического искусственного интеллекта. Однако главная ставка делается на открытую экосистему: доступ к API с первого дня позволит сформировать вокруг модели активное сообщество специалистов.
По словам сооснователя и генерального директора Decart Дина Лейтерсдорфа, Oasis 3 станет первой практически применимой моделью мира, на базе которой сторонние специалисты смогут программировать собственные решения. Сейчас у стартапа уже насчитывается более 100 тысяч разработчиков, использующих предыдущую модель генерации потокового видео Lucy. Стоимость доступа к Oasis 3 составляет 0,02 доллара за секунду генерации, а тарифы для крупных предприятий рассчитываются индивидуально.
Эффективность архитектуры и финансовые успехи
Сфера моделей мира становится все более конкурентной. За последнее время Google представила исследовательскую версию Genie 3, проект World Labs запустил коммерческую систему Marble, а разработчики видеогенераторов Luma и Runway также активно развивают свои физически точные модели.
Выпуск Oasis 3 состоялся спустя несколько недель после того, как двухлетний стартап Decart привлек 300 млн долларов инвестиций. Это увеличило оценку компании почти до 4 млрд долларов. В раунде приняли участие такие стратегические инвесторы, как Toyota, Adobe, eBay и Nvidia.
Преимущество Oasis 3 заключается в высокой детализации графики и возможности бесконечной генерации окружения. Это стало возможным благодаря собственной оптимизационной платформе DOS (Decart Optimization Stack), которая позволяет эффективно запускать модели на оборудовании Nvidia, Amazon и Google, существенно снижая затраты на вычислительные мощности. Руководство стартапа подчеркивает, что благодаря глубокой вертикальной интеграции стоимость эксплуатации систем компании на порядок ниже, чем у конкурентов. За все время своего существования стартап израсходовал на разработки значительно меньше 100 млн долларов.
Технические возможности и ограничения технологии
Oasis 3 создает физически корректную симуляцию с поддержкой нескольких ракурсов (вид спереди и два боковых обзора), что крайне важно для обучения сенсоров беспилотников. В отличие от закрытых демонстрационных версий конкурентов, здесь пользователи могут генерировать сценарии непрерывно.
В ходе независимого тестирования было отмечено, что Oasis 3 демонстрирует впечатляющий уровень фотореализма по текстовому описанию. Тем не менее, у технологии остаются слабые места:
- Постепенная потеря логики окружения при длительной генерации (например, заданная в промпте улица Нью-Йорка со временем превращается в собирательный образ типового мегаполиса);
- Исчезновение ранее сгенерированных объектов при попытке развернуться назад;
- Недостаточно отзывчивое управление виртуальным автомобилем;
- Ошибки в симуляции физики твердых тел, из-за чего машины могут беспрепятственно проезжать сквозь другие транспортные средства.
Разработчики признают наличие проблем с физикой столкновений и связывают их с тем, что в обучающих выборках содержится колоссальный объем данных о правильном вождении и крайне мало примеров аварийных ситуаций.
Проблема усложняется авторегрессионным принципом работы Oasis 3: модель генерирует картинку покадрово, опираясь на предыдущие кадры. Каждый кадр эквивалентен примерно 8000 токенов, а при генерации десятков кадров в секунду контекстное окно переполняется мгновенно. Сейчас инженеры Decart ищут способы увеличения памяти модели и сжатия обрабатываемых данных. Ожидается, что часть этих проблем решится в следующей версии системы, где генерацию можно будет запускать не по тексту, а на основе реального видеоролика.
