Google анонсировала Gemini Omni: новая мультимодальная модель DeepMind
Google анонсировала Gemini Omni - новую модель семейства Gemini от Google DeepMind. Вместо стандартного релиза компания опубликовала круглый стол с исследователями и инженерами модели. Технических спецификаций, бенчмарков и цен пока нет. Позиционирование - мультимодальность: текст, изображения, аудио и видео одновременно.
Google DeepMind анонсировала Gemini Omni - новую модель в линейке Gemini, которая претендует на работу с текстом, изображениями, аудио и видео одновременно. Формат анонса нестандартный: не пресс-релиз и не технический доклад, а публикация на официальном блоге Google с круглым столом исследователей и инженеров.
Что именно анонсировали
Gemini Omni - это дополнение к уже существующей линейке, куда входят Gemini Pro, Gemini Ultra и специализированные версии для отдельных задач. По описанию из источника, Omni позиционируется как универсальный вариант: способный работать в нескольких модальностях без потери производительности в каждой из них.
Название «Omni» прямо отсылает к тренду на омнимодальные системы. OpenAI запустила GPT-4o раньше, Google теперь заявляет своё место в том же сегменте.
Как Google подаёт анонс
Вместо традиционного запуска с демо и бенчмарками - интервью с командой DeepMind. Разговоры провела Линдси Ланквист (Lindsey Lanquist). Инженеры и исследователи рассказывают, что их самих в модели впечатляет.
Это осознанный выбор формата. Google ставит на то, что живой разговор с людьми, которые делали модель, выглядит убедительнее, чем маркетинговые слайды. Особенно для enterprise-аудитории, которая уже насмотрелась на красивые презентации без реального результата.
Чего в анонсе нет
Почти всего конкретного:
- Технических спецификаций
- Результатов бенчмарков
- Сроков доступности
- Цен
По данным источника, всё это «пока остаётся за кадром». Возможно, это зондирование рынка перед полноценным раскрытием. Возможно - попытка опередить конкурентов хоть чем-то публичным.
Контекст: зачем Google это нужно
Google DeepMind - объединение Google Brain и DeepMind - это команда за AlphaGo и AlphaFold. При этом в гонке потребительских AI-продуктов Google оказалась в позиции догоняющего: сначала спешный запуск Bard, потом ребрендинг в Gemini, потом череда обновлений.
На фоне этого Anthropic наращивает контекстное окно Claude и делает ставку на безопасность, OpenAI держит лидерство по узнаваемости среди разработчиков, Meta раздаёт Llama в open source. Google нужен аргумент, который выделяет Gemini Omni среди всего этого.
Ранние корпоративные клиенты Gemini через Google Cloud, по данным источника, отмечают сильные результаты в задачах сложного рассуждения и мультимодального понимания. Но это не цифры и не публичные кейсы - пока только слова.
Что это значит
Если ты работаешь с AI-инструментами в продукте, маркетинге или аналитике - за Gemini Omni стоит следить. Формат анонса без цифр сейчас говорит скорее о том, что Google готовится к более крупному релизу ближе к осени. Реальный тест - когда модель станет доступна и её можно будет сравнить с GPT-4o и Claude на конкретных задачах.
Для работы из России: пока доступность Gemini Omni через Google Cloud или API не анонсирована, отдельных данных по регионам в источнике нет.
Источник: The Tech Buzz, Lindsey Lanquist, 13 августа - https://www.techbuzz.ai/articles/google-unveils-gemini-omni-as-experts-detail-new-model
FAQ
Gemini Omni - это замена Gemini Ultra? По имеющимся данным - нет. Скорее отдельная позиция в линейке, ориентированная на мультимодальные сценарии. Точная иерархия моделей пока не раскрыта.
Когда можно будет попробовать? Сроков в анонсе нет. Источник упоминает возможный «крупный продуктовый рывок этой осенью», но это предположение автора материала, не официальное заявление Google.
Чем Gemini Omni отличается от GPT-4o? Пока сравнить невозможно: нет ни бенчмарков, ни технических параметров. Google намеренно не устраивает открытого сравнения - по крайней мере, пока.