← Назад

models

Представление агентного видеопонимания с Gemini

DeepMind представила новую модель Gemini, которая включает агентное понимание видео. Эта разработка расширяет возможности AI в анализе и интерпретации видеоданных.

AS1 NewsИсточник: deepmind.google

video-understandingdeepmindgeminiresearch
GOOGL$338.50-1.16%

DeepMind опубликовала исследование, в котором описывается новая модель Gemini, способная к агентному пониманию видео. Эта модель предназначена для более глубокого анализа видеоматериалов, что может способствовать развитию приложений в области автоматического видеоанализа, робототехники и мультимедийных сервисов.

Gemini использует передовые методы обучения и архитектуры, позволяющие моделям лучше интерпретировать динамические сцены и взаимодействия в видео. Исследование подчеркивает, что модель прошла ряд тестов, демонстрируя улучшенные показатели по сравнению с предыдущими подходами.

В рамках исследования отмечается, что Gemini способна к более точному распознаванию действий, объектов и их взаимодействий, что важно для задач автоматического мониторинга, безопасности и развлечений. Однако, авторы подчеркивают, что модель находится на стадии исследований, и её коммерческое внедрение требует дальнейшей доработки и тестирования.

DeepMind подчеркивает, что Gemini является частью более широкой стратегии по развитию AI, способного к агентному взаимодействию с окружающей средой, что открывает новые горизонты для автоматизации и интеллектуальных систем.

позитивно

Разработка Gemini расширяет возможности AI в области видеопонимания, что может повлиять на развитие приложений в автоматическом анализе видео и взаимодействии с окружающей средой.