Исследователи МФТИ, института AIRI и университета «Иннополис» создали метод DyGEnc

Исследователи МФТИ, института AIRI и университета «Иннополис» представили метод DyGEnc, который позволяет большим языковым моделям анализировать происходящее на видео. Система отслеживает движение объектов, понимает их взаимодействие и даже может предсказывать, что произойдёт в следующий момент.

Как это работает

Вместо того чтобы анализировать каждый кадр отдельно, DyGEnc превращает происходящее в граф событий. Каждый объект становится вершиной, а действия между объектами — связями. Затем эта компактная структура кодируется всего в несколько токенов и передаётся языковой модели, которая отвечает на вопросы о происходящем.

Почему это важно

Большинство современных систем воспринимают видео как непрерывный поток кадров и не формируют понятную структуру событий. DyGEnc, наоборот, создаёт интерпретируемую модель сцены во времени. Даже если описание видео содержит ошибки — например, отсутствует часть связей или слова заменены синонимами, — метод сохраняет точность выше 90%.

Результаты

На датасете STAR, включающем около 9 тысяч бытовых видеороликов, система правильно ответила на 99% вопросов о взаимодействии объектов и на 97% задач по прогнозированию следующего действия. На более сложном наборе AGQA, содержащем 2,27 миллиона вопросов, DyGEnc показал 93% точности против 54% у подходов без использования графа событий.

По словам разработчиков, общая картина происходящего буквально собирается из отдельных фрагментов, благодаря чему модель лучше понимает логику событий.

Где пригодится

Разработка ориентирована на робототехнику, логистику, производство и бытовые сервисы. Метод уже протестировали на мобильном роботе с манипулятором: он получал команды на русском языке, анализировал видео с камер в реальном времени и успешно выполнял задачи, например подъезжал к столу и брал нужный предмет.