Ego2Act — бенчмарк генерации видео для embodied-планирования от первого лица
· Source: original
Ego2Act — бенчмарк egocentric-видеогенерации для embodied-планирования 🤖
Видеомодели всё чаще пробуют ставить в роль world simulator — симулятора мира для робототехники. Проверять их было особо нечем: существующие бенчмарки фокусировались на одиночных коротких действиях либо на пошаговых инструкциях. Multi-step physical reasoning в egocentric-видеогенерации оставался малоизученным.
Инструмент: на HuggingFace Papers вышел Ego2Act — «Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation», идентификатор 2610.01092. Это бенчмарк для оценки видеомоделей в роли world simulator.
Как гоняют модели: бенчмарк проверяет способность предсказывать, как среда меняется при выполнении многошаговых целенаправленных (goal-directed) действий. Требование жёстче, чем «красивая картинка»: модель должна не только генерировать визуально привлекательные кадры, но и предсказывать динамику среды. 🎥
Область применения — генеративное видео и робототехника на его основе: embodied planning and learning. Работа лежит на huggingface.co/papers/2610.01092
🤖 Интересуют ИИ-агенты и автоматизация?
Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:
🔗 Вся библиотека промптов · Категория «ИИ-агенты»
Готовый продукт по теме: Конвейер коротких видео на n8n: озвучка, монтаж, субтитры и публикация в TikTok, Reels и Shorts — забрать и применить сразу.