- Исследователи из Принстона, Беркли, МИТ и Наньянского технологического университета создали модель машинного обучения UniMate для анимации 3D-моделей людей, животных и предметов по текстовому описанию.
- UniMate использует генеративный трансформер для создания анимации с учетом строения скелета и позы персонажа.
- Модель является универсальной и не требует обучения для каждого типа персонажа.
- Система также позволяет редактировать готовую анимацию и достраивать движения между позами.
- Обучение модели проводилось на датасете из более чем 13 тыс. анимационных последовательностей с текстовыми описаниями.
- Генерация 60 кадров занимает около 1,2 секунды на одной Nvidia H100.
- В слепых оценках UniMate получила среднюю оценку 4,62 за соответствие тексту, правдоподобие движений и сохранение формы персонажа.
- Код и веса модели опубликованы по лицензии MIT, но публичная версия ограничена созданием фрагментов анимации, которые необходимо соединять между собой для более длительной анимации.
