- Ученые из МФТИ и AIRI разработали метод активного итеративного дообучения Delta Data Generation (DDG) для управления миллионом роботов.
- Метод основан на трансформерной модели MAPF-GPT, созданной для мультиагентного поиска путей.
- DDG позволяет модели доучиваться на единичных примерах и решать задачи, не встречавшиеся в исходной выборке.
- Однако масштабирование на очень большое число роботов выявило серьезный барьер, когда модель сталкивается с ситуациями вне распределения.
- Авторы предложили алгоритм MAPF-GPT-DDG с активным режимом дообучения, который позволяет системе выявлять сложные сцены и запрашивать у экспертного планировщика правильные примеры поведения.
- Такой подход позволил адаптировать модель к принципиально иному классу задач и установить абсолютный рекорд в координации миллиона агентов на одной карте.
- Метод DDG имеет практическую значимость для автоматизации крупных логистических центров, где важно оперативно строить траектории и исправлять ошибки.
«Наша разработка впервые среди обучаемых систем успешно скоординировала движение миллиона виртуальных агентов на одной карте — это абсолютный рекорд для этого класса задач. Классические подходы либо не масштабируются, либо требуют огромных вычислительных ресурсов. MAPF-GPT-DDG эту проблему решил», — рассказал соавтор работы Александр Панов.