Роботы зачастую сталкиваются с задачами, которые для человека кажутся простыми, такими как правильная связь действий с объектами и их местоположением в пространстве. Microsoft, вместе с исследовательской группой из университетов, решила сосредоточиться на этой проблеме и разработала тест GroundedPlanBench. Это испытание проверяет способности моделей планирования действий и их привязки к конкретным объектам на изображениях.
В традиционной системе планы действий формируются отдельной моделью, после чего другая модель преобразует их в физические действия. Однако часто возникают несостыковки, и ошибки в планировании приводят к неправильным действиям, например, к выбору не того предмета или выполнению лишних действий. Особенно это заметно в запутанных или перегруженных помещениях.
В новом тесте каждая инструкция должна быть четко связана с определённым объектом или точкой на изображении. Базовые действия, такие как «взять» или «положить», должны быть строго привязаны к предмету. Такой подход помогает моделям лучше взаимодействовать с физическим окружением.
Тест включает более 1000 заданий, основанных на реальных сценариях использования роботами. Примеры варьируются от простых инструкций до более сложных, что подчеркивает разницу в понимании между людьми и машинами. Исследования показывают, что нечеткие формулировки создают трудности для роботизированных систем.
В рамках проекта был предложен новый метод обучения V2GP (Video-to-Spatially Grounded Planning), который обучает модели на видео роботизированных взаимодействий с предметами, помогая им присваивать действия конкретным объектам и местам. Эта методология уже продемонстрировала улучшения в точности выполнения действий.
Несмотря на достижения, задача по разрешению сложных, неоднозначных инструкций остается актуальной. Однако текущие разработки показывают, что интеграция планирования и пространственного контекста может значительно улучшить взаимодействие роботов с окружающим миром.