Выполнение, верификация и риски агентов графического пользовательского интерфейса: обзор с учетом платформы

Yu WU ,  

Yi YANG ,  

Abstract

Агенты графического пользовательского интерфейса (GUI) получили широкое применение в общей цифровой автоматизации. Большие языковые модели, визуально-языковые модели и многомодальные базовые модели теперь способны интерпретировать скриншоты, следовать инструкциям на естественном языке и выполнять операции с учётом позиционирования на веб-сайтах, в мобильных приложениях и настольных операционных системах. Однако, несмотря на различающиеся условия выполнения, существующие исследования часто объединяют эти сценарии под одной категорией. В данной статье представлен обзор типичных фреймворков, моделей, наборов данных и тестовых бенчмарков агентов GUI через единую техническую стеку — включая наблюдение, локализацию, планирование, память, выполнение и проверку. Мы предлагаем рассматривать веб-агентов, мобильных агентов и агентов настольных/операционных систем как различные операционные режимы, поскольку они отличаются степенью наблюдаемости, семантикой действий, зависимостью от скрытых состояний, затратами на выполнение и рисками побочных эффектов. Описан переход в этой области от прогнозирования следующего действия к надежному выполнению, с растущим вниманием к проверке результатов, эффективности выполнения и надежности. В заключение обсуждаются будущие направления исследований в области надежного использования компьютеров, включая отслеживание состояния убеждений, адаптивное восприятие, смешанное исполнение GUI и инструментов, а также человеческий контроль.

Keywords

Агенты графического пользовательского интерфейса; операционные режимы; доверительная оценка; верификация постусловий

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website