Оценка больших языковых моделей для прогнозирования имен бинарных функций

Yunxiang GE ,  

Bing XIA ,  

Yong DING ,  

Wenbo LIU ,  

Abstract

В практическом реверс-инжиниринге очищенные и оптимизированные бинарные файлы лишены высокоуровневой семантики, что затрудняет автоматическое понимание функций. В данной статье используется прогнозирование имен бинарных функций в качестве ориентира для оценки открытых моделей больших языковых моделей (LLMs) для семантической интерпретации функций в реалистичных условиях. Мы систематически изучаем ключевые факторы, влияющие на производительность, включая домен предварительного обучения, масштаб модели, архитектуру и настройки оптимизации, подсказки и контекстную информацию. Эксперименты на крупномасштабном многопроектном бинарном наборе данных выявляют явные ограничения в восстановлении семантики функций из очищенных бинарных файлов. Ориентированные на код LLM постоянно превосходят универсальные модели, в то время как увеличение размера модели само по себе не приводит к монотонному улучшению. Мы также показываем, что реально восстанавливаемые контекстные сигналы, особенно структурно восстанавливаемые межфункциональные контексты, значительно уменьшают семантическую разреженность и улучшают качество прогнозирования. Эти результаты очерчивают текущие ограничения возможностей понимания бинарной семантики на основе LLM и предлагают направления для будущих исследований в области контекстного моделирования и методов адаптации к домену для практического реверс-инжиниринга.

Keywords

Прогнозирование имен бинарных функций;Большие языковые модели (LLMs);Реверс-инжиниринг (RE);Анализ бинарного кода

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website