Bewertung großer Sprachmodelle zur Vorhersage von Binärfunktionsnamen

Yunxiang GE ,  

Bing XIA ,  

Yong DING ,  

Wenbo LIU ,  

Abstract

Im praktischen Reverse Engineering fehlen bei bereinigten und optimierten Binärdateien hochrangige Semantiken, was die automatisierte Funktionsverständnis erschwert. Dieses Papier verwendet die Vorhersage von Binärfunktionsnamen als Benchmark zur Bewertung von Open-Source-Großsprachmodellen (LLMs) für die semantische Funktionserkennung unter realistischen Bedingungen. Wir untersuchen systematisch Schlüsselfaktoren, die die Leistung beeinflussen, darunter den Vortrainingsbereich, die Modellgröße, Architektur- und Optimierungseinstellungen, Prompting und Kontextinformationen. Experimente mit einem groß angelegten mehrprojektigen Binärdatensatz zeigen klare Einschränkungen bei der Wiederherstellung der Funktionssemantik aus bereinigten Binärdateien. Codeorientierte LLMs übertreffen durchgängig allgemeine Modelle, während die Erhöhung der Modellgröße allein keine monotonen Verbesserungen bringt. Wir zeigen außerdem, dass realistisch wiederherstellbare kontextuelle Signale, insbesondere strukturell wiederherstellbare funktionsübergreifende Kontexte, die semantische Sparsität erheblich verringern und die Vorhersagequalität verbessern. Diese Ergebnisse zeichnen aktuelle Fähigkeitsgrenzen des LLM-basierten binären semantischen Verständnisses und schlagen zukünftige Richtungen in der kontextuellen Modellierung und domänenadaptiven Techniken für praktisches Reverse Engineering vor.

Keywords

Vorhersage von Binärfunktionsnamen;Große Sprachmodelle (LLMs);Reverse Engineering (RE);Binärcode-Analyse

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website