惡意程式無所遁形—以自然語言處理模型實現惡意程式之識別
本研究旨在運用自然語言處理技術,建立辨識惡意程式的模型。首先搜集良性及惡意執行檔,進行反組譯及前處理以建立資料集。使用反組譯後的組合語言檔作為文本,訓練模型以區分良性和惡意程式。研究比較詞袋模型、序列模型、fastText以及不同n-gram對模型的影響,並將結果與其他相似研究比較。 研究結果顯示。詞袋模型以使用multi-hot編碼表現最佳,序列模型有位置編碼的Transformer encoder表現最優。在不同n-gram的比較,2-gram詞袋模型識別惡意程式達到99.6%的F1-score,且本研究的識別準確率優於其他相似研究。