基于局部敏感哈希的K邻近算法识别垃圾短信

  • 打印
  • 收藏
收藏成功


打开文本图片集

文章编号:1671-3559(2023)06-0746-06DOI:10.13349/j.cnki.jdxbn.20230816.002

摘要: 针对目前垃圾短信的识别算法存在的关键字及频次的规则死板,易于被不法分子探测和规避等问题,提出将局部敏感哈希的K邻近算法应用于垃圾短信分类识别;首先定义特征,然后采用局部敏感哈希算法计算向量距离,通过得到的距离衡量矩阵的相似性,量化矩阵相似程度,对本文中提出的优化模型进行实现和训练;基于短信文本内容,运用词频-逆向文本频率算法生成矩阵,利用局部敏感哈希算法求解最相似样本,记录样本类别,将训练结果导入K邻近算法分类器得到最优近邻,在测试集或验证集上对优化模型垃圾短信分类识别准确率进行评测。(剩余11747字)

monitor