1. 首页
  2. 移动开发
  3. 其他
  4. 论文研究 中文短文本去重方法研究.pdf

论文研究 中文短文本去重方法研究.pdf

上传者: 2020-07-18 13:14:52上传 PDF文件 619.29KB 热度 25次
针对中文短文本冗余问题,提出了有效的去重算法框架。考虑到短文本海量性和简短性的特点,以及中文与英文之间的区别,引入了Bloom Filter、Trie树以及SimHash算法。算法框架的第一阶段由Bloom Filter或Trie树进行完全去重,第二阶段由SimHash算法进行相似去重。设计了该算法框架的各项参数,并通过仿真实验证实了该算法框架的可行性及合理性。
下载地址
用户评论