10.3969/j.issn.1001-2400.2015.04.026
数据依赖的多索引哈希算法
由于多索引哈希基于数据集中的二进制码呈均匀分布这一假设,不能有效地处理非均匀分布的数据集,故针对这一问题提出数据依赖的多索引哈希算法.首先把二进制码划分为多个连续不重合的子串,并通过计算二进制码每位之间的相关性为每一个子串学习得到自适应投影向量;在为每个子串建立哈希表时,使用投影向量对子串进行投影,从而得到哈希表中的下标;采用自适应投影的方法可以使得哈希表中的元素接近于均匀分布,进而提升了查询速度.此外,提出一个基于熵的分布度量方法,以评价哈希表中数据元素的分布情况.在大规模数据集上的实验表明,与多索引哈希算法相比,数据依赖的多索引哈希算法可以使查询速度提升36.9%~87.4%.
最近邻查询、二进制码、索引、多索引哈希
TP183(自动化基础理论)
国家自然科学基金资助项目61170161,61303171,61271406
2015-08-26(万方平台首次上网日期,不代表论文的发表时间)
共6页
159-164