首页 > 解决方案 > spark中的minHashLSH实现解释

问题描述

spark mllib 中 minhashLSH 的拟合实际上有什么作用?据我了解,它会生成一组散列函数。这些函数是随机生成的吗?我们在这里用输入数据拟合什么?

我使用过的代码参考

上面生成的哈希函数可以在两个数据集上的 appx.similiarityjoin 中使用以生成哈希,并在这些哈希上计算 jaccard 距离。如果我在这里遗漏了什么,请告诉我。

标签: apache-sparkminhashlsh

解决方案


推荐阅读