首页 > 解决方案 > 获取多个字符串的相似度百分比

问题描述

Python 中是否有任何函数可以接受多行字符串并返回它们具有多少相似度的百分比?类似SequenceMatcher但对于多个字符串。

例如我们有以下句子

Hello how are you?
Hi how are you?
hi how are you doing?
Hey how is your day?

我希望能够根据句子彼此的相似程度获得百分比

假设我们有这三个句子

Hello how are you?
Hello how are you?
Hello how are you?

那么我们应该得到 100% 的相似度

但是如果我们有

Hello how are you?
Hello how are you?
hola como estats?

那么我们应该得到一个相似度约为 67% 的数字。

标签: pythonstringsimilaritysentence-similarity

解决方案


您可以使用pandas数据框进行操作,itertools.combinations计算列表中 2 个字符串的组合以及difflib.SequenceMatcher相似度计算:

import pandas as pd
import itertools
from difflib import SequenceMatcher

def similarity(a,b):
    seq = SequenceMatcher(a=a, b=b)
    return seq.ratio()    

strings = ['Hello how are you?', 'Hi how are you?', 'hi how are you doing?', 'Hey how is your day?']
combinations = itertools.combinations(strings,2)

df = pd.DataFrame(list(combinations))
df['similarity'] = df.apply(lambda x: similarity(x[0],x[1]), axis=1)

df.similarity.mean()
0.68

推荐阅读