国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁(yè) > 編程 > Python > 正文

python代碼如何實(shí)現(xiàn)余弦相似性計(jì)算

2020-02-15 21:19:01
字體:
來(lái)源:轉(zhuǎn)載
供稿:網(wǎng)友

這篇文章主要介紹了python代碼如何實(shí)現(xiàn)余弦相似性計(jì)算,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下

A:西米喜歡健身

B:超超不愛(ài)健身,喜歡打游戲

step1:分詞

A:西米/喜歡/健身

B:超超/不/喜歡/健身,喜歡/打/游戲

step2:列出兩個(gè)句子的并集

西米/喜歡/健身/超超/不/打/游戲

step3:計(jì)算詞頻向量

A:[1,1,1,0,0,0,0]

B:[0,1,1,1,1,1,1]

step4:計(jì)算余弦值

余弦值越大,證明夾角越小,兩個(gè)向量越相似。

step5:python代碼實(shí)現(xiàn)

import jiebaimport jieba.analyse def words2vec(words1=None, words2=None):  v1 = []  v2 = []  tag1 = jieba.analyse.extract_tags(words1, withWeight=True)  tag2 = jieba.analyse.extract_tags(words2, withWeight=True)  tag_dict1 = {i[0]: i[1] for i in tag1}  tag_dict2 = {i[0]: i[1] for i in tag2}  merged_tag = set(tag_dict1.keys()) | set(tag_dict2.keys())  for i in merged_tag:    if i in tag_dict1:      v1.append(tag_dict1[i])    else:      v1.append(0)    if i in tag_dict2:      v2.append(tag_dict2[i])    else:      v2.append(0)  return v1, v2  def cosine_similarity(vector1, vector2):  dot_product = 0.0  normA = 0.0  normB = 0.0  for a, b in zip(vector1, vector2):    dot_product += a * b    normA += a ** 2    normB += b ** 2  if normA == 0.0 or normB == 0.0:    return 0  else:    return round(dot_product / ((normA**0.5)*(normB**0.5)) * 100, 2)   def cosine(str1, str2):  vec1, vec2 = words2vec(str1, str2)  return cosine_similarity(vec1, vec2) print(cosine('阿克蘇蘋(píng)果', '阿克蘇蘋(píng)果'))

以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持武林站長(zhǎng)站。

發(fā)表評(píng)論 共有條評(píng)論
用戶(hù)名: 密碼:
驗(yàn)證碼: 匿名發(fā)表
主站蜘蛛池模板: 南城县| 东乡族自治县| 长岛县| 治县。| 聊城市| 尚志市| 莎车县| 南城县| 贺州市| 青龙| 仪陇县| 虞城县| 台北市| 郎溪县| 高密市| 尚义县| 临沭县| 玉环县| 镇巴县| 尉犁县| 庆安县| 霍城县| 自贡市| 龙泉市| 邵阳县| 萨嘎县| 崇礼县| 招远市| 临颍县| 安乡县| 乌兰浩特市| 徐水县| 万盛区| 古浪县| 新平| 自治县| 东安县| 龙岩市| 扎赉特旗| 若羌县| 卓资县|