余弦距离在计算相似度的应用中经常使用,比如:

文本相似度检索

人脸识别检索

相似图片检索

原理简述

下面是

但是,余弦相似度和常用的欧式距离的有所区别。

余弦相似度的取值范围在-1到1之间。完全相同时数值为1,相反反向时为-1,正交或不相关是为0。(如下图,来源)

欧式距离一般为正值,归一化之后在0~1之间。距离越小,越相似。

欧式距离用于相似度检索更符合直觉。因此在使用时,需要将余弦相似度转化成类似欧氏距离的余弦距离。

维基页面中给出的

由于在计算图片或者文本相似度时,提取的特征没有负值,余弦相似度的取值为0~1,因此采用更简便的方法,直接定义为:

余弦距离 = 1- 余弦相似度

代码分析

根据输入数据的不同,分为两种模式处理。

输入数据为一维向量,计算单张图片或文本之间的相似度 (单张模式)

输入数据为二维向量(矩阵),计算多张图片或文本之间的相似度 (批量模式)

1 importnumpy as np

2 defcosine_distance(a, b):

3 if a.shape !=b.shape:

4 raise RuntimeError("array {} shape not match {}".format(a.shape, b.shape))

5 if a.ndim==1: 6 a_norm =np.linalg.norm(a) 7 b_norm =np.linalg.norm(b) 8 elif a.ndim==2: 9 a_norm = np.linalg.norm(a, axis=1, keepdims=True) 10 b_norm = np.linalg.norm(b, axis=1, keepdims=True) 11 else: 12 raise RuntimeError("array dimensions {} not right".format(a.ndim)) 13 similiarity = np.dot(a, b.T)/(a_norm *b_norm) 14 dist = 1. -similiarity 15 return dist

6~7 行 ,

9~10行 ,设置参数 axis=1 。对于归一化二维向量时,将数据按行向量处理,相当于单独对每张图片特征进行归一化处理。

13行,

一维向量求

二维向量(矩阵)求

numpy.dot(a, b, out=None)

Dot product of two arrays. Specifically,

If both a and b are 1-D arrays, it is inner product of vectors (without complex conjugation).

If both a and b are 2-D arrays, it is matrix multiplication, but using matmul or a @ b is preferred.

为了保持一致性,都使用了转置操作。如下图所示,矩阵乘法按线性代数定义,必须是 行 × 列才能完成乘法运算。举例 32张128维特征进行运算,则应该是 32x128 * 128x32 才行。

参考文章

python 余弦距离_numpy :: 计算特征之间的余弦距离相关推荐

  1. python数组如果余弦_numpy :: 计算特征之间的余弦距离

    余弦距离在计算相似度的应用中经常使用,比如: 文本相似度检索 人脸识别检索 相似图片检索 原理简述 下面是 但是,余弦相似度和常用的欧式距离的有所区别. 余弦相似度的取值范围在-1到1之间.完全相同时 ...

  2. Java-高德地图根据经纬度计算两坐标之间的直线距离

    Java-高德地图根据经纬度计算两坐标之间的直线距离 最近在做毕设项目,项目打卡需要用到高德地图,看了下高德地图计算两坐标距离的方法,官网上提供的开发包中也有相关的方法. /**** @author ...

  3. 物理引擎学习04-GJK计算多边形之间的最近距离

    计算多边形之间的最近距离,才是GJK算法原本的目的.只有两个多边形不相交,计算最近距离才有效.如果相交,则最近距离无效,但是可以使用EPA算法要计算碰撞深度.本文的写作目的,主要是对GJK算法的理解和 ...

  4. 计算特征矩阵之间的余弦距离(余弦相似度)

    转自两矩阵各向量余弦相似度计算操作向量化.md - 苏轶然 - 博客园 (cnblogs.com)https://www.cnblogs.com/suanec/p/9121092.html 对A,B矩 ...

  5. Python爬取两个城市之间的直线距离

    因需要爬取江浙沪皖地级市之间的城市距离,爬取的网址是http://www.china6636.com/.爬取代码如下: ###江浙沪皖41城市代号 x=[27005208,27017237,27029 ...

  6. JS高德地图计算两地之间的实际距离

    这个是通过导航的方式来获取两地之间的实际距离,和消耗的时间(key值自己去申请哈) <!doctype html> <html> <head><meta ch ...

  7. python算生日_Python3计算今天是否生日以及距离生日还有多少天

    #!/usr/bin/python # -*- coding: utf-8 -*- import datetime import time # 年月日单个 toyear = time.strftime ...

  8. PHP利用两点之间经纬度,计算两点之间的直线距离

    推荐一个小工具(坐标拾取,包含百度地图,高德地图,腾讯地图,Google地图),方便测试:http://www.gpsspg.com/maps.htm /*** 计算两组经纬度坐标 之间的距离* pa ...

  9. 距离度量——使用 np.linalg.norm 计算两点之间的 Lp 距离

    特征空间中两个实例点的距离是两个实例点相似程度的反映.可以用LpL_pLp​ distance来度量两个实例点的距离: Lp(xi,xj)=(∑l=1n∣xi(l)−xj(l)∣p))1pL_p(x_ ...

最新文章

  1. HTML和JavaScript代码分离、平稳退化(1)
  2. 测绘技术的发展与分类简述
  3. “人工智能创新大讲堂”全日程发布 | 听大咖畅谈智能社会
  4. Qt学习笔记-----Model/View架构之自定义Model
  5. 计算机视觉对扫描文件分类 OCR
  6. C语言(CED)判断一个数是否是2的整数幂的简便方法!
  7. android 生命周期流程图,Android Studio ——Service的生命周期
  8. linux6.3 dhcp,51CTO博客-专业IT技术博客创作平台-技术成就梦想
  9. The only difference is that they are written
  10. 解决curl: (7) Failed to connect to raw.githubusercontent.com port 443: Connection refused
  11. 记录一次日志实现,基于log4j2
  12. WDM驱动实操No.1
  13. 计算机使用hdmi需要设置方法,如何在计算机显示器上切换HDMI
  14. cocos creator播放声音控制台显示Simulator: jsb: ERROR
  15. webbug靶场-渗透基础
  16. 1467B. Hills And Valleys(思维模拟)
  17. 若依项目实现手机号+密码登录且密码验证为自定义加密方式
  18. raft协议对网络分区的处理
  19. Unet实现细胞分割
  20. 如何使用 JavaScript 创建水平和垂直标签?

热门文章

  1. LNAMP第二版(nginx 1.2.0+apache 2.4.2+php 5.4)
  2. 浙江省电力试验研究所打造IT运维精品工程
  3. 阿里巴巴和亚马逊“必有一战”,马云能赢吗?
  4. 原始GAN-pytorch-生成MNIST数据集(代码)
  5. [SSM完整项目]仿豆瓣优秀电影评分系统
  6. windows下的object-环境配置
  7. NIO(一)--简介API介绍
  8. 贝塞尔曲线下的动画效果
  9. 通过Otsu算法实现条形码的角度矫正matlab仿真
  10. VC6.0配置OpenGL