1. 引言

现在有一个需求是从一个单词表中每次随机选取三个单词。

这个表的建表语句和如下所示:

mysql> Create table 'words'('id' int(11) not null auto_increment;'word' varchar(64) default null;primary key ('id')
) ENGINE=InnoDB;

然后我们向其中插入10000行数据。接下来我们看看如何从中随机选择3个单词。

2. 内存临时表

首先,我们通常会想到用order by rand()来实现这个逻辑:

mysql> select word from words order by rand() limit 3;

虽然这句话很简单,但是执行流程则比较复杂。我们使用explain来看看语句的执行情况:

Extra字段中Using temporary表示需要使用临时表,Using filesort表示需要进行排序。也就是需要进行排序操作。

对于InnoDB表来说,执行全字段排序能够减少对于磁盘的访问,所以会被优先选择。

而对于内存表来说,回表过程只是简单地根据数据行的位置,直接访问内存得到数据,根本不会导致多访问磁盘。所以这时MySQL会优选选择rowid排序。

我们接下来再来梳理下这条语句的执行流程:

  1. 创建一个临时表,这个表使用memory引擎,表里有两个字段,第一个字段是double类型,记为R,第二个字段是varchar(64)类型,记为W。并且这个表没有索引。
  2. 从words表中,按主键顺序取出所有的word。对于每个word,调用rand()函数随机生成一个大于0小于1的随机小数,并把这个随机小数和word分别存入临时表的R和W字段中。
  3. 接下来就是按照字段R进行排序
  4. 初始化sort_buffer。sort_buffer有两个字段,一个是double类型,另一个是整型。
  5. 从内存临时表中一行行取出R值和位置信息,分别存入sort_buffer的两个字段里。
  6. sort_buffer按照R值进行排序
  7. 排序完成后,取出前三个结果的位置信息,到内存临时表中取出相应的word,返回给客户端。

流程示意图如下所示:

上面讲的位置信息,其实就是行所在的位置,也就是我们之前说的rowid。

对于InnoDB引擎来说,对于有没有主键表来说有两种处理方式:

  • 对于有主键的InnoDB表来说,这个rowid就是主键id
  • 对于没有主键的InnoDB表来说,这个rowid是由系统生成的,用来标识不同行。

因此,order by randn()使用了内存临时表,内存临时表的排序方法用的是rowid排序方法

3. 磁盘临时表

不是所有的临时表都是内存临时表。tmp_table_size这个配置限制了内存临时表的大小,如果超过了这个大小,就会使用磁盘临时表。InnoDB引擎就是默认使用磁盘临时表

4. 优先队列排序算法

在MySQL5.6之后,引入了优先队列排序算法,这种算法是不需要使用临时文件的。而原本的归并排序算法则是需要使用临时文件。

因为当你使用归并算法的时候,其实你只需要得到前3,但是你是用完归并排序,那已经整体有序了,造成了资源的浪费。

而优先队列排序算法则可以只取到前三,执行流程如下:

  1. 对于这10000个准备排序的(R,rowid),先取前三行,构造成一个堆,并且将最大的值放在堆顶;
  2. 取下一行(R’,rowid’),跟当前堆里面最大的R比较,如果R’小于R,则把(R,rowid)从堆中去掉,换成(R’,rowid’)。
  3. 不断重复上面的过程。

流程如下图所示:

但是当limit的数比较大时,维护堆比较困难,所以又会使用归并排序算法。

来源:自己整理的MySQL实战45讲笔记

MySQL中的随机抽取相关推荐

  1. MySQL中如何随机产生验证码,MySQL 生成随机数字 UUID MySQL 生成随机数字、字符串、日期、验证码及 UUID的方法...

    想了解MySQL 生成随机数字.字符串.日期.验证码及 UUID的方法的相关内容吗,不剪发的Tony老师在本文为您仔细讲解MySQL 生成随机数字 UUID的相关知识和一些Code实例,欢迎阅读和指正 ...

  2. mysql题库随机抽取试题_Python从MySQL数据库中面抽取试题,生成试卷

    一.背景 本文章主要是分享如何使用Python从MySQL数据库中面抽取试题,生成的试卷每一份都不一样. 二.准备工作 1.安装Python3 2.安装库 pip install python-doc ...

  3. mysql中先随机提取再排序d_mysql性能优化

    mysql性能的优化: 1.mysql基础操作 2.常用的sql技巧 3.sql语句优化 4.mysql数据库优化 5.mysql服务器优化 1.mysql的基础操作 1.1 mysql表复制 命令: ...

  4. matlab中随机抽取函数,matlab 哪个函数可以从一组数据中随机抽取一部分出来

    假设你原来的数据存在变量a中 如果,你想从a中随机抽取固定N个数 c=randperm(numel(a)); b=a(c(1:N)); b就是从a中随机抽取的N个数(N应该小于a中元素的总个数) nu ...

  5. MYSQL中RAND子句的使用_mysql优化--rand()优化

    众所周知,在mysql中,随机的取10条数据,如:select * from users order by rand() limit 10,效果非常差,因为会多次的执行,如果等值查询用rand()也是 ...

  6. excel随机抽取_简单随机抽样及其进阶分层随机抽样方法展示

    一.分享简单随机抽样的几种方法 1.抽样分析工具抽样 2.INDIRECT+RANDBETWEEN函数抽样 3.RAND+排序抽样 4.SAS抽样 二.分层抽样方法 1.Python分层抽样 2.SA ...

  7. 从数组随机抽取5个不重复_Power Query 如何保证随机抽取元素不重复

    继续昨天的话题,昨天我们实现完全的随抽取列表元素,有一个问题就是可能几次会抽取同一个位置的元素: 1-50中随机抽取5个数值,点击刷新,就会出现不同的结果,如上图可能会出现两个相同的数值,如何确保每次 ...

  8. laravel mysql rand_laravel如何从mysql数据库中随机抽取n条数据(高性能) - Laravel学习网...

    laravel如何高性能地从mysql数据库中随机获取n条数据,有时候我们常常会需要从数据库随机获取数据,比如:给工作人员随机分配10个订单,随机从数据库中随机抽查100个用户:这样我们就需要随机从数 ...

  9. MYSQL的随机抽取实现方法

    MYSQL的随机抽取实现方法.举个例子,要从tablename表中随机提取一条记录,大家一般的写法就是:SELECT * FROM tablename ORDER BY RAND() LIMIT 1. ...

最新文章

  1. CentOS7.4到Elasticsearch一路坑(五)
  2. IAR编译器的常见问题
  3. 降低网站跳出率的技巧分享!
  4. android使用软引用构建缓存
  5. ubuntu apache2配置
  6. 大厂经验(二):多端可视化埋点解决方案
  7. sql两个列值以下划线拼接得到一个新的列_面试必备sql知识点——MySQL基础
  8. java jvm 加载_Jvm是如何加载Java类的?
  9. 医院怎样进行计算机安全管理制度,医院信息安全管理制度
  10. 有序数组中插入元素依然保持有序
  11. Elasticsearch性能监控(二)
  12. python 时间序列异常值_python中缺少时间序列值
  13. matlab平行因子_基于MATLAB某客车悬置系统优化与运动仿真
  14. A - Divisors POJ - 2992 (组合数C的因子数)数学—大数
  15. atitit 研发管理 要不要自己做引擎自己实现架构?.docx
  16. 调试错误,请回到请求来源地,重新发起请求。 错误代码 insufficient-isv-permissions 错误原因: ISV权限不足,建议在开发者中心检查对应功能是否已经添加
  17. 程序员自我介绍如何出彩?面试「万能模板」快拿走!
  18. Is your Tecplot 360 EX liense valid?
  19. Python自学(三)
  20. YOLOv3在Intel Realsense上的Python实现(未实现)

热门文章

  1. 特步2020年总收入81.72亿元,主品牌下半年显著复苏
  2. 博客园添加页首导航菜单
  3. redis分布式事务脏数据问题
  4. python学习笔记-day5-文件修改
  5. 自定义Camera系列之:SurfaceView + Camera
  6. Maya快捷键学习游戏的方法有很多,但是自学和老师带是不一样
  7. 【总结】MATLAB绘制散点密度图
  8. 服务器重装ie浏览器,怎么重装IE浏览器
  9. 项目进度管理的算法总结
  10. JavaScript交互式网页设计 • 【第5章 JavaScript对象】