一点前言

直接来说,这种很多程序员的梦想~
撸了大半辈子的代码,号称可以把宇宙Coding出来,结果到了Excel这块卡主了。我就是想写SQL去查Excel,不喜欢记住那么多Excel操作!
好在,我们这个世界变化很快,Excel新的版本号称是支持python的,也准备支持js,不过有个问题是当年一直追随window的程序员因为技术提升有了Mac了,新版本的office目测还收费,en~
我在玩Spark的时候发现可以搞Excel,秃秃的脑袋瓜一转~~

起手

不得不说真需要狠狠感谢这个开源的世界,以及基础环境的搭建人员。
首先,我们看到了一个github上面的开源项目:spark-excel
其次,在github网络不通的背景下,我们找到了gitee上面的镜像地址:可用的地址,剩下的工作我们就是调通。

引入

这个其实是一个sbt下的工程,所以我们可以直接用maven引入

  <dependency><groupId>com.crealytics</groupId><artifactId>spark-excel_2.11</artifactId><version>0.11.1</version></dependency>

当然,根据Scala版本的不同可以有不一样的配方

Scala 2.12

groupId: com.crealytics
artifactId: spark-excel_2.12
version: <spark-version>_0.14.0

Scala 2.11

groupId: com.crealytics
artifactId: spark-excel_2.11
version: <spark-version>_0.14.0

如果还有特殊版本,公司内部版本,源码编译方式也是提供了。

起手

上手自然先准备一把Excel数据,先弄一个excel的数据表格

数据ready,我们进行编码,初始化之类的跳过,需要读取excel的话首先要构建schema,这个是后面读取数据需要的列

 //定义数据结构val schema = StructType(List(StructField("id", StringType, nullable = false),StructField("name", StringType, nullable = false),StructField("age", IntegerType, nullable = false),StructField("gender", StringType, nullable = false),StructField("cls", StringType, nullable = false)))

读取数据

val df = spark.read.format("com.crealytics.spark.excel").option("dataAddress", "'学生信息'!A2:E6").option("useHeader", "false") .schema(schema).load(filePath)df.show()

代码执行,结果如下:

读取的时候有挺多配置的,适宜各种场景下需要定制化执行,关键配置进行说明

配置项 说明
dataAddress 学生信息’!A2:E6,这个表示的其实是Sheet中表格的范围,我指定的是A2到E6表示的其实是一个对角线的区域
useHeader 必须,是否使用表头,false的话自己命名表头(_c0),true则第一行为表头

更多配置的话参考源码中的文档或者看源码也是可以的。

实战

目标:前面有一个学生表,我们再搞一个班级表

我们目标是把学生对应的班主任合并到一个sheet里面去。
我们增加一个对班级读取的df

 val clsSchema = StructType(List(StructField("cls_id", StringType, nullable = false),StructField("cls_addr", StringType, nullable = false),StructField("headteacher", StringType, nullable = false)))val clsDf = spark.read.format("com.crealytics.spark.excel").option("dataAddress", "'班级信息'!A2:C2").option("useHeader", "false").option("treatEmptyValuesAsNulls", "true").option("inferSchema", "true").schema(clsSchema).load(filePath)clsDf.show(10)


分别建立自己的表视图

studentDf.createOrReplaceTempView("student")
clsDf.createOrReplaceTempView("cls")

激动人心的撸sql环节就来了

  val sql="""|select id,name,age,gender,cls,cls_addr,headteacher from|student left join cls on student.cls=cls.cls_id|""".stripMarginspark.sql(sql).show(100)

看一下结果

最后我们把结果写到excel中

 val savefilePath = "D:\\学生信息详情.xlsx"val stuDetail = spark.sql(sql)stuDetail.write.format("com.crealytics.spark.excel").option("dataAddress", "'学生详情'!A1").option("useHeader", "false").option("header", "true").mode("append").save(savefilePath)

效果如下:

通关 ~

利用SparkSQL读写Excel数据相关推荐

  1. python读写excel数据--pandas

    文章目录 1读写excel数据 1.1 读: 1.1 写: 2举例 2.1 要求 2.2 实现 1读写excel数据 利用pandas可以很方便的读写excel数据 1.1 读: data_in = ...

  2. R语言心得说:R语言之xlsx包读写Excel数据

    R语言心得说:R语言之xlsx包读写Excel数据 感谢Adrian A. Drǎgulescu发布的xlsx包 工具准备 [基础]简单读取excel文件数据 [基础]简单写入数据到excel文件 [ ...

  3. toad导入数据_利用TOAD实现EXCEL数据在oracle的导入导出

    利用TOAD实现EXCEL数据在oracle的导入导出 1.从ORACLE数据库导出成为EXCEL文件 利用TOAD连接上数据库,访问某个表,我本机是选中表"OA_USER" 右键 ...

  4. Java程序利用POJ读写Excel的.xls或.xlsx文件所需的3个jar包

    Java程序利用POJ读写Excel文件时,不能只用poi的jar包,因为它还依赖于xmlbeans的jar包,xmlbeans又以来与common-collections的jar包,因此,正常使用P ...

  5. pandas玩转excel-> (2)如何利用pandas读取excel数据文件

    pandas玩转excel-> (2)如何利用pandas读取excel数据文件 import pandas as pd #将excel文件读到内存中,形成dataframe,并命名为peopl ...

  6. pandas玩转excel-> (1)如何利用pandas创建excel数据文件

    pandas玩转excel-> (1)如何利用pandas创建excel数据文件 #在Anaconda3 的Spyder中 #定义pandas模块为pd import pandas as pd ...

  7. Python读写Excel数据(指定某行某列)

    Python读写Excel数据(指定某行某列) 在Python数据处理中,经常需要对Excel表格进行读写操作,本文的代码介绍了如何通过行与列的下标进行数据的读写:代码对数据格式有要求,读数据要求文件 ...

  8. PHP利用phpExcel实现Excel数据的导入导出

    phpExcel包的下载地址:http://download.csdn.net/detail/kesixin/9920920 首先先说一下,这段例程是使用在Thinkphp的开发框架上,要是使用在其他 ...

  9. 利用MFC绘制Excel数据的波形

    利用MFC绘制Excel数据的波形 工具:VS2015.Excel2013 项目的创建 创建文件对话框 打开并读取Excel文件 绘制波形 项目的创建 打开VS2015,文件-新建-项目-MFC应用程 ...

  10. python在excel中的应用-Python利用pandas处理Excel数据的应用详解

    最近迷上了高效处理数据的pandas,其实这个是用来做数据分析的,如果你是做大数据分析和测试的,那么这个是非常的有用的!!但是其实我们平时在做自动化测试的时候,如果涉及到数据的读取和存储,那么而利用p ...

最新文章

  1. Nature最新封面:两大数学难题被AI突破!DeepMind YYDS
  2. 最新:2020年度陈嘉庚科学奖出炉!施一公获生命科学奖
  3. 打造高效机房就这么简单(一)
  4. python打印类的属性
  5. 若依前后端分离版怎样修改主页面显示请求的SpringBoot后台数据
  6. sscanf 的应用noj——663弟弟的作业
  7. HDU 1540 Tunnel Warfare
  8. 如何手动删除一个business document和pricing document的relationship
  9. 《MySQL 8.0.22执行器源码分析(1)——execute iterator一些记录》
  10. Java Se相关测试题(偏线程、集合)含答案及详解
  11. C++ 不能重载的运算符
  12. hadoop-集群管理(3)——不常用参数
  13. 初学者python笔记(文件的操作)
  14. 梳理项目的pom文件
  15. SpringBoot2线程池的创建以及执行异步任务
  16. Gurobi优化器使用(一)搭建并求解一个优化模型的过程【C++环境】
  17. XP系统服务启动设置优化
  18. 【POI】导出Excel自适应列宽
  19. ParrotSec 中文社区 QQ群认证 Openssl解密
  20. index.php g wap,代码阅读--wap端入口文件index.php

热门文章

  1. 可解释性(一)之CAM和Grad_CAM
  2. 手摸手教你使用Yarn包管理工具
  3. C语言填色游戏,‎爱涂色-数字填色涂鸦游戏 v App Storu
  4. 微信朋友圈运营10条经验总结
  5. 查询出编号长度大于4的code_code 编号为14的代码用来解决一下问题: 给出一百分制成绩 联合开发网 - pudn.com...
  6. Dell PowerEdge R710服务器内存条插法/Dell 11G/12G系列服务器内存条插法(转)
  7. vue详细介绍,使用实例
  8. 干货 | 通透理解Elasticsearch聚合
  9. Wafer2 快速开发 Demo
  10. 伦敦 quant_伦敦统一用户组9