ICode9

精准搜索请尝试: 精确搜索
首页 > 数据库> 文章详细

Databricks 第11篇:Spark SQL 查询(行转列,列转行,Lateral View)

2021-02-09 16:04:21  阅读:1073  来源: 互联网

标签:11 category list Databricks UDTF explode 转列 game select


本文分享在Azure Databricks中如何实现行转列和列转行。

一,行转列

在分组中,把每个分组中的某一列的数据连接在一起:

  • collect_list:把一个分组中的列合成为数组,数据不去重,格式是['a','a','b']
  • collect_set:把一个分组中的列合成为集合,数据去重,格式是['a','b']

用于连接文本数组的函数,通过sep把数组中的item分割开,连接成一个字符串:

concat_ws(sep, [str | array(str)]+)

举个例子,把每个用户的game,通过逗号连接起来:

select uid
 ,concat_ws(",",collect_list(game)) as game_list 
from user_game

二,列转行

Explode(expr) 用于处理array和map结构的数据,把一行的列值转换成多行,该函数产生一个虚拟表,包含一行或多行数据,也就是说,Explode(expr)函数把array类型expr中的元素分成多行,或者将map类型的expr中的元素分成多行和多列。

举个例子,把game_list中的每个item转换为一行数据:

with cte_game as
(
  select uid
    ,collect_list(game) as game_list 
  from user_game
group by uid ) select uid ,explode(game_list) as game from cte_game

三,Lateral View子句

Lateral View子句用于连接表值函数(UDTF),比如explode、split 。Lateral View通过UDTF函数把数据拆分成多行,再把多行结果组合成一个虚拟表。

该子句主要解决的问题是:在select使用UDTF做查询的过程中,该查询只能包含单个UDTF,不能包含其它字段以及多个UDTF的情况。

LATERAL VIEW udtf(expression) tableAlias AS columnAlias (',' columnAlias)

使用LATERAL VIEW + explode 函数进行查询,语句如下:

select movie,category_name 
from movie_info
LATERAL VIEW explode(category) tmpTable as category_name;
-- category_name 是给 explode(category) 列起的别名

 

 

参考文档:

掌握这个SQL技巧超越80%的人——行转列/列转行

SQL reference for Databricks Runtime 7.x

标签:11,category,list,Databricks,UDTF,explode,转列,game,select
来源: https://www.cnblogs.com/ljhdo/p/14263019.html

本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享;
2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关;
3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关;
4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除;
5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。

专注分享技术,共同学习,共同进步。侵权联系[81616952@qq.com]

Copyright (C)ICode9.com, All Rights Reserved.

ICode9版权所有