ICode9

精准搜索请尝试: 精确搜索
首页 > 其他分享> 文章详细

Greenplum 分布键 distribute hash分布和随机分布

2021-04-18 15:01:12  阅读:229  来源: 互联网

标签:hash INT Greenplum distribute 分布 随机 segment 主键


  Greenplum是分布式系统,创建表时需要指定分布键,目的是为了数据能够平均分布到各个段,所以选择分布键十分重要,选择错了会导致数据不一致。 分布方式:
  • Hash分布:按分布键对数据列进行hash取模存放到对应的segment。
  • 随机分布:数据随机分布在数据库,每次查询都会查询所有的segment。
 

1.分布策略

(1)hash分布

  Greenplum默认使用hash分布策略。该策略可选一个或者多个列作为分布键(distribution key,简称DK)。分布键做哈希算法来确认数据存放到对应的segment上。相同分布键值会hash到相同的段上。表上最好有唯一键或者主键,这样能保证数据均衡分不到各个段上。   如果没有主键或者唯一键,默认选择第一列作为分布键 语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by id;
 

(2)随机分布

  数据被随机分布到段上,相同记录可能会存放在不同的段上。随机分布可以保证数据平均,但是Greenplum的没有跨节点的唯一键约束数据,所以无法保证数据唯一。基于唯一性和性能考虑,推荐使用hash分布。 语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by random;
 

2.分布键语法

(1)查看表的节点分布情况
select gp_segment_id,count(1) from 表名 group by 1 order by 1;
  (2)更改分布键 # 如果有主键存在,需要先删除主键关联
ALTER TABLE 表名 set distributed by(列名);
 

标签:hash,INT,Greenplum,distribute,分布,随机,segment,主键
来源: https://blog.csdn.net/qq_35260875/article/details/115829538

本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享;
2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关;
3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关;
4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除;
5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。

专注分享技术,共同学习,共同进步。侵权联系[81616952@qq.com]

Copyright (C)ICode9.com, All Rights Reserved.

ICode9版权所有