功能:
根据指定的一个或多个列,保留唯一记录。
语法:
去重 <列> <方式> [分区 <分区字段>]
参数:列
用于判断重复的一个或多个列。
必填,省略参数名。
参数:方式
去重的方式。
可选,省略参数名。枚举类型,枚举值如下:
- 保留唯一:缺省值,N条记录重复时只保留第1条。
- 删除重复:删除有重复的记录,相当于只保留所有单条的记录。
- 删除不重复:删除不重复的记录,即删除所有单条的记录。
示例:
订单表如下:
|
OrderID |
Product |
Salesperson |
Amount |
|
1 |
watermelon |
ZhangSan |
100 |
|
2 |
watermelon |
ZhangSan |
200 |
|
3 |
watermelon |
ZhangSan |
300 |
|
4 |
apple |
ZhangSan |
400 |
|
5 |
apple |
ZhangSan |
500 |
|
6 |
watermelon |
LiSi |
600 |
去重 Product, Salesperson // 按Product和Salesperson字段去重,重复时只保留第一条记录,结果如下:
|
OrderID |
Product |
Salesperson |
Amount |
|
1 |
watermelon |
ZhangSan |
100 |
|
4 |
apple |
ZhangSan |
400 |
|
6 |
watermelon |
LiSi |
600 |
去重 Product, Salesperson; 删除重复 //按Product和Salesperson字段去重,删除有重复的记录,结果如下:
|
OrderID |
Product |
Salesperson |
Amount |
|
6 |
watermelon |
LiSi |
600 |
去重 Product, Salesperson; 删除不重复 //按Product和Salesperson字段删除不重复的记录,结果如下:
|
OrderID |
Product |
Salesperson |
Amount |
|
1 |
watermelon |
ZhangSan |
100 |
|
2 |
watermelon |
ZhangSan |
200 |
|
3 |
watermelon |
ZhangSan |
300 |
|
4 |
apple |
ZhangSan |
400 |
|
5 |
apple |
ZhangSan |
500 |
参数:分区
按分区进行去重,概念上类似SQL的PARTITION BY。
可选,不可省略参数名。