首页 > 资讯 > 后端开发 > Python >spark中使用groupByKey进行分组排序的示例代码

357

分享到

spark中使用groupByKey进行分组排序的示例代码

spark使用groupByKey分组排序 spark分组排序 2023-03-09 17:03:34 357人浏览安东尼

Python 官方文档：入门教程 => 点击学习

摘要

任务需求：已知RDD[(query:String, item_id:String, imp:Int, clk:Int)]，要求找到每个query对应的点击最多的前2个item_id，

任务需求：已知RDD[(query:String, item_id:String, imp:Int, clk:Int)]，要求找到每个query对应的点击最多的前2个item_id，即：按照query分组，并按照clk降序排序，每组取前两个。

例如：

（连衣裙，1234, 22, 13）

（牛仔裤，2768, 34, 7）

（连衣裙，1673，45, 9）

（衬衣，3468， 67, 12）

（牛仔裤，2754, 68， 20）

（连衣裙，1976，93, 29）

希望得到：

（连衣裙，1976，93, 29）

（连衣裙，1234, 22, 13）

（牛仔裤，2754, 68， 20）

（牛仔裤，2768, 34, 7）

（衬衣，3468， 67, 12）

先看一个错误的版本：

val list = List(("连衣裙",1234, 22, 13),("牛仔裤",2768, 34, 7),("连衣裙",1673,45, 9)
    ,("衬衣",3468,67, 12),("牛仔裤",2754, 68, 20),("连衣裙",1976,93, 29))
val rdd = ss.sparkContext.parallelize(list)
 
val topItem_set= rdd.map(ele => (ele._1, (ele._2, ele._3, ele._4))).groupByKey()
  .map(line => {
        val topItem = line._2.toArray.sortBy(_._3)(Ordering[Int].reverse).take(2)
        topItem.mkString(",")
        topItem.map(x => {(line._1, x._1, x._2, x._3)})
  })
topItem_set.foreach(println)
println()
topItem_set.map(_.mkString).foreach(println)

我们把query作为key，其余放到一起，groupByKey后（map之前），类型为：RDD[(String, Iterable[(String, Int, Int)])]，根据query分组再map，line._2.toArray把Iterable转为Array，sortBy(_._3)是按最后一个Int即clk排序，(Ordering[Int].reverse)表示从大到小（sortBy默认从小到大，注意这里的sortBy是Array的成员函数而不是rdd的sortBy，用法比较不同），take(2)是取前2个，然后返回（query, item_id）。跑一下上面的过程。

[LScala.Tuple4;@2b672e4
[Lscala.Tuple4;@52e50126
[Lscala.Tuple4;@1362b124
 
(连衣裙,1976,93,29)(连衣裙,1234,22,13)
(衬衣,3468,67,12)
(牛仔裤,2754,68,20)(牛仔裤,2768,34,7)

上面3行是直接打印跟预期稍有差别，同一个key下的top两个元素是作为一个整体，但已经很接近目标，如果希望拆分，需要使用flatMap:

val topItem_set= rdd.map(ele => (ele._1, (ele._2, ele._3, ele._4))).groupByKey()
  .flatMap(line => {
        val topItem = line._2.toArray.sortBy(_._3)(Ordering[Int].reverse).take(2)
        topItem.mkString(",")
        topItem.map(x => {(line._1, x._1, x._2, x._3)})
  })

为什么呢？GroupByKey后，类型为RDD[(String, Iterable[(String, Int, Int)])]，如果用map，那每一个key对应的一个Iterable变量，相当于一条数据，map后的结果自然还是一条。但flatMap，相当于map+flat操作，这才是我们真正的需要的形式。

任务进阶：要求找到每个query对应的点击最多的前2个item_id，当点击一样时，选曝光最少的，即：按照query分组，并优先按照clk降序排序，其次按照imp升序排序，每组取前两个。

例如：

（连衣裙，1234, 22, 13）

（牛仔裤，2768, 34, 7）

（连衣裙，1673，45, 9）

（衬衣，3468， 67, 12）

（牛仔裤，2754, 68， 20）

（连衣裙，1976，93, 29）

（牛仔裤，1232, 20， 7）

希望得到：

（连衣裙，1976，93, 29）

（连衣裙，1234, 22, 13）

（牛仔裤，2754, 68， 20）

（牛仔裤，1232, 20, 7）

（衬衣，2768, 34, 7）

注意，上面样本中牛仔裤有两个样本的点击都是7，但标红的样本曝光数是更小，所以应该入选top2，直接上代码吧：

val list2 = List(("连衣裙",1234, 22, 13),("牛仔裤",2768, 34, 7),("连衣裙",1673,45, 9)
    ,("衬衣",3468,67, 12),("牛仔裤",2754, 68, 20),("连衣裙",1976,93, 29),("牛仔裤",1232, 20, 7))
    val rdd2 = ss.sparkContext.parallelize(list2)
    rdd2.foreach(println)
    val topItem_set= rdd2.map(ele => (ele._1, (ele._2, ele._3, ele._4))).groupByKey()
      .flatMap(line => {
        val topItem = line._2.toArray.sortBy(x => (x._3, x._2))(Ordering.Tuple2(Ordering[Int].reverse, Ordering[Int])).take(2)
        topItem.map(x => {(line._1, x._1, x._2, x._3)})
      })
    topItem_set.foreach(println)

sortBy可以根据需要增加排序维度，参数按优先级排列，这个在日常使用较多。

到此这篇关于spark中使用groupByKey进行分组排序的文章就介绍到这了,更多相关spark使用groupByKey分组排序内容请搜索编程网以前的文章或继续浏览下面的相关文章希望大家以后多多支持编程网！

您可能感兴趣的文档:

点击免费下载>>软考高级考试备考技巧/历年真题/备考精华资料

--结束END--

本文标题: spark中使用groupByKey进行分组排序的示例代码

本文链接: https://www.lsjlt.com/news/199166.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑，方便收藏和打印～

下载Word文档

去做题

猜你喜欢

spark中使用groupByKey进行分组排序的示例代码

任务需求：已知RDD[(query:String, item_id:String, imp:Int, clk:Int)]，要求找到每个query对应的点击最多的前2个item_id，...

99+

2023-03-09

spark使用groupByKey分组排序 spark分组排序
spark中如何使用groupByKey进行分组排序

今天小编给大家分享一下spark中如何使用groupByKey进行分组排序的相关知识点，内容详细，逻辑清晰，相信大部分人都还太了解这方面的知识，所以分享这篇文章给大家参考一下，希望大家阅读完这篇文章后有所收获，下面我们一起来了解一下吧。任务...

99+

2023-07-05
PostgreSQL聚合函数的分组排序使用示例

目录聚合函数COUNTSUM、AVGMAX、MIN聚合函数+DISTINCTGROUP BYHAVINGORDER BY聚合函数用于汇总的函数。 COUNT COUNT，计...

99+

2022-11-13
Python中使用插入排序算法的简单分析与代码示例

问题描述将一组随机排列的数字重新按照从小到大的顺序排列。插入算法每次从数组中取一个数字，与现有数字比较并插入适当位置。如此重复，每次均可以保持现有数字按照顺序排列，直到数字取完，即排序成功。这很像...

99+

2022-06-04

示例算法代码
使用Criteria进行分组求和、排序、模糊查询的实例

目录Criteria进行分组求和、排序、模糊查询1.Entity如下2.repository如下3.service如下4.顺便提及一个不经意间的小错误Criteria进行模糊查询实现...

99+

2022-11-13
AngularJS中使用模块组织代码的示例分析

本篇文章给大家分享的是有关AngularJS中使用模块组织代码的示例分析，小编觉得挺实用的，因此分享给大家学习，希望大家阅读完这篇文章后可以有所收获，话不多说，跟着小编一起来看看吧。下载 modu...

99+

2022-10-19
使用shell脚本对Nginx日志进行切分的示例代码

本文介绍了使用shell脚本对Nginx日志进行切分的示例代码，分享给大家，具体如下： 1.日志格式默认的日志格式: main log_format main '$remote_addr - $rem...

99+

2022-06-04

切分示例脚本
使用python对视频文件分辨率进行分组的实例代码

在平时的工作中，我们的目录有很多的视频文件，如果你没有一个好的视频分类习惯，在找视频素材的时候会很费时，通过对视频的分辨路进行分类可以在需要的时候快速找到你想要的视频分辨率。当然人工...

99+

2022-11-12
Python中对元组和列表按条件进行排序的方法示例

在python中对一个元组排序我的同事Axel Hecht 给我展示了一些我所不知道的关于python排序的东西。在python里你可以对一个元组进行排序。例子是最好的说明： >>>...

99+

2022-06-04

示例中对条件
PyQt中使用QProcess运行一个进程的示例代码

目录一、前言二、运行一个进程三、启动进程的例子一、前言设计应用程序时，有时不希望将一个不太相关的功能集成到程序中，或者是因为该功能与当前设计的应用程序联系不大，或者是因为该功能已经...

99+

2022-12-24

PyQt使用QProcess运行进程 PyQt使用QProcess PyQt运行进程
vue中使用element日历组件的示例代码

先看下效果图：完整代码附上 <template> <div class="newSeeds" id="famerCalendar"> ...

99+

2022-11-12
中文分词入门：使用IK分词器进行文本分词（附Java代码示例）

1. 介绍中文分词是将连续的中文文本切分成一个个独立的词语的过程，是中文文本处理的基础。IK分词器是一个高效准确的中文分词工具，采用了"正向最大匹配"算法，并提供了丰富的功能和可定制选项。 2. I...

99+

2023-09-14

中文分词 java python
使用C#中的Array.Sort函数对数组进行排序

标题：C#中使用Array.Sort函数对数组进行排序的示例正文：在C#中，数组是一种常用的数据结构，经常需要对数组进行排序操作。C#提供了Array类，其中有Sort方法可以方便地对数组进行排序。本文将演示如何使用C#中的Array.So...

99+

2023-11-18

C# Array sort
如何使用SQL语句在MySQL中进行数据排序和分组？

如何使用SQL语句在MySQL中进行数据排序和分组？在数据库中，我们经常需要对数据进行排序和分组以满足不同的需求。MySQL提供了强大的SQL语句来实现这些操作。本文将介绍如何使用SQL语句在MySQL中进行数据排序和分组，并提供具体的代码...

99+

2023-12-17

分组 SQL语句数据排序
Android使用KeyStore对数据进行加密的示例代码

谈到 Android 安全性话题，Android Developers 官方网站给出了许多很好的建议和讲解，涵盖了存储数据、权限、网络、处理凭据、输入验证、处理用户数据、加密等...

99+

2022-06-06

加密 keystore 示例数据 Android
使用PHP中的arsort()函数对数组按值进行逆序排序

标题：PHP中使用arsort()函数对数组按值进行逆序排序文章正文：在PHP中，数组是非常常用的数据结构。有时候我们需要对数组进行排序，特别是按值进行排序。PHP提供了一系列的排序函数来满足我们的需求，其中之一就是arsort()函数。a...

99+

2023-11-18

PHP arsort() 逆序排序
使用Apache commons-cli包进行命令行参数解析的示例代码

Apache的commons-cli包是专门用于解析命令行参数格式的包。依赖： <dependency> <groupId>commons-cli</groupId&g...

99+

2022-06-04

apache commons cli commons cli
Java使用System.currentTimeMillis()方法计算程序运行时间的示例代码

Java 中提供的 System.currentTimeMillis() 方法用于获取当前的计算机时间，时间的表达格式为当前计算机时间和 GMT 时间（格林威治时间）1970年1月1...

99+

2022-11-13
java中静态代码块与构造方法执行顺序判断的示例分析

这篇文章将为大家详细讲解有关java中静态代码块与构造方法执行顺序判断的示例分析，小编觉得挺实用的，因此分享给大家做个参考，希望大家阅读完这篇文章后可以有所收获。静态代码优先于非静态的代码，是因为被static修饰的成员都是类成员，会随着J...

99+

2023-05-30

java
如何使用PHP中的krsort()函数按键名对数组进行逆序排序

如何使用PHP中的krsort()函数按键名对数组进行逆序排序，需要具体代码示例PHP中的数组是一种非常有用的数据结构，它可以存储多个值，并根据键名进行访问和操作。在PHP中，我们可以使用krsort()函数对数组按照键名进行逆序排序。本文...

99+

2023-11-18

PHP 逆序排序 krsort()