Spark實現二次排序

阿新 • • 發佈：2019-02-16

1、HDFS檔案說明

檔案為普通的文字檔案，無壓縮，\001分割，共3列，一次為province_id,city_id,city_uv

需要按照province_id升序，city_uv降序操作

2、程式碼

var data = sc.textFile("/home/hdfs/test_second")

var rdd1=data.map(_.split("\001")).map(fields=>(fields(0).toInt,s"${fields(1)},${fields(2)}"))
var rdd2 = rdd1.groupByKey.sortByKey()
var rdd3 = rdd2.flatMap(x=>{
var r = x._2.toList.sortWith(_.split(",")(1).toInt>_.split(",")(1).toInt)
for(e <- r) yield s"${x._1},${e}"

}).collect.foreach(println)

結果如下：---------------------------------------------

如果想把province_id按照字串排序，需要加上，修改預設的數字排序為字串排序

implicit val sortIntegersByString = new Ordering[Int]{
override def compare(a: Int, b: Int) =

a.toString.compare(b.toString)}

結果

3、使用dataframe實現

var data = sc.textFile("/home/hdfs//test_second")
case class Element(province_id: Integer, city_id: Integer, uv: Integer)
import org.apache.spark.sql.hive.HiveContext
val hiveContext = new org.apache.spark.sql.hive.HiveContext(sc)
import hiveContext.implicits._
val df = data.map(_.split("\001")).map(x=>Element(x(0).toInt,x(1).toInt,x(2).toInt)).toDF()
df.registerTempTable("element")
hiveContext.sql("select * from element order by province_id desc ,uv desc ").collect().foreach(println)

Spark實現二次排序

1、HDFS檔案說明

2、程式碼

3、使用dataframe實現

分別使用Hadoop和Spark實現二次排序

Spark實現二次排序

Hadoop和Spark分別實現二次排序

Spark:Java實現二次排序

結合案例講解MapReduce重要知識點 ------- 使用自定義MapReduce資料型別實現二次排序

43.top10熱門品類之使用Scala實現二次排序

Spark分組二次排序

Spark 二次排序自定義key 實現(Java)

第三天 -- Spark shuffle -- DAG -- 廣播變數 -- 二次排序

一起學Hadoop——二次排序演算法的實現

Hadoop MapReduce二次排序演算法與實現之演算法解析

Spark：高階排序（二次排序）

hadoop 二次排序和一個java實現

Python Hadoop Mapreduce 實現Hadoop Streaming分組和二次排序

Spark的高階排序（二次排序）

《資料演算法-Hadoop/Spark大資料處理技巧》讀書筆記（一）——二次排序

spark學習記錄（七、二次排序和分組取TopN問題）

MapReduce二次排序原理和實現

Hadoop 二次排序實現

spark二次排序到多次排序

Spark實現二次排序

1、HDFS檔案說明

2、程式碼

3、使用dataframe實現

相關推薦