spark jdk8 單詞統計示例

阿新 • • 發佈：2017-12-25

apache imp ace lang rtb use basis 寫法 work

在github上有spark-java8 實例地址：

https://github.com/ypriverol/spark-java8

https://github.com/ihr/java8-spark

學些java8 Lambda Expressions 的可以參考下，同時自己也做下比較。

java8 代碼實例

 1 /* 
 2  * Licensed to the Apache Software Foundation (ASF) under one or more 
 3  * contributor license agreements.  See the NOTICE file distributed with 
 
 4  * this work for additional information regarding copyright ownership. 
 5  * The ASF licenses this file to You under the Apache License, Version 2.0 
 6  * (the "License"); you may not use this file except in compliance with 
 7  * the License.  You may obtain a copy of the License at 
 8  * 
 9  *     
http://www.apache.org/licenses/LICENSE-2.0 
10  * 
11  * Unless required by applicable law or agreed to in writing, software 
12  * distributed under the License is distributed on an "AS IS" BASIS, 
13  * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. 
14  * See the License for the specific language governing permissions and 
 
15  * limitations under the License. 
16  */  
17   
18 package com.east.spark.stream;  
19   
20 import java.util.Arrays;  
21 import java.util.List;  
22 import java.util.regex.Pattern;  
23   
24 import org.apache.spark.api.java.JavaPairRDD;  
25 import org.apache.spark.api.java.JavaRDD;  
26 import org.apache.spark.sql.SparkSession;  
27   
28 import scala.Tuple2;  
29   
30 public final class JavaWordCount2 {  
31     private static final Pattern SPACE = Pattern.compile(" ");  
32   
33     public static void main(String[] args) throws Exception {  
34   
35         args = new String[] { "D:/tmp/spark/test.txt" };  
36   
37         if (args.length < 1) {  
38             System.err.println("Usage: JavaWordCount <file>");  
39             System.exit(1);  
40         }  
41   
42         SparkSession spark = SparkSession.builder().appName("JavaWordCount").master("local").getOrCreate();  
43   
44         // SparkConf conf = new  
45         // SparkConf().setAppName("ingini-spark-java8").setMaster("local");  
46   
47         JavaRDD<String> lines = spark.read().textFile(args[0]).javaRDD();  
48   
49         JavaRDD<String> words = lines.flatMap(line -> Arrays.asList(line.split(" ")).iterator());  
50   
51         JavaPairRDD<String, Integer> counts = words.mapToPair(w -> new Tuple2<String, Integer>(w, 1))  
52                 .reduceByKey((x, y) -> x + y);  
53         // counts.collect();  
54   
55         List<Tuple2<String, Integer>> output = counts.collect();  
56         for (Tuple2<?, ?> tuple : output) {  
57             System.out.println(tuple._1() + ":== " + tuple._2());  
58         }  
59   
60         spark.stop();  
61     }  
62 }

更簡潔的寫法：

1 JavaRDD<String> lines = sc.textFile("src/main/resources/a.txt");
2         JavaPairRDD<String, Integer> counts = lines.flatMap(line -> Arrays.asList(line.split(REGEX)))
3                 .mapToPair(word -> new Tuple2(word, 1))
4                 .reduceByKey((x, y) -> (Integer) x + (Integer) y)
5                 .sortByKey();
6         
7         counts.foreach(stringIntegerTuple2 ->System.out.println( stringIntegerTuple2._1+":"+stringIntegerTuple2._2));

spark jdk8 單詞統計示例

apache imp ace lang rtb use basis 寫法 work 在github上有spark-java8 實例地址： https://github.com/ypriverol/spark-java8 https://github.com/ihr/java

spark wordcount 單詞統計

spark wordcount 單詞統計檔案1.txt hello world hello tom hello lucy tom lucy hello python # -*- coding:utf-8 -*- import os import shutil from pyspark

Spark Streaming從Kafka中獲取數據，並進行實時單詞統計，統計URL出現的次數

scrip 發送消息 rip mark 3.2 umt 過程 bject ttr 1、創建Maven項目創建的過程參考：http://blog.csdn.net/tototuzuoquan/article/details/74571374 2、啟動Kafka A:安裝ka

spark入門實踐之單詞統計

2017-07-01 簡介 Apache Spark 是專為大規模資料處理而設計的快速通用的計算引擎。 Spark由UC Berkeley AMP lab (加州大學伯克利分校的AMP實驗室) 於2009年開始開發並開源. 目前

大資料實時計算Spark學習筆記（1）—— Spak單詞統計

1 啟動 Spark-shell [[email protected] ~]$ spark-shell Using Spark's default log4j profile: org/apache/spark/log4j-defaults.properties Se

Spark Streaming從Kafka中獲取資料，並進行實時單詞統計，統計URL出現的次數

1、建立Maven專案 2、啟動Kafka 3、編寫Pom檔案 <?xml version="1.0" encoding="UTF-8"?> <project xmlns="http://maven.apache.or

Hadoop mapduce 統計單詞程式設計示例

首先，完成mapper類 package sinc.hadoops.mr; import java.io.IOException; import org.apache.hadoop.io.LongWritable; import org.apache.hadoop.i

spark操作hdfs統計單詞例項 for Eclipse

Set() 2018-09-07 20:27:46 INFO Utils:54 - Successfully started service 'sparkDriver' on port 1623. 2018-09-07 20:27:46 INFO SparkEnv:54 - Registering Map

Spark運行命令示例

clu spark 示例 mit res java example amp pro local單機模式：結果xshell可見：./bin/spark-submit --class org.apache.spark.examples.SparkPi --master loca

一個單詞統計的實例，怎樣通過MapReduce完成排序？

mapreduce hadoop假設有一批海量的數據，每個數據都是由26個字母組成的字符串，原始的數據集合是完全無序的，怎樣通過MapReduce完成排序工作，使其有序（字典序）呢？對原始的數據進行分割（Split），得到N個不同的數據分塊：實例分析：WordCount這個類實現Mapper接口中的map 方

scala基本語法和單詞統計

引用包裝類 tab 組成 oop imp 2個 err 方法調用 scala 基本語法 1.聲明變量 (1)val i = 1 使用val聲明的變量值是不可變的，相當於java裏final修飾的變量，推薦使用。(2)var i = "hello" 使用var聲明的變量值是

【MapReduce實例】單詞統計

clas e30 xor acdb pwc blog tar target xorg 鍁ye廢此比構es熱誓腔垂斯鞍燎拼烙傯煞6k略史熱http://blog.sina.com.cn/s/blog_17cbe977f0102x7sl.html裂jb焚諢時鉤df緞字靖琴悼放克

手動實現一個單詞統計MapReduce程序與過程原理分析

Hadoop MapReduce Java [toc] 手動實現一個單詞統計MapReduce程序與過程原理分析前言我們知道，在搭建好hadoop環境後，可以運行wordcount程序來體驗一下hadoop的功能，該程序在hadoop目錄下的share/hadoop/mapreduce目錄中

使用正則表達式進行單詞統計

nes int readline ole span dsw eno col 正則表達式 1 import java.io.BufferedReader; 2 import java.io.File; 3 import java.io.FileNotFoundExce

Storm筆記整理（二）：Storm本地開發案例—總和計算與單詞統計

大數據實時計算 Storm [TOC] 概述在Strom的API中提供了LocalCluster對象，這樣在不用搭建Storm環境或者Storm集群的情況下也能夠開發Storm的程序，非常方便。基於Maven構建工程項目，其所需要的依賴如下： <dependency>

Spark shell 詞頻統計和統計PV心得

spark shell spark shell PV spark shell 詞頻統計所有過程按本人實驗並以本人能夠接受的方式理解的，大家可以參考，如有問題請留言指正。樣本數據[hadoop@h201 ~]$ cat hh.txt hello,worldhello,hadoophello,ora

單詞統計：對程序設計語言源文件統計字符數、單詞數、行數，統計結果以指定格式輸出到默認文件中

let 單詞百度 cli info class bsp push lan 　項目地址：https://gitee.com/loyal888/WordCount 一.工具篇 1.1 IDEA+gitee+git　方便push和增加開發效率，自從用了idea

MapReduce實現單詞統計

mapreduce實現思路： Map階段： a) 從HDFS的源資料檔案中逐行讀取資料 b) 將每一行資料切分出單詞 c) 為每一個單詞構造一個鍵值對(單詞，1) d) 將鍵值對傳送給reduce Reduce階段： a)&nb

十、spark graphx的scala示例

簡介 spark graphx官網：http://spark.apache.org/docs/latest/graphx-programming-guide.html#overview spark graphx是基於spark core之上的一個圖計算元件，graphx擴充套件了s

十二、spark MLlib的scala示例

簡介 spark MLlib官網：http://spark.apache.org/docs/latest/ml-guide.html mllib是spark core之上的演算法庫，包含了豐富的機器學習的一系列演算法。你可以通過簡單的API來構建演算法模型，然後利用模型來進行預測分析推

spark jdk8 單詞統計示例

相關推薦