摘要:本篇教程探讨了大数据技术 重新认识mapreduce,希望阅读本篇文章以后大家有所收获,帮助大家对大数据技术的理解更加深入。
本篇教程探讨了大数据技术 重新认识mapreduce,希望阅读本篇文章以后大家有所收获,帮助大家对大数据技术的理解更加深入。
<
首先看一下mapreduce的过程
相信这张图熟悉MR的人都应该见过,再来一张图
wordcount也不细说了,hadoop里面的hello,world
之前我的理解是map过来的
后来自定义Writable对象,封装一组值作为key,也没有什么问题,而且一直认为key只要在compareTo中重写 了方法就万事大吉,而且compareTo返回0的会作为相同的key。误区就在这里,之前一直认为key相同的value会合并到一个"list"中-。这句话就有错,key是key,value是value,根本不会将key对应的value合并在一起,真实情况是默认将key相同(compareTo返回0的)的合并成了一组,在组相同的里面去foreach里面的value,如果是自定义key的话你可以将key打印一下,或发现key并不相同。
上代码:
public class Entry implements WritableComparable
private String yearMonth;
private int count;
public Entry() {
}
@Override
public int compareTo(Entry entry) {
int result = this.yearMonth.compareTo(entry.getYearMonth());
if (result == 0) {
result = Integer.compare(count, entry.getCount());
}
return result;
}
@Override
public void write(DataOutput dataOutput) throws IOException {
dataOutput.writeUTF(yearMonth);
dataOutput.writeInt(count);
}
@Override
public void readFields(DataInput dataInput) throws IOException {
this.yearMonth = dataInput.readUTF();
this.count = dataInput.readInt();
}
public String getYearMonth() {
return yearMonth;
}
public void setYearMonth(String yearMonth) {
this.yearMonth = yearMonth;
}
public int getCount() {
return count;
}
public void setCount(int count) {
this.count = count;
}
@Override
public String toString() {
return yearMonth;
}
}
自定义分区 EntryPartitioner.java
public class EntryPartitioner extends Partitioner
@Override
public int getPartition(Entry entry, Text paramVALUE, int numberPartitions) {
return Math.abs((entry.getYearMonth().hashCode() % numberPartitions));
}
}
自定义分组
public class EntryGroupingComparator extends WritableComparator {
public EntryGroupingComparator() {
super(Entry.class, true);
}
@Override
public int compare(WritableComparable a, WritableComparable b) {
Entry a1 = (Entry) a;
Entry b1 = (Entry) b;
return a1.getYearMonth().compareTo(b1.getYearMonth());
}
}
mapper类
public class SecondarySortMapper extends
Mapper
private Entry entry = new Entry();
private Text value = new Text();
@Override
protected void map(LongWritable key, Text lines, Context context)
throws IOException, InterruptedException {
String line = lines.toString();
String[] tokens = line.split(",");
String yearMonth = tokens[0] + "-" + tokens[1];
int count = Integer.parseInt(tokens[2]);
entry.setYearMonth(yearMonth);
entry.setCount(count);
value.set(tokens[2]);
context.write(entry, value);
}
}
reducer类
public class SecondarySortReducer extends Reducer
@Override
protected void reduce(Entry key, Iterable
throws IOException, InterruptedException {
System.out.println("-----------------华丽的分割线-----------------");
StringBuilder builder = new StringBuilder();
for (Text value : values) {
System.out.println(key+"==>"+value);
builder.append(value.toString());
builder.append(",");
}
context.write(key, new Text(builder.toString()));
}
}
reducer中打印出来的跟原来想的不一样,一组的值除了自定义分组的属性相同外,其他的属性有不同的。看来以前是自己理解不够深入啊,特此写出,以示警戒
本文由职坐标整理发布,学习更多的大数据技术相关知识,请关注职坐标大技术云计算大技术技术频道!
您输入的评论内容中包含违禁敏感词
我知道了
请输入正确的手机号码
请输入正确的验证码
您今天的短信下发次数太多了,明天再试试吧!
我们会在第一时间安排职业规划师联系您!
您也可以联系我们的职业规划师咨询:
版权所有 职坐标-一站式IT培训就业服务领导者 沪ICP备13042190号-4
上海海同信息科技有限公司 Copyright ©2015 www.zhizuobiao.com,All Rights Reserved.
沪公网安备 31011502005948号