pig 是什么?

1. 什么是pig? 
Pig在Hadoop  Pig Latin,并行的数据流语言 
pig是hadoop上层的衍生架构,与hive类似。对比hive(hive类似sql,是一种声明式的语言),pig是一种过程语言,类似于存储过程一步一步得进行数据转化。


5.Pig Latin的介绍 

大小写敏感 
注释 
输入和输出 
加载(Load)  
存储(Store) 
转储(dump)

pig数据类型
double > float > long > int > bytearray
tuple|bag|map|chararray > bytearray
double float long int chararray bytearray都相当于pig的基本类型
tuple相当于数组 ,但是可以类型不一,举例('dirkzhang','dallas',41)
Bag相当于tuple的一个集合,举例{('dirk',41),('kedde',2),('terre',31)},在group的时候会生成bag
Map相当于哈希表,key为chararray,value为任意类型,例如['name'#dirk,'age'#36,'num'#41

nulls 表示的不只是数据不存在,他更表示数据是unkown


http://lxneliu.iteye.com/blog/1669226

你可能感兴趣的:(hadoop,Java)