hive自定义函数过滤emoj表情符

mysql插入数据问题:java.sql.SQLException: Incorrect string value: ‘\xF0\x9F\x98\x8D\xE8\xBE…’ for column ‘job_title’ at row 1

问题原因:
数据中存在Emoj表情内容,每个字符占用4个字节,在Mysql中utf-8默认最大支持3个字节,超长了,所以报错了。
解决办法:

(1)在较新版本的Mysql上可选择修改数据类型为utf8mb4
(2)hive 数据处理过滤掉Emoj表情内容(Emoj数据一般无用),处理完再集成到MySQL数据库。用自定义函数
create temporary function StringFilter as ‘UppUDF.StringFilter’
using jar ‘hdfs://namenodeha/user/p66_u1038_upp_ludp1/tmp/StringFilter.jar’;
自定义函数代码如下:

import org.apache.commons.lang3.CharEncoding;
import org.apache.commons.lang3.CharUtils;
import org.apache.hadoop.hive.ql.exec.UDF;

import java.net.URLEncoder;
import java.nio.charset.StandardCharsets;

/***
 * 过滤emoj表情符
 *
 */
public class StringFilter extends UDF {
    public String evaluate(String str){
        if(str == null || str == ""){
            return null;
        }else{
            StringBuilder sb = new StringBuilder();
            byte[] bytes = str.getBytes(StandardCharsets.UTF_8);
            for(int i=0; i

你可能感兴趣的:(hive)