敏感词文字过滤是一个网站必不可少的功能,如何设计一个好的、高效的过滤算法是非常有必要的。作为一般开发人员来说首先考虑的肯定是简单的匹配,这样是可以实现功能,但效率比较慢,在高级一点的就是正则表达式,比前一个好一点,但终究还是一丘之貉,非常遗憾,两种方法都不可取。当然,在我意识里没有我也没有认知到那个算法可以解决问题,但是百度知道,以下就是学习的DFA算法简单介绍和功能实现。
DFA全称为:Deterministic Finite Automaton,即确定有穷自动机。其特征为:有一个有限状态集合和一些从一个状态通向另一个状态的边,每条边上标记有一个符号,其中一个状态是初态,某些状态是终态。但不同于不确定的有限自动机,DFA中不会有从同一状态出发的两条边标志有相同的符号。
简单点说就是,它是是通过event和当前的state得到下一个state,即event+state=nextstate。理解为系统中有多个节点,通过传递进入的event,来确定走哪个路由至另一个节点,而节点是有限的。
1、敏感词库初始化(将敏感词用DFA算法的原理封装到敏感词库中,敏感词库采用HashMap保存)
package com.fintech.modules.base.util;
import java.util.HashMap;
import java.util.HashSet;
import java.util.Iterator;
import java.util.List;
import java.util.Map;
import java.util.Set;
import org.slf4j.Logger;
import org.slf4j.LoggerFactory;
import com.fintech.modules.sms.black.dto.SmsBlackDict;
/**
* @Description: 敏感词库初始化
* @author lc
* @date 2018年10月9日
*/
public class SensitiveWordInit {
private static Logger logger = LoggerFactory.getLogger(SensitiveWordInit.class);
/**
* 敏感词库
*/
public HashMap sensitiveWordMap;
/**
* 初始化敏感词
* @return
*/
public Map initKeyWord(List sensitiveWords)
{
try
{
// 从敏感词集合对象中取出敏感词并封装到Set集合中
Set keyWordSet = new HashSet();
for (SmsBlackDict s : sensitiveWords)
{
keyWordSet.add(s.getName().trim());
}
// 将敏感词库加入到HashMap中
addSensitiveWordToHashMap(keyWordSet);
}
catch (Exception e)
{
e.printStackTrace();
}
return sensitiveWordMap;
}
/**
* 封装敏感词库
* @param keyWordSet
*/
@SuppressWarnings("rawtypes")
private void addSensitiveWordToHashMap(Set keyWordSet)
{
// 初始化HashMap对象并控制容器的大小
sensitiveWordMap = new HashMap(keyWordSet.size());
// 敏感词
String key = null;
// 用来按照相应的格式保存敏感词库数据
Map nowMap = null;
// 用来辅助构建敏感词库
Map newWorMap = null;
// 使用一个迭代器来循环敏感词集合
Iterator iterator = keyWordSet.iterator();
while (iterator.hasNext())
{
key = iterator.next();
// 等于敏感词库,HashMap对象在内存中占用的是同一个地址,所以此nowMap对象的变化,sensitiveWordMap对象也会跟着改变
nowMap = sensitiveWordMap;
for (int i = 0; i < key.length(); i++)
{
// 截取敏感词当中的字,在敏感词库中字为HashMap对象的Key键值
char keyChar = key.charAt(i);
// 判断这个字是否存在于敏感词库中
Object wordMap = nowMap.get(keyChar);
if (wordMap != null)
{
nowMap = (Map) wordMap;
}
else
{
newWorMap = new HashMap();
newWorMap.put("isEnd", "0");
nowMap.put(keyChar, newWorMap);
nowMap = newWorMap;
}
// 如果该字是当前敏感词的最后一个字,则标识为结尾字
if (i == key.length() - 1)
{
nowMap.put("isEnd", "1");
}
logger.warn("封装敏感词库过程:"+sensitiveWordMap);
}
logger.warn("查看敏感词库数据:" + sensitiveWordMap);
}
}
}
2、敏感词过滤工具类
package com.fintech.modules.base.util;
import java.util.HashSet;
import java.util.Iterator;
import java.util.Map;
import java.util.Set;
/**
* @Description: 敏感词过滤工具类
* @author lc
* @date 2018年10月10日
*/
public class SensitiveWordEngine {
/**
* 敏感词库
*/
public static Map sensitiveWordMap = null;
/**
* 只过滤最小敏感词
*/
public static int minMatchTYpe = 1;
/**
* 过滤所有敏感词
*/
public static int maxMatchType = 2;
/**
* 敏感词库敏感词数量
*
* @return
*/
public int getWordSize()
{
if (SensitiveWordEngine.sensitiveWordMap == null)
{
return 0;
}
return SensitiveWordEngine.sensitiveWordMap.size();
}
/**
* 是否包含敏感词
*
* @param txt
* @param matchType
* @return
*/
public static boolean isContaintSensitiveWord(String txt, int matchType)
{
boolean flag = false;
for (int i = 0; i < txt.length(); i++)
{
int matchFlag = checkSensitiveWord(txt, i, matchType);
if (matchFlag > 0)
{
flag = true;
}
}
return flag;
}
/**
* 获取敏感词内容
*
* @param txt
* @param matchType
* @return 敏感词内容
*/
public static Set getSensitiveWord(String txt, int matchType)
{
Set sensitiveWordList = new HashSet();
for (int i = 0; i < txt.length(); i++)
{
int length = checkSensitiveWord(txt, i, matchType);
if (length > 0)
{
// 将检测出的敏感词保存到集合中
sensitiveWordList.add(txt.substring(i, i + length));
i = i + length - 1;
}
}
return sensitiveWordList;
}
/**
* 替换敏感词
*
* @param txt
* @param matchType
* @param replaceChar
* @return
*/
public static String replaceSensitiveWord(String txt, int matchType, String replaceChar)
{
String resultTxt = txt;
Set set = getSensitiveWord(txt, matchType);
Iterator iterator = set.iterator();
String word = null;
String replaceString = null;
while (iterator.hasNext())
{
word = iterator.next();
replaceString = getReplaceChars(replaceChar, word.length());
resultTxt = resultTxt.replaceAll(word, replaceString);
}
return resultTxt;
}
/**
* 替换敏感词内容
*
* @param replaceChar
* @param length
* @return
*/
private static String getReplaceChars(String replaceChar, int length)
{
String resultReplace = replaceChar;
for (int i = 1; i < length; i++)
{
resultReplace += replaceChar;
}
return resultReplace;
}
/**
* 检查敏感词数量
*
* @param txt
* @param beginIndex
* @param matchType
* @return
*/
public static int checkSensitiveWord(String txt, int beginIndex, int matchType)
{
boolean flag = false;
// 记录敏感词数量
int matchFlag = 0;
char word = 0;
Map nowMap = SensitiveWordEngine.sensitiveWordMap;
for (int i = beginIndex; i < txt.length(); i++)
{
word = txt.charAt(i);
// 判断该字是否存在于敏感词库中
nowMap = (Map) nowMap.get(word);
if (nowMap != null)
{
matchFlag++;
// 判断是否是敏感词的结尾字,如果是结尾字则判断是否继续检测
if ("1".equals(nowMap.get("isEnd")))
{
flag = true;
// 判断过滤类型,如果是小过滤则跳出循环,否则继续循环
if (SensitiveWordEngine.minMatchTYpe == matchType)
{
break;
}
}
}
else
{
break;
}
}
if (!flag)
{
matchFlag = 0;
}
return matchFlag;
}
}
3、调用
/**
* @Description: 是否包含敏感词
* @author lc
*/
public Boolean isContaintSensitiveWord(String message){
logger.info("[通用短信请求]是否包含敏感词验证, 短信内容为: {}", message);
Map paramMap = new HashMap();
Boolean boo = false;
try {
paramMap.put("valid", PublicEnum.YES.getCode());
paramMap.put("type", PublicEnum.N.getCode());
// 从数据库中获取敏感词对象集合
List list = blackDictMapper.listBlack(paramMap);
// 初始化敏感词库对象
SensitiveWordInit sensitiveWordInit = new SensitiveWordInit();
// 构建敏感词库
Map sensitiveWordMap = sensitiveWordInit.initKeyWord(list);
// 传入SensitivewordEngine类中的敏感词库
SensitiveWordEngine.sensitiveWordMap = sensitiveWordMap;
boo = SensitiveWordEngine.isContaintSensitiveWord(message, 2);
} catch (Exception e) {
logger.error("[通用短信请求]是否包含敏感词验证异常!{}", e.getMessage());
}
return boo;
}
/**
* @Description: 获取敏感词内容
* @author lc
*/
public Set getSensitiveWord(BaseMessage baseMessage){
logger.info("[通用短信请求]获取敏感词内容, 短信内容为: {}", baseMessage.getMessage());
Map paramMap = new HashMap();
Set sensitiveWordList = null;
try {
paramMap.put("valid", PublicEnum.YES.getCode());
paramMap.put("type", PublicEnum.N.getCode());
// 从数据库中获取敏感词对象集合
List list = blackDictMapper.listBlack(paramMap);
// 初始化敏感词库对象
SensitiveWordInit sensitiveWordInit = new SensitiveWordInit();
// 构建敏感词库
Map sensitiveWordMap = sensitiveWordInit.initKeyWord(list);
// 传入SensitivewordEngine类中的敏感词库
SensitiveWordEngine.sensitiveWordMap = sensitiveWordMap;
sensitiveWordList = SensitiveWordEngine.getSensitiveWord(baseMessage.getMessage(), 2);
logger.info("[通用短信请求]获取敏感词内容, 敏感词为: {}", sensitiveWordList);
// 留存拦截记录
SmsBlackInterceptRecord record = new SmsBlackInterceptRecord(baseMessage, sensitiveWordList.toString());
interceptRecordService.insert(record);
} catch (Exception e) {
logger.error("[通用短信请求]获取敏感词内容异常!{}", e.getMessage());
}
return sensitiveWordList;
}
注释:代码中包含自己的业务逻辑代码,只要改成自己的就可以使用