1. 程式人生 > >Java實現DFA演算法對敏感詞、廣告詞過濾功能

Java實現DFA演算法對敏感詞、廣告詞過濾功能

一、前言

開發中經常要處理使用者一些文字的提交,所以涉及到了敏感詞過濾的功能,參考資料中DFA有窮狀態機演算法的實現,建立有向圖。完成了對敏感詞、廣告詞的過濾,而且效率較好,所以分享一下

具體實現:

 1、匹配大小寫過濾

 2、匹配全形半形過濾

 3、匹配過濾停頓詞過濾。

 4、敏感詞重複詞過濾。

例如:

支援如下型別型別過濾檢測:
fuck 全小寫
FuCk 大小寫
fuck全形半形
f!!!u&c ###k 停頓詞
fffuuuucccckkk 重複詞

二、程式碼實現

    其目錄結構如下:

   其中resources資源目錄中:

stopwd.txt :停頓詞,匹配時間直接過濾。

wd.txt:敏感詞庫。

   1、WordFilter敏感詞過濾類

package org.andy.sensitivewdfilter;

import java.io.BufferedReader;
import java.io.IOException;
import java.io.InputStreamReader;
import java.util.ArrayList;
import java.util.HashMap;
import java.util.HashSet;
import java.util.List;
import java.util.Map;
import java.util.Set;

import org.andy.sensitivewdfilter.util.BCConvert;

/**
 * 建立時間:2016年8月30日 下午3:01:12
 * 
 * 思路: 建立一個FilterSet,枚舉了0~65535的所有char是否是某個敏感詞開頭的狀態
 * 
 * 判斷是否是 敏感詞開頭 | | 是 不是 獲取頭節點 OK--下一個字 然後逐級遍歷,DFA演算法
 * 
 * @author andy
 * @version 2.2
 */
public class WordFilter {

	private static final FilterSet set = new FilterSet(); // 儲存首字
	private static final Map<Integer, WordNode> nodes = new HashMap<Integer, WordNode>(1024, 1); // 儲存節點
	private static final Set<Integer> stopwdSet = new HashSet<>(); // 停頓詞
	private static final char SIGN = '*'; // 敏感詞過濾替換

	static {
		try {
			long a = System.nanoTime();
			init();
			a = System.nanoTime() - a;
			System.out.println("載入時間 : " + a + "ns");
			System.out.println("載入時間 : " + a / 1000000 + "ms");
		} catch (Exception e) {
			throw new RuntimeException("初始化過濾器失敗");
		}
	}

	private static void init() {
		// 獲取敏感詞
		addSensitiveWord(readWordFromFile("wd.txt"));
		addStopWord(readWordFromFile("stopwd.txt"));
	}

	/**
	 * 增加敏感詞
	 * @param path
	 * @return
	 */
	private static List<String> readWordFromFile(String path) {
		List<String> words;
		BufferedReader br = null;
		try {
			br = new BufferedReader(new InputStreamReader(WordFilter.class.getClassLoader().getResourceAsStream(path)));
			words = new ArrayList<String>(1200);
			for (String buf = ""; (buf = br.readLine()) != null;) {
				if (buf == null || buf.trim().equals(""))
					continue;
				words.add(buf);
			}
		} catch (Exception e) {
			throw new RuntimeException(e);
		} finally {
			try {
				if (br != null)
					br.close();
			} catch (IOException e) {
			}
		}
		return words;
	}

	/**
	 * 增加停頓詞
	 * 
	 * @param words
	 */
	private static void addStopWord(final List<String> words) {
		if (words != null && words.size() > 0) {
			char[] chs;
			for (String curr : words) {
				chs = curr.toCharArray();
				for (char c : chs) {
					stopwdSet.add(charConvert(c));
				}
			}
		}
	}

	/**
	 * 新增DFA節點
	 * @param words
	 */
	private static void addSensitiveWord(final List<String> words) {
		if (words != null && words.size() > 0) {
			char[] chs;
			int fchar;
			int lastIndex;
			WordNode fnode; // 首字母節點
			for (String curr : words) {
				chs = curr.toCharArray();
				fchar = charConvert(chs[0]);
				if (!set.contains(fchar)) {// 沒有首字定義
					set.add(fchar);// 首字標誌位 可重複add,反正判斷了,不重複了
					fnode = new WordNode(fchar, chs.length == 1);
					nodes.put(fchar, fnode);
				} else {
					fnode = nodes.get(fchar);
					if (!fnode.isLast() && chs.length == 1)
						fnode.setLast(true);
				}
				lastIndex = chs.length - 1;
				for (int i = 1; i < chs.length; i++) {
					fnode = fnode.addIfNoExist(charConvert(chs[i]), i == lastIndex);
				}
			}
		}
	}

	/**
	 * 過濾判斷 將敏感詞轉化為成遮蔽詞
	 * @param src
	 * @return
	 */
	public static final String doFilter(final String src) {
		char[] chs = src.toCharArray();
		int length = chs.length;
		int currc;
		int k;
		WordNode node;
		for (int i = 0; i < length; i++) {
			currc = charConvert(chs[i]);
			if (!set.contains(currc)) {
				continue;
			}
			node = nodes.get(currc);// 日 2
			if (node == null)// 其實不會發生,習慣性寫上了
				continue;
			boolean couldMark = false;
			int markNum = -1;
			if (node.isLast()) {// 單字匹配(日)
				couldMark = true;
				markNum = 0;
			}
			// 繼續匹配(日你/日你妹),以長的優先
			// 你-3 妹-4 夫-5
			k = i;
			for (; ++k < length;) {
				int temp = charConvert(chs[k]);
				if (stopwdSet.contains(temp))
					continue;
				node = node.querySub(temp);
				if (node == null)// 沒有了
					break;
				if (node.isLast()) {
					couldMark = true;
					markNum = k - i;// 3-2
				}
			}
			if (couldMark) {
				for (k = 0; k <= markNum; k++) {
					chs[k + i] = SIGN;
				}
				i = i + markNum;
			}
		}

		return new String(chs);
	}
	
	/**
	 * 是否包含敏感詞
	 * @param src
	 * @return
	 */
	public static final boolean isContains(final String src) {
		char[] chs = src.toCharArray();
		int length = chs.length;
		int currc;
		int k;
		WordNode node;
		for (int i = 0; i < length; i++) {
			currc = charConvert(chs[i]);
			if (!set.contains(currc)) {
				continue;
			}
			node = nodes.get(currc);// 日 2
			if (node == null)// 其實不會發生,習慣性寫上了
				continue;
			boolean couldMark = false;
			if (node.isLast()) {// 單字匹配(日)
				couldMark = true;
			}
			// 繼續匹配(日你/日你妹),以長的優先
			// 你-3 妹-4 夫-5
			k = i;
			for (; ++k < length;) {
				int temp = charConvert(chs[k]);
				if (stopwdSet.contains(temp))
					continue;
				node = node.querySub(temp);
				if (node == null)// 沒有了
					break;
				if (node.isLast()) {
					couldMark = true;
				}
			}
			if (couldMark) {
				return true;
			}
		}

		return false;
	}

	/**
	 * 大寫轉化為小寫 全形轉化為半形
	 * 
	 * @param src
	 * @return
	 */
	private static int charConvert(char src) {
		int r = BCConvert.qj2bj(src);
		return (r >= 'A' && r <= 'Z') ? r + 32 : r;
	}

}

其中:

      isContains :是否包含敏感詞

     doFilter:過濾敏感詞

   2、WordNode敏感詞節點

package org.andy.sensitivewdfilter;

import java.util.LinkedList;
import java.util.List;

/**
 * 建立時間:2016年8月30日 下午3:07:45
 * 
 * @author andy
 * @version 2.2
 */
public class WordNode {

	private int value; // 節點名稱

	private List<WordNode> subNodes; // 子節點

	private boolean isLast;// 預設false

	public WordNode(int value) {
		this.value = value;
	}

	public WordNode(int value, boolean isLast) {
		this.value = value;
		this.isLast = isLast;
	}

	/**
	 * 
	 * @param subNode
	 * @return 就是傳入的subNode
	 */
	private WordNode addSubNode(final WordNode subNode) {
		if (subNodes == null)
			subNodes = new LinkedList<WordNode>();
		subNodes.add(subNode);
		return subNode;
	}

	/**
	 * 有就直接返回該子節點, 沒有就建立新增並返回該子節點
	 * 
	 * @param value
	 * @return
	 */
	public WordNode addIfNoExist(final int value, final boolean isLast) {
		if (subNodes == null) {
			return addSubNode(new WordNode(value, isLast));
		}
		for (WordNode subNode : subNodes) {
			if (subNode.value == value) {
				if (!subNode.isLast && isLast)
					subNode.isLast = true;
				return subNode;
			}
		}
		return addSubNode(new WordNode(value, isLast));
	}

	public WordNode querySub(final int value) {
		if (subNodes == null) {
			return null;
		}
		for (WordNode subNode : subNodes) {
			if (subNode.value == value)
				return subNode;
		}
		return null;
	}

	public boolean isLast() {
		return isLast;
	}

	public void setLast(boolean isLast) {
		this.isLast = isLast;
	}

	@Override
	public int hashCode() {
		return value;
	}

}

三、測試結果


專案包含敏感詞庫,原始碼,停頓詞庫等,只需執行maven打jar包直接可執行。