您好,欢迎来到三六零分类信息网!老站,搜索引擎当天收录,欢迎发信息

java过滤乱码(\u形式乱码、unicode乱码)

2025/11/2 1:41:58发布18次查看
由于编辑人员从excel,word等乱七八糟的地方copy内容过来,其中有不可见的字符,导致输出内容看上去是对的,其实是多了一个零长度的字符(比如:\u2028,0000200b zero width space),所以需要过滤掉不合法的unicode编码等特殊字符
整理的正则:
[\\u007f-\\u009f]|\\u00ad|[\\u0483-\\u0489]|[\\u0559-\\u055a]|\\u058a|[\\u0591-\\u05bd]|\\u05bf|[\\u05c1-\\u05c2]|[\\u05c4-\\u05c7]|[\\u0606-\\u060a]|[\\u063b-\\u063f]|\\u0674|[\\u06e5-\\u06e6]|\\u070f|[\\u076e-\\u077f]|\\u0a51|\\u0a75|\\u0b44|[\\u0b62-\\u0b63]|[\\u0c62-\\u0c63]|[\\u0ce2-\\u0ce3]|[\\u0d62-\\u0d63]|\\u135f|[\\u200b-\\u200f]|[\\u2028-\\u202e]|\\u2044|\\u2071|[\\uf701-\\uf70e]|[\\uf710-\\uf71a]|\\ufb1e|[\\ufc5e-\\ufc62]|\\ufeff|\\ufffc
java代码如下:
private string replacewrongunicode(string source, string replace) { if (stringutils.isblank(source)) { return source; } if (stringutils.isblank(replace)) { replace = ""; } pattern crlf = pattern.compile("([\\u007f-\\u009f]|\\u00ad|[\\u0483-\\u0489]|[\\u0559-\\u055a]|\\u058a|[\\u0591-\\u05bd]|\\u05bf|[\\u05c1-\\u05c2]|[\\u05c4-\\u05c7]|[\\u0606-\\u060a]|[\\u063b-\\u063f]|\\u0674|[\\u06e5-\\u06e6]|\\u070f|[\\u076e-\\u077f]|\\u0a51|\\u0a75|\\u0b44|[\\u0b62-\\u0b63]|[\\u0c62-\\u0c63]|[\\u0ce2-\\u0ce3]|[\\u0d62-\\u0d63]|\\u135f|[\\u200b-\\u200f]|[\\u2028-\\u202e]|\\u2044|\\u2071|[\\uf701-\\uf70e]|[\\uf710-\\uf71a]|\\ufb1e|[\\ufc5e-\\ufc62]|\\ufeff|\\ufffc)"); matcher m = crlf.matcher(source); if (m.find()) { return m.replaceall(replace); } return source; }
附:过滤\n成<br/>
private string replaceenter(string source) { if (stringutils.isblank(source)) { return source; } pattern crlf = pattern.compile("(\r\n|\r|\n|\n\r)"); matcher m = crlf.matcher(source); if (m.find()) { return m.replaceall("<br/>"); } return source; }
更多java知识请关注java基础教程栏目。
以上就是java过滤乱码(\u形式乱码、unicode乱码)的详细内容。
该用户其它信息

VIP推荐

免费发布信息,免费发布B2B信息网站平台 - 三六零分类信息网 沪ICP备09012988号-2
企业名录 Product