Java中正则表达式去除html标签
Java中正则表达式去除html的标签,主要目的更精确的显示内容,比如前一段时间在做类似于博客中发布文章功能,当编辑器中输入内容后会将样式标签也传入后台并且保存数据库,但是在显示摘要的时候,比如显示正文的前50字作为摘要,那么这时需要去除所有html标签,然后在截取50字,所以就通过了Java正则表达式实现了如下方法,代码如下:
注:这是Java正则表达式去除html标签方法。
privatestaticfinalStringregEx_script="<script[^>]*?>[\\s\\S]*?<\\/script>";//定义script的正则表达式
privatestaticfinalStringregEx_style="<style[^>]*?>[\\s\\S]*?<\\/style>";//定义style的正则表达式
privatestaticfinalStringregEx_html="<[^>]+>";//定义HTML标签的正则表达式
privatestaticfinalStringregEx_space="\\s*|\t|\r|\n";//定义空格回车换行符
privatestaticfinalStringregEx_w="<w[^>]*?>[\\s\\S]*?<\\/w[^>]*?>";//定义所有w标签
/**
*@paramhtmlStr
*@return删除Html标签
*@authorLongJin
*/
publicstaticStringdelHTMLTag(StringhtmlStr){
Patternp_w=Pattern.compile(regEx_w,Pattern.CASE_INSENSITIVE);
Matcherm_w=p_w.matcher(htmlStr);
htmlStr=m_w.replaceAll("");//过滤script标签
Patternp_script=Pattern.compile(regEx_script,Pattern.CASE_INSENSITIVE);
Matcherm_script=p_script.matcher(htmlStr);
htmlStr=m_script.replaceAll("");//过滤script标签
Patternp_style=Pattern.compile(regEx_style,Pattern.CASE_INSENSITIVE);
Matcherm_style=p_style.matcher(htmlStr);
htmlStr=m_style.replaceAll("");//过滤style标签
Patternp_html=Pattern.compile(regEx_html,Pattern.CASE_INSENSITIVE);
Matcherm_html=p_html.matcher(htmlStr);
htmlStr=m_html.replaceAll("");//过滤html标签
Patternp_space=Pattern.compile(regEx_space,Pattern.CASE_INSENSITIVE);
Matcherm_space=p_space.matcher(htmlStr);
htmlStr=m_space.replaceAll("");//过滤空格回车标签
htmlStr=htmlStr.replaceAll("","");//过滤
returnhtmlStr.trim();//返回文本字符串
}
ps:方法仅供参考,供大家一起互相学习,若有不足或者疑问欢迎评论。