微客导航 » 文章资讯 » Java中正则表达式去除html标签

Java中正则表达式去除html标签

2024-02-29 23:06:02 400

Java中正则表达式去除html的标签，主要目的更精确的显示内容，比如前一段时间在做类似于博客中发布文章功能，当编辑器中输入内容后会将样式标签也传入后台并且保存数据库，但是在显示摘要的时候，比如显示正文的前50字作为摘要，那么这时需要去除所有html标签，然后在截取50字，所以就通过了Java正则表达式实现了如下方法，代码如下：

注：这是Java正则表达式去除html标签方法。

privatestaticfinalStringregEx_script="<script[^>]*?>[\\s\\S]*?<\\/script>";//定义script的正则表达式
privatestaticfinalStringregEx_style="<style[^>]*?>[\\s\\S]*?<\\/style>";//定义style的正则表达式
privatestaticfinalStringregEx_html="<[^>]+>";//定义HTML标签的正则表达式
privatestaticfinalStringregEx_space="\\s*|\t|\r|\n";//定义空格回车换行符
privatestaticfinalStringregEx_w="<w[^>]*?>[\\s\\S]*?<\\/w[^>]*?>";//定义所有w标签
/**
*@paramhtmlStr
*@return删除Html标签
*@authorLongJin
*/
publicstaticStringdelHTMLTag(StringhtmlStr){
Patternp_w=Pattern.compile(regEx_w,Pattern.CASE_INSENSITIVE);
Matcherm_w=p_w.matcher(htmlStr);
htmlStr=m_w.replaceAll("");//过滤script标签
Patternp_script=Pattern.compile(regEx_script,Pattern.CASE_INSENSITIVE);
Matcherm_script=p_script.matcher(htmlStr);
htmlStr=m_script.replaceAll("");//过滤script标签
Patternp_style=Pattern.compile(regEx_style,Pattern.CASE_INSENSITIVE);
Matcherm_style=p_style.matcher(htmlStr);
htmlStr=m_style.replaceAll("");//过滤style标签
Patternp_html=Pattern.compile(regEx_html,Pattern.CASE_INSENSITIVE);
Matcherm_html=p_html.matcher(htmlStr);
htmlStr=m_html.replaceAll("");//过滤html标签
Patternp_space=Pattern.compile(regEx_space,Pattern.CASE_INSENSITIVE);
Matcherm_space=p_space.matcher(htmlStr);
htmlStr=m_space.replaceAll("");//过滤空格回车标签
htmlStr=htmlStr.replaceAll("","");//过滤
returnhtmlStr.trim();//返回文本字符串
}

ps：方法仅供参考，供大家一起互相学习，若有不足或者疑问欢迎评论。

返回顶部
3162201930
czq8825@qq.com

Java中正则表达式去除html标签

热门推荐

随机推荐