南宁大学生兼职官网京东招兼职快递员吗

应用介绍

HtmlCleaner使用示例

写一个测试用的html文件：html-clean-demo.html

<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd " >

< html xmlns = "http://www.w3.org/1999/xhtml " xml:lang = "zh-CN" dir = "ltr" >

< head >

< meta http-equiv = "Content-Type" content = "text/html; charset=GBK" />

< meta http-equiv = "Content-Language" content = "zh-CN" />

< title > html clean demo </ title >

</ head >

< body >

< div class = "d_1" >

< ul >

< li > bar </ li >

< li > foo </ li >

< li > gzz </ li >

</ ul >

</ div >

< div >

< ul >

< li > < a name = "my_href" href = "1.html" > text-1 </ a > </ li >

< li > < a name = "my_href" href = "2.html" > text-2 </ a > </ li >

< li > < a name = "my_href" href = "3.html" > text-3 </ a > </ li >

< li > < a name = "my_href" href = "4.html" > text-4 </ a > </ li >

</ ul >

</ div >

</ body >

</ html >

Html代码

<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd">

<head>

<title>html clean demo</title>

</head>

<body>

<ul>

</ul>

</div>

<div>

<ul>

</ul>

</div>

</body>

</html>

模拟需求：取出title，name="my_href"的链接，div的class="d_1"下的所有li内容。下面用htmlcleaner写代码，HtmlCleanerDemo.java

package com.chenlb;

import java.io.File;

import org.htmlcleaner.HtmlCleaner;

import org.htmlcleaner.TagNode;

/**

* htmlcleaner 使用示例.

* @author chenlb 2008-11-26 下午02:12:02

public class HtmlCleanerDemo {

public static void main(String[] args) throws Exception {

HtmlCleaner cleaner = new HtmlCleaner();

TagNode node = cleaner.clean(new File( "html/html-clean-demo.html" ), "GBK" );

//按tag取.

Object[] ns = node.getElementsByName("title" , true ); //标题

if (ns.length > 0 ) {

System.out.println("title=" +((TagNode)ns[ 0 ]).getText());

}

System.out.println("ul/li:" );

//按xpath取

ns = node.evaluateXPath("//div[@class='d_1']//li" );

for (Object on : ns) {

TagNode n = (TagNode) on;

System.out.println(" text=" +n.getText());

}

System.out.println("a:" );

//按属性值取

ns = node.getElementsByAttValue("name" , "my_href" , true , true );

for (Object on : ns) {

TagNode n = (TagNode) on;

System.out.println(" href=" +n.getAttributeByName( "href" )+ ", text=" +n.getText());

}

Java代码

package com.chenlb;

import java.io.File;

import org.htmlcleaner.HtmlCleaner;

import org.htmlcleaner.TagNode;

/**

* htmlcleaner 使用示例.

* @author chenlb 2008-11-26 下午02:12:02

public class HtmlCleanerDemo {

public static void main(String[] args) throws Exception {

HtmlCleaner cleaner = new HtmlCleaner();

TagNode node = cleaner.clean(new File("html/html-clean-demo.html"), "GBK");

//按tag取.

Object[] ns = node.getElementsByName("title", true); //标题

if(ns.length > 0) {

System.out.println("title="+((TagNode)ns[0]).getText());

}

System.out.println("ul/li:");

//按xpath取

ns = node.evaluateXPath("//div[@class='d_1']//li");

for(Object on : ns) {

TagNode n = (TagNode) on;

System.out.println(" text="+n.getText());

}

System.out.println("a:");

//按属性值取

ns = node.getElementsByAttValue("name", "my_href", true, true);

for(Object on : ns) {

TagNode n = (TagNode) on;

System.out.println(" href="+n.getAttributeByName("href")+", text="+n.getText());

}

cleaner.clean()中的参数，可以是文件，可以是url，可以是字符串内容。个人认为：比较常用的应该是evaluateXPath、getElementsByAttValue、getElementsByName方法了。另外说明下，htmlcleaner对不规范的html兼容性比较好。

HtmlCleaner是一个免费开源的适用范围广的Java语言Html文档解析器，它能重新整理HTML文档的每个元素并生成结构良好(Well-Formed)的HTML文档。默认它遵循的规则是类似于大部份web浏览器为创文档对象模型所使用的规则，户可以提供自定义tag和规则组来进行过滤和匹配。温州手工制作兼职

HtmlCleaner更新内容

1.HtmlCleaner的文档对象模型拥有了一些函数，处理节点和属性，所以在序列化之前搜索或者编辑是非常容易的。

2.提供基本HtmlCleanerDOM的XPath支持

3.使用XML配置文件让创建定制tag变得更加容易

4.修复多个bug以及API改进

HtmlCleaner软件特色

它被设计的小，快速，灵活而且独立。HtmlCleaner也可用在Java代码中，当命令行工具或Ant任务。解析后编程轻量级文档对象，能够很容易的被转换到DOM或者JDom标准文档，或者通过各种方式(压缩，打印)连续输出XML。

用户评论

周末兼职qq群西安

2025/11/20 23:01更新

2016新年工作计划ppt模板，告诉你计划的重要性。不管做什么，都要有计划，那么如果要让我们把工作计划用ppt展示出来的话，在这2016新的一年里，我们会选择用...

移动宽带网友 qwe123 基金公司佣金: 基金公司佣金
支持 ( 19 ) 盖楼(回复)
移动宽带网友 qwe123 副业兼职招聘语句: 副业兼职招聘语句
支持 ( 63 ) 盖楼(回复)
移动宽带网友 qwe123 开发接单平台怎么赚钱: 开发接单平台怎么赚钱
支持 ( 118 ) 盖楼(回复)
移动宽带网友 qwe123 大富豪棋牌6.0: 大富豪棋牌6.0
支持 ( 71 ) 盖楼(回复)
移动宽带网友 qwe123 巨鳄棋牌图片大全: 巨鳄棋牌图片大全
支持 ( 16 ) 盖楼(回复)
移动宽带网友 qwe123 咸鱼如何赚钱来钱快: 咸鱼如何赚钱来钱快
支持 ( 36 ) 盖楼(回复)
移动宽带网友 qwe123 亲朋棋牌中心官网电话: 亲朋棋牌中心官网电话
支持 ( 136 ) 盖楼(回复)
移动宽带网友 qwe123 夜班司机兼职安阳: 夜班司机兼职安阳
支持 ( 78 ) 盖楼(回复)
移动宽带网友 qwe123 京梦棋牌输了能办警吗: 京梦棋牌输了能办警吗
支持 ( 8 ) 盖楼(回复)
移动宽带网友 qwe123 热搜榜觉醒棋牌: 热搜榜觉醒棋牌
支持 ( 29 ) 盖楼(回复)
移动宽带网友 qwe123 手机捕鱼咋赚钱: 手机捕鱼咋赚钱
支持 ( 194 ) 盖楼(回复)
移动宽带网友 qwe123 游戏赚钱方法视频: 游戏赚钱方法视频
支持 ( 17 ) 盖楼(回复)
移动宽带网友 qwe123 老年人能打游戏赚钱吗: 老年人能打游戏赚钱吗
支持 ( 126 ) 盖楼(回复)
移动宽带网友 qwe123 55海淘提现: 55海淘提现
支持 ( 120 ) 盖楼(回复)
移动宽带网友 qwe123 赚一个亿需要多少秒: 赚一个亿需要多少秒
支持 ( 188 ) 盖楼(回复)
移动宽带网友 qwe123 手机业余时间赚钱: 手机业余时间赚钱
支持 ( 5 ) 盖楼(回复)
移动宽带网友 qwe123 手游戏赚钱平台: 手游戏赚钱平台
支持 ( 50 ) 盖楼(回复)
移动宽带网友 qwe123 钱赚够了想出去旅游: 钱赚够了想出去旅游
支持 ( 5 ) 盖楼(回复)
移动宽带网友 qwe123 棋牌游戏代理开发: 棋牌游戏代理开发
支持 ( 111 ) 盖楼(回复)
移动宽带网友 qwe123 zepeto怎么赚金币快: zepeto怎么赚金币快
支持 ( 34 ) 盖楼(回复)

查看更多评论