【Jsoup学习礼记】解析一个body片断

问题

假如你有一个HTML片断 (比如. 一个 div 包含一对 p 标签;
一个不完整的HTML文档) 想对它进行解析。这个HTML片断可以是用户提交的一条评论或在一个CMS页面中编辑body部分。

办法

使用Jsoup.parseBodyFragment(String html)方法.

String html = "<div><p>Lorem ipsum.</p>";
Document doc = Jsoup.parseBodyFragment(html);
Element body = doc.body();

说明

parseBodyFragment 方法创建一个空壳的文档，并插入解析过的HTML到body元素中。假如你使用正常的 Jsoup.parse(String html) 方法，通常你也可以得到相同的结果，但是明确将用户输入作为 body片段处理，以确保用户所提供的任何糟糕的HTML都将被解析成body元素。

Document.body() 方法能够取得文档body元素的所有子元素，与 doc.getElementsByTag("body")相同。

保证安全Stay safe

假如你可以让用户输入HTML内容，那么要小心避免跨站脚本攻击。利用基于 Whitelist 的清除器和 clean(String bodyHtml, Whitelist whitelist)方法来清除用户输入的恶意内容。

时间： 2024-11-07 12:51:05

【Jsoup学习礼记】解析一个body片断的相关文章

【Jsoup学习礼记】从一个URL加载一个Document

存在问题你需要从一个网站获取和解析一个HTML文档,并查找其中的相关数据.你可以使用下面解决方法: 解决方法使用 Jsoup.connect(String url)方法: Document doc = Jsoup.connect("http://example.com/").get(); String title = doc.title(); 说明 connect(String url) 方法创建一个新的 Connection, 和 get() 取得和解析一个HTML文件.如果从该

【Jsoup学习礼记】从一个文件加载一个文档

问题在本机硬盘上有一个HTML文件,需要对它进行解析从中抽取数据或进行修改. 办法可以使用静态 Jsoup.parse(File in, String charsetName, String baseUri) 方法: File input = new File("/tmp/input.html"); Document doc = Jsoup.parse(input, "UTF-8", "http://example.com/"); 说明 pa

解析一个body片断

问题假如你有一个HTML片断 (比如. 一个 div 包含一对 p 标签; 一个不完整的HTML文档) 想对它进行解析.这个HTML片断可以是用户提交的一条评论或在一个CMS页面中编辑body部分. 办法使用Jsoup.parseBodyFragment(String html)方法. String html = "<div><p>Lorem ipsum.</p>"; Document doc = Jsoup.parseBodyFragment(

【Jsoup学习礼记】从元素抽取属性，文本和HTML

问题在解析获得一个Document实例对象,并查找到一些元素之后,你希望取得在这些元素中的数据. 方法要取得一个属性的值,可以使用Node.attr(String key) 方法对于一个元素中的文本,可以使用Element.text()方法对于要取得元素或属性中的HTML内容,可以使用Element.html(), 或 Node.outerHtml()方法示例: String html = "<p>An <a href='http://example.com/'>

【Jsoup学习礼记】设置属性的值

问题在你解析一个Document之后可能想修改其中的某些属性值,然后再保存到磁盘或都输出到前台页面. 方法可以使用属性设置方法 Element.attr(String key, String value), 和 Elements.attr(String key, String value). 假如你需要修改一个元素的 class 属性,可以使用 Element.addClass(String className) 和Element.removeClass(String className)

【Jsoup学习礼记】解析一个HTML字符串

存在问题来自用户输入,一个文件或一个网站的HTML字符串,你可能需要对它进行解析并取其内容,或校验其格式是否完整,或想修改它.怎么办?jsonu能够帮你轻松解决这些问题解决方法使用静态Jsoup.parse(String html) 方法或 Jsoup.parse(String html, String baseUri)示例代码: String html = "<html><head><title>First parse</title><

【Jsoup学习礼记】使用DOM方法来遍历一个文档

问题你有一个HTML文档要从中提取数据,并了解这个HTML文档的结构. 方法将HTML解析成一个Document之后,就可以使用类似于DOM的方法进行操作.示例代码: File input = new File("/tmp/input.html"); Document doc = Jsoup.parse(input, "UTF-8", "http://example.com/"); Element content = doc.getEleme

【Jsoup学习礼记】处理URLs

问题你有一个包含相对URLs路径的HTML文档,需要将这些相对路径转换成绝对路径的URLs. 方法在你解析文档时确保有指定base URI,然后使用 abs: 属性前缀来取得包含base URI的绝对路径.代码如下: Document doc = Jsoup.connect("http://www.open-open.com").get(); Element link = doc.select("a").first(); String relHref = li

【Jsoup学习礼记】示例程序: 获取所有链接

这个示例程序将展示如何从一个URL获得一个页面.然后提取页面中的所有链接.图片和其它辅助内容.并检查URLs和文本信息. 运行下面程序需要指定一个URLs作为参数 package org.jsoup.examples; import org.jsoup.Jsoup; import org.jsoup.helper.Validate; import org.jsoup.nodes.Document; import org.jsoup.nodes.Element; import org.jsoup.

猜你喜欢

bzoj1878[SDOI2009]HH的项链

题目:http://www.lydsy.com/JudgeOnline/problem.php?id=1878 //通过此题,我粗略地了解了什么是离线和它的好处题意:有一串颜色,m条询问:l,r,目 ...

USACO butter

多次使用dijkstra就行, 代码如下: /* ID: m1500293 LANG: C++ PROG: butter */ #include <cstdio> #include < ...

1. Question 判断一个二叉树是否是对称的. Given a binary tree, check whether it is a mirror of itself (ie, symmetri ...

jQuery【学习心得】简介和选择器第一天

之前我也自学过jquery但是就是没有毅力,老是三天打鱼两天撒网,所以学习的不怎么好,现在我每天都会写下我今天学习的心得,给自己加油! 第一天: 1. 区别一下js中的windowonload=fun ...

主键索引小结

InnoDB主键特点 1.索引定义时,若不显示包含主键,会隐式加入主键值. 2.索引定义时,若显示包含主键,会加入主键值. 3.在5.6.8以后,优化器已能自动识别索引末尾的主键值(Index Ext ...

SPI、I2C、UART三种串行总线协议的区别和SPI接口介绍（转）

SPI.I2C.UART三种串行总线协议的区别第一个区别当然是名字: SPI(Serial Peripheral Interface:串行外设接口); I2C(INTER IC BUS) UART( ...

js源生惯性滚动与回弹(备用)

<!DOCTYPE html> <html lang="zh-CN"> <head> <meta charset="UTF-8& ...

java selenium (十二) 操作弹出窗口

selenium 中如何处理弹出窗口阅读目录原理在代码里, 通过 Set<String> allWindowsId = driver.getWindowHandles ...

【Linxu学习007】管道和重定向

一.管道使用管道能够很方便的实现一个程序的输出作为另外一个程序的输入.管道符号为'|',用法: COMMEND | COMMEND | COMMEND| ...... 示例: [email prot ...

华为交换机查看发光收光

今天,单位的S9306做链路扩容,简单讲就是安一个光模块,插一对光线.能上网. 插好线,发现灯不亮,瞬间懵了.线坏了那就麻烦了.25米的线,而且机柜比我高很多.最主要上走线,电源线也是走上面的,(其实 ...

jquery选择器（原创）<二>

jquery选择器,选择接着学: 前面学习了基本选择器中的CSS选择器,现在学层级选择器: 1.子元素选择器子元素选择器,用于在给定的父元素下,查找这个父元素下面的所有的子元素,语法格式,如下: $ ...

记录我所接触的python模块

文本re 模式匹配,正则BeautifulSoup HTML分析ElementTree XML分析文档与报告shelve 对象数据库,操作此实例如操作字典poplib 以 ...

vue-validator（vue验证器）

官方文档:http://vuejs.github.io/vue-validator/zh-cn/index.html github项目地址:https://github.com/vuejs/vue-v ...

Javascript类型——boolean类型

布尔值在Javascript中有两个值:true和false. 布尔值和其他数据类型的转换关系数据类型 true false boolean true false String 任何非空字符串 &q ...

幡然改途是人员态度发一个为双方的后果

http://blog.csdn.net/yj_1989/article/details/48080319 http://blog.csdn.net/yj_1989/article/details/4 ...

type="submit" 和type="button"

今天,小菜鸟又遇到一个问题,当不小心在页面输入框回车一下,结果莫名的页面发出了一个请求. 把问题定位在一个button上,代码是这样写的<button class="btn btn-d ...

Hark的数据结构与算法练习之快速排序

---恢复内容开始--- 前言快速排序是最常见,也是面试中最容易考的排序方法,这里做一下总结算法说明其实这里说的很清楚了:http://blog.csdn.net/morewindows/art ...

spring mvc使用ClassPathXmlApplicationContext或FileSystemXmlApplicationContext和XmlWebApplicationContext类的操作其中 XmlWebApplicationContext是专为Web工程定制的。

一.简单的用ApplicationContext做测试的话,获得Spring中定义的Bean实例(对象).可以用: ApplicationContext ac = new ClassPathXmlAp ...

双缓冲技术讲解

笔者介绍:姜雪伟,IT公司技术合伙人,IT高级讲师,CSDN社区专家,特邀编辑,畅销书作者,国家专利发明人;已出版书籍:<手把手教你架构3D游戏引擎>电子工业出版社和<Unity3D ...

浅谈腾讯技术发展创新不止

针对网络安全现状,国内网络安全厂商不断推陈出新,通过创新的安全产品和技术与安全威胁抗衡.作为国内首家推出下一代防火墙的厂商腾讯,一直以来取得了不错的成绩,其专业的安全防护深受全国众多用户的信赖. 顺应 ...

专题

随机推荐

© 2024 憋错料 | info#biecuoliao.com | 10 q. 0.019 s.