[原创]利用爬虫技术获取网页数据，以及想要的指定数据

最近在公司做个系统，由于要获取网页的一些数据，以及一些网页的数据，所以就写的一个公用的HttpUtils.下面是针对乌云网我写的一个例子。

一、首先是获取指定路径下的网页内容。

	public static String httpGet(String urlStr, Map<String, String> params) throws Exception {
		StringBuilder sb = new StringBuilder();
		if (null != params && params.size() > 0) {
			sb.append("?");
			Entry<String, String> en;
			for (Iterator<Entry<String, String>> ir = params.entrySet().iterator(); ir.hasNext();) {
				en = ir.next();
				sb.append(en.getKey() + "=" + URLEncoder.encode(en.getValue(),"utf-8") + (ir.hasNext() ? "&" : ""));
			}
		}
		URL url = new URL(urlStr + sb);
		HttpURLConnection conn = (HttpURLConnection) url.openConnection();
		conn.setConnectTimeout(5000);
		conn.setReadTimeout(5000);
		conn.setRequestMethod("GET");
		if (conn.getResponseCode() != 200)
			throw new Exception("请求异常状态值:" + conn.getResponseCode());
		BufferedInputStream bis = new BufferedInputStream(conn.getInputStream());
		Reader reader = new InputStreamReader(bis,"gbk");
		char[] buffer = new char[2048];
		int len = 0;
		CharArrayWriter caw = new CharArrayWriter();
		while ((len = reader.read(buffer)) > -1)
			caw.write(buffer, 0, len);
		reader.close();
		bis.close();
		conn.disconnect();
		//System.out.println(caw);
		return caw.toString();
	}

浏览器询问结果：

代码询问结果与上面一致：

二、通过指定url获取，网页部分想要的数据。

对于这个方法，要导入Jsoup包，这个可以自己在网上下载。

Document doc = null;
    try {
          doc = Jsoup.connect("http://www.wooyun.org//bugs//wooyun-2016-0225856").userAgent("Mozilla/5.0 (Windows NT 10.0; Trident/7.0; rv:11.0) like 				Gecko").timeout(30000).get();
    } catch (IOException e) {
         e.printStackTrace();
    }
    for(Iterator<Element> ir = doc.select("h3").iterator();ir.hasNext();){
        System.out.println(ir.next().text());
 }

对于那个select选择器，根据条件来选择，doc.select("h3").iterator()，对于Jsoup有以下规则：

jsoup 是一款基于Java 的HTML解析器，可直接解析某个URL地址或HTML文本内容。它提供了一套非常省力的API，可通过DOM，CSS以及类似于jQuery的操作方法来取出和操作数据。
jsoup的强大在于它对文档元素的检索，Select方法将返回一个Elements集合，并提供一组方法来抽取和处理结果，要掌握Jsoup首先要熟悉它的选择器语法。
1、Selector选择器基本语法

tagname: 通过标签查找元素，比如：a
ns|tag: 通过标签在命名空间查找元素，比如：可以用 fb|name 语法来查找 <fb:name> 元素
#id: 通过ID查找元素，比如：#logo
.class: 通过class名称查找元素，比如：.masthead
[attribute]: 利用属性查找元素，比如：[href]
[^attr]: 利用属性名前缀来查找元素，比如：可以用[^data-] 来查找带有HTML5 Dataset属性的元素
[attr=value]: 利用属性值来查找元素，比如：[width=500]
[attr^=value], [attr$=value], [attr*=value]: 利用匹配属性值开头、结尾或包含属性值来查找元素，比如：[href*=/path/]
[attr~=regex]: 利用属性值匹配正则表达式来查找元素，比如： img[src~=(?i)\.(png|jpe?g)]
*: 这个符号将匹配所有元素

2、Selector选择器组合使用语法

el#id: 元素+ID，比如： div#logo
el.class: 元素+class，比如： div.masthead
el[attr]: 元素+class，比如： a[href]
任意组合，比如：a[href].highlight
ancestor child: 查找某个元素下子元素，比如：可以用.body p 查找在”body”元素下的所有 p元素
parent > child: 查找某个父元素下的直接子元素，比如：可以用div.content > p 查找 p 元素，也可以用body > * 查找body标签下所有直接子元素
siblingA + siblingB: 查找在A元素之前第一个同级元素B，比如：div.head + div
siblingA ~ siblingX: 查找A元素之前的同级X元素，比如：h1 ~ p
el, el, el:多个选择器组合，查找匹配任一选择器的唯一元素，例如：div.masthead, div.logo

3、Selector伪选择器语法

:lt(n): 查找哪些元素的同级索引值（它的位置在DOM树中是相对于它的父节点）小于n，比如：td:lt(3) 表示小于三列的元素
:gt(n):查找哪些元素的同级索引值大于n，比如： div p:gt(2)表示哪些div中有包含2个以上的p元素
:eq(n): 查找哪些元素的同级索引值与n相等，比如：form input:eq(1)表示包含一个input标签的Form元素
:has(seletor): 查找匹配选择器包含元素的元素，比如：div:has(p)表示哪些div包含了p元素
:not(selector): 查找与选择器不匹配的元素，比如： div:not(.logo) 表示不包含 class="logo" 元素的所有 div 列表
:contains(text): 查找包含给定文本的元素，搜索不区分大不写，比如： p:contains(jsoup)
:containsOwn(text): 查找直接包含给定文本的元素
:matches(regex): 查找哪些元素的文本匹配指定的正则表达式，比如：div:matches((?i)login)
:matchesOwn(regex): 查找自身包含文本匹配指定正则表达式的元素

注意：上述伪选择器索引是从0开始的，也就是说第一个元素索引值为0，第二个元素index为1等。

浏览器访问：

代码访问：

源代码HttpUtils.java：

package com.ffcs.lsoc.bug.utils;
import java.io.BufferedInputStream;
import java.io.CharArrayWriter;
import java.io.InputStreamReader;
import java.io.Reader;
import java.net.HttpURLConnection;
import java.net.URL;
import java.net.URLEncoder;
import java.util.Iterator;
import java.util.Map;
import java.util.Map.Entry;

import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;

/**
 * 抓取网页工具类
 * @author g-gaojp
 * @date 2016-7-10
 */
public class HttpUtils {

	/**
	 * 获取网页数据
	 * @param urlStr  访问地址
	 * @param params  参数
	 * @param charset 字符编码
	 * @return
	 * @throws Exception
	 */
	public static String httpGet(String urlStr, Map<String, String> params,String charset) throws Exception {
		StringBuilder sb = new StringBuilder();
		if (null != params && params.size() > 0) {
			sb.append("?");
			Entry<String, String> en;
			for (Iterator<Entry<String, String>> ir = params.entrySet().iterator(); ir.hasNext();) {
				en = ir.next();
				sb.append(en.getKey() + "=" + URLEncoder.encode(en.getValue(),"utf-8") + (ir.hasNext() ? "&" : ""));
			}
		}
		URL url = new URL(urlStr + sb);
		HttpURLConnection conn = (HttpURLConnection) url.openConnection();
		conn.setConnectTimeout(5000);
		conn.setReadTimeout(5000);
		conn.setRequestMethod("GET");
		if (conn.getResponseCode() != 200){
			throw new Exception("请求异常状态值:" + conn.getResponseCode());
		}
		BufferedInputStream bis = new BufferedInputStream(conn.getInputStream());
		Reader reader = new InputStreamReader(bis,charset);
		char[] buffer = new char[2048];
		int len = 0;
		CharArrayWriter caw = new CharArrayWriter();
		while ((len = reader.read(buffer)) > -1)
			caw.write(buffer, 0, len);
		reader.close();
		bis.close();
		conn.disconnect();
		return caw.toString();
	}

	/**
	 * 获取网页数据
	 * @param urlStr  访问地址
	 * @param params  参数
	 * @return
	 * @throws Exception
	 */
	public static String httpGet(String urlStr, Map<String, String> params) throws Exception {
		StringBuilder sb = new StringBuilder();
		if (null != params && params.size() > 0) {
			sb.append("?");
			Entry<String, String> en;
			for (Iterator<Entry<String, String>> ir = params.entrySet().iterator(); ir.hasNext();) {
				en = ir.next();
				sb.append(en.getKey() + "=" + URLEncoder.encode(en.getValue(),"utf-8") + (ir.hasNext() ? "&" : ""));
			}
		}
		URL url = new URL(urlStr + sb);
		HttpURLConnection conn = (HttpURLConnection) url.openConnection();
		conn.setConnectTimeout(5000);
		conn.setReadTimeout(5000);
		conn.setRequestMethod("GET");
		if (conn.getResponseCode() != 200)
			throw new Exception("请求异常状态值:" + conn.getResponseCode());
		BufferedInputStream bis = new BufferedInputStream(conn.getInputStream());
		Reader reader = new InputStreamReader(bis,"gbk");
		char[] buffer = new char[2048];
		int len = 0;
		CharArrayWriter caw = new CharArrayWriter();
		while ((len = reader.read(buffer)) > -1)
			caw.write(buffer, 0, len);
		reader.close();
		bis.close();
		conn.disconnect();
		//System.out.println(caw);
		return caw.toString();
	}

	/**
	 * 从获得的网页的document中获取指定条件的内容
	 * @param document
	 * @param condition 条件
	 * @return
	 */
	public static String catchInfomationFromDocument(Document document , String condition , int position){

		if(document != null){
			Iterator<Element> iterator = document.select(condition).iterator();
			if(iterator.hasNext()){
				String str = iterator.next().text();
				return str.substring(position).trim();
			}
		}
		return null;
	}

	/**
	 * 判断从获得的网页的document中<br/>
	 * 获取指定条件的内容是否存在
	 * @param document
	 * @param condition 条件
	 * @return
	 */
	public static boolean isExistInfomation(Document document , String condition){

		if(document != null){
			Iterator<Element> iterator = document.select(condition).iterator();
			if(iterator.hasNext()){
				return true;
			}
		}
		return false;
	}

}

时间： 2024-10-07 10:22:23

[原创]利用爬虫技术获取网页数据，以及想要的指定数据的相关文章

使用webcollector爬虫技术获取网易云音乐全部歌曲

最近在知乎上看到一个话题,说使用爬虫技术获取网易云音乐上的歌曲,甚至还包括付费的歌曲,哥瞬间心动了,这年头,好听的流行音乐或者经典老歌都开始收费了,只能听不能下载,着实很郁闷,现在机会来了,于是开始研究爬虫技术,翻阅各种资料,最终选择网友们一致认为比较好用的webcollector框架来实现. 首先,我们来认识一下webcollector,webcollector是一个无需配置,便于二次开发的爬虫框架,它提供精简的API,只需少量代码即可实现一个功能强大的爬虫,webcollector+hado

asp.net 利用HttpWebRequest自动获取网页编码并获取网页源代码

/// <summary> /// 获取源代码 /// </summary> /// <param name="url"></param> /// <returns></returns> public static string GetHtml(string url, Encoding encoding) { HttpWebRequest request = null; HttpWebResponse respon

03 爬虫实例-获取网页弹幕内容

练习:爬取哔哩哔哩网页弹幕内容,并将爬取的内容以五角星的形式显示出来思路: 向哔哩哔哩网站发送请求请求成功后,解析爬取的弹幕内容保存到一个文件中读取文件并分析弹幕内容中词组或文字出现的频率将这些词组或文字组成五角星图形组成五角星图形后,以图片的形式输出实现: 1 #!/usr/bin/env python 2 # -*- coding: utf-8 -*- 3 # author:albert time:2019/10/28 4 import requests 5 from bs4 i

利用备份技术获取apk本地存储数据

即使设备没有root,我们也可以通过物理访问设备来获取应用程序的数据,我们还可以通过此方法改变一个应用程序的数据.如果一个应用程序将数据存储在客户端, 使用简单的密码或pin检查,攻击者有可能使用这种方法来绕过这些检查.在本文中,我们将讨论如何在一台没有root的设备上利用这种方法来改变应用程序特定的数据.主要操作步骤如下所示: Step 1: 备份目标应用 Step 2: 去掉头部信息然后保存文件 Step 3: 做必要的修改 Step 4: 从原始的”.ab”文件获得头部信息 Step 5:

Python爬虫技术(从网页获取图片)+HierarchicalClustering层次聚类算法，实现自动从网页获取图片然后根据图片色调自动分类—Jason niu

网上教程太啰嗦,本人最讨厌一大堆没用的废话,直接上,就是干! 网络爬虫?非监督学习? 只有两步,只有两个步骤? Are you kidding me? Are you ok? 来吧,follow me, come on! 第一步:首先,我们从网上获取图片自动下载到自己电脑的文件内,如从网址,下载到F:\File_Python\Crawler文件夹内,具体代码请查看http://www.cnblogs.com/yunyaniu/p/8244490.html 第二步:我们利用非监督学习的Hierar

Python爬虫学习——获取网页

通过GET请求获取返回的网页,其中加入了User-agent信息,不然会抛出"HTTP Error 403: Forbidden"异常, 因为有些网站为了防止这种没有User-agent信息的访问,会验证请求信息中的UserAgent(它的信息包括硬件平台.系统软件.应用软件和用户个人偏好),如果UserAgent存在异常或者是不存在,那么这次请求将会被拒绝. #coding=utf-8 import urllib2 import re #使用Python2.7 def getHtml

利用爬虫技术，仿有道翻译小案例

import requests import time import hashlib import json inputInfo = input('请输入你想要翻译的内容:') # 请求的url必须是点击翻译后跳转出来的页面路由 url = 'http://fanyi.youdao.com/translate_o?smartresult=dict&smartresult=rule' # 观察form表单和header请求头每次访问会有哪些变量发生变换,此处form发生变化的有salt,sign,

Python爬虫学习之获取网页源码

偶然的机会,在知乎上看到一个有关爬虫的话题<利用爬虫技术能做到哪些很酷很有趣很有用的事情?>,因为强烈的好奇心和觉得会写爬虫是一件高大上的事情,所以就对爬虫产生了兴趣. 关于网络爬虫的定义就不多说了,不知道的请自行点击查看 =>百度百科网络爬虫,维基百科网络爬虫有很多编程语言都可以编写网络爬虫,只不过各有各的优缺点,这里我选择用Python语言编写爬虫,因为Python是一门非常适合用来编写爬虫的语言,用它实现爬虫的代码量相对其他语言要少很多,并且python语言对网络编程这类模块

利用“爬虫”抓视频法院审结全国首例计算机抓取数据案

近期,海淀法院审结了一起利用"爬虫"技术侵入计算机信息系统抓取数据的刑事案件.该案是全国首例利用"爬虫"技术非法入侵其他公司服务器抓取数据,进而实施复制被害单位视频资源的案件. 法院经审理查明,被告单位上海某网络科技有限公司,经营计算机网络科技领域内的技术开发.技术服务.电子商务.电子产品等业务.被告人张某是上海某网络科技有限公司法定代表人兼CEO,负责公司整体运行:被告人宋某于2016年8月至2017年2月任职上海某网络科技有限公司,担任联席CEO,是产品负责人: