简单的方法爬取b站dnf视频封面步骤解释

这随笔代码链接：http://www.cnblogs.com/yinghualuowu/p/8186375.html

首先我们要知道，一个分区封面显示到底在哪里可以找到。

很明显，查看审查元素并不能找到封面。这个时候应该想到封面是动态加载的。

再次去Network寻找，我们发现这样一个JS。这是右侧热门视频封面的内容，点开之后存在pic:正是封面的链接。

进行json解析之后，判定pic在data>archives结构下。这个时候链接是有了，那么将如何把Json拿出来呢？

让我们观察一下原来的信息，除去JQuery........()这层，里面就是json字符串了，既然如此简单，那么我们就...

查找开头第一个(，然后截取至最后一个),里面不就是了吗？

def instr(keystr):
    st=keystr.find(‘(‘)+1
    strhtml=keystr[st:len(keystr)-1]
    return strhtml

def picsave(strJson,number):
    global cnt
    strdic=strJson[‘data‘][‘archives‘]
    num=len(strdic)
    for i in range(0,num,1):
        cnt=cnt+1
        strdic=strJson[‘data‘][‘archives‘][i]
        print(strdic[‘pic‘])
        urllib.request.urlretrieve(strdic[‘pic‘],‘E:\图片\dnf\%s.jpg‘%(cnt))

然后进行翻页判断，我们尝试点开第一页和后面几页，看看不同。pn数字貌似变化很有规律啊。

于是...

def urlget(num):
    for i in range(1,num,1):
        url=‘https://api.bilibili.com/x/tag/ranking/archives?callback=jQuery172014070206081723846_1514982701564&tag_id=5033&rid=65&type=0&pn=‘+str(i)+‘&ps=20&jsonp=jsonp&_=1514982702144‘
        response=urllib.request.urlopen(url)
        html=response.read().decode(‘utf-8‘)
        html=instr(html)
        strJson=eval(html)
        picsave(strJson,i)

然后，就没有了。其实要高清大图的话，你需要点进去一个视频，然后审查元素，后面我会写一个输入av号来获取封面的代码

原文地址：https://www.cnblogs.com/yinghualuowu/p/8481490.html

时间： 2024-09-30 04:55:19

简单的方法爬取b站dnf视频封面步骤解释的相关文章

零基础如何学好python爬虫？之python爬取B站小视频

B 站真是个神奇的网站.找不到资料了,去 B 站逛一逛,保准有你满意的东西. 前几天写了个爬虫,用 path.re.BeautifulSoup 爬取的 B 站 python 视频,如果要爬取多页的话在最下方循环中填写好循环的次数就可以了 B 站真是个神奇的网站.找不到资料了,去 B 站逛一逛,保准有你满意的东西. 前几天写了个爬虫,用 path.re.BeautifulSoup 爬取的 B 站 python 视频,如果要爬取多页的话在最下方循环中填写好循环的次数就可以了废话不多说直接上

python爬取b站排行榜视频信息

和上一篇相比,差别不是很大 1 import xlrd#读取excel 2 import xlwt#写入excel 3 import requests 4 import linecache 5 import wordcloud 6 import jieba 7 import matplotlib.pyplot as plt 8 from bs4 import BeautifulSoup 9 10 if __name__=="__main__": 11 f = xlwt.Workbook

python爬取B站千万级数据，发现了这些热门UP主的秘密！

Python(发音:英[?pa?θ?n],美[?pa?θɑ:n]),是一种面向对象.直译式电脑编程语言,也是一种功能强大的通用型语言,已经具有近二十年的发展历史,成熟且稳定.它包含了一组完善而且容易理解的标准库,能够轻松完成很多常见的任务.它的语法非常简捷和清晰,与其它大多数程序设计语言不一样,它使用缩进来定义语句. Python支持命令式程序设计.面向对象程序设计.函数式编程.面向切面编程.泛型编程多种编程范式.与Scheme.Ruby.Perl.Tcl等动态语言一样,Python具备垃圾回收

Web侦察工具HTTrack （爬取整站）

Web侦察工具HTTrack (爬取整站) HTTrack介绍爬取整站的网页,用于离线浏览,减少与目标系统交互,HTTrack是一个免费的(GPL,自由软件)和易于使用的离线浏览器工具.它允许您从Internet上下载万维网站点到本地目录,递归地构建所有目录,从服务器获取HTML,图像和其他文件到您的计算机.HTTrack安排原始网站的相关链接结构.只需在浏览器中打开"镜像"网站的页面,即可从链接到链接浏览网站,就像在线查看网站一样.HTTrack也可以更新现有的镜像站点,并恢复中断

爬虫----爬取校花网视频

import requests import re import time import hashlib def get_page(url): print('GET %s' %url) try: response=requests.get(url) if response.status_code == 200: return response.content except Exception: pass def parse_index(res): obj=re.compile('class="i

Python爬虫学习教程，批量爬取下载抖音视频

这篇文章主要为大家详细介绍了python批量爬取下载抖音视频,具有一定的参考价值,感兴趣的小伙伴们可以参考一下这篇文章主要为大家详细介绍了python批量爬取下载抖音视频,具有一定的参考价值,感兴趣的小伙伴们可以参考一下这篇文章主要为大家详细介绍了python批量爬取下载抖音视频,具有一定的参考价值,感兴趣的小伙伴们可以参考一下项目源码展示: 1 ''' 2 在学习过程中有什么不懂得可以加我的 3 python学习交流扣扣qun,934109170 4 群里有不错的学习教程.开发工具与电子

一个简单的爬取b站up下所有视频的所有评论信息的爬虫

心血来潮搞了一个简单的爬虫,主要是想知道某个人的b站账号,但是你知道,b站在搜索一个用户时,如果这个用户没有投过稿,是搜不到的,,,这时就只能想方法搞到对方的mid,,就是 space.bilibili.com/9444976 后面的那一串数字.偶然看到这个人关注了某个主播,,想到可能这个人会回复主播的视频,于是想着爬到所有up下的视频的评论对应的用户,这样我就可以在数据库里检索昵称得到mid,,,嘿嘿嘿(然而失败了,,不是所有人都像我这么无聊,,,,有些人真的看视频不会回复,, 项目地址: h

使用Node.js实现简单的网络爬取

由于最近要实现一个爬取H5游戏的代理服务器,隧看到这么一篇不错的文章(http://blog.miguelgrinberg.com/post/easy-web-scraping-with-nodejs),加之最近在学习Node.js,所以就准备翻译出来加深一下印象. 转载请注明来源:(www.cnblogs.com/xdxer ) 在这篇文章中,我将会向大家展示如何用JavaScript配合Node.js写一个网络爬取的脚本. 网络抓取工具在大部分情况下,一个网络抓取的脚本只需要一种方法去

python requests 简单网页文本爬取

爬取网页: http://www.cnblogs.com/xrq730/archive/2018/06/11/9159586.html 抓取的是一个博客的文本内容用requeusts获取整个网页的HTML信息: 使用Beautiful Soup解析HTML信息 1 import requests 2 from bs4 import BeautifulSoup 3 4 5 if __name__=='__main__': 6 target='http://www.cnblogs.com/xrq7