python爬虫初战之小说爬取

废话不多说，上代码。
总体思路是构建函数然后循环。
函数分两块，第一个函数得到标题和每一章节的网址，第二个函数得到每一章节的具体内容，然后循环就ok。

import urllib.request as req
import re
#打开页面，找到正文
url = 'https://www.gulongwang.com/liu/'
name = '流星蝴蝶剑'
def get_url_title(url):the_url = 'https://www.gulongwang.com/'webpage = req.urlopen(url)data = webpage.read()data = data.decode('gbk')    #在网页源代码上有编码形式web = re.findall('/liu/.*?.html',data) #找到每一章网址用列表表示，方便循环webs = [the_url + x for x in web]title = re.findall('(正文.*?)</a>',data)  #标题也很重要return (webs,title)
def get_body(url):webpage = req.urlopen(url)data = webpage.read()data = data.decode('gbk')body = re.findall('(.*?)<br /><br />',data)body = '\n'.join(body)body = body.replace('&quot','')return(body)
txt = open('%s.txt'%name,'w')   #开始写入文件
urls,title = get_url_title(url)
for i in range(len(title)):txt.write('\n\t\t'+title[i]+'\n')body = get_body(urls[i])txt.write(body)

就这样，儿时的梦想就达成了，还有些小惆怅，当初躲在被窝里，背着玄重尺，去天下扑猎武魂的日子终究还是过去了。

python爬虫初战之小说爬取相关推荐

python爬虫实例之小说爬取器
今天和大家分享一个爬取盗版小说的实例. 如今的网络小说可谓是百家齐放各领风骚,玄幻科幻穿越修仙都市- 各种套路看得我是心潮澎湃,笔者曾经也蛮喜欢看小说的,以前经常是拿着一台诺基亚看到深夜,第二天带着黑 ...
python爬虫实例之——多线程爬取小说
之前写过一篇爬取小说的博客,但是单线程爬取速度太慢了,之前爬取一部小说花了700多秒,1秒两章的速度有点让人难以接受. 所以弄了个多线程的爬虫. 这次的思路和之前的不一样,之前是一章一章的爬,每爬一章 ...
python爬取图片教程-推荐|Python 爬虫系列教程一爬取批量百度图片
Python 爬虫系列教程一爬取批量百度图片https://blog.csdn.net/qq_40774175/article/details/81273198# -*- coding: utf-8 ...
python爬虫对炒股有没有用_使用python爬虫实现网络股票信息爬取的demo
实例如下所示: import requests from bs4 import BeautifulSoup import traceback import re def getHTMLText(url ...
python爬虫豆瓣影评的爬取cookies实现自动登录账号
python爬虫豆瓣影评的爬取cookies实现自动登录账号频繁的登录网页会让豆瓣锁定你的账号-- 网页请求使用cookies来实现的自动登录账号,这里的cookies因为涉及到账号我屏蔽了,具 ...
转 Python爬虫实战一之爬取糗事百科段子
静觅 » Python爬虫实战一之爬取糗事百科段子首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致 ...
《python爬虫实战》：爬取贴吧上的帖子
<python爬虫实战>:爬取贴吧上的帖子经过前面两篇例子的练习,自己也对爬虫有了一定的经验. 由于目前还没有利用BeautifulSoup库,因此关于爬虫的难点还是正则表达式的书写. ...
Python 爬虫中国行政区划信息爬取（初学者）
Python 爬虫中国行政区划信息爬取 (初学者) 背景环境准备代码片段 1.定义地址信息对象 2.地址解析对象 2.1 获取web信息 2.2 web信息解析 2.3 区划信息提取 2.4 省 ...
python爬虫学习之定向爬取淘宝商品价格
python爬虫学习之定向爬取淘宝商品价格 import requests import redef getHTMLText(url):try:r = requests.get(url, tim ...

python爬虫初战之小说爬取

python爬虫初战之小说爬取相关推荐

最新文章

热门文章