学校的服务器可以上外网了,所以打算写一个自动爬取笑话并发到bbs的东西,从网上搜了一个笑话网站,感觉大部分还不太冷,html结构如下:

可以看到,笑话的链接列表都在<div class="list_title">里面,用正则表达式可以把最近的几个笑话地址找出来,再进到一个笑话页面看下:

每一个笑话页面里面是有多个小笑话组成的,全部在<span id="text110">标签下,每个小笑话又单独一个<p>包裹,这样非常容易就可以把每个单独笑话放到一个list中。由于我爬笑话的目的是每天白天一个小时发一个笑话,所以爬取20个是足够的了,每个页面平均有5个小笑话,爬4个页面就OK啦。这里有几个细节,这个笑话网有的链接是有中文的,比如:

[html] view plaincopy
  1. <a href="/jokehtml/冷笑话/2014051200030765.htm" target="_blank">读书破万卷,搞笑如有神</a>

直接urllib.request.urlopen函数不能解析中文的URL,必须要urllib.parse先转码一下才能正确解析。还有一个细节是每段的小笑话之间是有换行的,用正则表达式的“.”是不能匹配换行符的,需要改成“[\w\W]”才能匹配。好了,下面是代码:

[python] view plaincopy
  1. import urllib.request
  2. import urllib.parse
  3. import re
  4. rule_joke=re.compile('<span id=\"text110\">([\w\W]*?)</span>')
  5. rule_url=re.compile('<a href=\"(.*?)\"target=\"_blank\" >')
  6. mainUrl='http://www.jokeji.cn'
  7. url='http://www.jokeji.cn/list.htm'
  8. req=urllib.request.urlopen(url)
  9. html=req.read().decode('gbk')
  10. urls=rule_url.findall(html)
  11. f=open('joke.txt','w')
  12. for i in range(4):
  13. url2=urllib.parse.quote(urls[i])
  14. joke_url=mainUrl+url2
  15. req2=urllib.request.urlopen(joke_url)
  16. html2=req2.read().decode('gbk')
  17. joke=rule_joke.findall(html2)
  18. jokes=joke[0].split('<P>')
  19. for i in jokes:
  20. i=i.replace('</P>','')
  21. i=i.replace('<BR>','')
  22. i=i[2:]
  23. f.write(i)
  24. f.close()

看下爬取的结果:

这样,每行是一个单独的笑话,方便其他程序使用。

转载请注明:转自http://blog.csdn.net/littlethunder/article/details/25693641

python3自动爬笑话(留下学习)相关推荐

  1. python3自动爬笑话

     学校的服务器可以上外网了,所以打算写一个自动爬取笑话并发到bbs的东西,从网上搜了一个笑话网站,感觉大部分还不太冷,html结构如下: 可以看到,笑话的链接列表都在<div class=& ...

  2. python3自动爬取网页资源并保存为epub电子书

    使用Python获取网页内容并生成EPUB格式电子书 前言 EPUB的介绍 思路 代码示例 前言 现在的有很多电子书都不能下载了,只能在线看,但是广告又多.所以想编个程序抓取这些内容生成电子书. EP ...

  3. Python3从零开始爬取今日头条的新闻【五、解析头条视频真实播放地址并自动下载】

    Python3从零开始爬取今日头条的新闻[一.开发环境搭建] Python3从零开始爬取今日头条的新闻[二.首页热点新闻抓取] Python3从零开始爬取今日头条的新闻[三.滚动到底自动加载] Pyt ...

  4. python3爬虫系列03之requests库:根据关键词自动爬取下载百度图片

    python3爬虫系列03之requests库:根据关键词自动爬取下载百度图片 1.前言 在上一篇文章urllib使用:根据关键词自动爬取下载百度图片 当中,我们已经分析过了百度图片的搜索URL的变化 ...

  5. python3自己主动爬笑话

    学校的server能够上外网了,所以打算写一个自己主动爬取笑话并发到bbs的东西,从网上搜了一个笑话站点,感觉大部分还不太冷.html结构例如以下: 能够看到,笑话的链接列表都在<div cla ...

  6. Python3从零开始爬取今日头条的新闻【一、开发环境搭建】

    Python3从零开始爬取今日头条的新闻[一.开发环境搭建] Python3从零开始爬取今日头条的新闻[二.首页热点新闻抓取] Python3从零开始爬取今日头条的新闻[三.滚动到底自动加载] Pyt ...

  7. 使用Selenium模拟浏览器,实现自动爬取数据

    最近需要在一个网站下载一批数据.但是输入一个查询,返回三四万条结果,每次只能导出500条,而且每次还得输入下载条目的范围!这样点击下载,还不要了我的老命.于是乎想自动化这个过程. 我的需求主要是两点: ...

  8. python 模拟浏览器selenium_使用Selenium模拟浏览器,实现自动爬取数据

    最近需要在一个网站下载一批数据.但是输入一个查询,返回三四万条结果,每次只能导出500条,而且每次还得输入下载条目的范围!这样点击下载,还不要了我的老命.于是乎想自动化这个过程. 我的需求主要是两点: ...

  9. python3+selenium爬取笔记本电脑详情信息

    python3+selenium爬取购物商店 准备工作 分析 url xpath 附完整代码 准备工作 # 用到的包 selenium #Web自动化测试工具 urllib #URL地址中查询参数进行 ...

最新文章

  1. 再次刷新单模型纪录!快手登顶多模态理解权威榜单VCR
  2. linux usr local权限,OS X权限被拒绝/ usr/local/lib
  3. Java FAQ(6)
  4. Linux日志系统-08:定时执行脚本
  5. arr.sort的排序原理
  6. ASP.NET Core Razor 标签助手 - ASP.NET Core 基础教程 - 简单教程,简单编程
  7. [PHP] 存储改造中的逻辑和清理遗留的问题
  8. js检测鼠标是否在操作_原生JS趣味demo:炫酷头像鼠标追随效果的实现
  9. .NET串口通讯解决方案
  10. php5.5开发环境配置,windows下配置php5.5开发环境及开发扩展
  11. 201509-2-日期计算
  12. Leap Motion 上手体验
  13. Atitit.md5 实现原理
  14. Demo:第四章:Gateway网关
  15. C++之 Eigen-3.4.0 全方位教程:Chapter02-矩阵篇
  16. 支持ipv6路由器有什么优点?路由器应用了哪些技术?
  17. mysql远程3306不通_mysql服务器3306端口不能远程连接的解决
  18. 子网掩码的作用和用法
  19. OpenGL-曲面细分
  20. Introduction1.1:模糊投影几何学

热门文章

  1. July《十五个经典算法研究与总结》目录+索引
  2. Android课设电台论文,调频收音机设计 毕业论文.doc
  3. 使用傅立叶变换清理时间序列数据噪声
  4. python无法导入Cython的.pyx文件?
  5. passive-interface
  6. NOIP初赛准备:第6课时
  7. 80%的业绩掌握在20%的客服手中
  8. Ubuntu连不上网问题
  9. python批量下载文件只有1kb_python 批量下载文件
  10. 项目管理 : 如何控制新产品研发项目的成本?