python正则爬取某段子网站前20页段子(request库)过程解析-侯体宗的博客

python正则爬取某段子网站前20页段子(request库)过程解析
Python / 管理员发布于 8年前 346

首先还是谷歌浏览器抓包对该网站数据进行分析，结果如下：

该网站地址：http://www.budejie.com/text

该网站数据都是通过html页面进行展示，网站url默认为第一页，http://www.budejie.com/text/2为第二页，以此类推

对网站的内容段子所处位置进行分析，发现段子内容都是在一个 a 标签中

坑还是有的，这是我第一次写的正则：

content_list = re.findall(r'<a href="https:detail-.*" rel="external nofollow" rel="external nofollow" rel="external nofollow" >(.+?)</a>', html_str)

之后发现竟然匹配到了一些推荐的内容，最后我把正则改变下面这样，发现没有问题了，关于正则的知识这里就不做过多解释了

content_list = re.findall(r'<div class="j-r-list-c-desc">\s*<a href="https:detail-.*" rel="external nofollow" rel="external nofollow" rel="external nofollow" >(.+?)</a>', html_str)

现在要的是爬取前20页的段子并保存到本地，已经知道翻页的规律和匹配内容的正则，就直接可以写代码了

代码如下，整体思路还是和前两排爬虫博客一样，面向对象的写法：

import requestsimport reimport jsonclass NeihanSpider(object):  """内涵段子，百思不得其姐，正则爬取一页的数据"""  def __init__(self):    self.temp_url = 'http://www.budejie.com/text/{}' # 网站地址，给页码留个可替换的{}    self.headers = {      'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36',    }  def pass_url(self, url): # 发送请求，获取响应    print(url)    response = requests.get(url, headers=self.headers)    return response.content.decode()  def get_first_page_content_list(self, html_str): # 提取第一页的数据    content_list = re.findall(r'<div class="j-r-list-c-desc">\s*<a href="https:detail-.*" rel="external nofollow" rel="external nofollow" rel="external nofollow" >(.+?)</a>', html_str) # 非贪婪匹配    return content_list  def save_content_list(self, content_list):    with open('neihan.txt', 'a', encoding='utf-8') as f:      for content in content_list:        f.write(json.dumps(content, ensure_ascii=False))        f.write('\n') # 换行      print('成功保存一页！')  def run(self): # 实现主要逻辑    for i in range(20): # 只爬取前20页数据      # 1. 构造url      # 2. 发送请求，获取响应      html_str = self.pass_url(self.temp_url.format(i+1))      # 3. 提取数据      content_list = self.get_first_page_content_list(html_str)      # 4. 保存      self.save_content_list(content_list)if __name__ == '__main__':  neihan = NeihanSpider()  neihan.run()

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

上一条：
python爬取百度贴吧前1000页内容（requests库面向对象思想实现）
下一条：
Python中的 sort 和 sorted的用法与区别

0条评论 (评论内容有缓存机制,请悉知!)

最新最热

近期评论
test1 在
opencode + Oh-my-openagent,我的第一个免费的ai编程智能体管家:Sisyphus中评论 test..
122 在
学历：一种延缓就业设计，生活需求下的权衡之选中评论工作几年后，报名考研了，到现在还没认真学习备考，迷茫中。作为一名北漂互联网打工人..
Zita 在
Google AI Studio升级全栈 vibe coding体验，可直接构建带登录和数据库的应用中评论 111222..
123 在
Clash for Windows作者删库跑路了，github已404中评论按理说只要你在国内，所有的流量进出都在监控范围内，不管你怎么隐藏也没用，想搞你分..
原梓番博客在
在Laravel框架中使用模型Model分表最简单的方法中评论好久好久都没看友情链接申请了，今天刚看，已经添加。..

Top