Python爬虫利用cookie实现模拟登陆实例详解-侯体宗的博客

Python爬虫利用cookie实现模拟登陆实例详解
Python / 管理员发布于 8年前 200

Cookie，指某些网站为了辨别用户身份、进行session跟踪而储存在用户本地终端上的数据（通常经过加密）。

举个例子，某些网站是需要登录后才能得到你想要的信息的，不登陆只能是游客模式，那么我们可以利用Urllib2库保存我们以前登录过的Cookie，之后载入cookie获取我们想要的页面，然后再进行抓取。理解cookie主要是为我们快捷模拟登录抓取目标网页做出准备。

我之前的帖子中使用过urlopen()这个函数来打开网页进行抓取，这仅仅只是一个简单的Python网页打开器，其参数也仅有urlopen(url,data,timeout),这三个参数对于我们获取目标网页的cookie是远远不够的。这时候我们就要利用到另外一种Opener――CookieJar。

cookielib也是Python进行爬虫的一个重要模块，他能与urllib2相互结合一起爬取想要的内容。该模块的CookieJar类的对象可以捕获cookie并在后续连接请求时重新发送，这样就可以实现我们所需要的模拟登录功能。

这里特别说明一下，cookielib是在py2.7中自带的模块，无需重新安装，想要查看其自带模块可以查看Python目录下的Lib文件夹，里面有所有安装的模块。我一开始没想起来，在pycharm中竟然没有搜到cookielib,使用了快捷安装也报错：Couldn't find index page for 'Cookielib' (maybe misspelled?)

之后才想起来是不是自带的就有，没想到去lib文件夹一看还真有，白白浪费半个小时各种瞎折腾~~

下面我们就来介绍一下这个模块，该模块主要的对象有CookieJar、FileCookieJar、MozillaCookieJar、LWPCookieJar。

它们的关系：CookieJar ―-派生―->FileCookieJar ―-派生―C>MozillaCookieJar和LWPCookieJar 主要用法，我们下面也会讲到。urllib2.urlopen()函数不支持验证、cookie或者其它HTTP高级功能。要支持这些功能，必须使用build_opener()（可以用于让python程序模拟浏览器进行访问，作用你懂得~）函数创建自定义Opener对象。

1、首先我们就来获取一下网站的cookie

例子：

#coding=utf-8 import cookielib import urllib2  mycookie = cookielib.CookieJar() #声明一个CookieJar的类对象保存cookie(注意CookieJar的大小写问题) handler = urllib2.HTTPCookieProcessor(mycookie) #利用urllib2库中的HTTPCookieProcessor来声明一个处理cookie的处理器 opener = urllib2.build_opener(handler) #利用handler来构造opener，opener的用法和urlopen()类似 response = opener.open("http://www.baidu.com") #opener返回的一个应答对象response for item in my.cookie:   print"name="+item.name   print"value="+item.value

结果：

name=BAIDUID value=73BD718962A6EA0DAD4CB9578A08FDD0:FG=1 name=BIDUPSID value=73BD718962A6EA0DAD4CB9578A08FDD0 name=H_PS_PSSID value=1450_19035_21122_17001_21454_21409_21394_21377_21526_21189_21398 name=PSTM value=1478834132 name=BDSVRTM value=0 name=BD_HOME value=0

这样我们就得到了一个最简单的cookie。

2、将cookie保存到文件

上面我们得到了cookie,下面我们学习如何保存cookie。在这里我们使用它的子类MozillaCookieJar来实现Cookie的保存

例子：

#coding=utf-8 import cookielib import urllib2  mycookie = cookielib.MozillaCookieJar() #声明一个MozillaCookieJar的类对象保存cookie(注意MozillaCookieJar的大小写问题) handler = urllib2.HTTPCookieProcessor(mycookie) #利用urllib2库中的HTTPCookieProcessor来声明一个处理cookie的处理器 opener = urllib2.build_opener(handler) #利用handler来构造opener，opener的用法和urlopen()类似 response = opener.open("http://www.baidu.com") #opener返回的一个应答对象response for item in mycookie:   print"name="+item.name   print"value="+item.value filename='mycookie.txt'#设定保存的文件名 mycookie.save(filename,ignore_discard=True, ignore_expires=True)

将上面的例子简单变形就可以得到本例，使用了CookieJar的子类MozillaCookiJar,为什么呢？我们将MozillaCookiJar换成CookieJar试试，下面一张图你就能明白：

CookieJar是没有保存save属性的~

save()这个方法中：ignore_discard的意思是即使cookies将被丢弃也将它保存下来，ignore_expires的意思是如果在该文件中cookies已经存在，则覆盖原文件写入，在这里，我们将这两个全部设置为True。运行之后，cookies将被保存到cookie.txt文件中，我们查看一下内容：

这样我们就成功保存了我们想要的cookie

3、从文件中获取cookie并访问

<pre style="background-color: rgb(255, 255, 255); font-family: 宋体; font-size: 9pt;"><pre name="code" class="python">#coding=utf-8 import urllib2 import cookielib import urllib  #第一步先给出账户密码网址准备模拟登录 postdata = urllib.urlencode({   'stuid': '1605122162',   'pwd': 'xxxxxxxxx'#密码这里就不泄漏啦，嘿嘿嘿 }) loginUrl = 'http://ids.xidian.edu.cn/authserver/login?service=http%3A%2F%2Fjwxt.xidian.edu.cn%2Fcaslogin.jsp'# 登录教务系统的URL，成绩查询网址  # 第二步模拟登陆并保存登录的cookie filename = 'cookie.txt'  #创建文本保存cookie mycookie = cookielib.MozillaCookieJar(filename) # 声明一个MozillaCookieJar对象实例来保存cookie，之后写入文件 opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(mycookie)) #定义这个opener，对象是cookie result = opener.open(loginUrl, postdata) mycookie.save(ignore_discard=True, ignore_expires=True)# 保存cookie到cookie.txt中  # 第三步利用cookie请求访问另一个网址，教务系统总址 gradeUrl = 'http://ids.xidian.edu.cn/authserver/login?service'  #只要是帐号密码一样的网址就可以， 请求访问成绩查询网址 result = opener.open(gradeUrl) print result.read()</pre><br> <pre></pre> <pre></pre> <p></p> <pre></pre> <pre></pre> 创建一个带有cookie的opener，在访问登录的URL时，将登录后的cookie保存下来，然后利用这个cookie来访问其他网址。 <p></p> <p><br> </p> <p>核心思想：创建opener,包含了cookie的内容。之后在利用opener时，就会自动使用原先保存的cookie.<br> <br> </p>    </pre>

感谢阅读，希望能帮助到大家，谢谢大家对本站的支持！

上一条：
python实现斐波那契数列的方法示例
下一条：
Python 出现错误TypeError: ‘NoneType’ object is not iterable解决办法

0条评论 (评论内容有缓存机制,请悉知!)