dede3.1分页文字采集过滤规则详说(图文教程)续二-侯体宗的博客

dede3.1分页文字采集过滤规则详说(图文教程)续二
php / 管理员发布于 8年前 295

稍微了解dede采集规则的朋友上篇内容完全可以略过，下面看看如何以静制动、以不变就万变地解决分页采集问题。
二、采集新目标

目标地址：
1、http://www.tiansou.net/Html/Y_CYFW/R_Gzzj/F_Gzjh/index.html
2、http://www.tiansou.net/Html/Y_CYFW/R_Gzzj/F_Gzjh/2007-2/9/20070209110903558.html
之所以选取两个目标页面，是因为以上的两个页面一个有分页，而另一个没有，并且在分页和全文取样部分有较大的差别。以下的说明是在为采集目标地址(首页)全部链接的基础上改动的，个别地方会显得蛇足，只为说明的方便。

目标文字部分头部代码1：

'700')this.width='700';">
目标文字部分头部代码2：

'700')this.width='700';">

通过比较不难发现，两个文字部分的开始采集部分能确定下来为描黑部分，开头部分好说，代码如下：

复制代码代码如下:

目标文尾及分页区域代码1：

'700')this.width='700';">

目标文尾及分页区域代码2：

'700')this.width='700';">

比较一下两个结尾，尽管想把第一个的结尾再往前提一点，但没法子，要考虑到全部链接的共同部分，就只好取描黑的部分了，这也给今后确定过滤规则添了点麻烦，这是后话。先把结尾部分确定了吧：

复制代码代码如下:

上一条：
dede3.1分页文字采集过滤规则详说(图文教程)续四
下一条：
dede3.1分页文字采集过滤规则详说(图文教程)

0条评论 (评论内容有缓存机制,请悉知!)

最新最热

相关文章
Laravel从Accel获得5700万美元A轮融资(0个评论)
PHP 8.4 Alpha 1现已发布！(0个评论)
用Time Warden监控PHP中的代码处理时间(0个评论)
在PHP中使用array_pop + yield实现读取超大型目录功能示例(0个评论)
Property Hooks RFC在PHP 8.4中越来越接近现实(0个评论)

近期评论
test1 在
opencode + Oh-my-openagent,我的第一个免费的ai编程智能体管家:Sisyphus中评论 test..
122 在
学历：一种延缓就业设计，生活需求下的权衡之选中评论工作几年后，报名考研了，到现在还没认真学习备考，迷茫中。作为一名北漂互联网打工人..
Zita 在
Google AI Studio升级全栈 vibe coding体验，可直接构建带登录和数据库的应用中评论 111222..
123 在
Clash for Windows作者删库跑路了，github已404中评论按理说只要你在国内，所有的流量进出都在监控范围内，不管你怎么隐藏也没用，想搞你分..
原梓番博客在
在Laravel框架中使用模型Model分表最简单的方法中评论好久好久都没看友情链接申请了，今天刚看，已经添加。..

Top