本文将使用php curl采集页面simple_html_dom解析,实现真正的去除广告。
随便找一个小说网站找一本书,不过这个站点在手机端是特别坑的,就有上述问题:
就拿这本小说来开刀。(声明:绝对不是推广,侵删)
一、了解curl的get方式
curl是一个命令行工具,通过指定的URL来上传或下载数据,并将数据展示出来。curl中的c表示client,而URL,就是URL。
PHP中使用cURL可以实现Get和Post请求的方法
简单的抓取小说仅需要get方法即可。
下面这个示例代码就是通过get请求获取第一章小说页面html的示例,只需要更改url参数即可。
初始化、设置选项、证书验证、执行、关闭
注释就特别详细了,按照步骤,发送curl的get请求,如果是post请求则需要多加一条设置post选项的设置,并且传参,最后输出获得的信息,运行结果如下,是没有css渲染的。
二、解析页面
输出的页面有很多不需要的内容,需要在所有内容中提取出我们需要的内容,比如标题和每章的内容,这时需要解析页面。
解析页面的方法也有很多,在这里使用的是simple_html_dom,需要下载引用simple_html_dom.php这个类,实例对象,并调用内部的方法。具体方法可以到官网查看,或者中文网其他文档。
先分析这个小说页面的源代码,看这章的标题和内容对应的元素
首先是标题:在类bookname下的h1下
然后是内容:在id为content的div下
simple_html_dom的可以使用find方法,类似jquery一样使用选择器查找定位元素。如:
find('.bookname h1'); //查找类bookname 下的h1标题元素
find('#content'); //查找id为content的章节内容
代码在以上的基础上新增:
include "simple_html_dom.php";
$html = new simple_html_dom();
@$html->load($res);
$h1 = $html->find('.bookname h1');
foreach ($h1 as $k=>$v) {
$artic['title'] = $v->innertext;
}
// 查找小说的具体内容
$divs = $html->find('#content');
foreach ($divs as $k=>$v) {
$content = $v->innertext;
}
// 正则替换去除多余部分
$pattern = "/(.*?
)|(.*?







