爬取新浪新闻的 PHP 爬虫实战
随着互联网的发展,信息爆炸式增长,而新闻是其中占比最高的一类信息。为了更快地获取最新、最有价值的新闻信息,人们通常会去浏览新闻网站上的最新资讯。然而,一个人每天所能阅读的新闻总量是有限的,因此,我们需要一种高效的工具来爬取新闻信息。本文将分享一种利用 PHP 实现的爬虫程序来爬取新浪新闻的实践经验。
一、爬虫基础知识
爬虫是一种自动化程序,其功能是模拟浏览器发出请求,解析返回的页面数据,抽取需要的信息并进行保存或下载。常见的爬虫程序语言有 Python、Java、JavaScript 等。本文选择 PHP 语言来编写爬虫程序,原因是 PHP 语言非常适合用于 Web 开发,并且它有许多强大的 HTTP 请求函数与 DOM 解析库,可以方便地完成网页抓取与信息提取。
二、编写爬虫程序
1.确定目标网站
在开始编写爬虫程序之前,需要先确定你要爬取的目标网站。本文选择的是新浪新闻网站。首先,我们需要了解一下该网站的网页结构与数据存储方式。
2.模拟浏览器发出请求
要想成功地获取目标网站的数据,需要模拟浏览器向目标网站发出请求。在 PHP 中,我们可以使用 cURL 函数库来完成这个过程。例如:
$url = 'http://news.sina.com.cn/'; $ch = curl_init($url); curl_setopt($ch, CURLOPT_RETURNTRANSFER, true); curl_setopt($ch, CURLOPT_ENCODING, ''); curl_setopt($ch, CURLOPT_USERAGENT, "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/78.0.3904.108 Safari/537.36"); curl_setopt($ch, CURLOPT_FOLLOWLOCATION, true); curl_setopt($ch, CURLOPT_MAXREDIRS, 3); curl_setopt($ch, CURLOPT_TIMEOUT, 10); $html = curl_exec($ch); curl_close($ch);
这段代码利用 cURL 发出一个 GET 请求,请求地址为新浪新闻的首页。我们可以看到,在请求中使用了一些参数,例如:CURLOPT_RETURNTRANSFER
用于告诉 cURL 函数要返回请求结果而不是直接将其输出到浏览器;CURLOPT_USERAGENT
用于模拟浏览器的身份,让目标网站不会防范我们的爬虫;CURLOPT_FOLLOWLOCATION
用于自动跟踪重定向,以便能够获取到完整的页面源代码等。
3.解析页面数据
在成功获取到页面源代码后,我们需要解析数据并提取出所需的信息。解析过程可以分为两个步骤:首先,将 HTML 代码转换成 DOM 对象,反映了文档结构的层次关系;然后,再从 DOM 对象中根据相应的语法规则筛选出需要的信息。
在 PHP 中,我们可以借助 DOMDocument 类与 SimpleXMLElement 类来解析 HTML 和 XML 代码。例如,以下代码片段中,我们从新浪新闻首页中提取出了新闻标题、链接和摘要:
//创建 DOM 对象 $dom = new DOMDocument(); //HTML 代码转 DOM 对象 $dom->loadHTML($html); //获取所有新闻列表 $newsList = $dom->getElementById('syncad_1'); //遍历新闻列表并提取信息 foreach ($newsList->getElementsByTagName('li') as $item) { //提取标题链接 $linkNode = $item->getElementsByTagName('a')->item(0); $link = $linkNode->getAttribute('href'); //提取标题 $titleNode = $linkNode->getElementsByTagName('span')->item(0); $title = $titleNode->nodeValue; //提取摘要 $summaryNode = $item->getElementsByTagName('p')->item(0); $summary = $summaryNode->nodeValue; //保存数据到数组中 $data[] = [ 'title' => $title, 'link' => $link, 'summary' => $summary ]; }
在上面的代码示例中,我们首先使用 getElementById
方法获取到所有的新闻列表,然后使用 getElementsByTagName
方法筛选出其中的 li 元素,并遍历该列表以提取出所需信息。其中,我们使用了 getAttribute
方法和 nodeValue
方法来提取属性值和文本内容。
4.保存数据
成功提取出所需信息后,我们需要将其保存到本地文件或数据库中以便后续的使用。在本文中,我们使用了 MySQL 数据库来保存数据,并使用了 PHP 自带的 PDO 扩展来实现与数据库的连接与操作。以下是保存数据到 MySQL 数据库中的代码示例:
//数据库连接 $dsn = 'mysql:host=127.0.0.1;dbname=news;charset=utf8'; $username = 'root'; $password = '123456'; $options = [ PDO::ATTR_ERRMODE => PDO::ERRMODE_EXCEPTION, ]; $pdo = new PDO($dsn, $username, $password, $options); //保存数据到数据库中 $stmt = $pdo->prepare("INSERT INTO news (title, link, summary) VALUES (:title, :link, :summary)"); foreach ($data as $item) { $stmt->bindParam(':title', $item['title']); $stmt->bindParam(':link', $item['link']); $stmt->bindParam(':summary', $item['summary']); $stmt->execute(); }
在上述代码中,我们首先创建了一个名为 news 的表,用于保存新闻的标题、链接和摘要信息。之后,利用 PDO 函数库实现对 MySQL 数据库的连接、预处理、参数绑定、执行等步骤。这里我们使用了 bindParam
方法来绑定参数并执行 SQL 语句。
三、总结
本文介绍了如何利用 PHP 语言编写一个爬虫程序,以爬取新浪新闻网站的实例进行说明。在这个过程中,例子代码中共包括了爬取目标、发出请求、解析数据、保存数据等步骤。在实践中,可能还需要考虑一些网站反爬措施、数据清洗、多线程爬取等问题,但是这些都属于更高级的爬虫技术,可在以后的学习中深入研究。