Python使用lxml模块和Requests模块抓取HTML页面的教程

Web抓取
Web站点使用HTML描述，这意味着每个web页面是一个结构化的文档。有时从中获取数据同时保持它的结构是有用的。web站点不总是以容易处理的格式，如 csv 或者 json 提供它们的数据。

这正是web抓取出场的时机。Web抓取是使用计算机程序将web页面数据进行收集并整理成所需格式,同时保存其结构的实践。

lxml和Requests
lxml（http://lxml.de/）是一个优美的扩展库，用来快速解析XML以及HTML文档即使所处理的标签非常混乱。我们也将使用 Requests （http://docs.python-requests.org/en/latest/#）模块取代内建的urllib2模块，因为其速度更快而且可读性更好。你可以通过使用 pip install lxml 与 pip install requests 命令来安装这两个模块。

让我们以下面的导入开始：

from lxml import html
import requests

下一步我们将使用 requests.get 来从web页面中取得我们的数据，通过使用 html 模块解析它，并将结果保存到 tree 中。

page = requests.get('http://econpy.pythonanywhere测试数据/ex/001.html')
tree = html.fromstring(page.text)

tree 现在包含了整个HTML文件到一个优雅的树结构中，我们可以使用两种方法访问：XPath以及CSS选择器。在这个例子中，我们将选择前者。

XPath是一种在结构化文档（如HTML或XML）中定位信息的方式。一个关于XPath的不错的介绍参见 W3Schools 。

有很多工具可以获取元素的XPath，如Firefox的FireBug或者Chrome的Inspector。如果你使用Chrome，你可以右键元素，选择 ‘Inspect element'，高亮这段代码，再次右击，并选择 ‘Copy XPath'。

在进行一次快速分析后，我们看到在页面中的数据保存在两个元素中，一个是title是 ‘buyer-name' 的div，另一个class是 ‘item-price' 的span：

Carson Busses

声明：本文来自网络，不代表【好得很程序员自学网】立场，转载请注明出处：http://haodehen.cn/did89693

更新时间：2022-10-19 阅读：58次