广告
返回顶部
首页 > 资讯 > 数据库 >Scrapy中怎么利用Xpath选择器从网页中采集目标数据
  • 833
分享到

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

2024-04-02 19:04:59 833人浏览 薄情痞子
摘要

scrapy中怎么利用Xpath选择器从网页中采集目标数据,相信很多没有经验的人对此束手无策,为此本文总结了问题出现的原因和解决方法,通过这篇文章希望你能解决这个问题。/具体实现/1、针对标题,在上篇文章中

scrapy中怎么利用Xpath选择器从网页中采集目标数据,相信很多没有经验的人对此束手无策,为此本文总结了问题出现的原因和解决方法,通过这篇文章希望你能解决这个问题。

/具体实现/

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

1、针对标题,在上篇文章中就有提及,其Xpath表达式有多种,任选其一即可,在scrapy shell脚本下进行调试,得到标题的提取方式,并写入到爬虫主体文件中。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

2、接下来是发布日期的提取,仍然是以交互式的方式实现网页与源码之间的交互,如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

3、而且标签“entry-meta-hide-on-mobile”具有全局唯一性,可以很方便的定位到元素。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

4、根据网页结构,我们可轻易的写出发布日期的Xpath表达式,可以在scrapy shell中先进行测试,再将选择器表达式写入爬虫文件中,详情如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

这里有部分杂质信息,需要利用strip()和replace()函数剔除多余的杂质,还日期一个“清白”。

5、关于文章主题标签的Xpath表达式,可以看到其在网页结构上处于日期的下方,如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

因此可以通过更改一下发布日期的Xpath表达式,即可获取到文章主题标签。

6、文章主题标签处于a标签下,如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

获取到整个列表之后,利用join函数将数组中的元素以逗号连接生成一个新的字符串叫tags,然后写入Scrapy爬虫文件中去。

7、对于点赞数,其分析方法同之前一致,找到唯一的一个标签“vote-post-up”即可定位到数据。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

8、细心的小伙伴可能会看到“vote-post-up”属性并不是class标签中唯一一个属性,所以一开始的Xpath表达式匹配的内容为空。

这里给大家安利一个小技巧,如果标签中存在多个属性,且属性是唯一的时候,可以利用contains函数进行助攻,其用法是'//span[contains(@class,"vote-post-up"),务必要多加练习,否则容易忘记。根据网页结构写出Xpath表达式,调试的过程如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

取出的点赞数是个字符串,需要利用int()将其强制转换为数字。

看完上述内容,你们掌握Scrapy中怎么利用Xpath选择器从网页中采集目标数据的方法了吗?如果还想学到更多技能或想了解更多相关内容,欢迎关注编程网数据库频道,感谢各位的阅读!

您可能感兴趣的文档:

--结束END--

本文标题: Scrapy中怎么利用Xpath选择器从网页中采集目标数据

本文链接: https://www.lsjlt.com/news/56680.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com    QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑,方便收藏和打印~

下载Word文档
猜你喜欢
  • Scrapy中怎么利用Xpath选择器从网页中采集目标数据
    Scrapy中怎么利用Xpath选择器从网页中采集目标数据,相信很多没有经验的人对此束手无策,为此本文总结了问题出现的原因和解决方法,通过这篇文章希望你能解决这个问题。/具体实现/1、针对标题,在上篇文章中...
    99+
    2022-10-18
  • 在Scrapy中怎么利用CSS选择器从网页中采集目标数据
    这篇文章主要介绍“在Scrapy中怎么利用CSS选择器从网页中采集目标数据”,在日常操作中,相信很多人在在Scrapy中怎么利用CSS选择器从网页中采集目标数据问题上存在疑惑,小编查阅了各式资料,整理出简单...
    99+
    2022-10-19
软考高级职称资格查询
编程网,编程工程师的家园,是目前国内优秀的开源技术社区之一,形成了由开源软件库、代码分享、资讯、协作翻译、讨论区和博客等几大频道内容,为IT开发者提供了一个发现、使用、并交流开源技术的平台。
  • 官方手机版

  • 微信公众号

  • 商务合作