一日一技:如何提取网页中的日期?

开发 前端
最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。我们来看看这个库怎么使用。

Gne[1]虽然在提取新闻正文的时候,准确率比较高,但由于提取新闻发布时间使用的是正则表达式,因此提取效果有时候不那么让人满意。

最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。我们来看看这个库怎么使用。首先使用pip安装:

python3 -m pip install htmldate

然后,我们使用Requests或者Selenium获得网站的源代码:

import requests
from htmldate import find_date
html = requests.get('https://www.kingname.info/2022/03/09/this-is-gnelist/').content.decode('utf-8')
date = find_date(html)
print(date)

运行效果如下图所示:

而这篇文章的发布时间,确实是3月9号:

我们再用网易新闻来看一下,相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示:

现在我们用Requests获得它的源代码,然后再提取发布时间:

发布日期确实对了,但是后面的时间怎么丢失了呢?如果想把时分秒保留下来,可以增加一个参数outputformat,它的值就是你在datetime.strftime里面输入的值:

find_date(html, outputformat='%Y-%m-%d %H:%M:%S')

运行效果如下图所示:

find_date的参数,除了网页源代码外,还可以传入URL,或者是lxml里面的Dom对象,例如:

from lxml.html import fromstring

selector = fromstring(html)
date = find_date(selector)

参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor

[2] 相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务: https://www.163.com/news/article/H28Q6NQ1000189FH.html


责任编辑:武晓燕 来源: 未闻Code
相关推荐

2020-12-04 06:39:25

爬虫网页

2021-10-15 21:08:31

PandasExcel对象

2022-06-28 09:31:44

LinuxmacOS系统

2020-12-11 06:30:00

工具分组DataFrame

2023-10-28 12:14:35

爬虫JavaScriptObject

2024-07-30 08:16:18

Python代码工具

2024-07-30 08:11:16

2021-04-27 22:15:02

Selenium浏览器爬虫

2021-05-08 19:33:51

移除字符零宽

2024-11-11 00:38:13

Mypy静态类型

2021-07-27 21:32:57

Python 延迟调用

2021-06-08 21:36:24

PyCharm爬虫Scrapy

2022-03-07 09:14:04

Selenium鼠标元素

2021-02-14 22:22:18

格式图片 HTTP

2023-10-29 09:16:49

代码安全命令

2021-05-13 09:01:51

Cloud Flare浏览器网站

2021-04-05 14:47:55

Python多线程事件监控

2024-11-13 09:18:09

2021-01-08 05:17:16

重复值JSON爬虫

2024-02-20 22:13:48

Python项目Java
点赞
收藏

51CTO技术栈公众号