一日一技:如何提取网页中的日期?

最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。我们来看看这个库怎么使用。

最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。我们来看看这个库怎么使用。

Gne[1]虽然在提取新闻正文的时候,准确率比较高,但由于提取新闻发布时间使用的是正则表达式,因此提取效果有时候不那么让人满意。

最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。我们来看看这个库怎么使用。首先使用pip安装:

python3 -m pip install htmldate

然后,我们使用Requests或者Selenium获得网站的源代码:

import requests
from htmldate import find_date
html = requests.get('https://www.kingname.info/2022/03/09/this-is-gnelist/').content.decode('utf-8')
date = find_date(html)
print(date)

运行效果如下图所示:

一日一技:如何提取网页中的日期?

而这篇文章的发布时间,确实是3月9号:

一日一技:如何提取网页中的日期?

我们再用网易新闻来看一下,相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示:

一日一技:如何提取网页中的日期?

现在我们用Requests获得它的源代码,然后再提取发布时间:

一日一技:如何提取网页中的日期?

发布日期确实对了,但是后面的时间怎么丢失了呢?如果想把时分秒保留下来,可以增加一个参数outputformat,它的值就是你在datetime.strftime里面输入的值:

find_date(html, outputformat='%Y-%m-%d %H:%M:%S')

运行效果如下图所示:

一日一技:如何提取网页中的日期?

find_date的参数,除了网页源代码外,还可以传入URL,或者是lxml里面的Dom对象,例如:

from lxml.html import fromstring

selector = fromstring(html)
date = find_date(selector)

参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor

[2]
相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务:
https://www.163.com/news/article/H28Q6NQ1000189FH.html

©本文为清一色官方代发,观点仅代表作者本人,与清一色无关。清一色对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。本文不作为投资理财建议,请读者仅作参考,并请自行承担全部责任。文中部分文字/图片/视频/音频等来源于网络,如侵犯到著作权人的权利,请与我们联系(微信/QQ:1074760229)。转载请注明出处:清一色财经

(0)
打赏 微信扫码打赏 微信扫码打赏 支付宝扫码打赏 支付宝扫码打赏
清一色的头像清一色管理团队
上一篇 2023年5月5日 23:26
下一篇 2023年5月5日 23:26

相关推荐

发表评论

登录后才能评论

联系我们

在线咨询:1643011589-QQbutton

手机:13798586780

QQ/微信:1074760229

QQ群:551893940

工作时间:工作日9:00-18:00,节假日休息

关注微信