请问python2.7在获取到网页的html后如何能匹配正文的标题和发布时间
阿神
阿神 2017-04-17 17:57:07
[Python讨论组]

1:使用goose已经可以爬到meta里的title,但这个标题的内容比正文的标题内容要多一些,例如:meta的title:“艾君:我为何说“闹洞房”从来不是啥好风俗,早该废弃-艾君-搜狐博客”
而正文里的title:“艾君:我为何说“闹洞房”从来不是啥好风俗,早该废弃”,请问如何精准的获取到正文的title呢?
2:如果我能获取到正文里的title,怎么可以精准获取到发布时间呢?
如果是非定向爬取怎么做才好呢?谢谢

阿神
阿神

闭关修行中......

全部回复(2)
ringa_lee

可以使用beautifulsoup4来对html进行解析

PHPz

顶楼上,推荐beautifulsoup

热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 意见反馈 讲师合作 广告合作 最新更新 English
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习
PHP中文网抖音号
发现有趣的

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号