- 微信
- 微博
  
  分享文章到微博
- 复制链接
  
  复制链接到剪贴板

【Python成长之路】requests库爬取网站乱码（\xe4\xb8\xb0\xe5\xa）的解决方法

技术火炬手发表于 2020/07/27 17:14:32 2020/07/27

【摘要】【写在前面】在用requests库对自己的CSDN个人博客（https://blog.csdn.net/yuzipeng）进行爬取时，发现乱码报错（\xe4\xb8\xb0\xe5\xaf\x8c\xe7\x9），如下图所示：网上查找了一些方法，以为是遇到了网站加密处理。后来发现通过F12还是能获取网页的元素，那么有什么办法能规避乱码问题呢？答案是：用selenium.【效果如下】【...

【写在前面】

在用requests库对自己的CSDN个人博客（https://blog.csdn.net/yuzipeng）进行爬取时，发现乱码报错（\xe4\xb8\xb0\xe5\xaf\x8c\xe7\x9），如下图所示：

网上查找了一些方法，以为是遇到了网站加密处理。后来发现通过F12还是能获取网页的元素，那么有什么办法能规避乱码问题呢？答案是：用selenium.

【效果如下】

【示例代码】

# coding=utf-8
# @Auther : "鹏哥贼优秀"
# @Date : 2019/10/16
# @Software : PyCharm
from selenium import webdriver
url = 'https://blog.csdn.net/yuzipeng'
driver = webdriver.Chrome("F:\\Python成长之路\\chromedriver.exe")
driver.get(url)
urls = driver.find_elements_by_xpath('//div[@class="article-item-box csdn-tracking-statistics"]')
blogurl = ['https://blog.csdn.net/yuzipeng/article/details/' + url.get_attribute('data-articleid') for url in urls]
titles = driver.find_elements_by_xpath('//div[@class="article-item-box csdn-tracking-statistics"]/h4/a')
blogtitle = [title.text for title in titles]
myblog = {k:v for k,v in zip(blogtitle,blogurl)}
for k,v in myblog.items():
    print(k,v)
driver.close()

【知识点】

1、selenium使用

基本的selenium安装方法、使用方法（如查找元素的各类函数）可以详见之前的博客《【Python成长之路】从零学爬虫--给微信公众号阅读量作个弊：刷阅读量》

（https://blog.csdn.net/yuzipeng/article/details/100179696）

2、推导式使用

（1）列表推导式：[表达式 for 变量 in 列表] 或者 [表达式 for 变量 in 列表 if 条件]

类似这样就可以实现将for循环的多行程序浓缩到一句代码中，如

blogtitle = [title.text for title in titles]

而如果用for循环写，则需要这样：

blogtitle = []

for title in titles:

blogtitle.append(title)

（2）字典推导式：{ key表达式: value表达式 for value in collection if condition }

这样的写法，一般用于key和value能相互转换；但是如果key和value是完全不同的列表，那就需要用zip对key/value进行整合。

myblog = {k:v for k,v in zip(blogtitle,blogurl)}

如果对zip函数不熟悉，可以用下面的例子来介绍下。

a = ['a', 'b', 'c']
b = [1, 2, 3]
c = {k: v for k, v in zip(a, b)}
print(c)
 
结果是：{'a': 1, 'b': 2, 'c': 3}

作者：鹏哥贼优秀

【声明】本内容来自华为云开发者社区博主，不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源（华为云社区）、文章链接、文章作者等基本信息，否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容，欢迎发送邮件进行举报，并提供相关证据，一经查实，本社区将立刻删除涉嫌侵权内容，举报邮箱： cloudbbs@huaweicloud.com

点赞
收藏
关注作者

0/1000

抱歉，系统识别当前为高风险访问，暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称，即可参与社区互动！

*长度不超过10个汉字或20个英文字符，设置后3个月内不可修改。

确认取消

加入云驻计划，成为创作者

华为云周边好礼
免费体验产品
特殊身份标识
线下官方门票
内部专家零距离
与10000+优质创作者共同成长

立即加入

【Python成长之路】requests库爬取网站乱码（\xe4\xb8\xb0\xe5\xa）的解决方法

【写在前面】

全部回复

设置昵称

关于作者

目录

加入云驻计划，成为创作者

【Python成长之路】requests库爬取网站乱码（\xe4\xb8\xb0\xe5\xa）的解决方法

【写在前面】

全部回复

设置昵称

关于作者

目录

热门推荐查看更多

相关文章

加入云驻计划，成为创作者

相关产品