关于爬虫问题
import requests#反爬 让服务器知道你是浏览器
header = {
'Accept':'application/json, text/javascript, */*; q=0.01',
'Accept-Encoding':'gzip, deflate, br',
'Accept-Language':'zh-CN,zh;q=0.8,zh-TW;q=0.7,zh-HK;q=0.5,en-US;q=0.3,en;q=0.2',
'Cache-Control':'no-cache',
'Connection':'keep-alive',
'Content-Length':'26',
'Content-Type':'application/x-www-form-urlencoded; charset=UTF-8',
# 'Cookie':'JSESSIONID=ABAAABAAAGGABCB94CE…4f8c049724acf82ab15b71c77002d', #记住账号信息,不需要
'Host':'www.lagou.com',
'Pragma':'no-cache',
'Referer':'https://www.lagou.com/jobs/lis…ds=&fromSearch=true&suginput=',
'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:57.0) Gecko/20100101 Firefox/57.0',
'X-Anit-Forge-Code':'0',
'X-Anit-Forge-Token':'None',
'X-Requested-With':'XMLHttpRequest'
}
for n in range(1, 2):
# 真实地址
url = 'https://www.lagou.com/jobs/positionAjax.json?needAddtionalResult=false&isSchoolJob=0'
# 提交数据
dat = {'first':'false',
'pn':'3',
'kd':'python'}
html = requests.post(url, data=dat, headers=header)
html.status_code
#html.text
出现了UnicodeEncodeError: 'latin-1' codec can't encode character '\u2026' in position 30: ordinal not in range(256)
求问大腿们为什么出现这个问题以及怎么解决,万分感谢
这里都是来学习的,估计很少人懂 本帖最后由 8306最硬 于 2018-1-12 21:06 编辑
虽然不懂,但是我打开网址只有一条信息
{"success":false,"msg":"您操作太频繁,请稍后再访问","clientIp":"121.32.32.112"}
确定这网址有效么{:10_245:} 而且目测header设置错了 你爬的太快了。。。
字符编码还有问题。。 把.text换成.content.decode() 。ilovefishc.com 你的Referer键的参数出现了省略号…
导致python无法解读 7楼正解 给个最佳吧,以后发现这类报错信息,留意一下报错信息被双引号包起来的内容,
例如,你这里的\是 u2026
把它拿去谷歌一下,答案就出来了 {:9_226:} {:9_228:} {:9_218:} 学习学习 我去,大胸弟。
你是有多久没上线了???
我都忘记有这个问题了。 很好 顶帖子得鱼币 {:13_446:} 赞一个
页:
[1]