萌新淘宝定向爬取商品信息遇到了问题

2426157140 · 发表于 2020-7-13 17:24:41

马上注册，结交更多好友，享用更多功能^_^

您需要登录才可以下载或查看，没有账号？立即注册

x

import requests
import re
def getHTMLText(url):
{"cookie":'',
"user-agent":"Mozilla/5.0"}
try:
r = requests.get(url, headers = kv, timeout = 30)
r.raise_for_status()
r.encoding = r.apparent_encoding
return r.text
except:
return ""
def parsePage(ilt, html):
try:
plt = re.findall(r'"view_price"\:"[\d\.]*"', html)
tlt = re.findall(r'"raw_title"\:".*?"', html)
for i in range(len(plt)):
price = eval(plt[i].split(':')[1])
title = eval(tlt[i].split(':')[1])
ilt.append([price, title])
except:
print("")
def printGoodsList(ilt):
tplt = "{:4}\t{:8}\t{:16}"
print(tplt.format("序号", "价格", "商品名"))
count = 0
for g in ilt:
count = count + 1
print(tplt.format(count, g[0], g[1]))
def main():
goods = '书包'
depth = 2
start_url = 'http://s.taobao.com/search?q=' + goods
infoList = []
for i in range(depth):
try:
url = start_url + '&s=' + str(44*i)
html = getHTMLText(url)
parsePage(infoList, html)
except:
continue
printGoodsList(infoList)
main()

复制代码

以上是代码cookie我运行时候查了写里面了但是最后运行提示line38：Need type annotation for 'infoList' (hint: "infoList: List[<type>] = ...")

2426157140 · 发表于 2020-7-13 17:27:51

def getHTMLText(url):
kv = {"cookie":'',
"user-agent":"Mozilla/5.0"}
try:
r = requests.get(url, headers = kv, timeout = 30)
r.raise_for_status()
r.encoding = r.apparent_encoding
return r.text
except:
return ""

复制代码

不好意思刚才删cookie时候把kv = {}删了

Twilight6 · 发表于 2020-7-13 23:32:33

你代码发的有点乱，缩进也不对

import requests

import re

def getHTMLText(url):

kv = {"cookie":'',

"user-agent":"Mozilla/5.0"}

try:

      r = requests.get(url, headers = kv, timeout = 30)

      r.raise_for_status()

      r.encoding = r.apparent_encoding

      return r.text

except:

      return ""

def parsePage(ilt, html):

try:

      plt = re.findall(r'"view_price"\:"[\d\.]*"', html)

      tlt = re.findall(r'"raw_title"\:".*?"', html)

      for i in range(len(plt)):

         price = eval(plt[i].split(':')[1])

         title = eval(tlt[i].split(':')[1])

         ilt.append([price, title])

except:

      print("")

def printGoodsList(ilt):

tplt = "{:4}\t{:8}\t{:16}"

print(tplt.format("序号", "价格", "商品名"))

count = 0

for g in ilt:

      count = count + 1

      print(tplt.format(count, g[0], g[1]))

def main():

goods = '书包'

depth = 2

start_url = 'http://s.taobao.com/search?q=' + goods

infoList = []

for i in range(depth):

      try:

         url = start_url + '&s=' + str(44 * i)

         html = getHTMLText(url)

         parsePage(infoList, html)

      except:

         continue

printGoodsList(infoList)

main()
复制代码

账号		自动登录	找回密码
密码			立即注册