|
马上注册,结交更多好友,享用更多功能^_^
您需要 登录 才可以下载或查看,没有账号?立即注册
x
这次关于正则表达式的,代码如下:
- import urllib.request
- import re
- import os
- def url_open(url):
- req = urllib.request.Request(url)
- req.add_header('User-Agent','Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36')
- dakai = urllib.request.urlopen(req)
- html = dakai.read().decode('utf-8')
- return html
- def get_page(html):
- link = r'<a id="ha" href="/(.+?)"'
- find_link = re.findall(link,html)
- link_list = []
- for each in find_link:
- link_list.append('http://www.33mn.net/'+each)
- return link_list
- def get_imgs(html):
- img = r'<img src="(.+\.jpg)"'
- find_img = re.findall(img,html)
- for i in find_img:
- print(i)
-
- '''def down_girls(box='girl'):
- os.mkdir(box)
- os.chdir(box)'''
- if __name__ == '__main__':
- #down_girls()
- for i in range(1,31):
- url = 'http://www.33mn.net/ns/' + str(i)
- urllist = get_page(url_open(url))
- for x in urllist:
- get_imgs(url_open(x))
复制代码
问题是在打开内页图片的地址,我想PRINT下看图片地址,但却返回了这些- -
正则表达式里我也尝试过好几种添加的,但都是返回以上图片内容,正常应该是返回括号里的地址的啊- -
搞不懂,希望大神们能指点下,谢谢~
查找图片的改成这个就可以了
- img = r'name="(http:.+?\.jpg)"'
复制代码
你自己要好好看网页,你提取图片的那个标签里面都是空白图,而且是重复的链接,没用的
|
|