[已解决]小甲鱼视频里爬虫00xx的代码困扰我1天了

最爱丽丽 · 发表于 2018-8-16 23:20:44

def find_imgs(url):
html = url_open(url).decode('utf-8')
img_addrs = []
a = html.find('img src=')
while a!= -1:
b = html.find('.jpg', a, a+255)
if b != -1:
img_addrs.append(html[a+9:b+4])
else:
b = a+9
a = html.find('img src=', b)
for each in img_addrs:
print(each)

复制代码

这里测试地址有没有错结果测试结果发现打印的地址 http: 不见了但是a+9应该刚好对应这个地址啊很困挠求大神解答一下

最佳答案

月排行榜 / 总排行榜

无符号整形

2018-8-16 23:20:45

……煎蛋反爬了好吗……
参考-> https://fishc.com.cn/forum.php?m ... hlight=%BC%E5%B5%B0

跳转到最佳答案楼层

无符号整形 · 发表于 2018-8-16 23:20:45

……煎蛋反爬了好吗……
参考-> https://fishc.com.cn/forum.php?m ... hlight=%BC%E5%B5%B0

最爱丽丽 · 发表于 2018-8-16 23:21:39

import urllib.request
import os
import random

def url_open(url):
req = urllib.request.Request(url)
req.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.65 Safari/537.36')

'''proxies = ['119.6.144.70:81', '111.1.36.9:80', '203.144.144.162:8080']
proxy = random.choice(proxies)

proxy_support = urllib.request.ProxyHandler({'http':proxy})
opener = urllib.request.build_opener(proxy_support)
urllib.request.install_opener(opener)'''

response = urllib.request.urlopen(url)
html = response.read()

return html

def get_page(url):
html = url_open(url).decode('utf-8')

a = html.find('current-comment-page') + 23
b = html.find(']', a)

return html[a:b]

def find_imgs(url):
html = url_open(url).decode('utf-8')
img_addrs = []

a = html.find('img src=')

while a!= -1:
      b = html.find('.jpg', a, a+255)
      if b != -1:
         img_addrs.append(html[a+9:b+4])
      else:
         b = a+9

      a = html.find('img src=', b)

for each in img_addrs:
      print(each)


def save_imgs(folder, img_addrs):
pass

def download_mm(folder='OOXX', pages=10):
os.mkdir(folder)
os.chdir(folder)

url = "http://jandan.net/ooxx/"
page_num = int(get_page(url))

for i in range(pages):
      page_num -= i
      page_url = url + 'page-' + str(page_num) + '#comments'
      img_addrs = find_imgs(page_url)
      save_imgs(folder, img_addrs)

if __name__ == '__main__':
download_mm()

源码

塔利班 · 发表于 2018-8-16 23:39:01

你print 下html就知道了，里面藏了点小陷阱，img src=后边就是非图片网址

最爱丽丽 · 发表于 2018-8-17 05:10:31

塔利班发表于 2018-8-16 23:39
你print 下html就知道了，里面藏了点小陷阱，img src=后边就是非图片网址

print（html）能打印出图片的页面的页码出来但是大神我这里的问题咋解决呀
我现在不知道哪里出错了

塔利班 · 发表于 2018-8-17 07:30:39

最爱丽丽发表于 2018-8-17 05:10
print（html）能打印出图片的页面的页码出来但是大神我这里的问题咋解决呀
我现在不知道哪里出错了

你学正则了么，
学了用正则调整

或者find('img src="http')

最爱丽丽 · 发表于 2018-8-17 08:00:38

塔利班发表于 2018-8-17 07:30
你学正则了么，
学了用正则调整

学了但是没学会大神能用正则匹配一下嘛跪谢！

塔利班 · 发表于 2018-8-17 08:09:15

p=r'img src="(http.+?.jpg)'
用re.findall(p,html)返回图片地址列表

最爱丽丽 · 发表于 2018-8-17 09:05:39

塔利班发表于 2018-8-17 08:09
p=r'img src="(http.+?.jpg)'
用re.findall(p,html)返回图片地址列表

是这样嘛好像还是不行哇心态都快蹦了大佬你复制下我的代码在你电脑上运行下可好顺便帮我修改下
我实在不知道怎么弄了

最爱丽丽 · 发表于 2018-8-17 09:08:57

无符号整形发表于 2018-8-17 08:19
……煎蛋反爬了好吗……
参考-> https://fishc.com.cn/forum.php?mod=viewthread&tid=118774&highlight=%B ...

大佬你这里面我几个模块都没有运行不了要怎么安装呀

无符号整形 · 发表于 2018-8-17 09:10:29

最爱丽丽发表于 2018-8-17 09:08
大佬你这里面我几个模块都没有运行不了要怎么安装呀

用pip安装啊。

最爱丽丽 · 发表于 2018-8-17 09:15:12

无符号整形发表于 2018-8-17 09:10
用pip安装啊。

每次都是这样我该怎么弄

无符号整形 · 发表于 2018-8-17 09:17:03

最爱丽丽发表于 2018-8-17 09:15
每次都是这样我该怎么弄

环境变量没有设置好
在环境变量里面加上

;你的Python路径

复制代码

分号切记

塔利班 · 发表于 2018-8-17 09:26:06

的确反爬了，图片格式已经不是你看到的img src=
需要学习新的模块

最爱丽丽 · 发表于 2018-8-17 09:46:35

无符号整形发表于 2018-8-17 09:17
环境变量没有设置好
在环境变量里面加上

我怎么还是安装不了好难受

无符号整形 · 发表于 2018-8-17 09:50:08

最爱丽丽发表于 2018-8-17 09:46
我怎么还是安装不了好难受

Pyexecjs

最爱丽丽 · 发表于 2018-8-17 10:00:15

无符号整形发表于 2018-8-17 09:50
Pyexecjs

大神 beautifulsoup 输入什么呀

无符号整形 · 发表于 2018-8-17 10:01:35

最爱丽丽发表于 2018-8-17 10:00
大神 beautifulsoup 输入什么呀

beautifulsoup4

最爱丽丽 · 发表于 2018-8-17 10:03:12

无符号整形发表于 2018-8-17 10:01
beautifulsoup4

感谢感谢

最爱丽丽 · 发表于 2018-8-17 10:17:40

最爱丽丽发表于 2018-8-17 10:03
感谢感谢

大佬你的这些魔板在哪学习呀

账号		自动登录	找回密码
密码			立即注册