百度文库爬虫（爬取需要下载券的文档）

冷小漠 · 发表于 2018-6-10 14:49:24

看了楼主的代码，总结了一下思路：

百度文库比较特殊，虽然抓包可以抓得到，但是文章的api很难逆向，至少我不行。。。
楼主提供了一个很好的思路，就是简单粗暴的正则表达式匹配百度文库js自己生成的api地址，再用改地址请求真正的文章内容

1. 获得某篇文章的url之后，下载该url对应的网页数据，在该网页数据中含有真正文章的地址

WkInfo.htmlUrls = '{\x22ttf\x22:[{\x22pageIndex\x22:1,\x22param\x22:\x22&md5sum=2247898bde5831aa14cb0ff6976d581d&range=0-35283&sign=865b03efea\x22},{\x22pageIndex\x22:2,\x22param\x22:\x22&md5sum=2247898bde5831aa14cb0ff6976d581d&range=35284-&sign=865b03efea\x22}],\x22json\x22:[{\x22pageIndex\x22:1,\x22pageLoadUrl\x22:\x22https:\\\/\\\/wkbos.bdimg.com\\\/v1\\\/docconvert3256\\\/\\\/wk\\\/2247898bde5831aa14cb0ff6976d581d\\\/0.json?responseCacheControl=max-age%3D3888000&responseExpires=Wed%2C%2025%20Jul%202018%2013%3A45%3A30%20%2B0800&authorization=bce-auth-v1%2Ffa1126e91489401fa7cc85045ce7179e%2F2018-06-10T05%3A45%3A30Z%2F3600%2Fhost%2F3b600f217b1607544a7cce957b88c84d7d3ca5422dae74a2510f25a24335d268&x-bce-range=0-18105&token=b60d225474165f8613deafe1cbf02f87c4b17bfcc15b158c736120600be7f600&expire=2018-06-10T06:45:30Z\x22},{\x22pageIndex\x22:2,\x22pageLoadUrl\x22:\x22https:\\\/\\\/wkbos.bdimg.com\\\/v1\\\/docconvert3256\\\/\\\/wk\\\/2247898bde5831aa14cb0ff6976d581d\\\/0.json?responseCacheControl=max-age%3D3888000&responseExpires=Wed%2C%2025%20Jul%202018%2013%3A45%3A30%20%2B0800&authorization=bce-auth-v1%2Ffa1126e91489401fa7cc85045ce7179e%2F2018-06-10T05%3A45%3A30Z%2F3600%2Fhost%2F3b600f217b1607544a7cce957b88c84d7d3ca5422dae74a2510f25a24335d268&x-bce-range=18106-&token=b60d225474165f8613deafe1cbf02f87c4b17bfcc15b158c736120600be7f600&expire=2018-06-10T06:45:30Z\x22}],\x22png\x22:[{\x22pageIndex\x22:1,\x22pageLoadUrl\x22:\x22https:\\\/\\\/wkbos.bdimg.com\\\/v1\\\/docconvert3256\\\/\\\/wk\\\/2247898bde5831aa14cb0ff6976d581d\\\/0.png?responseCacheControl=max-age%3D3888000&responseExpires=Wed%2C%2025%20Jul%202018%2013%3A45%3A30%20%2B0800&authorization=bce-auth-v1%2Ffa1126e91489401fa7cc85045ce7179e%2F2018-06-10T05%3A45%3A30Z%2F3600%2Fhost%2Ff019623704c4d40895636a821d422e588f4843e0f007709d51eb75180696b573&x-bce-range=0-518&token=7276583f9571ef22b7465eb0b96fd1ef5a576fd7ee28b4d7f67b4bbcfc9e432d&expire=2018-06-10T06:45:30Z\x22},{\x22pageIndex\x22:2,\x22pageLoadUrl\x22:\x22https:\\\/\\\/wkbos.bdimg.com\\\/v1\\\/docconvert3256\\\/\\\/wk\\\/2247898bde5831aa14cb0ff6976d581d\\\/0.png?responseCacheControl=max-age%3D3888000&responseExpires=Wed%2C%2025%20Jul%202018%2013%3A45%3A30%20%2B0800&authorization=bce-auth-v1%2Ffa1126e91489401fa7cc85045ce7179e%2F2018-06-10T05%3A45%3A30Z%2F3600%2Fhost%2Ff019623704c4d40895636a821d422e588f4843e0f007709d51eb75180696b573&x-bce-range=519-&token=7276583f9571ef22b7465eb0b96fd1ef5a576fd7ee28b4d7f67b4bbcfc9e432d&expire=2018-06-10T06:45:30Z\x22}]}'

复制代码

2. 使用正则表达式取得该文章的地址，可能不止一个

https://wkbos.bdimg.com/v1/docconvert3256//wk/2247898bde5831aa14cb0ff6976d581d/0.json?responseCacheControl=max-age%3D3888000&responseExpires=Wed%2C%2025%20Jul%202018%2013%3A45%3A30%20%2B0800&authorization=bce-auth-v1%2Ffa1126e91489401fa7cc85045ce7179e%2F2018-06-10T05%3A45%3A30Z%2F3600%2Fhost%2F3b600f217b1607544a7cce957b88c84d7d3ca5422dae74a2510f25a24335d268&x-bce-range=0-18105&token=b60d225474165f8613deafe1cbf02f87c4b17bfcc15b158c736120600be7f600&expire=2018-06-10T06:45:30Z

复制代码

3. 使用文章的地址再次向服务器请求，获得文章的数据，但是此时并不是文章的内容，是一个json结构的数据集

数据集与正则结果

4. 看到这个数据集我头皮发麻，不知道楼主是经历过怎样的绝望才能将其解析出来，辛苦了。。。
5. 该数据集是基于百度文库自己的阅读器生成的，其中包含了非常多的信息，文章内容就在其中，以五维的位置参数，标明内容出现的位置

{"c":"\\u897f\\u534e\\u5bb6\\u4ff1\\u6709\\u9650\\u516c\\u53f8","p":{"h":24.977,"w":168.29,"x":257.79,"y":111.534,"z":210}

复制代码

比如现在这样，内容就是 c 这一串的Unicode编码，p 就是其位置参数什么高啊宽啊
6. 最后就是楼主根据 y 的数值简单排列整个文档，解码保存

不得不说，楼主真的很牛X ，看完之后觉得不难，但是不看楼主的解析方法，我拿到数据集就是一脸懵逼，wtf？？！

PS：谢谢楼主

lobester · 发表于 2018-6-10 14:54:39

我也叫甲鱼 · 发表于 2018-6-10 15:01:29

学习学习

PUIHO · 发表于 2018-6-10 15:45:56

。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。。

ghjghj2012 · 发表于 2018-6-10 16:59:24

6666

ghjghj2012 · 发表于 2018-6-10 17:10:26

小白完全不懂，想知道能以原来的文件格式保存下载内容吗？

smallFishBug · 发表于 2018-6-10 17:22:36

谢谢分享~

gdhsb88 · 发表于 2018-6-10 17:34:35

不用下载券吗？

千载明道 · 发表于 2018-6-10 19:22:01

dong628 · 发表于 2018-6-10 20:23:41

好厉害！

小恒小小恒 · 发表于 2018-6-10 21:10:49

66666

孤独的嫖客 · 发表于 2018-6-11 00:28:52

看看辛苦了

凡尘生凡人 · 发表于 2018-6-11 08:37:37

大神太多，小弟膜拜

九宫 · 发表于 2018-6-11 08:50:54

学习看看

学Java · 发表于 2018-6-11 09:21:29

看代码

曦罗尤尔 · 发表于 2018-6-11 09:59:19

真的可以吗？我来试试

Damon丶 · 发表于 2018-6-11 10:00:38

学习学习

stylyl2018 · 发表于 2018-6-11 11:10:35

学习学习

零夜·鱼 · 发表于 2018-6-11 11:12:47

小小浩 · 发表于 2018-6-11 11:32:55

nhl123 发表于 2018-6-4 14:30
gg

我想参考你的代码！谢谢楼主

账号		自动登录	找回密码
密码			立即注册

[作品展示] 百度文库爬虫（爬取需要下载券的文档）

点评

评分

浏览过的版块