Python爬虫新手入门教学（九）：线程同步爬虫案例讲解

2021-01-29 00:28:05LanceLee数据爬虫295

- N +

序言

文中的文本及图片来自互联网,仅作学习培训、沟通交流应用,不具备一切商业行为,如有什么问题请立即在线留言以作解决。

Python爬虫、数据统计分析、网站建设等实例视频教程在线免费收看

https://space.bilibili.com/523606542

前文內容

Python爬虫新手入门课堂教学（一）：爬取豆瓣影评排名信息内容

Python爬虫新手入门课堂教学（二）：爬取小说集

Python爬虫新手入门课堂教学（三）：爬取链家二手房数据信息

Python爬虫新手入门课堂教学（四）：爬取boss直聘招聘职位

Python爬虫新手入门课堂教学（五）：爬取B站视頻视频弹幕

Python爬虫新手入门课堂教学（六）：制做词云图

Python爬虫新手入门课堂教学（七）：爬取腾迅视频视频弹幕

Python爬虫新手入门课堂教学（八）：爬取社区论坛文章内容储存成PDF

基础开发工具

Python 3.6
Pycharm
wkhtmltopdf

有关控制模块的应用

re
requests
concurrent.futures

安裝Python并加上到环境变量，pip安装必须的有关控制模块就可以。

一、确立要求

如今闲聊谁还不发好多个表情图？闲聊时,表情图是大家关键的专用工具,也是拉进朋友们间距的好助手,当闲聊深陷难堪处境时,顺手一张表情图,让难堪化作无形中

这篇文章内容就用python大批量爬取表情图图片，留以预留

二、网页页面数据统计分析

如下图所示斗图网上边的图片数据信息都包括在 a 标识之中，能够试着立即要求这一网页页面，查询response 回到的数据信息之中是不是也带有图片详细地址。

import requests


def get_response(html_url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
    }
    response = requests.get(url=html_url, headers=headers)
    return response


def main(html_url):
    response = get_response(html_url)
    print(response.text)


if __name__ == '__main__':
    url = 'https://www.doutula.com/photo/list/'
    main(url)

在輸出結果中 ctrl F 开展检索。

这里有一个点要想留意一下，我就用python要求网页页面所给大家回到的結果之中，包括图片url地址是：
data-original="图片url"
data-backup="图片url"

假如要想获取url地址得话，可以用parsel 分析库，或是 re 正则表达式。以前全是应用的parsel ，这篇文章内容就用正则表达式吧。

urls = re.findall('data-original="(.*?)"', response.text)

宣传单页爬取详细编码

import requests
import re


def get_response(html_url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
    }
    response = requests.get(url=html_url, headers=headers)
    return response


def save(image_url, image_name):
    image_content = get_response(image_url).content
    filename = 'images\\'   image_name
    with open(filename, mode='wb') as f:
        f.write(image_content)
        print(image_name)


def main(html_url):
    response = get_response(html_url)
    urls = re.findall('data-original="(.*?)"', response.text)
    for link in urls:
        image_name = link.split('/')[-1]
        save(link, image_name)


if __name__ == '__main__':
    url = 'https://www.doutula.com/photo/list/'
    main(url)

线程同步爬取整站图片（假如你的运行内存够大）

3631页的数据信息，是什么表情都是有，嘿嘿

import requests
import re
import concurrent.futures


def get_response(html_url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
    }
    response = requests.get(url=html_url, headers=headers)
    return response


def save(image_url, image_name):
    image_content = get_response(image_url).content
    filename = 'images\\'   image_name
    with open(filename, mode='wb') as f:
        f.write(image_content)
        print(image_name)


def main(html_url):
    response = get_response(html_url)
    urls = re.findall('data-original="(.*?)"', response.text)
    for link in urls:
        image_name = link.split('/')[-1]
        save(link, image_name)


if __name__ == '__main__':
    # ThreadPoolExecutor 线程池的目标
    # max_workers  较大 每日任务数
    executor = concurrent.futures.ThreadPoolExecutor(max_workers=3)
    for page in range(1, 3632):
        url = f'https://www.doutula.com/photo/list/?page={page}'
        # submit  往线程池里边加上每日任务
        executor.submit(main, url)
    executor.shutdown()

文章来源于网络，如有侵权请联系站长QQ61910465删除

本文版权归趣快排SEO www.SeogurUblog.com 所有,如有转发请注明来出,竞价开户托管,seo优化请联系QQ▶61910465

序言