序言

文中的文本及图片来自互联网,仅作学习培训、沟通交流应用,不具备一切商业行为,如有什么问题请立即在线留言以作解决。

Python爬虫、数据统计分析 、网站建设等实例视频教程在线免费收看

https://space.bilibili.com/523606542

前文內容

Python爬虫新手入门课堂教学(一):爬取豆瓣影评排名信息内容

Python爬虫新手入门课堂教学(二):爬取小说集

Python爬虫新手入门课堂教学(三):爬取链家二手房数据信息

Python爬虫新手入门课堂教学(四):爬取boss直聘招聘职位

Python爬虫新手入门课堂教学(五):爬取B站视頻视频弹幕

Python爬虫新手入门课堂教学(六):制做词云图

Python爬虫新手入门课堂教学(七):爬取腾迅视频视频弹幕

Python爬虫新手入门课堂教学(八):爬取社区论坛文章内容储存成PDF

基础开发工具

  • Python 3.6
  • Pycharm
  • wkhtmltopdf

有关控制模块的应用

  • re
  • requests
  • concurrent.futures

安裝Python并加上到环境变量,pip安装必须的有关控制模块就可以。

一、确立要求

如今闲聊谁还不发好多个表情图?闲聊时,表情图是大家关键的专用工具,也是拉进朋友们间距的好助手,当闲聊深陷难堪处境时,顺手一张表情图,让难堪化作无形中

这篇文章内容就用python大批量爬取表情图图片,留以预留

 

二、网页页面数据统计分析

 


如下图所示斗图网上边的图片数据信息都包括在 a 标识之中 ,能够试着立即要求这一网页页面,查询response 回到的数据信息之中是不是也带有 图片详细地址 。

import requests


def get_response(html_url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
    }
    response = requests.get(url=html_url, headers=headers)
    return response


def main(html_url):
    response = get_response(html_url)
    print(response.text)


if __name__ == '__main__':
    url = 'https://www.doutula.com/photo/list/'
    main(url)

在輸出結果中 ctrl F 开展检索。

 


这里有一个点要想留意一下,我就用python要求网页页面所给大家回到的結果之中 ,包括图片url地址是:
data-original="图片url"
data-backup="图片url"

假如要想获取url地址得话,可以用parsel 分析库,或是 re 正则表达式。以前全是应用的parsel ,这篇文章内容就用 正则表达式吧 。

urls = re.findall('data-original="(.*?)"', response.text)

宣传单页爬取详细编码

import requests
import re


def get_response(html_url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
    }
    response = requests.get(url=html_url, headers=headers)
    return response


def save(image_url, image_name):
    image_content = get_response(image_url).content
    filename = 'images\\'   image_name
    with open(filename, mode='wb') as f:
        f.write(image_content)
        print(image_name)


def main(html_url):
    response = get_response(html_url)
    urls = re.findall('data-original="(.*?)"', response.text)
    for link in urls:
        image_name = link.split('/')[-1]
        save(link, image_name)


if __name__ == '__main__':
    url = 'https://www.doutula.com/photo/list/'
    main(url)

线程同步爬取整站图片(假如你的运行内存够大)

 


3631页的数据信息,是什么表情都是有,嘿嘿

import requests
import re
import concurrent.futures


def get_response(html_url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
    }
    response = requests.get(url=html_url, headers=headers)
    return response


def save(image_url, image_name):
    image_content = get_response(image_url).content
    filename = 'images\\'   image_name
    with open(filename, mode='wb') as f:
        f.write(image_content)
        print(image_name)


def main(html_url):
    response = get_response(html_url)
    urls = re.findall('data-original="(.*?)"', response.text)
    for link in urls:
        image_name = link.split('/')[-1]
        save(link, image_name)


if __name__ == '__main__':
    # ThreadPoolExecutor 线程池的目标
    # max_workers  较大 每日任务数
    executor = concurrent.futures.ThreadPoolExecutor(max_workers=3)
    for page in range(1, 3632):
        url = f'https://www.doutula.com/photo/list/?page={page}'
        # submit  往线程池里边加上每日任务
        executor.submit(main, url)
    executor.shutdown()
文章来源于网络 ,如有侵权请联系站长QQ61910465删除
本文版权归趣快排SEO www.SeogurUblog.com 所有,如有转发请注明来出,竞价开户托管,seo优化请联系QQ▶61910465