序言
文中的文本及图片来自互联网,仅作学习培训、沟通交流应用,不具备一切商业行为,如有什么问题请立即在线留言以作解决。
Python爬虫、数据统计分析 、网站建设等实例视频教程在线免费收看
https://space.bilibili.com/523606542
前文內容
Python爬虫新手入门课堂教学(一):爬取豆瓣影评排名信息内容
Python爬虫新手入门课堂教学(二):爬取小说集
Python爬虫新手入门课堂教学(三):爬取链家二手房数据信息
Python爬虫新手入门课堂教学(四):爬取boss直聘招聘职位
Python爬虫新手入门课堂教学(五):爬取B站视頻视频弹幕
Python爬虫新手入门课堂教学(六):制做词云图
Python爬虫新手入门课堂教学(七):爬取腾迅视频视频弹幕
Python爬虫新手入门课堂教学(八):爬取社区论坛文章内容储存成PDF
基础开发工具
- Python 3.6
- Pycharm
- wkhtmltopdf
有关控制模块的应用
- re
- requests
- concurrent.futures
安裝Python并加上到环境变量,pip安装必须的有关控制模块就可以。
一、确立要求
如今闲聊谁还不发好多个表情图?闲聊时,表情图是大家关键的专用工具,也是拉进朋友们间距的好助手,当闲聊深陷难堪处境时,顺手一张表情图,让难堪化作无形中
这篇文章内容就用python大批量爬取表情图图片,留以预留
二、网页页面数据统计分析
如下图所示斗图网上边的图片数据信息都包括在 a 标识之中 ,能够试着立即要求这一网页页面,查询response 回到的数据信息之中是不是也带有 图片详细地址 。
import requests
def get_response(html_url):
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
}
response = requests.get(url=html_url, headers=headers)
return response
def main(html_url):
response = get_response(html_url)
print(response.text)
if __name__ == '__main__':
url = 'https://www.doutula.com/photo/list/'
main(url)
在輸出結果中 ctrl F 开展检索。
这里有一个点要想留意一下,我就用python要求网页页面所给大家回到的結果之中 ,包括图片url地址是:
data-original="图片url"
data-backup="图片url"
假如要想获取url地址得话,可以用parsel 分析库,或是 re 正则表达式。以前全是应用的parsel ,这篇文章内容就用 正则表达式吧 。
urls = re.findall('data-original="(.*?)"', response.text)
宣传单页爬取详细编码
import requests
import re
def get_response(html_url):
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
}
response = requests.get(url=html_url, headers=headers)
return response
def save(image_url, image_name):
image_content = get_response(image_url).content
filename = 'images\\' image_name
with open(filename, mode='wb') as f:
f.write(image_content)
print(image_name)
def main(html_url):
response = get_response(html_url)
urls = re.findall('data-original="(.*?)"', response.text)
for link in urls:
image_name = link.split('/')[-1]
save(link, image_name)
if __name__ == '__main__':
url = 'https://www.doutula.com/photo/list/'
main(url)
线程同步爬取整站图片(假如你的运行内存够大)
3631页的数据信息,是什么表情都是有,嘿嘿
import requests
import re
import concurrent.futures
def get_response(html_url):
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36'
}
response = requests.get(url=html_url, headers=headers)
return response
def save(image_url, image_name):
image_content = get_response(image_url).content
filename = 'images\\' image_name
with open(filename, mode='wb') as f:
f.write(image_content)
print(image_name)
def main(html_url):
response = get_response(html_url)
urls = re.findall('data-original="(.*?)"', response.text)
for link in urls:
image_name = link.split('/')[-1]
save(link, image_name)
if __name__ == '__main__':
# ThreadPoolExecutor 线程池的目标
# max_workers 较大 每日任务数
executor = concurrent.futures.ThreadPoolExecutor(max_workers=3)
for page in range(1, 3632):
url = f'https://www.doutula.com/photo/list/?page={page}'
# submit 往线程池里边加上每日任务
executor.submit(main, url)
executor.shutdown()