python爬取海量表情包,讓你成為群裡的鬥圖王

最近加入了鬥圖群,發現自己的表情包太少了,鬥不過他們。今天用python實現批量抓取百度圖片裡面的表情包和他們決戰。

需要實現的效果圖:


python爬取海量表情包,讓你成為群裡的鬥圖王


目標

  • 獲取百度圖片的URL,並且下載到本地

分析:

  • F12檢查來獲取圖片在源代碼的位置。可是發現源代碼里根本就找不到的。
python爬取海量表情包,讓你成為群裡的鬥圖王

源代碼

  • 那就是通過動態加載完成的,我們來驗證一下


python爬取海量表情包,讓你成為群裡的鬥圖王

  • 果然是這樣的,圖片鏈接在這個數據包裡面,thumbURL對應著url,而且還發現pageNum: 30這個參數,表示一個數據包裡面有30條數據(也就是30個圖片鏈接)
  • 每一次請求的url參數,幾乎都一樣,只有一個參數是不同的,那就是pn,他指的是當前頁面中已經展示的圖片數目。

我們所需要的信息都已經找到,那麼開始編寫代碼吧



<code>import requests

class Spider(object):
def __init__(self):

# 初始化headers
self.headers = {
"User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.149 Safari/537.36"
}
# 指定存儲路徑
self.path = '/Users/admin/Desktop/Image/'
self.page = int(input('請輸入需要爬取的頁數:'))
# 獲取翻頁url
def get_parse_url(self):
urls =[]
for i in range(1,self.page+1):
urls.append('https://image.baidu.com/search/acjson?tn=resultjson_com&ipn=rj&ct=201326592&is=&fp=result&queryWord=%E8%A1%A8%E6%83%85%E5%8C%85&cl=2&lm=-1&ie=utf-8&oe=utf-8&adpicid=&st=&z=&ic=&hd=&latest=©right=&word=%E8%A1%A8%E6%83%85%E5%8C%85&s=&se=&tab=&width=&height=&face=&istype=&qc=&nc=&fr=&expermode=&force=&pn={}&rn=30&gsm=1e&1586570843561='.format(30*i))
return urls
# 獲取圖片url
def get_immage_url(self,urls):
image_url = []
for url in urls:
response = requests.get(url,headers=self.headers).json()
results = response.get('data')
for i in results:
image_url.append(i.get('thumbURL'))

return image_url
# 存儲
def storage_image(self,image_url):

i = 1 # 圖片編號標記
for img_url in image_url:
print('正在爬取第{}張'.format(i))
if img_url is None:
continue
response = requests.get(img_url,headers=self.headers).content
with open(self.path + '{}.jpg'.format(i),'wb') as f:
f.write(response)
i +=1

def start(self):
urls = self.get_parse_url()
image_url = self.get_immage_url(urls)
self.storage_image(image_url)

spider = Spider()
spider.start()/<code>

代碼解讀:

  1. def __init__(self): 對我們所需要的url和headers等參數進行一個初始化。
  2. def get_parse_url(self): 獲取數據包url的翻頁
  3. def get_immage_url(self,urls): 獲取圖片url
  4. def storage_image(self,image_url): 對下載的圖片存儲到指定位置
  5. def start(self): 把所有的方法整合,方便調用。

最終效果圖:

python爬取海量表情包,讓你成為群裡的鬥圖王

總結

  • 本章學習瞭如何實現爬取海量的表情包,鬥圖再也不怕圖不夠了
  • 代碼定製了爬取的數量,一頁是30個表情包,可以根據需求輸入爬取的數量

如果本文對你有幫助,幫忙轉發一下唄~


python爬取海量表情包,讓你成為群裡的鬥圖王


分享到:


相關文章: