文章詳情頁(yè)

基于Python爬取愛(ài)奇藝資源過(guò)程解析

瀏覽：4日期：2022-08-04 18:13:20

像iqiyi這種視頻網(wǎng)站，現(xiàn)在下載視頻都需要下載相應(yīng)的客戶端。那么如何不用下載客戶端，直接下載非vip視頻？

選擇你想要爬取的內(nèi)容

該安裝的程序以及運(yùn)行環(huán)境都配置好

下面這段代碼就是我在愛(ài)奇藝?yán)锼阉亍坝⑽拿保缓蟪鰜?lái)的視頻，共有20頁(yè)，那么我們便從第一頁(yè)開始，解析網(wǎng)頁(yè)，然后分析

分析每一頁(yè)網(wǎng)址，找出規(guī)律就可以直接得到所有頁(yè)面

然后根據(jù)每一個(gè)視頻的URL的標(biāo)簽，如’class’ ’div’ ’href’......通過(guò)bs4庫(kù)進(jìn)行爬取

而其他的信息則是直接循環(huán)所爬取到的URL，在每一個(gè)里再通過(guò)標(biāo)簽去找

import requestsimport pandas as pdfrom bs4 import BeautifulSoup#爬取URL headers={’user-agent’:’Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.79 Safari/537.36’}b=[]for i in range(1,2): url='https://so.iqiyi.com/so/q_英文名_ctg_t_0_page_'+str(i)+'_p_1_qc_0_rd__site__m_1_bitrate_' #共20頁(yè),根據(jù)每頁(yè)的網(wǎng)址變換規(guī)律進(jìn)行拼接 r=requests.get(url,headers=headers) soup=BeautifulSoup(r.text,'html.parser') a=soup.findAll(’a’,{’class’:’main-tit’}) for i in a: if ’http://www.’in i.get(’href’)and ’html’in i.get(’href’): b.append(i.get(’href’))print(b)#爬取標(biāo)題e=[]for k in b: res=requests.get(k,headers=headers) Soup=BeautifulSoup(res.text,’html.parser’) c=Soup.findAll(’div’,{’class’:’feed-title-box’}) for d in c: e.append(d.find(’h1’).text) print(e)#爬取標(biāo)題下方描述f=[]for j in b: res=requests.get(j,headers=headers) Soup=BeautifulSoup(res.text,’html.parser’) c=Soup.findAll(’div’,{’class’:’qy-play-intro-feed’}) for d in c: f.append(d.find(’p’,{’class’:'intro-iterm__block'}).text)print(f)#爬取發(fā)布時(shí)間h=[]for j in b: res=requests.get(j,headers=headers) Soup=BeautifulSoup(res.text,’html.parser’) c=Soup.findAll(’div’,{’class’:’intro-iterm’}) for d in c: ff=(d.find(’span’,{’class’:'intro-iterm__txt'})) if ff==None: continue h.append(ff.text)print(h)# 爬取上傳作者m=[]for k in b: res=requests.get(k,headers=headers) Soup=BeautifulSoup(res.text,’html.parser’) c=Soup.find(’div’,{’id’:’block-P’}) d=Soup.find(’div’,{’class’:’qy-player-maker’}) try: name=c.get(’:uploader’).split(’,’)[1].split(’:’)[1].replace(’'’,’’)#輸出是字符串的格式，所以用split切割。replace替換 except: try: name=d.get(’:uploader’).split(’,’)[1].split(’:’)[1].replace(’'’,’’) except: m.append('匿名用戶') m.append(name)print(m)

上面的代碼輸出結(jié)果便是英文名的所有網(wǎng)址及其視頻中的一些信息

這里我需要講一下的是，為什么在爬取作者信息的模塊里我采取了try的方法，因?yàn)樵谖遗廊〉倪^(guò)程中我發(fā)現(xiàn)，有的視頻的上傳作者在視頻左下方，有的在視頻的右下方，有的視頻干脆沒(méi)有上傳作者。

同樣的，你想要爬取其他內(nèi)容也可以用這種方法獲取URL和他的其他信息

以上就是本文的全部?jī)?nèi)容，希望對(duì)大家的學(xué)習(xí)有所幫助，也希望大家多多支持好吧啦網(wǎng)。

上一條：Python通過(guò)正則庫(kù)爬取淘寶商品信息代碼實(shí)例下一條：python GUI庫(kù)圖形界面開發(fā)之PyQt5樹形結(jié)構(gòu)控件QTreeWidget詳細(xì)使用方法與實(shí)例

相關(guān)文章：

1. ASP基礎(chǔ)入門第二篇(ASP基礎(chǔ)知識(shí))2. 不使用XMLHttpRequest對(duì)象實(shí)現(xiàn)Ajax效果的方法小結(jié)3. python使用pywinauto驅(qū)動(dòng)微信客戶端實(shí)現(xiàn)公眾號(hào)爬蟲4. Python如何解決secure_filename對(duì)中文不支持問(wèn)題5. ThinkPHP6使用JWT+中間件實(shí)現(xiàn)Token驗(yàn)證實(shí)例詳解6. python使用ProjectQ生成量子算法指令集7. 怎樣打開XML文件？xml文件如何打開?8. Python使用oslo.vmware管理ESXI虛擬機(jī)的示例參考9. python 定義函數(shù) 返回值只取其中一個(gè)的實(shí)現(xiàn)10. JSP出現(xiàn)中文亂碼問(wèn)題解決方法詳解

排行榜

					
					在Vue中獲取自定義屬性方法:data-id的實(shí)例
python 定義函數(shù) 返回值只取其中一個(gè)的實(shí)現(xiàn)
sql server2005 jdbc解決自動(dòng)自動(dòng)增長(zhǎng)列統(tǒng)一處理問(wèn)題紀(jì)實(shí)
Android實(shí)現(xiàn)輪詢的三種方式
不使用XMLHttpRequest對(duì)象實(shí)現(xiàn)Ajax效果的方法小結(jié)
Java調(diào)用新浪api通過(guò)Ip查詢地區(qū)
Python使用oslo.vmware管理ESXI虛擬機(jī)的示例參考
JSP出現(xiàn)中文亂碼問(wèn)題解決方法詳解
IntelliJ IDEA 2020安裝使用教程詳解
ASP基礎(chǔ)入門第二篇(ASP基礎(chǔ)知識(shí))
怎樣打開XML文件？xml文件如何打開?