python - beautifulSoup4 .select(’.bnrName’) 取不到到 text 文字
問題描述
背景: Python3 下使用 bs4 的 select 去獲取 ZOZO首頁上方的 coupon 信息中店鋪名字。 (國內ip貌似看不到優惠券信息,需要翻一下才能看到,最好是島國ip)
問題: 發現自己找不到他的店鋪名字在寫在什么地方,不知道怎么取,前端 js 不懂,請教諸位解答。謝謝。
自己的代碼如下:
import requests, bs4shopName = ’BEAUTY&YOUTH’url = ’http://zozo.jp/’def getZozoCoupon(): res = requests.get(url, headers={'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_4) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.110 Safari/537.36'}) res.raise_for_status() soup = bs4.BeautifulSoup(res.text, ’html.parser’) elems = soup.select(’.bnrName’) return elems[0].text.strip()
如下截圖中是想要獲取的文字,
發現查看源碼中卻沒有文字。
<p class='couponInfo'> <p class='bnrName'>說好的文字呢。。。</p> <p class='bnrText'></p></p>
請教他的文字是在哪實現的啊,要怎么用bs4 select才出來,謝謝。
問題解答
回答1:有可能用ajax從服務器獲取之后操作dom動態添加的吧,在瀏覽器里執行了js就文字也被添加進來。而你用爬蟲爬的時候沒有執行有關js所以也沒有添加文字。
要是真的這樣的話,你可以在瀏覽器的f12那里查看network,把獲取文字的那個http請求的url找出來,直接請求這個url獲取你需要的信息。
回答2:我在瀏覽器中打開http://zozo.jp/查看源代碼并沒有找到你所要找的bnrName
你在瀏覽器上右鍵“查看網頁源碼”看看能不能找得你那段文字,如果找不到,那網頁應該是用js或者ajax動態加載的,想要爬取這種動態頁面,兩種方法,要么是自己手動模擬請求,要么就用selenium去抓吧
回答4:確實是js生成的,已經采用headless瀏覽器模擬抓取了,謝謝大家!
相關文章:
1. html5 - 在一個頁面中 初始了兩個swiper 不知道哪里錯了 一直不對2. html5和Flash對抗是什么情況?3. 微信小程序session無法緩存的問題4. 前端 - 微信支付開發:調用jsapi時缺少參數total_fee5. mac連接阿里云docker集群,已經卡了2天了,求問?6. docker綁定了nginx端口 外部訪問不到7. phpadmin的數據庫,可以設置自動變化時間的變量嗎?就是不需要接收時間數據,自動變化8. node.js - vue怎么部署到網站里9. java - Web開發 - POI導出帶有下拉框的Excel和解決下拉中數組過多而產生的異常10. node.js - 如何在vue模板中使用nodeJS?
