Python識別html主要文本框過程解析-創(chuàng)新互聯(lián)

這篇文章主要介紹了python識別html主要文本框過程解析,文中通過示例代碼介紹的非常詳細(xì)，對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下

創(chuàng)新互聯(lián)是一家專業(yè)提供海珠企業(yè)網(wǎng)站建設(shè),專注與網(wǎng)站設(shè)計(jì)、成都網(wǎng)站設(shè)計(jì)、H5場景定制、小程序制作等業(yè)務(wù)。10年已為海珠眾多企業(yè)、政府機(jī)構(gòu)等服務(wù)。創(chuàng)新互聯(lián)專業(yè)網(wǎng)站建設(shè)公司優(yōu)惠進(jìn)行中。

在抓取網(wǎng)頁的時候只想抓取主要的文本框，例如 csdn 中的主要文本框?yàn)橄聢D紅色框：

Python識別html主要文本框過程解析

抓取的思想是，利用 bs4 查找所有的 div，用正則篩選出每個 div 里面的中文，找到中文字?jǐn)?shù)最多的 div 就是屬于正文的 div 了。定義一個抓取的頭部抓取網(wǎng)頁內(nèi)容：

import requests
headers = {
  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.106 Safari/537.36',
  'Host': 'blog.csdn.net'}
session = requests.session()
 
def getHtmlByRequests(url):
  headers.update(
    dict(Referer=url, Accept="*/*", Connection="keep-alive"))
  htmlContent = session.get(url=url, headers=headers).content
  return htmlContent.decode("utf-8", "ignore")

另外有需要云服務(wù)器可以了解下創(chuàng)新互聯(lián)scvps.cn，海內(nèi)外云服務(wù)器15元起步，三天無理由+7*72小時售后在線，公司持有idc許可證，提供“云服務(wù)器、裸金屬服務(wù)器、高防服務(wù)器、香港服務(wù)器、美國服務(wù)器、虛擬主機(jī)、免備案服務(wù)器”等云主機(jī)租用服務(wù)以及企業(yè)上云的綜合解決方案，具有“安全穩(wěn)定、簡單易用、服務(wù)可用性高、性價比高”等特點(diǎn)與優(yōu)勢，專為企業(yè)上云打造定制，能夠滿足用戶豐富、多元化的應(yīng)用場景需求。

分享名稱：Python識別html主要文本框過程解析-創(chuàng)新互聯(lián)
URL分享：http://m.jiaotiyi.com/article/doicch.html

網(wǎng)站建設(shè)知識

Python識別html主要文本框過程解析-創(chuàng)新互聯(lián)

其他資訊