123,123,123

<cite id="xf2xt"><label id="xf2xt"></label></cite>

當(dāng)前位置： OFweek 人工智能網(wǎng) > 其他 > 正文

精彩不停！Python解析庫(kù)lxml與xpath用法總結(jié)

2021-01-12 09:17

Python進(jìn)階學(xué)習(xí)交流

4．xpath 軸

軸可定義相對(duì)于當(dāng)前節(jié)點(diǎn)的節(jié)點(diǎn)集。

軸名稱結(jié)果ancestor選取當(dāng)前節(jié)點(diǎn)的所有先輩（父、祖父等）。ancestor－or－self選取當(dāng)前節(jié)點(diǎn)的所有先輩（父、祖父等）以及當(dāng)前節(jié)點(diǎn)本身。attribute選取當(dāng)前節(jié)點(diǎn)的所有屬性。child選取當(dāng)前節(jié)點(diǎn)的所有子元素。descendant選取當(dāng)前節(jié)點(diǎn)的所有后代元素（子、孫等）。descendant－or－self選取當(dāng)前節(jié)點(diǎn)的所有后代元素（子、孫等）以及當(dāng)前節(jié)點(diǎn)本身。following選取文檔中當(dāng)前節(jié)點(diǎn)的結(jié)束標(biāo)簽之后的所有節(jié)點(diǎn)。namespace選取當(dāng)前節(jié)點(diǎn)的所有命名空間節(jié)點(diǎn)。parent選取當(dāng)前節(jié)點(diǎn)的父節(jié)點(diǎn)。preceding選取文檔中當(dāng)前節(jié)點(diǎn)的開始標(biāo)簽之前的所有節(jié)點(diǎn)。preceding－sibling選取當(dāng)前節(jié)點(diǎn)之前的所有同級(jí)節(jié)點(diǎn)。self選取當(dāng)前節(jié)點(diǎn)。

5．xpath運(yùn)算符

下面列出了可用在 XPath 表達(dá)式中的運(yùn)算符：

運(yùn)算符描述實(shí)例返回值｜計(jì)算兩個(gè)節(jié)點(diǎn)集／／book ｜／／cd返回所有擁有 book 和 cd 元素的節(jié)點(diǎn)集＋加法6 ＋ 410－減法6 － 42＊乘法6 ＊ 424div除法8 div 42＝等于price＝9．80如果 price 是 9．80，則返回 true。如果 price 是 9．90，則返回 false。�。讲坏扔趐rice！＝9．80如果 price 是 9．90，則返回 true。如果 price 是 9．80，則返回 false。＜小于price＜9．80如果 price 是 9．00，則返回 true。如果 price 是 9．90，則返回 false。＜＝小于或等于price＜＝9．80如果 price 是 9．00，則返回 true。如果 price 是 9．90，則返回 false。＞大于price＞9．80如果 price 是 9．90，則返回 true。如果 price 是 9．80，則返回 false。＞＝大于或等于price＞＝9．80如果 price 是 9．90，則返回 true。如果 price 是 9．70，則返回 false。or或price＝9．80 or price＝9．70如果 price 是 9．80，則返回 true。如果 price 是 9．50，則返回 false。and與price＞9．00 and price＜9．90如果 price 是 9．80，則返回 true。如果 price 是 8．50，則返回 false。mod計(jì)算除法的余數(shù)5 mod 21

好了，xpath的內(nèi)容就這么多了。接下來(lái)我們要介紹一個(gè)神器lxml，他的速度很快，曾經(jīng)一直是我使用beautifulsoup時(shí)最鐘愛的解析器，沒有之一，因?yàn)樗乃俣鹊拇_比其他的html．parser 和html5lib快了許多。

二、lxml

1．lxml安裝

lxml 是一個(gè)xpath格式解析模塊，安裝很方便，直接pip install lxml 或者easy＿install lxml即可。

2．lxml 使用

lxml提供了兩種解析網(wǎng)頁(yè)的方式，一種是你解析自己寫的離線網(wǎng)頁(yè)時(shí)，另一種則是解析線上網(wǎng)頁(yè)。

導(dǎo)入包：

from lxml import etree

1．解析離線網(wǎng)頁(yè)：

html＝etree．parse（＇xx．html＇，etree．HTMLParser（））aa＝html．xpath（＇／［＠id＝＂s＿xmancard＿news＂］／div／div［2］／div／div［1］／h2／a［1］／＠href＇）print（aa）

2．解析在線網(wǎng)頁(yè)：

from lxml import etreeimport requestsrep＝requests．get（＇https：／／www．baidu．com＇）html＝etree．HTML（rep．text）aa＝html．xpath（＇／［＠id＝＂s＿xmancard＿news＂］／div／div［2］／div／div［1］／h2／a［1］／＠href＇）print（aa）

那么我們?cè)趺传@取這些標(biāo)簽和標(biāo)簽對(duì)應(yīng)的屬性值了，很簡(jiǎn)單，首先獲取標(biāo)簽只需你這樣做：

然后我們可以，比方說(shuō)，你要獲取a標(biāo)簽內(nèi)的文本和它的屬性href所對(duì)應(yīng)的值，有兩種方法，

1．表達(dá)式內(nèi)獲取

aa＝html．xpath（＇／［＠id＝＂s＿xmancard＿news＂］／div／div［2］／div／div［1］／h2／a［1］／text（）＇）
ab＝html．xpath（＇／［＠id＝＂s＿xmancard＿news＂］／div／div［2］／div／div［1］／h2／a［1］／＠href＇）

2．表達(dá)式外獲取

aa＝html．xpath（＇／［＠id＝＂s＿xmancard＿news＂］／div／div［2］／div／div［1］／h2／a［1］＇）
aa．text
aa．a(chǎn)ttrib．get（＇href＇）

這樣就完成了獲取，怎么樣，是不是很簡(jiǎn)單了，哈哈哈。

下面再來(lái)lxml的解析規(guī)則：

表達(dá)式描述nodename選取此節(jié)點(diǎn)的所有子節(jié)點(diǎn)／從當(dāng)前節(jié)點(diǎn)選取直接子節(jié)點(diǎn)／／從當(dāng)前節(jié)點(diǎn)選取子孫節(jié)點(diǎn)．選取當(dāng)前節(jié)點(diǎn)．．選取當(dāng)前節(jié)點(diǎn)的父節(jié)點(diǎn)＠選取屬性

html ＝ lxml．etree．HTML（text）＃使用text構(gòu)造一個(gè)XPath解析對(duì)象，etree模塊可以自動(dòng)修正HTML文本html ＝ lxml．etree．parse（＇．／ex．html＇，etree．HTMLParser（））＃直接讀取文本進(jìn)行解析from lxml import etreeresult ＝ html．xpath（＇／＇）＃選取所有節(jié)點(diǎn)result ＝ html．xpath（＇／／li＇）＃獲取所有l(wèi)i節(jié)點(diǎn)result ＝ html．xpath（＇／／li／a＇）＃獲取所有l(wèi)i節(jié)點(diǎn)的直接a子節(jié)點(diǎn)result ＝ html．xpath（＇／／li／／a＇）＃獲取所有l(wèi)i節(jié)點(diǎn)的所有a子孫節(jié)點(diǎn)result ＝ html．xpath（＇／／a［＠href＝＂link．html＂］／．．／＠class＇）＃獲取所有href屬性為link．html的a節(jié)點(diǎn)的父節(jié)點(diǎn)的class屬性result ＝ html．xpath（＇／／li［＠class＝＂ni＂］＇）＃獲取所有class屬性為ni的li節(jié)點(diǎn)result ＝ html．xpath（＇／／li／text（）＇）＃獲取所有l(wèi)i節(jié)點(diǎn)的文本result ＝ html．xpath（＇／／li／a／＠href＇）＃獲取所有l(wèi)i節(jié)點(diǎn)的a節(jié)點(diǎn)的href屬性result ＝ html．xpath（＇／／li［contains（＠class，＂li＂）］／a／text（））＃當(dāng)li的class屬性有多個(gè)值時(shí)，需用contains函數(shù)完成匹配result ＝ html．xpath（＇／／li［contains（＠class，＂li＂） and ＠name＝＂item＂］／a／text（）＇）＃多屬性匹配result ＝ html．xpath（＇／／li［1］／a／text（）＇）result ＝ html．xpath（＇／／li［last（）］／a／text（）＇）result ＝ html．xpath（＇／／li［position（）＜3］／a／text（）＇）result ＝ html．xpath（＇／／li［last（）－2］／a／text（）＇）＃按序選擇，中括號(hào)內(nèi)為XPath提供的函數(shù)result ＝ html．xpath（＇／／li［1］／ancestor：：＊＇）＃獲取祖先節(jié)點(diǎn)result ＝ html．xpath（＇／／li［1］／ancestor：：div＇）result ＝ html．xpath（＇／／li［1］／attribute：：＊＇）＃獲取屬性值result ＝ html．xpath（＇／／li［1］／child：：a［＠href＝＂link1．html＂］＇）＃獲取直接子節(jié)點(diǎn)result ＝ html．xpath（＇／／li［1］／descendant：：span＇）＃獲取所有子孫節(jié)點(diǎn)result ＝ html．xpath（＇／／li［1］／following：：＊［2］＇）＃獲取當(dāng)前節(jié)點(diǎn)之后的所有節(jié)點(diǎn)的第二個(gè)result ＝ html．xpath（＇／／li［1］／following－sibling：：＊＇）＃獲取后續(xù)所有同級(jí)節(jié)點(diǎn)

3．lxml案例

為了偷懶，小編決定還是采用urllib那篇文章的代碼，哈哈哈，機(jī)智如我。

好了，今天就講這么多，大家感興趣的話可以多多關(guān)注哦，精彩不停息�。。。�

圖片標(biāo)題

<上一頁(yè) 1 2

本地收藏打印推薦給朋友

聲明： 本文由入駐維科號(hào)的作者撰寫，觀點(diǎn)僅代表作者本人，不代表OFweek立場(chǎng)。如有侵權(quán)或其他問(wèn)題，請(qǐng)聯(lián)系舉報(bào)。

發(fā)表評(píng)論

共0條評(píng)論，0人參與

立即登錄即可訪問(wèn)所有OFweek服務(wù)

忘記密碼

其他方式

請(qǐng)輸入評(píng)論內(nèi)容...

請(qǐng)輸入評(píng)論/評(píng)論長(zhǎng)度6~500個(gè)字

暫無(wú)評(píng)論

暫無(wú)評(píng)論

圖片新聞

最新發(fā)布

最新活動(dòng)更多

一周熱點(diǎn) 月點(diǎn)擊榜

企業(yè)服務(wù) 廣告服務(wù) 獵頭服務(wù) 薪酬報(bào)告

人工智能獵頭職位更多

高級(jí)軟件工程師廣東省/深圳市
自動(dòng)化高級(jí)工程師廣東省/深圳市
光器件研發(fā)工程師福建省/福州市
銷售總監(jiān)（光器件）北京市/海淀區(qū)
激光器高級(jí)銷售經(jīng)理上海市/虹口區(qū)
光器件物理工程師北京市/海淀區(qū)
激光研發(fā)工程師北京市/昌平區(qū)
技術(shù)專家廣東省/江門市
封裝工程師北京市/海淀區(qū)
結(jié)構(gòu)工程師廣東省/深圳市

掃碼關(guān)注公眾號(hào)
OFweek人工智能網(wǎng)
獲取更多精彩內(nèi)容

文章糾錯(cuò)

x

_*文字標(biāo)題：

_*糾錯(cuò)內(nèi)容：

聯(lián)系郵箱：

_*驗(yàn) 證碼：

看不清，點(diǎn)擊換一張

粵公網(wǎng)安備 44030502002758號(hào)

感谢您访问我们的网站，您可能还对以下资源感兴趣：

久久人妻av无码中文字幕

m3u8午夜福利一区二区三区久久久精产国品一产二产三产区中文字幕在线一级av片久久精品国产亚洲AV电影网

<progress id="wqiik"><label id="wqiik"><b id="wqiik"></b></label></progress>