Python--Xpath详解
1.2 解析库的使用–XPath:
XPath(XML Path Language)是一门在XML文档中查找信息的语言。
XPath 可用来在XML文档中对元素和属性进行遍历。
XPath 是 W3C XSLT 标准的主要元素,并且 XQuery 和 XPointer 都构建于 XPath 表达之上。
官方网址:http://lxml.de 官方文档:
http://lxml.de/api/index.html
python中如何安装使用XPath:
①: 安装 lxml 库。
②: from lxml import etree
③: Selector = etree.HTML(网页源代码)
④: Selector.xpath(一段神奇的符号)
1.2.1. 准备工作:
要使用XPath首先要先安装lxml库:
pip install lxml
谷歌浏览器配置XPath插件
配置参考链接
:https://jingyan.baidu.com/article/1e5468f94694ac484861b77d.html
如果安装报 包装包无效,解决办法
:https://www.cnblogs.com/ljxh/p/11222898.html
1.2.2. XPath选取节点规则

1.2.3. 解析案例
案例1:
根据视频,实现csdn官网一级分类和二级分类的提取.
案例2:
首先创建一个html文件:my.html 用于测试XPath的解析效果
我的网页使用XPath解析说明
# 导入模块from lxml import etree# 读取html文件信息(在真实代码中是爬取的网页信息)f = open("./my.html",'r',encoding="utf-8")content = f.read()f.close()# 解析HTML文档,返回根节点对象html = etree.HTML(content)#print(html) #
# 获取网页中所有标签并遍历输出标签名result = html.xpath("//*")for t in result: print(t.tag,end=" ")#[html head title body h3 ul li a li a ... ... td]print()# 获取节点result = html.xpath("//li") # 获取所有li节点result = html.xpath("//li/a") # 获取所有li节点下的所有直接a子节点result = html.xpath("//ul//a") # 效果同上(ul下所有子孙节点)result = html.xpath("//a/..") #获取所有a节点的父节点print(result)# 获取属性和文本内容result = html.xpath("//li/a/@href") #获取所有li下所有直接子a节点的href属性值result = html.xpath("//li/a/text()") #获取所有li下所有直接子a节点内的文本内容print(result) #['百度', '京东', '搜狐', '新浪', '淘宝']result = html.xpath("//li/a[@class]/text()") #获取所有li下所有直接含有class属性子a节点内的文本内容print(result) #['百度', '搜狐', '新浪']#获取所有li下所有直接含有class属性值为aa的子a节点内的文本内容result = html.xpath("//li/a[@class='aa']/text()") print(result) #['搜狐', '新浪']#获取class属性值中含有shop的li节点下所有直接a子节点内的文本内容result = html.xpath("//li[contains(@class,'shop')]/a/text()") print(result) #['搜狐', '新浪']# 按序选择result = html.xpath("//li[1]/a/text()") # 获取每组li中的第一个li节点里面的a的文本result = html.xpath("//li[last()]/a/text()") # 获取每组li中最后一个li节点里面的a的文本result = html.xpath("//li[position()<3]/a/text()") # 获取每组li中前两个li节点里面的a的文本result = html.xpath("//li[last()-2]/a/text()") # 获取每组li中倒数第三个li节点里面的a的文本print(result) print("--"*30)# 节点轴选择result = html.xpath("//li[1]/ancestor::*") # 获取li的所有祖先节点result = html.xpath("//li[1]/ancestor::ul") # 获取li的所有祖先中的ul节点result = html.xpath("//li[1]/a/attribute::*") # 获取li中a节点的所有属性值result = html.xpath("//li/child::a[@href='http://www.sohu.com']") #获取li子节点中属性href值的a节点result = html.xpath("//body/descendant::a") # 获取body中的所有子孙节点aprint(result) result = html.xpath("//li[3]") #获取li中的第三个节点 result = html.xpath("//li[3]/following::li") #获取第三个li节点之后所有li节点result = html.xpath("//li[3]/following-sibling::*") #获取第三个li节点之后所有同级li节点for v in result: print(v.find("a").text)解析案例
# 导入模块from lxml import etree# 读取html文件信息(在真实代码中是爬取的网页信息)f = open("./my.html",'r')content = f.read()f.close()# 解析HTML文档,返回根节点对象html = etree.HTML(content)# 1. 获取id属性为hid的h3节点中的文本内容print(html.xpath("//h3[@id='hid']/text()")) #['我的常用链接']# 2. 获取li中所有超级链接a的信息result = html.xpath("//li/a")for t in result: # 通过xapth()二次解析结果 #print(t.xpath("text()")[0], ':', t.xpath("@href")[0]) # 效果同上,使用节点对象属性方法解析 print(t.text, ':', t.get("href"))'''#结果:百度 : http://www.baidu.com京东 : http://www.jd.com搜狐 : http://www.sohu.com新浪 : http://www.sina.com淘宝 : http://www.taobao.com''''''HTML元素的属性: tag:元素标签名 text:标签中间的文本HTML元素的方法: find() 查找一个匹配的元素 findall() 查找所有匹配的元素 get(key, default=None) 获取指定属性值 items()获取元素属性,作为序列返回 keys()获取属性名称列表 value是()将元素属性值作为字符串序列'''
标签:
186
主播行业开始走下坡路了吗?95.2%的主播月收入在5000元以下! 直播行业在近年来迅速崛起,成为了一个备受关注的领域。无数人为了追求一夜成名、一夜暴富,纷纷加入到这个行业中来...
115
男人放不下前任的表现,有一个就别爱了 文丨桃小菁 春风十里不如你,小菁在这里,等着你! 我们总说要活在当下,珍惜眼前人,可很多男人却只活在过去的回忆里,怀念着那个早已...
186
10种炒饭做法,最后一个居然这么好吃,快试试吧! 今天我要为大家带来家庭必备的炒饭大全:10种绝妙的炒饭做法! 炒饭不仅简单易做,还能满足全家人的胃口。而且最后一个做法还...
77
粘土手工—60种超萌的粘土手工制作教程来了,值得收藏! 图片来自网络,仅作分享,如有侵权请联系删除哦...
146
嘉北郊野公园24日试开园:免费不免票,入园需预约! 这个周日(9月24日),嘉北郊野公园将正式对公众试开放。为了让游客有一个舒适的游玩度,公园管理方推出了免费不免票的运作...
136
北大红楼·人物 | 高君宇:“生如闪电之耀亮”的青年先锋 新京报讯(记者 冯雅君)“我是宝剑,我是火花,我愿生如闪电之耀亮,我愿死如彗星之迅忽”,中共早期政治活动家、理论...
137
“才聚泉城高校行”走进西安电子科技大学、西北工业大学 4月23日至24日,2025年“才聚泉城高校行”西安线引才活动分别在西安电子科技大学、西北工业大学举办。济南市委组织部分管...
199
微信可设置「特级好友」,还有多少人不知道? 不得不说,最近以来微信这边的动作真不少。 比如前几天,微信和淘宝迎来了互联互通、鸿蒙原生微信跟随华为 HarmonyOS NEXT 同步开启了...
190
蓬莱仙境,三天两晚自由行攻略,带你玩转蓬莱 说到蓬莱,你们会想到什么呢?从小看着《八仙过海》长大,每每说到蓬莱,就会想到蓬莱仙境,八仙过海的美丽传说。来烟台旅行,怎...
118
放映厅按摩座椅霸占“黄金座”,观众为啥不买账? 不小心买到按摩座位,不按摩就得忍受硌人的椅套,就算付了费按摩也不一定舒服,振动声还引来其他观众侧目 ……不知从何时开...
156
不允许退休的专业技术高官郭守敬,真正的专家,元朝少有的亮点 公元1303年,元朝大德七年,已经年满72岁的郭守敬,向朝廷递交了退休申请,准备退休回家养老。 此时,他已经过了...
73
文玩界的“四大天王”,你集齐了吗?快来看看你还缺哪个! 在这个纷繁复杂的世界里,总有一些东西能够触动我们的心灵,让我们为之倾倒、为之痴迷。文玩,便是这样一种存在。它...
161
哇塞!这个上等兵立了三等功 机枪轰鸣,钢铁碰撞奏出最美的乐章;火花四溅,弹道飞驰是你奋斗的光芒;机枪手钟升洋满腔热血为打赢,强军精武当标兵。作为一名义务兵,从初入军...
73
费翔母亲离世,曾经的儿媳纷争,以及64岁儿子的未婚之谜 为了您更好的阅读互动体验,为了您及时看到更多内容,点个“关注”,我们每天为您更新精彩资讯! 在这个炎热的夏季,娱乐...
110
北京“八大胡同”在解放后彻底变了模样 北京的胡同多如牛毛,但从清朝开始,八大胡同的名声逐渐响亮,闻名中外。所谓“八大胡同”由西往东依次为:百顺胡同、胭脂胡同、韩家胡...
63
锐者行稳 爱卡试驾2016款MG GT名爵锐行 [XCAR 评测 原创] 家用紧凑型车市场一直是各大厂商的必争之地,前有堵截后有追兵,想脱颖而出实属不易,前两年上市的MG GT名爵锐行显然不能落下...
97
金三角大毒枭——坤沙的传奇一生 坤沙 (缅甸语委转写:Khun Sa;泰文:ขุนส่า;1933年2月17日-2007年10月26日),汉名 张奇夫 ,著名毒枭,亦是缅甸军阀,前蒙泰军(MTA)总指...
148
2024年山东省高考状元出自肥城一中 总分712 各地状元出炉 网友热议 2024年山东省高考奇迹!肥城一中状元独领,712分引爆全网热议 在一个寻常又不平凡的夏日早晨,山东省高考成绩的揭...
154
孕妈顺产“开十指”有多疼?妇产科医生用食物生动演绎,感恩妈妈 文|菁妈 顺产之痛,骨开十指艰辛路,母爱如河,流淌无尽伟大情。 顺产到底有多疼? 生过孩子的妈妈才有发言权...
69
那英生孩子无名分,曾讨公道怒砸王纳文酒吧,被渣男耽误10年青春 01 那英的青春岁月是无所畏惧的、肆无忌惮,敢爱敢恨, 与足球运动员高峰相恋十年,却没落得一纸婚书,没有任何...