商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > XPath的定义、基础语法、使用示例和高级用法

XPath的定义、基础语法、使用示例和高级用法

  发布于2026-07-22 阅读(0)

扫一扫,手机访问

XPath的全称是XML Path Language,这名字听起来有点学术,但说白了,它其实是一套专门用来在XML文档里精准定位、筛选节点的语言。它的选择能力非常强,你只需要写一个简单的路径表达式,就能把文档里任意一个节点或节点集给“揪”出来。而且,它同样适用于解析HTML文档,很多网页数据抓取的工作里,都离不开它。可以说,弄懂XPath,就等于拿到了高效获取网页数据的钥匙。

一、定义

XPath(XML Path Language)是一种用于在 XML 文档中定位和选择节点的语言。XPath的选择功能非常强大,可以通过简单的路径选择语法,选取文档中的任意节点或节点集。同样也支持 HTML 元素的解析,学会XPath,可以轻松抓取网页数据,提高数据获取效率。

二、XPath基础语法

节点(Nodes): XML 文档的基本构建块,可以是元素、属性、文本等。

路径表达式: 用于定位 XML 文档中的节点。路径表达式由一系列步骤组成,每个步骤用斜杠 / 分隔。

XPath的节点是指在XML或HTML文档中被选择的元素或属性。XPath中有7种类型的节点,包括元素节点、属性节点、文本节点、命名空间节点、处理指令节点、注释节点以及文档节点(或称为根节点)。

- 元素节点:表示XML或HTML文档中的元素。例如,在HTML文档中,、

等都是元素节点。在XPath中,可以使用元素名称来选择元素节点,例如://div表示选择所有的

元素。- 属性节点:表示XML或HTML文档中元素的属性。例如,在HTML文档中,元素的class、id、src等属性都是属性节点。在XPath中,可以使用@符号来选择属性节点,例如://img/@src表示选择所有元素的src属性。- 文本节点:表示XML或HTML文档中的文本内容。例如,在HTML文档中,

标签中的文本内容就是文本节点。在XPath中,可以使用text()函数来选择文本节点,例如://p/text()表示选择所有

元素中的文本内容。- 命名空间节点:表示XML文档中的命名空间。命名空间是一种避免元素命名冲突的方法。在XPath中,可以使用namespace轴来选择命名空间节点,例如://namespace::*表示选择所有的命名空间节点。- 处理指令节点:表示XML文档中的处理指令。处理指令是一种用来给处理器传递指令的机制。在XPath中,可以使用processing-instruction()函数来选择处理指令节点,例如://processing-instruction('xml-stylesheet')表示选择所有的xml-stylesheet处理指令节点。- 注释节点:表示XML或HTML文档中的注释。注释是一种用来添加说明和备注的机制。在XPath中,可以使用comment()函数来选择注释节点,例如://comment()表示选择所有的注释节点。- 文档节点:表示整个XML或HTML文档。文档节点也被称为根节点。在XPath中,可以使用/符号来选择文档节点,例如:/表示选择整个文档节点。

本文使用XML示例如下

            活着        余华        作家出版社        2012-8-1        191        20.00        平装        余华作品(2012版)        9787506365437                撒哈拉的故事        三毛        哈尔滨出版社        2003-8        217        15.80        平装        三毛全集(华文天下2003版)        9787806398791                明朝那些事儿(1-9)        当年明月        中国海关出版社        2009-4        2682        358.20        精装16开        明朝那些事儿(典藏本)        9787801656087    

除了这些基本节点类型之外,XPath还支持使用通配符:

通配符描述示例
*匹配任何元素节点//book/* 选取元素下的任意子元素节点
@*匹配任何属性节点//book/@* 选取元素上的任意属性节点,如中的category属性
node()匹配任何类型的节点//book/node() 选取元素下的所有类型的子节点,包括元素节点、文本节点、注释节点等

以及使用谓词来进一步筛选选择的节点集。谓词是一种用来对节点进行过滤和排序的机制,可以包含比较运算符、逻辑运算符和函数等,部分示例如下:

谓语描述示例
[position()=n]选取位于指定位置的节点。n 是节点的位置(从 1 开始计数)//book[position()=1] 选取第一个元素
[last()=n]选取位于指定位置的最后一个节点。n 是节点的位置(从 1 开始计数)//book[last()=1] 选取最后一个元素
[contains(string, substring)]选取包含指定子字符串的节点。string 是节点的文本内容,substring 是要查找的子字符串//book[contains(title, 'XML')] 选取标题中包含子字符串'XML'元素
[starts-with(string, prefix)]选取以指定前缀开始的节点。string 是节点的文本内容,prefix 是要匹配的前缀字符串//book[starts-with(title, 'The')] 选取标题以'The'开始的元素
[text()=string]选取文本内容完全匹配的节点。string 是要匹配的文本内容//book[text()='Book Title'] 选取文本内容为'Book Title'元素
[@category='non-fiction']选取具有指定属性值的节点。category 是属性名称,non-fiction 是要匹配的值//book[@category='non-fiction'] 选取具有属性category值为'non-fiction'元素

XPath使用路径表达式来选取XML或HTML文档中的节点或节点集。下面是一些常用的路径表达式:

表达式描述示例
nodename选取此节点的所有子节点//bookstore/book 选取元素下所有子元素
/从根节点选取直接子节点/bookstore 从根节点选取元素
//从当前节点选取子孙节点//book 选取所有元素,无论它们在文档中的位置
.选取当前节点./title 选取当前节点的</code>子元素</td></tr><tr><td style="padding:8px 12px;">..</td><td style="padding:8px 12px;">选取当前节点的父节点</td><td style="padding:8px 12px;"><code>../price</code> 选取当前节点的父节点的<code><price></code>子元素</td></tr><tr><td style="padding:8px 12px;">@</td><td style="padding:8px 12px;">选取属性</td><td style="padding:8px 12px;"><code>//book/@id</code> 选取所有<code><book></code>元素的<code>id</code>属性</td></tr></tbody></table> <h2>三、XPath使用示例</h2> <p>选择所有名称为title的节点://title</p> <p>选择所有名称为title,同时属性lang的值为eng的节点://title[@lang='eng']</p> <p>选择id为bookstore的节点的所有子节点:/bookstore/*</p> <p>选择id为bookstore的节点的所有子孙节点:/bookstore//*</p> <p>选择id为bookstore的节点的直接子节点中的第一个节点:/bookstore/*[1]</p> <p>选择id为bookstore的节点的属性为category的值:/bookstore/@category</p> <h2>四、XPath的高级用法</h2> <p>XPath语言提供了一些高级的功能,包括:</p> <p>轴(Axes):XPath提供了几种轴,用于在文档中导航。包括child(子元素)、ancestor(祖先元素)、descendant(后代元素)和following-sibling(后续同级元素)等。</p> <p>函数:XPath提供了一些内置的函数,如count(),concat(),string(),local-name(),contains(),not(),string-length()等,可以用于处理和操作节点和属性3。</p> <p>条件语句:XPath提供了条件语句(如if-else语句),使得我们可以根据某些条件来选择性地提取元素或属性3。</p> <h2>五、.NET中使用</h2> <pre class="brush:vb;">// XML 文档内容string xmlContent = @" <bookstore> <book category='fiction'> <title>活着 余华 作家出版社 2012-8-1 191 20.00 平装 余华作品(2012版) 9787506365437 撒哈拉的故事 三毛 哈尔滨出版社 2003-8 217 15.80 平装 三毛全集(华文天下2003版) 9787806398791 明朝那些事儿(1-9) 当年明月 中国海关出版社 2009-4 2682 358.20 精装16开 明朝那些事儿(典藏本) 9787801656087 ";// 创建 XPath 文档using (XmlReader reader = XmlReader.Create(new StringReader(xmlContent))){ XPathDocument xpathDoc = new XPathDocument(reader); // 创建 XPath 导航器 XPathNa vigator na vigator = xpathDoc.CreateNa vigator(); // 使用 XPath 查询(选择所有位于bookstore下、其category属性值为'fiction'的book元素中的title元素) string xpathExpression = "//bookstore/book[@category='fiction']/title"; XPathNodeIterator nodes = na vigator.Select(xpathExpression); // 检查是否有匹配的节点 if (nodes != null) { // 遍历结果 while (nodes.MoveNext()) { // 检查当前节点是否为空 if (nodes.Current != null) { Console.WriteLine(nodes.Current.Value); } } }}

六、XPath在自动化测试中的应用

XPath最常用的场景之一就是在自动化测试中用来选择HTML DOM节点。例如,在Selenium自动化测试中,可以使用XPath作为选择web元素的主要方法之一。通过XPath选择器,可以方便地定位页面中的任意元素,进行自动化测试操作。

七、XPath的优势与不足

XPath的优势在于其强大的选择功能,可以通过简单的路径选择语法,选取文档中的任意节点或节点集。此外,XPath还支持超过100个内建函数,可用于字符串处理、数值计算、日期和时间比较等等。这些函数可以大大提高数据处理的效率。

然而,XPath也有其不足之处。首先,XPath对于复杂的文档结构可能会变得非常复杂,导致选择语句难以理解和维护。其次,XPath在处理大量数据时可能会出现性能问题,因为它需要遍历整个文档来查找匹配的节点。因此,在使用XPath时需要注意优化查询语句,提高查询效率。

八、总结

学会XPath,可以轻松抓取网页数据,提高数据获取效率。本文介绍了XPath的定义、基础语法、使用示例、高级用法、.NET中使用举例以及在自动化测试中的应用场景,同时也讨论了XPath的优势与不足。希望本文能够帮助读者更好地理解和掌握XPath的使用方法。

本文转载于:https://www.jb51.net/program/306644fge.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。
  • using namespace 使用中遇到的问题怎么解决 正版软件
    using namespace 使用中遇到的问题怎么解决
    命名空间的基本概念与常见引入问题在C++等编程语言中,命名空间(namespace)是一种将代码标识符(如变量、函数、类名)封装在特定名称下的机制,其主要目的是避免命名冲突,尤其是在大型项目或使用多个第三方库时。使用“using namespace”指令可以将指定命名空间中的所有名称引入当前作用域,
    9天前 0
  • c语言函数递归 实操经验总结:这些技巧很实用 正版软件
    c语言函数递归 实操经验总结:这些技巧很实用
    理解递归的基本原理在C语言中,递归是一种函数调用自身的编程技术。要掌握它,首先需要理解其核心思想:将一个复杂的大问题,分解为一个或几个与原问题相似但规模更小的子问题,直到子问题足够简单,可以直接求解。这个过程通常包含两个关键部分:递归出口和递归体。递归出口定义了问题何时不再继续分解,即最简单、可直接
    9天前 0
  • c语言函数递归 怎么选?常见方案对比分析 正版软件
    c语言函数递归 怎么选?常见方案对比分析
    递归函数的基本概念与适用场景在C语言编程中,递归是一种函数调用自身的编程技巧。它并非适用于所有问题,但在处理某些具有自相似结构的问题时,能提供极其清晰和优雅的解决方案。递归的核心思想是将一个大规模问题分解为一个或多个同类型但规模更小的子问题,直到子问题简单到可以直接求解。典型的适用场景包括树形结构的
    9天前 0
  • Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解 正版软件
    Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解
    理解内存管理的基石在Objective-C的编程世界中,内存管理是开发者必须掌握的核心技能之一。它直接关系到应用的性能、稳定性与资源利用效率。与一些采用自动垃圾回收机制的语言不同,Objective-C在很长一段时间里,依赖一套基于引用计数的、需要开发者部分介入的管理规则。这套规则的核心思想是明确的
    9天前 0
  • 如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏 正版软件
    如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏
    理解 dealloc 的角色与时机在 iOS 应用开发中,内存管理是保障应用性能与稳定性的基石。dealloc 方法是 Objective-C 中对象生命周期结束时的关键回调,它标志着对象即将被系统回收内存。正确理解其触发时机至关重要:当一个对象的引用计数降为零时,运行时系统会自动调用该对象的 de
    9天前 0