商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > XML入门的常见问题(三)

XML入门的常见问题(三)

  发布于2026-07-22 阅读(0)

扫一扫,手机访问

处理XML时,经常会遇到外国字符、特殊符号以及空白字符的麻烦。这篇文章将系统梳理这些常见问题,并提供MSXML环境下的实用解决方案。

如何加载包含外国字符和特殊字符的XML文档?

XML文档可以包含外国字符,比如 úóí? 这类拉丁字母变体,或者像 磲 这样的Unicode字符。对于这些字符,需要在它们前面加上转义序列(escape sequence)。外国字符可以用UTF-8编码,也可以用其他编码指定。只要处理得当,XML就能正确加载。

不过,有些字符是XML语法保留的,需要特殊对待。比如下面这段XML:

This & that

会引发错误:此处不允许有空格。行 0000001: This & that 位置 0000012: ----------^。原因在于,& 是XML句法结构的一部分,如果它只是作为数据内容出现,就不能被直接解释为“&”符号。你需要用称为“实体”的特殊字符序列来替换它:

This & that

需要转义的五个内置实体如下:

字符实体
<<
&&
>>
""
''

引号字符通常用作属性值的定界符,因此不能在属性值内部直接使用。例如, 会报错,因为单引号既用作定界符,又出现在内容中。解决办法有两种:将属性定界符换成双引号,或者将单引号转义为 '。两种方式都能通过XML对象模型的 getAttribute 方法返回 John's Stuff。双引号同理,可以用 " 转义。

对于元素内容中的特殊字符,也可以使用CDATA节来处理。例如:

XML对象模型会将CDATA节点显示为xml节点的子节点,nodeValue 返回字符串 This & that is just "text" content.

如何在Visual Studio 6.0 C++中使用MSXML COM组件?

在Visual C++ 6.0中使用MSXML COM组件,最简便的方式是使用 #import 指令:

#import "msxml.dll" named_guids no_namespace

这会定义所有IXML*接口和接口ID,从而可以在应用程序中直接使用。也可以从INETSDK获取MSXML类型库和头文件,以及包含类IID的uuid.lib。

如何在XML中使用HTML实体?

下面的XML包含HTML实体:

Copyright © 2000, Microsoft Inc, All rights reserved.

加载时会报错:引用未定义的实体 'copy'。 这是因为XML只内置了五个实体(<, >, &, ", ')。要使用HTML实体,需要用DTD来定义它们。将DTD直接包含在DOCTYPE标记中,如下所示:


]>
Copyright © 2000, Microsoft Inc, All rights reserved.

加载时需要关闭 IXMLDOMDocument 接口的 validateOnParse 属性。如果已经完成了DTD验证,那么必须将HTML实体作为参数实体包括在现有的DTD中,例如:

%HTMLENT;

这将定义所有HTML实体,以便在XML文档中使用。

元素内容中的空白字符如何处理?

XML DOM有三种访问元素文本内容的方式:

属性行为
nodeValue按照原始XML源中指定的那样,返回TEXT、CDATA、COMMENT和PI节点上的原始文本内容(包括空白字符)。对于ELEMENT节点和DOCUMENT本身,返回空值。
datanodeValue相同。
text重复连接指定子树中的多个TEXT和CDATA节点,并返回组合结果。

注意:空白字符包括新行、制表符和空格。

nodeValue 属性通常返回原始文档中的内容,与文档如何加载和当前 xml:space 范围无关。而 text 属性连接指定子树中的所有文本并扩展实体,这与文档加载时 preserveWhiteSpace 开关的状态和当前 xml:space 范围有关。下表展示了不同组合下的行为:

preserveWhiteSpace = true 时加载文档

xml:space=preservexml:space=defaultxml:space=preservexml:space=default
保留保留保留保留并截断

preserveWhiteSpace = false 时加载文档

xml:space=preservexml:space=defaultxml:space=preservexml:space=default
半保留半保留并截断半保留半保留并截断

这里的“保留”表示与原始XML文档完全相同的原始文本内容;“截断”意味着删除前导和尾部空格;“半保留”意味着保留“重要的空白字符”并规范化“不重要的空白字符”。重要的空白字符是文本内容内部的空白字符,不重要的空白字符是标记之间的空白字符。例如:


     Jane
  Smith   

红色(\n\t、空格)是不重要的空白字符,绿色( JaneSmith 内部的空格)是重要的空白字符。不同状态下 text 属性返回的结果如下:

状态返回值
保留"\n\t Jane\n\tSmith \n"
保留并截断"Jane\n\tSmith"
半保留" Jane Smith "
半保留并截断"Jane Smith"

注意“半保留”会将不重要的空白字符规范化,例如新行和制表符会退化为单个空格。

CDATA 和 xml:space="preserve" 子树边界

CDATA节点或“保留”节点的内容会直接连接,因为它们不参与不重要的空白字符规范化。例如:


  

在“半保留并截断”情况下,返回 "Jane Smith "。注意CDATA内部的空白字符不会被“合并”,也不会被截断。如果用实体引用代替CDATA,结果相同。

实体是特殊的

实体作为DTD的一部分加载,显示在DOCTYPE节点下,它们不一定有任何 xml:space 范围。例如:

Jane Software Design Engineer">
]>
&Jane;

假定 preserveWhiteSpace=false,在分析实体时不重要的空白字符会丢失,实体内部不会有空白节点。这意味着即使实体引用位于 xml:space="preserve" 范围内,其子节点也没有空白节点。如果实体必须保留空白字符,要么在实体内部自行指定 xml:space 属性,要么将文档的 preserveWhiteSpace 开关设置为 true

如何处理属性中的空白字符?

访问属性值有几种方式。IXMLDOMAttribute 接口有 nodeValue 属性,它等价于作为Microsoft扩展的 nodeValuetext 属性。不同属性返回的文本如下:

属性/方法返回的文本
attrNode.nodeValue
attrNode.value
getAttribute("name")
与原始文档中完全相同(扩展了实体)。
attrNode.nodeTypedValueNull
attrNode.text除了前导和尾部空白字符已截断外,其他与 nodeValue 相同。

XML规范为应用程序定义了以下行为:

属性类型返回的文本
CDATA半规范化(将新行和制表符转换为空格,但多个空格不会退化为一个空格)
ID, IDREF, IDREFS, ENTITY, ENTITIES, NOTATION, 枚举全规范化

至此,XML中外国字符、特殊字符、实体以及空白字符的处理方式就清晰了。掌握这些机制,就能避免大多数解析错误,让XML文档在各种环境下正确加载。

本文转载于:https://www.jb51.net/article/2434.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注