发布于2026-07-22 阅读(0)
扫一扫,手机访问
处理XML时,经常会遇到外国字符、特殊符号以及空白字符的麻烦。这篇文章将系统梳理这些常见问题,并提供MSXML环境下的实用解决方案。
XML文档可以包含外国字符,比如 úóí? 这类拉丁字母变体,或者像 磲 这样的Unicode字符。对于这些字符,需要在它们前面加上转义序列(escape sequence)。外国字符可以用UTF-8编码,也可以用其他编码指定。只要处理得当,XML就能正确加载。
不过,有些字符是XML语法保留的,需要特殊对待。比如下面这段XML:
This & that
会引发错误:此处不允许有空格。行 0000001: This & that 位置 0000012: ----------^。原因在于,& 是XML句法结构的一部分,如果它只是作为数据内容出现,就不能被直接解释为“&”符号。你需要用称为“实体”的特殊字符序列来替换它:
This & that
需要转义的五个内置实体如下:
| 字符 | 实体 |
|---|---|
| < | < |
| & | & |
| > | > |
| " | " |
| ' | ' |
引号字符通常用作属性值的定界符,因此不能在属性值内部直接使用。例如, 会报错,因为单引号既用作定界符,又出现在内容中。解决办法有两种:将属性定界符换成双引号,或者将单引号转义为 '。两种方式都能通过XML对象模型的 getAttribute 方法返回 John's Stuff。双引号同理,可以用 " 转义。
对于元素内容中的特殊字符,也可以使用CDATA节来处理。例如:
XML对象模型会将CDATA节点显示为xml节点的子节点,nodeValue 返回字符串 This & that is just "text" content.。
在Visual C++ 6.0中使用MSXML COM组件,最简便的方式是使用 #import 指令:
#import "msxml.dll" named_guids no_namespace
这会定义所有IXML*接口和接口ID,从而可以在应用程序中直接使用。也可以从INETSDK获取MSXML类型库和头文件,以及包含类IID的uuid.lib。
下面的XML包含HTML实体:
Copyright © 2000, Microsoft Inc, All rights reserved.
加载时会报错:引用未定义的实体 'copy'。 这是因为XML只内置了五个实体(<, >, &, ", ')。要使用HTML实体,需要用DTD来定义它们。将DTD直接包含在DOCTYPE标记中,如下所示:
]>
Copyright © 2000, Microsoft Inc, All rights reserved.
加载时需要关闭 IXMLDOMDocument 接口的 validateOnParse 属性。如果已经完成了DTD验证,那么必须将HTML实体作为参数实体包括在现有的DTD中,例如:
%HTMLENT;
这将定义所有HTML实体,以便在XML文档中使用。
XML DOM有三种访问元素文本内容的方式:
| 属性 | 行为 |
|---|---|
nodeValue | 按照原始XML源中指定的那样,返回TEXT、CDATA、COMMENT和PI节点上的原始文本内容(包括空白字符)。对于ELEMENT节点和DOCUMENT本身,返回空值。 |
data | 与nodeValue相同。 |
text | 重复连接指定子树中的多个TEXT和CDATA节点,并返回组合结果。 |
注意:空白字符包括新行、制表符和空格。
nodeValue 属性通常返回原始文档中的内容,与文档如何加载和当前 xml:space 范围无关。而 text 属性连接指定子树中的所有文本并扩展实体,这与文档加载时 preserveWhiteSpace 开关的状态和当前 xml:space 范围有关。下表展示了不同组合下的行为:
preserveWhiteSpace = true 时加载文档
| xml:space=preserve | xml:space=default | xml:space=preserve | xml:space=default |
|---|---|---|---|
| 保留 | 保留 | 保留 | 保留并截断 |
preserveWhiteSpace = false 时加载文档
| xml:space=preserve | xml:space=default | xml:space=preserve | xml:space=default |
|---|---|---|---|
| 半保留 | 半保留并截断 | 半保留 | 半保留并截断 |
这里的“保留”表示与原始XML文档完全相同的原始文本内容;“截断”意味着删除前导和尾部空格;“半保留”意味着保留“重要的空白字符”并规范化“不重要的空白字符”。重要的空白字符是文本内容内部的空白字符,不重要的空白字符是标记之间的空白字符。例如:
Jane
Smith
红色(\n、\t、空格)是不重要的空白字符,绿色( Jane 和 Smith 内部的空格)是重要的空白字符。不同状态下 text 属性返回的结果如下:
| 状态 | 返回值 |
|---|---|
| 保留 | "\n\t Jane\n\tSmith \n" |
| 保留并截断 | "Jane\n\tSmith" |
| 半保留 | " Jane Smith " |
| 半保留并截断 | "Jane Smith" |
注意“半保留”会将不重要的空白字符规范化,例如新行和制表符会退化为单个空格。
CDATA 和 xml:space="preserve" 子树边界
CDATA节点或“保留”节点的内容会直接连接,因为它们不参与不重要的空白字符规范化。例如:
在“半保留并截断”情况下,返回 "Jane Smith "。注意CDATA内部的空白字符不会被“合并”,也不会被截断。如果用实体引用代替CDATA,结果相同。
实体是特殊的
实体作为DTD的一部分加载,显示在DOCTYPE节点下,它们不一定有任何 xml:space 范围。例如:
Jane Software Design Engineer ">
]>
&Jane;
假定 preserveWhiteSpace=false,在分析实体时不重要的空白字符会丢失,实体内部不会有空白节点。这意味着即使实体引用位于 xml:space="preserve" 范围内,其子节点也没有空白节点。如果实体必须保留空白字符,要么在实体内部自行指定 xml:space 属性,要么将文档的 preserveWhiteSpace 开关设置为 true。
访问属性值有几种方式。IXMLDOMAttribute 接口有 nodeValue 属性,它等价于作为Microsoft扩展的 nodeValue 和 text 属性。不同属性返回的文本如下:
| 属性/方法 | 返回的文本 |
|---|---|
attrNode.nodeValueattrNode.valuegetAttribute("name") | 与原始文档中完全相同(扩展了实体)。 |
attrNode.nodeTypedValue | Null |
attrNode.text | 除了前导和尾部空白字符已截断外,其他与 nodeValue 相同。 |
XML规范为应用程序定义了以下行为:
| 属性类型 | 返回的文本 |
|---|---|
| CDATA | 半规范化(将新行和制表符转换为空格,但多个空格不会退化为一个空格) |
| ID, IDREF, IDREFS, ENTITY, ENTITIES, NOTATION, 枚举 | 全规范化 |
至此,XML中外国字符、特殊字符、实体以及空白字符的处理方式就清晰了。掌握这些机制,就能避免大多数解析错误,让XML文档在各种环境下正确加载。
下一篇:UDDI FAQs
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8