XML文件的结构其实不难理解,它主要由三部分构成:序言、元素和杂项。这三者各有各的职责,咱们一个一个来看。

序言的结构

序言部分,说白了,就是给XML文档做的“自我介绍”。它里面主要包含两个东西:一个是XML声明,另一个是文档类型声明。

XML的声明信息,就像文件头部的标签,告诉解析器这是个XML文档。它的格式是固定的,里面通常包含几个关键信息:

首先是版本信息,说明用的是哪个版本的XML,目前主流是1.0,写法是 version="1.0"。如果文件内容是中文,还需要指定编码,比如 encoding="gb2312"。最后,还有一个文档独立性信息,用 standalone="yes" 表示这个文件可以独立存在,不依赖其他外部文件。

文档类型声明,则负责定义文档的“规矩”。它有两种常见的玩法:

一是引用外部的DTD文件,比如:,这就好比引用了一本“行为规范手册”。

另一种是直接在XML文档内部把规则写清楚,比如: ]>,这样一来,文档的“家规”就一目了然了。

元素的结构

元素是XML文档的真正主角,所有内容都在它里面。元素的内容相当丰富,可以包含子元素、字符数据、字符数据段、引用、处理指令和注释。

这里需要特别说明一下“字符数据”。它指的是那些没有使用任何标记或实体引用的纯文本内容。有一点要注意,在字符数据中,是不能直接包含 ^>& 以及 ]]> 这些特殊符号的,否则XML解析器会“犯迷糊”。

为了解决这个问题,XML为我们准备了几个预定义的实体引用,比如用 & 代表 &,用 < 代表 <,用 > 代表 >,用 ' 代表单引号,用 " 代表双引号。这样一来,特殊字符就能安全地出现在XML文档中了。

字符数据段(CDATA段)是XML中一个非常贴心的小功能,专门用来存放那些不想被XML解析器解析的内容,比如代码片段或脚本。它的格式很固定: + 字符数据 + ]]>。需要注意,这个字符数据段必须放在根元素中。

举个例子:



    my test
    cdata test !]]>

用浏览器打开这个文件,CDATA段里的内容会被原封不动地显示出来,就像上面代码中展示的那样。

引用是XML中另一种强大的机制,分为实体引用和字符引用。

实体引用需要先声明,后使用。声明时用 ENTITY 关键字,使用时用 & + 实体名称 + ; 的格式。比如:



]>
<就业信息>&company;

这里 &company; 被解析后,就会自动替换成“连通公司”。

字符引用则更直接,它使用字符的ASCII值,格式是 &# + ASCII值 + ;

本文转载于:https://www.jb51.net/article/8862.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。