PHP解析XML

时间：2010-08-05 来源：icycling

前言

这篇文章的面向对象是所有对PHP5的XML新功能感兴趣的各个水平的PHP开发者。我们假定读者掌握XML的基本知识。然而，如果你已经在你的PHP当中使用了XML，那么这篇文章也会让你受益非浅。

介绍

在当今的互联网世界，XML已经不再是一个时髦词了，它已经被广泛的接受和规范的使用了。因此相对于PHP4，PHP5对于XML的支持更受到了重视。在 PHP4中你面对的几乎都是非标准，API中断，内存泄漏以及其它不完全的功能。尽管有些不足已经在PHP4.3中得到改进，开发者们还是决定抛弃原有的代码，在PHP5重写全部代码。

这篇文章将对PHP5中关于XML的所有令人激动的新特性逐一介绍。

PHP4 的 XML

早期的PHP版本就已经开始支持XML了，而这只是一个基于SAX的接口，它可以轻松的解析任何XML文档。随着PHP4中加入了DOMXML扩展模块，XML被更好的支持了。后来XSLT做为补充被加了进来。在整个PHP4的阶段，其它一些功能如HTML，XSLT和DTD验证也被加到了 DOMXML扩展中，不幸的是，由于XSLT和DOMXML扩展始终处于实验阶段，API部分也被不止一次的修改，它们还是不能以默认方式安装。此外，DOMXML扩展没有遵循W3C制定的DOM标准，而有自己的命名方法。虽然在PHP4.3中这部分得到了改善并且许多内存泄漏和其它一些功能也得以修复，但它始终没有发展到一个稳定的阶段，一些深入的问题已经几乎不可能修复。只有SAX扩展被已默认方式安装，其它的一些扩展从未得到广泛的使用。

基于所有这些原因，PHP的XML开发者决定在PHP5重写全部代码，并遵循使用标准。

PHP5的XML
在 PHP5中所有支持XML的部分几乎全部重新编写.现在的所有XML扩展都是基于GNOME项目的LIBXML2库。这将允许在不同的扩展模块之间互相操作，核心开发者只需要在一个底层的库上进行开发。例如，复杂的内存管理只实现一次就可以让所有XML相关扩展得到改善。

除了继承 PHP4中闻名的SAX解析器之外，PHP5还支持遵循W3C标准的DOM和基于LIBXSLT引擎的XSLT。同时还加入了PHP独有的 SimpleXML扩展和符合标准的SOAP扩展。随着XML越来越被重视，PHP开发者决定在默认安装方式中加入更多对XML的支持。这就意味着你现在可以使用SAX，DOM和SimpleXML，而这些扩展将会在更多的服务器上安装。然后对于XSLT和SOAP的支持，还需要在PHP编译时被显式的配置。

数据流的支持

现在所有的XML扩展都支持PHP数据流，即使你不从PHP中直接访问。例如，在PHP5中你可以从一个文件或从一条指令访问数据流。基本上你能够在任何可以访问普通文件的地方访问PHP数据流。

PHP4.3中简要的介绍了数据流，在PHP5中已经得到了进一步的提高，包含文件存取，网络存取和其它操作，如共享一套功能函数。你甚至可以使用PHP代码来实现你自己的数据流，这样数据存取将变得非常简单。关于这部分的更多细节请参考PHP文档。

SAX

SAX 的全称是Simple API for XML，它是用于解析XML文档的接口，是基于回调形式的。从PHP3开始就已经支持了SAX，到现在也没有太大的变化。在PHP5中，API接口并没有改变，所以你的代码仍然可以运行。唯一不同的是它不再基于EXPAT库，而是基于LIBXML2库。

这个变化带来了一些对命名空间支持上的问题，这个问题在LIBXML2.2.6版本中已经得到解决。但是LIBXML2以前的版本中并没有解决，因此如果你使用了xml_parse_create_ns()；强烈建议在你的系统上安装LIBXML2.2.6。

DOM

DOM (文档对象模型)是由W3C制定的一套访问XML文档树的标准。在PHP4可以使用DOMXML来对此进行操作，DOMXML的最主要问题是它不符合标准的命名方法。而且在很长一段时间内还存在内存泄漏问题（PHP4.3已经修复了这个问题）。

新的DOM扩展是基于W3C标准完成的，包含方法和属性名称。如果你在其它语言中熟悉DOM，例如在JavaScript中，那么在PHP中编写类似的功能将变得非常容易。你不必每次都查看文档，因为方法和参数都是相同的。

由于使用了新的W3C标准，基于DOMXML的代码将不能运行。在PHP中的API有很大的不同。但是如果你的代码中使用了类似W3C标准的方法命名方式，移植并不是很困难。你只需要将载入函数和保存函数修改，删除函数名中的下划线（DOM标准使用首字母大写）。其它各处的调节当然也是必须的，但是主要逻辑部分可以保持不变。

读取DOM

我不会在这篇文章中解释DOM扩展的所有特性，那也是没有必要的。或许你应该将HTTP://www.w3.org/DOM的文档加入书签。它与PHP5的DOM部分基本上相同。

在这篇文章的大多数例子中我们将使用同一个XML文件，zend.com上有非常简单的RSS版本。将下面的文本粘贴到一个文本文件中并保存为articles.xml。

http://www.zend.com/zend/week/week172.php

http://www.zend.com/zend/tut/tut-hatwar3.php

要将这个例子载入到一个DOM对象，首先要创建一个DOMDocument对象，然后载入XML文件。

$dom = new DomDocument();
$dom->load("articles.xml");

正像上面所提及的，你可以使用PHP的数据流来载入一个XML文档，你应该这样写：

$dom->load("file:///articles.xml");

（或者其它类型的数据流）

如果你想将XML文档输出到浏览器或做为标准标出，使用：

print $dom->saveXML();

如果你想把它保存成文件，请使用：

print $dom->save("newfile.xml");

（注意这样做会将文件大小发送到stdout）

当然这个例子没有太多的功能，让我们来做些更有用的。我们来取得所有的title元素。有很多方法可以办到，最简单的就是使用getElementsByTagName($tagname):

$titles = $dom->getElementsByTagName("title");
foreach($titles as $node) {
print $node->textContent . "\n";
}

textContent属性并不是W3C标准，它可以让我们很方便的快速读取一个元素的所有文本节点，使用W3C的标准读取是下面这样：

$node->firstChild->data;

（这时候你要确保firstChild结点是你需要的文本结点，否则你还得遍历所有子结点来查找）。

另外一个要注意的问题是getElementsByTagName()返回一个DomNodeList,对象，而不是像PHP4中 get_elements_by_tagname()那样返回一个数组，但是正像你在这个例子中看到的那样，你可以使用foreach语句轻松的遍历它。你也可以直接使用$titles->item(0)来访问结点。该方法将返回第一个title元素。

另一个取得所有title元素的办法是从根结点遍历，你可以看到，这个方法更复杂，但是如果你需要的不只是title元素的时候，这个方法也就更灵活。

foreach ($dom->documentElement->childNodes as $articles) {
//如果节点是一个元素(nodeType == 1)并且名字是item就继续循环
if ($articles->nodeType == 1 && $articles->nodeName == "item") {
foreach ($articles->childNodes as $item) {
//如果节点是一个元素，并且名字是title就打印它.
if ($item->nodeType == 1 && $item->nodeName == "title") {
print $item->textContent . "\n";
}
}
}
}

XPath
XPaht 就像是XML的SQL，使用XPath你可以在一个XML文档中查询符合一些模式语法的特定结点。想使用XPath获得所有title结点，只需要这么做：

$xp = new domxpath($dom);
$titles = $xp->query("/articles/item/title");
foreach ($titles as $node) {
print $node->textContent . "\n";
}
?>

这样和使用getElementsByTagName()方法差不多，但是Xpath要强大的多，例如，如果我们有一个title元素是article的子元素(而不是item的子元素)，getElementsByTagName()就会将它返回。而使用/articles/item/title语法，我们只会得到在指定深度和位置的title元素。这只是一个简单的例子，再深入一点可能是这样：

/articles/item[position() = 1]/title 返回第一个item元素的所有

/articles/item/title[@id = '23'] 返回所有含有id属性并且值为23的title

/articles//title 返回所有articles元素下面的title(译者注：//代表任意深度)

你也可以查询含有特殊兄弟元素的点，含有特殊文本内容的元素，或者使用命名空间等等。如果你必须大量的查询XML文档，适当的学习使用XPath会节省你很多时间，它使用简单，执行速度快，比标准的DOM需要更少的代码。

向DOM中写入数据
文档对象模型并不是只能读取和查询，你也可以操作和写入。(DOM标准有点冗长，因为编写者想尽量支持能够想像到的每一个环境，但是它工作的非常好)。看看下面这个例子，它在我们的article.xml文件中添加了一个新元素。

$item = $dom->createElement("item");
$title = $dom->createElement("title");
$titletext = $dom->createTextNode("XML in PHP5");
$title->appendChild($titletext);
$item->appendChild($title);
$dom->documentElement->appendChild($item);
print $dom->saveXML();