PHP Tokenizer 学习笔记

简述

在某个项目中需要分析 PHP 代码，分离出对应的函数调用（以及源代码对应的位置）。虽然这使用正则也可以实现，但无论从效率还是代码复杂度方面考虑，这都不是最优的方式。

查询了 PHP 手册，发现其实 PHP 已经内置解析器的接口，那就是 PHP Tokenizer ，这工具正是我想要的。使用 PHP Tokenizer 能简单、高效、准确的分析出 PHP 源代码的组成。

实例

官方站点对 Tokenizer 的文档很少，不过这不影响我们理解它。Tokenizer 组件仅仅包含两个函数： token_get_all 以及 token_name ，它们分别用于分析 PHP 代码以及获取代码对应的标识符名称。

下面是个简单的实例，说明如何使用这两个函数：

$code = '<?php echo "string1"."string2"; ?>';
$tokens = token_get_all($code);
foreach ($tokens as $token) {
    if (is_array($token)) {
        // 行号、标识符字面量、对应内容
        printf("%d - %s\t%s\n", $token[2], token_name($token[0]), $token[1]);
    }
}

对应的输出为

1 - T_OPEN_TAG    <?php 
1 - T_ECHO    echo
1 - T_WHITESPACE     
1 - T_CONSTANT_ENCAPSED_STRING    "string1"
1 - T_CONSTANT_ENCAPSED_STRING    "string2"
1 - T_WHITESPACE     
1 - T_CLOSE_TAG    ?>

这里顺便说明下，$token 如果为数组，那么分别对应的三个数组成员为 token 标识符（可以用 token_name 获得字面量）、对应的源代码内容、以及对应的行号。

还有中情况就是 $token 为字符串，这可能的情况之一就是为 T_CONSTANT_ENCAPSED_STRING 等常量，在分析代码时要注意。如果对这点很在意，可以考虑使用这里的代码。

是的，调用方式非常的简单，我们的野心当然远远要比写个简单的循环要大得多。我们可以利用这个组件做写实事，例如下面的代码用于「压缩」 PHP 代码，去除不不要的换行、空白以及注释

/**
 * 「压缩」PHP 源代码
 *
 * @see http://c7y.phparch.com/c/entry/1/art,practical_uses_tokenizer
 */
class CompactCode
{
    static protected $out;
    static protected $tokens;

    static public function compact($source)
    {
        // 解析 PHP 源代码
        self::$tokens = token_get_all($source);   
        self::$out = '';

        reset(self::$tokens);

        // 递归判断每个标记符的类型
        while ($t = current(self::$tokens)) {
            if (is_array($t)) {
                // 过滤空白、注释
                if ($t[0] == T_WHITESPACE || $t[0] == T_DOC_COMMENT || $t[0] == T_COMMENT) {
                    self::skipWhiteAndComments();
                    continue;
                }       
                self::$out .= $t[1];
            } else {
                self::$out .= $t;
            }

            next(self::$tokens);
        }

        return self::$out;
    }

    static private function skipWhiteAndComments()
    {
        // 增加个空格，用于分割关键字
        self::$out .= ' ';
        while ($t = current(self::$tokens)) {
            // 再次贪婪查找
            if (is_array($t) && ($t[0] == T_WHITESPACE || $t[0] == T_DOC_COMMENT || $t[0] == T_COMMENT)) {
                next(self::$tokens);
            } else {
                return;
            }
        }
    }
}

调用方式很简单，只需要使用

CompactCode::compact($source_code);

即可，返回的字符串就是压缩以后的内容。在这里还有更多使用 Tokenizer 的实例，推荐阅读。

lifesinger

2009-06-29 17:40

华丽的坐个沙发，不错的代码
joyqi

2009-06-29 20:26

请参考函数php_strip_whitespace
手气不错

2009-06-29 21:27

@joyqi 咳咳，当然 php_strip_whitespace 能更好的完成这事情，可能我举的例子不是很好
blankyao

2009-06-29 22:53

搞前端也要分析php代码呀 :(
liuzhongshu

2009-06-30 09:22

写的很好，用了PHP这么多年，还是第一次知道PHP Tokenizer，PHP真是个麻雀小，五脏全的东西
网页打不开

2009-06-30 09:47

没看出来有啥用啊
刘策

2009-07-01 18:40

恩。例子确实不怎么好。
应该做一个能列出某php文件所有函数名，并参数表的，就更好一些了。

無標題文檔

PHP Tokenizer 学习笔记

简述

实例

分类

搜索

文章