三、语言分析方法与当代人工智能问题
从上述分析可以看出,分解方法是自然语言处理智能化发展过程中的必由之路。受乔姆斯基三个语法模式理论影响,对句子进行逐层分解成为自然语言形式处理的主要模式。
在人机交互系统中,早期自然语言处理在运用有限词汇与人会话时,分解方法表现出良好的适用性。然而,当把这类系统的处理范围拓展到充满不确定性的真实语境中时,就出现了很多难以克服的问题。其中,最关键的问题在于缺乏相应的常识知识来对句子的语义进行判断。因此,在自然语言处理的语形阶段发展相对成熟之后,就开始逐步向语义处理阶段迈进。
在这一发展过程中,对句子进行层次分解通常从句法分析入手。自然语言处理中最常见的是将句子分解为剖析树(parsetrees),其分析策略主要包括自顶向下、自底向上以及左角分析法等。其中,短语规则指出了从词到短语、从短语到句子的结合规律。也就是说,词可以看作句子中最小的语法成分,词与词之间通过一定的组成关系构成短语,各种类型的短语又可以根据特定的组合关系构成更大的短语成分,最后,各种短语按照句法语义构成规则组成完整的句子。
在上述分解过程中,要想完成对语义的正确理解,所涉及的每一步几乎都要涉及语义知识或语境知识。从技术层面来看,其主要的研究难点在于:
(1)在分词过程中,印欧语系的文字在书写上单词与单词之间有间隔,很容易实现对单词的自动识别。但对于像中文、日文、泰文等语言文字来说,在书写上没有单词之间的分界线。而句子剖析树的生成是以对单词的正确识别为基础的,这直接影响到智能系统对句法、语义、甚至语用的后续处理。如果分词发生错误,则不可能产生正确的语义理解,后续工作就没有任何意义。因此,分词是实现文本语义理解的第一步。在书写方式上没有单词分界线的语言中,分词对于计算机来说是一个非常困难的工作。因为在这类语言中,对于“词”的概念以及词的具体界定通常很难达成一致认识,普通人的语感与语言学标准之间常常有较大差异。并且,应用目的不同会造成对分词单位认识上的不同。①所以,很多分词系统往往从工程需要的角度出发制定相应的分词规范,从而解决信息处理用的“词”的划界问题。而自动分词系统很难将所有句子的单词都分割正确,句子中的某个字应该与前面的字组成词还是和后面的字组成词,往往需要根据整个句子中前后词语间的语义关系来确定。对于不具备人类认知能力的计算机来说,对这类语言进行分词常常会出现错误,通常都需要在自动分词的基础上耗费大量人工进一步校正。
(2)在分词基础上,需要通过词性标注才能进一步生成短语。词性标注难的根本原因在于词的兼类现象,即一个词具有多个词性。在一段文字中,一个词只能有一个意义,因而也只能有一个词性。想要对句子语义有一个正确的理解,就必须先正确判断每个词的词性。而在词性的确定过程中,一旦出现歧义现象,就需要引入相应的语义知识或语境知识。
(3)很多字词不止有一个义项,在自然语言处理中必须通过词义消歧从众多的义项中选出最为适合的一个。而词义消歧的选择过程也需要引入足够的语义知识或语境知识来协助判断。
(4)自然语言的语法通常模棱两可,对一个句子剖析可能会产生多棵剖析树。当一个句子可以分解为两个以上的剖析树时,这个句子就会产生句法歧义。而句法分析的主要目标就是消除句法歧义。此时,系统就必须根据相关的语义知识或语境知识,从中选出最为适合的一棵剖析树,从而达到消解歧义的目的。

