已绑定手机 已实名认证
|
: 北方教育 二、短语、句子的结构分析
由于汉语缺乏形态。所以。语序和虚词成了汉语中表示语法的主要手段。有些短语、句子的结构不好理解,需要形式和意义结合起来分析。例如:
A组:a。陕西+甘肃+宁夏 (“陕西+甘肃+宁夏”三者为联合关系)
b.中国+(北京+陕西)(“中国”与“北京陕西”是偏正关系.“北京”与“陕西”是联合关系)
C.中国(陕西(西安))(“中国”与“陕西西安”是偏正关系,“陕西”与“西安”也是偏正关系)这一组中的abe三个短语对人来说,都很容易分清楚,但计算机目前还很难区分,要让计算机分辨清楚,就得把三个处所名词组合在一起构成a类、b类、e类不同关系的条件与规则研究清楚,并将这些条件与规则加以形式化输入到计算机内。
B组:开始讨论(述宾关系)分析研究(联合关系)研究结束(主谓关系)
取下来(述补关系) 看完再说(连谓关系) 叫他回来(兼语关系)
生产管理(定中关系) 讽刺说(状中关系) 介绍写(不构成合法的句法关系)
这组是现代汉语里“动词性词语+动词性词语”构成的种种不同的结构关系,对人来说,通过讲解大致可以分辨,可是让计算机要分清楚,就非常难,因为我们至今还没有总结出“动词性词语+动词性词语”构成各种不同句法关系的具体规则。换句话说,“动词性词语+动词性词语”在什么条件下一定构成合法的什么句法关系,能构成什么样不同的句法关系,我们至今还说不清楚。
C组:天气好――好天气(主谓――偏正)很好――好得很(偏正――述补)
来人了。――人来了。(述宾――主谓)
一张票三元钱。――三元钱一张票。(主谓――主谓)这一组都是由于语序的不同而形成的结构和意义都不同的短语和句子。这些结构对人而言,稍加学习就可以理解,但这些给计算机理解意思增加了难度。需要人们把这些语序的变化形成的不同的结构概括出规律来,再用形式化的方式描述出来。输入到计算机里。
三、歧义现象
现代汉语短语结构的歧义是进行汉语句法分析的一大障碍。“句处理”要解决的核心问题是排歧问题,计算机面对的歧义,不只是我们人所能感觉到的诸如下面这样一些句子的歧义现象:
(1)他正在输血。(他正给病人输血。/他病了,正输血。)
(2)看望的是病人。(你看望的那个人是病人。/看望你的那个人是病人。)
(3)我们急需进口产品。(我们急需进口的产品。/我们急需从国外进口产品。)
某些在人看来不存在歧义的句子计算机会认为有歧义.例如:
(4)a他被警察叫去罚了一百块钱。
b他被警察叫去写了一份检查。例(4)a句和b句,在人的眼里结构是不一样的。a句“被警察”这个介词结构一直管到底。全句意思是“他被警察叫去,他被警察罚了一百块钱”:而b句“被警察”这个介词结构只 管到“叫去”,管不着“写了一份检查”。可是,计算机分辨不清楚。要让计算机分辨清楚,我们就得将“PP+VPI+VP2”(PP代表介词结构,VP1和VP2分别代表紧挨着的不同的动词性词语)这种结构中的PP对后面动词性词语管辖的范围及其条件与规则进行充分、准确的描写,并加以形式化,“交给”计算机。而这一类现象与规则我们过去根本就没有考虑过,更不用说研究了。
其实以上所举的例子都存在歧义问题,因此,也可以这么说,“句处理”要解决的核心问题是排歧问题。
中文信息“句处理”的研究工作,上个世纪80年代就开始了,最早进行“句处理”研究工作就是基于规则展开的,但上个世纪90年代初,基于规则的“句处理”研究工作遇到了重重困难与难关,主要是语言学家所提供的语言规则远远不能满足信息处理的需要。目前,为了解决好中文信息处理中的“句处理”难题,出现了一个竞相研究、竞相发展的局面。对于句处理,提出的各种策略和途径,归纳起来。主要有基于规则和基于统计这两种策略。基于规则的研究者,一般求诸专家的理性知识,由人来对语言知识进行抽象:基于统计者,一般求助于计算机对大规模语料库真实文本的统计分析,由计算机来抽象出语言知识。各种策略和途径,目前,我们还很难说哪一种是唯一正确的。各种策略和途径,表面看不同,其实,最终都需要依赖可靠的汉语知识来驱动计算机正确处理自然语言(汉语)。因此,“无论是比较传统的基于规则的处理策略,还是90年代以来方兴未艾的基于统计的方法,在对语言知识的需求这一点上实际上都是共同的。所不同者,走规则路线的研究者一般求诸专家的理性知识,由人来对语言知识进行抽象(比如以带有合一条件的规则形式给出)。而走统计路线的研究者一般求助于计算机对大规模的语料库的统计分析,由计算机来抽象出语言知识(比如以一定的数据结构记录的统计结果等)。两种路线孰优孰劣,不能笼统判断,只能跟具体的应用目标结合起来,由实践结果来评价。”目前,越来越多的学者提倡把两种方法结合起来使用。因此,相信在不久的将来,我们会攻克难关,实现计算机对自然语言的处理与理解的目标,使中文信息处理技术处于世界领先地位。 |
|