- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
论汉字字频统计方法的改进的策略.doc
论汉字字频统计方法的改进的策略
一、汉字字频统计的概念
在汉语汉字的语境下,汉字字频常常简称为字频,汉字字频是汉字使用的一个重要属性。冯志伟指出:传统的文字学认为,汉字具有形、音、义三个要素,但是,汉字作为记录汉语的符号,它必须作为一种交际工具而存在,在交际过程中,有的汉字使用得多些,有的使用的少些,呈现出一定的统计规律性。因此,从使用的角度来看,汉字还具有第四个要素字频。①顾名思义,字频就是字的使用频度。苏培成在《现代汉字学纲要》(增订本)给字频下的定义是:字频就是汉字的使用频度,是指在一定的历史时期内经抽样取得的文字资料里,每一个汉字的使用次数与抽样资料总字数的比例。②他所说的字频,就是指汉字字频。沙宗元在《文字学术语规范研究》中收了字频这个词条,他给出的定义是:某个汉字在一定语料中使用(出现)的次数与样本总字数(又叫样本容量)之比。③这个字频也指汉字字频。两家的定义大体不错,但表述不够严密。第一,用来作为字频统计的文字资料不一定是经抽样取得的,如《史记》的字频统计这类专书字频统计是根据特定目的选取的,而非经抽样取得的。经抽样取得不能作为字频统计的必要条件。第二,总字数的说法比较含混,应该改作总字次。第三,样本总字数的样本表意不明确。综合学术界的研究,汉字字频可以定义为:个体汉字字符在按特定原则选定的文本中出现的次数与选定文本总字次之比。
对使用中的汉字进行字频统计,并按字频的高低排列汉字的顺序即可以得出汉字的频序,依据频序给汉字分级可以划分出汉字的频级,汉字的频级是对使用中的汉字进行分级的主要依据,对汉字规范、汉字教学及汉字信息处理有重要意义。汉字字频统计是汉字研究中的一项具有实用意义的重要工作。
二、汉字字频统计的主要成果
以往的汉字字频统计与研究取得了重要的研究成果,为汉字的研究与应用作出了重要的贡献。字频统计一般分综合字频统计及分类字频统计两类。其代表性成果主要有以下几项:
现代汉字综合字频统计的主要成果有:1.《汉字频度表》,此表于1976年12月由七四八工程查频组完成。本次字频统计使用的语料时间范围为1973-1975年,语料内容包括科学技术、文学艺术、政治理论和新闻通讯四类,统计方式为手工操作。备选语料3亿多字次,选用语料2160多万字次,统计得出6376个字种。2.《汉字频率表》,此表包含在北京语言学院语言教学研究所编的《现代汉语频率辞典》中,1986年6月由北京语言学院出版社出版。本次字频统计使用的语料时间范围较多选用20世纪40年代至70年代的作品,语料内容包括报刊政论文章及专著、科普书刊材料、剧本和日常口语材料和各种体裁的文学作品四类,统计方式采用人工和计算机相结合。选用语料180万字次,统计得出不同汉字4574个。(参考该书前言和编纂说明)3.《现代汉语字频统计表》,此表由北京航空学院计算机科学与工程系和国家语言文字委员会汉字处研制,于1992年1月由语文出版社出版,出版署名单位是国家语言文字工作委员会和国家标准局。本次字频统计使用的语料时间范围为1977-1982年,语料内容包括自然科学和社会科学两大类,统计方式完全采用计算机自动统计,选用语料13800万字次,抽取出的统计样本语次,统计得出汉字7754个。(参考该书说明)4.《报纸、广播电视、网络用字总表》,本表收录在中国语言生活状况报告课题组编《中国语言生活状况报告(2005)》中,《报告》于2006年9月由商务印书馆出版。《中国语言生活状况报告(2005)》是由国家语委首次向社会发布的年度语言生活报告,其中的《报纸、广播电视、网络用字总表》是2005年年度用字字频统计表。该表语料时间范围为2005年,语料介质包括报纸、广播电视和网络,统计手段采用计算机,共选择892034个文本文件,包括732143010字次,统计得出字种数8128个。(该书把字种界定为这里的字种,指字形不同的汉字。④)古代文献使用汉字的综合字频统计成果主要有《古籍汉字字频统计》,该书由北京书同文数字化技术有限公司编写,2008年7月由商务印书馆出版。本书统计的语料为电子版《四库全书》和《四部丛刊》,统计方式完全采用计算机自动统计,使用语料8亿字次,统计得出汉字30127个。(在该书收录的大规模古籍汉字用字统计报告中统计结果汇总与初步分析一节中介绍该书统计出的总字数时说:1.文渊阁《四库全书》汉字总字数:29088字;2.《四部丛刊》汉字用字总字数:27606字;3.《四库全书》与《四部丛刊》汉字用字合计:30127字。⑤但是该书《古籍字频统计表》的顺序号的最后一号是30136,比30127多出9个数字。查《古籍字频统计表》中含有部分空格和非汉字符号,如八卦卦符、古琴书中的指符等,甚至有新式标点和符。因此,本书给出的总字数并不准
文档评论(0)