- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
英语信源汉语信信息熵的研究
英语信源、汉语信源及其信息熵的研究
摘要 英语信源和汉语信源是两种不同的自然语信源,而信息熵反映了信源的记忆长度,信源的记忆长度越长,熵就越小。只有当记忆长度为0,即信源符号间彼此没有任何依赖关系且等概率分布时,信源熵达到最大值。也就是说,信源符号相关性越强,所提供的平均信息量就越小。所以,研究这两种信源的信息熵,就可以得出每种信源中符号的相关性,和提供的平均信息量,量化的来比较两种语言。
关键词 英语信源 汉语信源 信息熵
正文
一、英语信源及其信息熵
英语字母有26个,加上空格,共27个符号。根据熵的性质,信源的最大熵
但实际上,英语中的字母并非等概率出现,字母之间还有严格的依赖关系。如果我们对英语书中27个符号出现的概率加以统计,可得:
27个英语字符出现的概率
符号 概率 符号 概率 符号 概率 空格 0.2 S 0.052 Y,M 0.012 E 0.105 H 0.047 G 0.011 T 0.072 D 0.035 B 0.0105 O 0.0654 L 0.029 V 0.008 A 0.063 C 0.023 K 0.003 N 0.059 F,U 0.0225 X 0.002 I 0.055 M 0.021 J,Q 0.001 R 0.054 P 0.0175 Z 0.001 如果不考虑上述符号之间的依赖关系,即近似地认为信源是离散无记忆信源,根据离散上的定义可得
按上述表格中的概率分布,随机选择英语字母排列起来,得到一个信源输出序列:
AI_NGAE_ITE_NNR_ASAEV_OTE_BAINTHA_HYROO_POER_SETRYGAIETRWCO…
可见,这些字母完全是随机排列,毫无相关性,却不是英语单词,所以我们应该考虑字母的依赖性。
为了进一步逼近实际情况,可把婴语信源近似地看作1阶,2阶,…,阶马尔可夫信源,求得相应的熵
异推出,马尔可夫信源阶数越高,输出的序列越接近实际情况。当依赖关系延伸到无穷远时,信源输出就是真正的英语。所以我们求马尔可夫信源的极限熵
二、汉语信源及其信息熵
对于英语,字符数少,可轻松的计算出英语信源的信息熵,但是对于汉语这个中文字符极其庞大的信源,科学家们做出了大量的统计与计算。方法同上面的英语信源信息熵的计算,不过计算量增加了非常多。下面是截取的一些统计资料。
CCL 语料库-现代汉语 总字频数:307,317,060
总字种数:9711
字频表:
的一:4140344 是:3291508 了:3059837 在:2933070
人:2827726 不:2733842 国:2645758 有:2507415 中:2182025
他:2029395 这:1968713 我:1940875 和:1872750 大:1832977
个:1701835 上:1615128 为:1607942 年:1529238 地:1464121
来:1456483 会:1445285 到:1353359 们:1350664 出:1262480
要:1259098 以:1240442 发:1218837 说:1186888 时:1137791
生:1133029 作:1114127 家:1092024 对:1074655 业:1018180
经:1015211 就:996530 日:991991 行:988420 成:944114
也:906313 工:891269 多:880855 学:860176 于:844000
得:839902 自:833435 子:824453 民:821583 过:810433
着:802863 方:801878 后:801821 下:797775 可:796081
能:792017 进:780713 部:779801 开:747231 新:746180
而:742961 主:741817 里:735032 现:730526 同:727742
全:723495 用:718945 产:713207 理:712150 法:709521
市:708052 之:705141 事:685890 动:683263 本:681058
者:680848 长:677790 你:677378 那:676119 实:670861
…… …… …… …… ……
…… …… …… …… ……
中国科学家冯志伟等人的对中文字符信息熵计算的结果是:
汉字容量:1 1052 18
文档评论(0)