世界上信息熵最大的语言是汉语吗( 三 )
重点来了,当此时信息熵完全取决于翻译文本的大小时,他们对原文大小的计算是,英文用ascii码存,中文用EUC-CN存,其他语言类似,然后用存储字节数来表示大小,并且对此完全不加说明原因和分析。
ascii码是存储效率很低的英文,EUC-CN是存储效率中等的中文,其他语言不了解。总之是没有任何可比性的。随便换几个编码方式,最后得到的结论可能是天壤之别。
那这是论文的锅吗?不是的。不要单看标题,哪怕看看它的intro和conclusion也知道这个论文的重点就不是在比较哪个语言的entropy低。
如果非要得出结论的话,只能说ascii码存储的英文的信息熵比EUC-CN编码的存储的中文的信息熵低。
实际上,假设信息熵纯粹取决于翻译长度的话,此处我们首先要对长度做一个定义,而这是最难的。两个完全不同的语言系统怎么比较长度呢?太难了。假如把中文的一个字定义为单位长度,把英文的一个字母定义为单位长度,那么中文完胜。如果把英文的一个单词定义为单位长度,那么英文胜。也可以把英文的一个音节定义为单位长度,那这个就不好说了。
或者说,可以先对语言系统进行完美编码,再用编码后的符号来表示长度,但是,首先,如果是计算机用完美编码方案存,那所有主流语言的信息熵都相同。其次,这么做没有任何实际意义。
大家可能更关心的是,实际生活中,我看书的话,同一本书,不同的语言翻译过后,单位时间内能获得的信息量是多大;或者同一个意思的话,我用不同的语言表达出来,单位时间内能表达的信息量有多大。
基于此,我们可以有如下的不同的定义:
如果是写作的话,可以把长度定义为一个普通人写完各语言翻译文本所需时间,此时得到的结果的含义是:单位时间内书写的信息量大小。
用类似的方法,我们还可以定义出单位时间内阅读的信息量大小,单位时间内朗读的信息量大小,印刷书本单位页数的信息量大小,单位时间内键盘输入的信息量大小,单位时间内手机九宫格输入的信息量大小,等等。
然后用这些数据就可以算出不同环境下的信息熵了。
当然,我个人的直观感觉,从阅读的角度或者印刷书本页数来看,汉语的信息熵应该是最大的,口语或者书写或者键盘输入等就不一定了。
ps: 大家可以看下那个论文原文,即使是完全的外行,有基本论文阅读能力的人10分钟之内就能看完,可以说信息量是相当低的。当然,他的contribution不低。
https://www.irif.fr/~dxiao/docs/entropy.pdf
■网友
谢邀。
历史上存在过两种很明确以「压缩」为最大特征的文字:
冠军:汉语文言
亚军:日语候文
其中汉语文言的「冠中冠」是《尚书》里的文言。
后世的标准汉语文言脱胎于孔子与司马迁,「熵」相比《尚书》已经有差距了。
日语候文脱胎于汉语文言,从汉语文言=\u0026gt;变体汉文=\u0026gt;候文 经历了日化。
《尚书》为什么是冠中冠的原因很简单,
因为3000年前的汉语音节复杂、远古词缀发达、虚词少。所以写成汉字,「熵」极大。
nuup=纳,nuups=内;ngaa=吾(原型),ngaaC=我(词缀型),,等等。
也就是说,用汉字来表记古藏语,或者训读俄语,「熵」都将远大于现代汉语\u0026amp;现代日语——这两门虚词化程度最高的语言。
比如 俄语 rod(种),然后 narod(民族)、rodina(祖国)分别写成「亻种」「女种」
所以这个冠中冠其实也就没那么神秘了。
整个事情的关键完全就是在汉字,
没有汉字的话,日语最终跟波利尼西亚也没什么区别。
■网友
中南半岛上大部分语言都是汉语这样的呀。泰语、越南语、老挝语、高棉语。。。国内的还有苗语、瑶语、壮语、傣语、侗语等等。。。
我不知道语言信息熵是什么意思。但汉语绝对说不上“最高”还是“最低”。因为有一大群类似的语言呢。。。(另外,题主似乎把“信息量”和“熵”搞混了?一般来说信息量越大,熵越小。。。)
推荐阅读
- 广东警方曝光38款存在超范围收集用户信息违规行为App
- 小米手机的指纹信息保管安全吗
- 讴歌MDX|于12月8日正式发布,讴歌全新MDX更多信息曝光!
- 电商会怎样存储和保护客户的信用卡信息不被泄漏
- 企业信息化系统可否自己搭建
- 地理信息科学专业地理所占比例怎样
- 电子信息工程考研有啥偏软件类的专业可以报考
- 可不可能利用网盘的秒传功能使用伪造的MD5(或其他信息)值进行文件分享
- 在汽车制造业从事企业的信息系统建设,该怎样规划自己的事业生涯?
- 趣头条|透过e-tron FE07赛车,奥迪在向我们传递什么信息?
