2007年1月11日木曜日

黎阳 :上海的"精英"与北京的"精英"

有人说,"北人直爽勇猛,南人聪明谨慎"。这是往好了说。要是往坏了说呢?那就成了"北人粗野蛮横,南人奸诈胆小"。这个概括对普通人适用不适用不知道,但用来

描述上海和北京两地的"主流精英",倒真是"姓郑的娶了个姓何的--郑何氏(正合适)"。

人们指责"主流精英"勾结利益集团盗窃国库坑害百姓。北京的"精英"们不知是听惯了还是不要脸惯了,反正从来不在乎。不仅不辩解,而且公开认帐直言不讳毫不忸怩,一副"敢作敢当"的架式:"我为你们(富人们)讲话不是一天两天,不是一年两年,而是20年"、"20年来一直为企业家说话"、"腐败有利于经济增长"、"为了达到改革的目标,必须牺牲一代人,这一代人就是3000万老工人。8亿多农民和下岗工人是中国巨大的财富,没有他们的辛苦哪有少数人的享乐,他们的存在和维持现在的状态是很有必要的"、"中国的贫富差距大吗?中国的贫富差距还不够大,只有拉大差距,社会才能进步,和谐社会才能有希望。中国穷人为什么穷,因为他们都有仇富心理"、"我建议取消所谓的养老保险失业保险工伤保险等等福利,目的是保持大家的工作热情和能力"......

上海的"精英"可没有这种"敢做敢当"的"大无畏"气概。不知还没听惯还是当了婊子仍舍不得牌坊,急急忙忙跑出来辩解,"声音颤抖"地说道:"请你指出我和哪个利益集团结盟"、"捣浆糊"......都一大把年纪的糟老头子了,还象大姑娘小媳妇似的当众故做娇嗔,好象自己还挺魅力无限、楚楚动人一般。

"主流精英"的倒行逆施犯了众怒,上网群起而攻。北京的"精英"从来一副"死猪不怕开水烫"、"我是流氓我怕谁"的嚎气(不是笔误,就是"嚎气"--没气怎么嚎?):"经济学家要有勇气顶住互联网的压力"、"我不与无耻之人辨论"、"讲策略不是学者的事"、"正确观点不需要投票"、"阿猫阿狗"、"你不懂,等学懂了再来说"、"图穷匕首现"......

上海的"精英"就乖巧得多,顶不顶要看情况,善于见风使舵。陈良宇在台上时傲得不得了:"很不屑于跟任何人讨论新版历史教科书问题"、"不接受任何采访"。等陈良宇一垮台立刻如同断了脊梁骨的癞皮狗,从"很不屑于"、"不接受任何采访"摇身一变为主动召开记者招待会,宣布"是改变,不是政变"、"盖茨来了,毛泽东也没有走"--但是就是故意不告诉你新版的高中教科书的确删掉了毛泽东,这样说其实是在拿着初中的课本糊弄人。

"上海专家建议不再以龙作为中国形象标志"消息一传出,全球华人大哗,抗议之声如狂风暴雨。上海"精英"见状立刻找记者宣布:"自己此前从未就此事接受过媒体采访,所谓龙不再作为中国形象标志的报道纯属无稽之谈","这场风波,本身就是一次误读,以及据此引发的误报",然后强调:"中国龙的形象一定要坚持!"--不过,要"使'龙'的形象更完整、更丰满",也就是说,"构塑中国国家形象品牌"这个"课题项目"依然是少不了的。

这一切看起来好象是天衣无缝,其实经不起仔细推敲。

"重新建构和向世界展示中国国家形象品牌"这一"重要研究"正式被列入"上海市哲学社会科学规划课题立项"这一事实本身就是对"龙"的否定。否则花钱搞这玩艺干什么?钱多得没地方使了?

"此前从未就此事接受过媒体采访"只是说:没有在媒体上提出过"不再以龙作为中国形象标志"的"专家建议",却回避了到底有没有这种"建议"这个真正的关键。只要有这回事,那跟谁讲过、在哪儿提出并没有太大关系。不在媒体上提出,可以在"学术探讨和学术研究专业会议"上提出,在"内部报告会"上提出,在"项目建议书"里提出。"上海精英"来了个"四两拨千斤",轻轻一带就把"有没有这回事"的问题变成了"有没有跟媒体提过这回事"的问题。乍一看是矢口否认,实际上是"金蝉脱壳"。

"强调'中国龙的形象一定要坚持!'"这句话听起来好象挺振奋人心,但是联系上下文一琢磨就满不是那么回事了。别忘了人家话中还有话哪:"在对外宣传和传播时可以注意挖掘诸如'龙凤呈祥'、'龙王送雨'、'龙飞凤舞'等和谐元素,使'龙'的形象更完整、更丰满"、"期待通过对'构塑中国国家形象品牌'的研究,构建和谐文化,不断提升中国的国际形象。"--
"龙的形象"必须挖掘了"凤"、"雨"之类"和谐因素"才能"更完整、更丰满"。如果不"挖掘"呢?那就不"完整"、不"丰满"、不"和谐"了。这跟"龙在西方世界被认为是一种充满霸气和攻击性的庞然大物"、"让对中国历史和文化了解甚少的外国人由此片面而武断地产生一些不符合实际的联想"之类说法有什么本质区别?不过是另一种表达方式而已。

马克.吐温说:"美国国会有些议员是狗婊子养的"。美国国会议员大人们怒火填膺,勒令马克.吐温道歉,否则司法伺候。马克.吐温遂公开"道歉"曰:我说错了,应该说"美国国会有些议员不是狗婊子养的"。于是雨过天晴。

再看看"上海精英"的逻辑,跟马克.吐温的是不是一个味儿?说"龙是一种充满霸气和攻击性的庞然大物"犯了众怒,那我就说要"挖掘诸如'龙凤呈祥'、'龙王送雨'、'龙飞凤舞'等和谐元素,使'龙'的形象更完整、更丰满"、"通过对'构塑中国国家形象品牌'的研究,构建和谐文化,不断提升中国的国际形象。"--说龙"充满霸气和攻击性"不行,说龙需要"挖掘和谐元素"该可以了吧?说你们"有些人是狗婊子养的"不行,那说你们"有些人不是狗婊子养的"该可以了吧?认可"上海精英"这番"解释"的人,象不象挨了骂还直夸好的傻瓜?

总结这一切,符合不符合"胆小加奸诈"的"上海精英""特色"?

"上海精英"也好,"北京精英"也罢,其"特色"都有可爱之处,当然也有可恨的地方。

"北京精英"往往坦白得可爱,直言不讳自己就是为少数权贵服务,一点也不掩饰。你敢惹他,他窜上来就咬人:打官司、发律师涵,大有????的遗传,凶神恶煞一点不隐瞒,所以欺骗性小一些,容易让大家看透本质,教育性极强。其可恨之处在于有股子"死猪不怕开水烫"的流氓气概,永远死不认帐,"煮熟的鸭子--肉烂嘴硬",宁可带着花岗岩头脑见上帝也要死缠滥打顽抗到底。

"上海精英"往往胆小得可爱,背后有老虎撑着便"狐假虎威"为所欲为,一旦没了老虎当靠山立刻能看出势头不对,及时装怂。不过仅仅是"装怂",只要你不备就立刻回过嘴来再偷偷咬上一口,不失狐狸本色。只要你看透这一套,抓住尾巴狠揍,它精神崩溃了立刻比谁都老实。其可恨之处在于极其狡猾,阴谋诡计层出不穷,属泥鳅的--滑溜得要命,稍不留神就要上当。比如这次关于"龙"的辩解。

不过有一点应该记住:无论是"上海精英"还是"北京精英",尽管有不同的地方,但相同之处更多更要害:都是勾结利益集团坑国家害百姓,都在实行"去中国化",都

在借口"国际接轨"帮国际垄断资本压榨中国,都在借口"市场化"疯狂推行"丛林法则",企图把中国变成野兽横行的大"丛林",把有五千年文明传统的中国人变成一群吃人的野兽。这才是其最共同的地方

怎样让女人觉得有安全感

很多时候男人们都没有搞懂一件事情,女人要的就是安全感,所以她才肯跟着你,为你洗衣做饭,一辈子守在你身边不离不弃。但是,安全感毕竟太虚无飘渺,
可能不少男人又会郁闷——我怎么知道怎么样她才有安全感?尤其是现在的都市女性,看了太多的悲欢离合,安全感似乎成为奢侈品。一个女人的幸福感往往与安全
感是联系在一起的。所以,一个男人,如果你能让对方有安全感,那么你的感情就成功了大半。

关于安全感这个问题,男女的看法明显是不同的,女人觉得这个男人有安全感,不会是因为他高大英俊、经济雄厚这些外在条件,而是对方让她有了托付终身的信
心,所以她才会心甘情愿地和对方在一起。外在条件或许是她爱上你的理由,但却不是安全感能诞生的原因。都说女人穿戴的衣裳越多越有安全感,但是女人交往的
男人越多越没有安全感,所以安全感其实就是衡量有没有爱情的经典标准。女人的安全感来自于对男人的爱,而女人的爱又给了男人安全感。

所以,在安全感这个话题中,男人是源泉,女人是主宰。

当你希望在她心中建立起一定的地位,你能否让她觉得有安全感其实就是制胜关键。

1.要懂得尊重女方

不要太多地干涉对方的选择,最好鼓励她发展自己的专长,因为每个人都是一样的,如果做的是自己不喜欢的东西,是不会有激情和干劲的,你觉得好,未必她认为就是最适合自己的。现代好男人的一条重要标准是,尊重所有的女性,包括仅有一面之缘的人。

2.温暖的肢体接触

为何女人都爱挽男人的手?因为这样亲密,让人感觉踏实。人其实都有身体的接触欲望,男人女人都一样。掌心、怀抱的温暖,是最令女人印象深刻的,远比什么钻石更能记住一辈子。她一般在想起你时,都多半是想起你的怀抱,所以,不要吝惜拥抱和十指交缠。

3.适时的嘘寒问暖

关心体贴每个女人都很受落,但是过分的关心只会让她不胜其烦。她苦恼的时候你好好充当垃圾桶的角色就可以了。有时女人需要的,只是一个能够诉说的对象,说完了就释放出来了,并不一定要求结果。

尽量记住她和你提过的朋友的名字,在她遇到困境时,给予你能想到的最好的建议。

4.让她的家人朋友都欣赏你

长辈们实在是厉害,眼睛超毒,如果你能赢得她家人、朋友的欣赏,简直就打通了一半。因为女人通常都很容易被身边的人影响,有赞赏你的人,在很多事情上你都会得到很多帮助。

5.尽量做到胸襟开阔、宽容忍让

虽然现在很多男人因为原先在家就是小太阳,事事要求公平,但是,毕竟女人需要哄,所以请不要太意气用事,如果不是涉及原则,先让步,只有让你们的矛盾平和下来,两人才能冷静下来,再寻求一个解决方法。

6.善待对方的宠物

女人们都觉得,喜欢小动物的男人心地善良,能照顾好宠物,肯定也会照顾好自己的家人。如果你实在不喜欢小动物,但是你也不要表现得太明显,可以以婉转温和的方式告诉她,你对毛发过敏之类的理由比较容易被接受。

7.要有运动爱好

有某种运动爱好的男人,较容易找到情绪的出口,你让她感觉到是和一个心中有热情的男人在一起,会让她对生活充满信心。我想,没有一个女人喜欢和只爱喝酒发泄的男人整天生活在一起吧。

8.让她觉得向你倾诉是安全的

如果一个女人能开诚布公地与你沟通,说明你在她心中是有一定地位的。但是你最好懂得什么时候该说话,什么时候该闭嘴。不要害怕表达,可以适当地和她分享
你的感受和想法,这样她会觉得你是站在她这边的,内心就会更加依靠你。要让她确信,你不会因为她表达出内心想法而嘲笑她。

9.搞清楚和女性朋友的分界

无论男女,都应该有自己的朋友圈子,但是玩暧昧的男人肯定是让女人最为痛恨的。如果你对别的女人不好意思拒绝,那么,迟早她就会毫不可惜地拒绝你。说是
虚荣心也好、没安全感也罢,总之,她们都希望自己的男人能始终出现在自己的视线当中、听力范围内。你可以让她知道你来往的朋友是谁,但是你们可以事先沟通
好,大家可以在信任的基础上互相给对方空间。适当的时候,给点甜蜜的话吧,很多时候,女人就受你这一套。

来源:《信息时报》

2007年1月10日水曜日

数学之美 系列九 -- 如何确定网页和查询的相关性



[我们已经谈过了如何自动下载网页、如何建立索引、如何衡量网页的质量(Page Rank)。我们今天谈谈如何确定一个网页和某个查询的相关性。了解了这四个方面,一个有一定编程基础的读者应该可以写一个简单的搜索引擎了,比如为您所在的学校或院系建立一个小的搜索引擎。]

我们还是看上回的例子,查找关于“原子能的应用”的网页。我们第一步是在索引中找到包含这三个词的网页(详见关于布尔运算的系列)。现在任何一个搜索引擎都包含几十万甚至是上百万个多少有点关系的网页。那么哪个应该排在前面呢?显然我们应该根据网页和查询“原子能的应用”的相关性对这些网页进行排序。因此,这里的关键问题是如何度量网页和查询的相关性。

我 们知道,短语“原子能的应用”可以分成三个关键词:原子能、的、应用。根据我们的直觉,我们知道,包含这三个词多的网页应该比包含它们少的网页相关。当 然,这个办法有一个明显的漏洞,就是长的网页比短的网页占便宜,因为长的网页总的来讲包含的关键词要多些。因此我们需要根据网页的长度,对关键词的次数进 行归一化,也就是用关键词的次数除以网页的总字数。我们把这个商称为“关键词的频率”,或者“单文本词汇频率”(Term Frequency),比如,在某个一共有一千词的网页中“原子能”、“的”和“应用”分别出现了 2 次、35 次 和 5 次,那么它们的词频就分别是 0.002、0.035 和 0.005。 我们将这三个数相加,其和 0.042 就是相应网页和查询“原子能的应用”
相关性的一个简单的度量。概括地讲,如果一个查询包含关键词 w1,w2,...,wN, 它们在一篇特定网页中的词频分别是: TF1, TF2, ..., TFN。 (TF: term frequency)。 那么,这个查询和该网页的相关性就是:
TF1 + TF2 + ... + TFN。

读 者可能已经发现了又一个漏洞。在上面的例子中,词“的”站了总词频的 80% 以上,而它对确定网页的主题几乎没有用。我们称这种词叫“应删除词”(Stopwords),也就是说在度量相关性是不应考虑它们的频率。在汉语中,应删 除词还有“是”、“和”、“中”、“地”、“得”等等几十个。忽略这些应删除词后,上述网页的相似度就变成了0.007,其中“原子能”贡献了 0.002,“应用”贡献了 0.005。

细心的读者可能还会发现另一个小的漏洞。在汉语中,“应用”是个很通用的词,而“原子能”是个很专业的词,后者在相关性排名中比前者重要。因此我们需要给汉语中的每一个词给一个权重,这个权重的设定必须满足下面两个条件:

1. 一个词预测主题能力越强,权重就越大,反之,权重就越小。我们在网页中看到“原子能”这个词,或多或少地能了解网页的主题。我们看到“应用”一次,对主题基本上还是一无所知。因此,“原子能“的权重就应该比应用大。

2. 应删除词的权重应该是零。

我 们很容易发现,如果一个关键词只在很少的网页中出现,我们通过它就容易锁定搜索目标,它的权重也就应该大。反之如果一个词在大量网页中出现,我们看到它仍 然不很清楚要找什么内容,因此它应该小。概括地讲,假定一个关键词 w 在 Dw 个网页中出现过,那么 Dw 越大,w 的权重越小,反之亦然。在信息检索中,使用最多的权重是“逆文本频率指数” (Inverse document frequency 缩写为IDF),它的公式为log(D/Dw)其中D是全部网页数。比如,我们假定中文网页数是D=10亿,应删除词“的”在所有的网页中都出现,即Dw =10亿,那么它的IDF=log(10亿/10亿)= log (1) = 0。假如专用词“原子能”在两百万个网页中出现,即Dw=200万,则它的权重IDF=log(500) =6.2。又假定通用词“应用”,出现在五亿个网页中,它的权重IDF = log(2)
则只有 0.7。也就只说,在网页中找到一个“原子能”的比配相当于找到九个“应用”的匹配。利用 IDF,上述相关性计算个公式就由词频的简单求和变成了加权求和,即 TF1*IDF1 + TF2*IDF2 +... + TFN*IDFN。在上面的例子中,该网页和“原子能的应用”的相关性为 0.0161,其中“原子能”贡献了 0.0126,而“应用”只贡献了0.0035。这个比例和我们的直觉比较一致了。

TF/IDF(term frequency/inverse document frequency) 的概念被公认为信息检索中最重要的发明。在搜索、文献分类和其他相关领域有广泛的应用。讲起 TF/IDF 的历史蛮有意思。IDF 的概念最早是剑桥大学的斯巴克-琼斯[注:她有两个姓] (Karen Sparck Jones)提出来的。斯巴克-琼斯 1972 年在一篇题为关键词特殊性的统计解释和她在文献检索中的应用的论文中提出IDF。遗憾的是,她既没有从理论上解释为什么权重IDF 应该是对数函数 log(D/Dw)(而不是其它的函数,比如平方根),也没有在这个题目上作进一步深入研究,以至于在以后的很多文献中人们提到 TF/IDF 时没有引用她的论文,绝大多数人甚至不知道斯巴克-琼斯的贡献。同年罗宾逊写了个两页纸的解释,解释得很不好。倒是后来康乃尔大学的萨尔顿 (Salton)多次写文章、写书讨论 TF/IDF 在信息检索中的用途,加上萨尔顿本人的大名(信息检索的世界大奖就是以萨尔顿的名字命名的)。很多人都引用萨尔顿的书,甚至以为这个信息检索中最重要的概 念是他提出的。当然,世界并没有忘记斯巴克-琼斯的贡献,2004年,在纪念文献学学报创刊 60 周年之际,该学报重印了斯巴克-琼斯的大作。罗宾逊在同期期刊上写了篇文章,用香农的信息论解释 IDF,这回的解释是对的,但文章写的并不好、非常冗长(足足十八页),把一个简单问题搞复杂了。其实,信息论的学者们已经发现并指出,其实 IDF 的概念就是一个特定条件下、关键词的概率分布的交叉熵(Kullback-Leibler Divergence)(详见上一系列)。这样,信息检索相关性的度量,又回到了信息论。

现 在的搜索引擎对 TF/IDF 进行了不少细微的优化,使得相关性的度量更加准确了。当然,对有兴趣写一个搜索引擎的爱好者来讲,使用 TF/IDF 就足够了。 如果我们结合上网页排名(Page Rank),那么给定一个查询,有关网页综合排名大致由相关性和网页排名乘积决定。

数学之美 系列八-- 贾里尼克的故事和现代语言处理



读者也许注意到了,我们 在前面的系列中多次提到了贾里尼克这个名字。事实上,现代语音识别和自然语言处理确实是和它的名字是紧密联系在一起的。我想在这回的系列里,介绍贾里尼克 本人。在这里我不想列举他的贡献,而想讲一讲他作为一个普普通通的人的故事。这些事要么是我亲身经历的,要么是他亲口对我讲的。

弗莱德 里克.贾里尼克(Fred Jelinek)出生于捷克一个富有的犹太家庭。他的父母原本打算送他去英国的公学(私立学校)读书。为了教他德语,还专门请的一位德国的家庭女教师,但 是第二次世界大战完全打碎了他们的梦想。他们先是被从家中赶了出去,流浪到布拉格。他的父亲死在了集中营,弗莱德自己成天在街上玩耍,完全荒废了学业。二 战后,当他再度回到学校时,他的成绩一塌糊涂, 全部是 D,但是很快他就赶上了班上的同学。不过,他在小学时从来没有得过 A。1949年,他的母亲带领全家移民美国。在美国,贾里尼克一家生活非常贫困,全家基本是靠母亲做点心卖钱为生,弗莱德自己十四五岁就进工厂打工补助全 家。

贾里尼克最初想成为一个律师,为他父亲那样的冤屈者辩护,但他很快意识到他那浓厚的外国口音将使他在法庭上的辩护很吃力。贾里 尼克的第二个理想是成为医生,他想进哈佛大学医学院,但经济上他无法承担医学院 8 年高昂的学费。与此同时麻省理工学院给于了他一份(为东欧移民设的)全额奖学金。贾里尼克决定到麻省理工学电机工程。在那里,他遇到了信息论的鼻祖香农博 士,和语言学大师贾格布森 Roman Jakobson (他提出了著名的通信六功能)[注释一],后来贾里尼克又陪着太太听最伟大的语言学家乔姆斯基(Noam Chomsky)的课。这三位大师对贾里尼克今后的研究方向--利用信息论解决语言问题产生的重要影响。

贾 里尼克从麻省理工获得博士学位后,在哈佛大学教了一年书,然后到康乃尔大学任教。他之所以选择康乃尔大学,是因为找工作时和那里的一位语言学家谈得颇为投 机。当时那位教授表示愿意和贾里尼克在利用信息论解决语言问题上合作。但是,等贾里尼克到康乃尔以后,那位教授表示对语言学在没有兴趣而转向写歌剧了。贾 里尼克对语言学家的坏印象从此开始。加上后来他在 IBM 时发现语言学家们嘴上头头是道,干起活来高不成低不就,对语言学家从此深恶痛绝。他甚至说:"我每开除一名语言学家,我的语音识别系统错误率就降低一个百 分点。" 这句话后来在业界广为流传,为每一个搞语音识别和语言处理的人所熟知。

贾里尼克在康乃尔十年磨一剑,潜心研究信息论,终于悟 出了自然语言处理的真谛。1972年,贾里尼克到IBM 华生实验室(IBM T.G.Watson Labs)做学术休假,无意中领导了语音识别实验室,两年后他在康乃尔和IBM 之间选择了留在IBM。在那里,贾里尼克组建了阵容空前绝后强大的研究队伍,其中包括他的著名搭档波尔(Bahl),著名的语音识别 Dragon 公司的创始人贝克夫妇,解决最大熵迭代算法的达拉皮垂(Della Pietra)孪生兄弟,BCJR 算法的另外两个共同提出者库克(Cocke)和拉维夫(Raviv),以及第一个提出机器翻译统计模型的布朗。

七十年代的 IBM 有点像九十年代的微软和今天的 Google, 给于杰出科学家作任何有兴趣研究的自由。在那种宽松的环境里,贾里尼克等人提出了统计语音识别的框架结构。 在贾里尼克以前,科学家们把语音识别问题当作人工智能问题和模式匹配问题。而贾里尼克把它当成通信问题,并用两个隐含马尔可夫模型(声学模型和语言模型) 把语音识别概括得清清楚楚。这个框架结构对至今的语音和语言处理有着深远的影响,它从根本上使得语音识别有实用的可能。 贾里尼克本人后来也因此当选美国工程院院士。

贾里尼克和波尔,库克以及拉维夫对人类的另一大贡献是 BCJR 算法,这是今天数字通信中应用的最广的两个算法之一(另一个是维特比算法)。有趣的是,这个算法发明了二十年后,才得以广泛应用。IBM 于是把它列为了 IBM 有史以来对人类最大贡献之一,并贴在加州 Amaden 实现室墙上。遗憾的是 BCJR 四个人已经全部离开 IBM,有一次IBM 的通信部门需要用这个算法,还得从斯坦福大学请一位专家去讲解,这位专家看到 IBM 橱窗里的成就榜,感慨万分。

贾 里尼克和 IBM 一批最杰出的科学家在九十年代初离开了 IBM,他们大多数在华尔街取得了巨大的成功。贾里尼克的书生气很浓,于是去约翰霍普金斯大学建立了世界著名的 CLSP 实验室。每年夏天,贾里尼克邀请世界上 20-30 名顶级的科学家和学生到 CLSP 一起工作,使得 CLSP 成为世界上语音和语言处理的中心之一。

贾里尼克治学极为严谨,对学生要求也极严。他淘汰学生的比例极高,即使留下来的,毕业时间也极 长。但是,另一方面,贾里尼克也千方百计利用自己的影响力为学生的学习和事业创造方便。贾里尼克为组里的每一位学生提供从进组第一天到离开组最后一天全部 的学费和生活费。他还为每一位学生联系实习机会,并保证每位学生在博士生阶段至少在大公司实习一次。从他那里拿到博士学位的学生,全部任职于著名实验室, 比如IBM, 微软,AT&T 和 Google 的实验室。为了提高外国人的英语水平,贾里尼克用自己的经费为他们请私人英语教师。

贾 里尼克生活俭朴,一辆老式丰田车开了二十多年,比组里学生的车都破。他每年都邀请组里的学生和教授到家里做客,很多毕业了的学生也专程赶来聚会。在那里, 他不再谈论学术问题,而会谈些巩俐的电影(他太太是哥伦比亚大学电影专业的教授),或是某著名教授被拉斯韦加斯的赌馆定为不受欢迎的人等等。但是他聚会的 食物实在难吃,无非是些生胡萝卜和芹菜。后来贾里尼克掏钱让系里另一个教授承办聚会,那个教授每次请专业大厨在家作出极丰盛的晚宴,并准备许多美酒,从此 这种聚会就转移到那个教授家了。

除了巩俐的电影,贾里尼克对中国的了解就是清华大学和青岛啤酒了。他有时会把两个名字搞混,有两次被香港科技大学的 Pascale 冯教授抓住。

贾 里尼克说话心直口快,不留余地。在他面前谈论学术一定要十分严谨,否则很容易被他抓住辫子。除了刚才提到的对语言学家略有偏见的评论,他对许多世界级的大 师都有过很多“刻薄”但又实事求是的评论,这些评论在业界广为流传。贾里尼克在四十多年的学术生涯中居然没有得罪太多的人 ,可以说是一个奇迹。

注释一:

贾格布森的通信模型
1 上下文
2
信息
3

发送着 --------------- 4 接收者
5

信道
6 编码

数学之美 系列七 -- 信息论在信息处理中的应用



我们已经介绍了信息熵,它是信息论的基础,我们这次谈谈信息论在自然语言处理中的应用。

先看看信息熵和语言模型的关系。我们在系列一中 谈到语言模型时,没有讲如何定量地衡量一个语言模型的好坏,当然,读者会很自然地想到,既然语言模型能减少语音识别和机器翻译的错误,那么就拿一个语音识 别系统或者机器翻译软件来试试,好的语言模型必然导致错误率较低。这种想法是对的,而且今天的语音识别和机器翻译也是这么做的。但这种测试方法对于研发语 言模型的人来讲,既不直接、又不方便,而且很难从错误率反过来定量度量语言模型。事实上,在贾里尼克(Fred Jelinek)的人研究语言模型时,世界上既没有像样的语音识别系统,更没有机器翻译。我们知道,语言模型是为了用上下文预测当前的文字,模型越好,预测得越准,那么当前文字的不确定性就越小。

信 息熵正是对不确定性的衡量,因此信息熵可以直接用于衡量统计语言模型的好坏。贾里尼克从信息熵出发,定义了一个称为语言模型复杂度 (Perplexity)的概念,直接衡量语言模型的好坏。一个模型的复杂度越小,模型越好。李开复博士在介绍他发明的 Sphinx 语音识别系统时谈到,如果不用任何语言模型(即零元语言模型)时,复杂度为997,也就是说句子中每个位置有 997 个可能的单词可以填入。如果(二元)语言模型只考虑前后词的搭配不考虑搭配的概率时,复杂度为 60。虽然它比不用语言模型好很多,但是和考虑了搭配概率的二元语言模型相比要差很多,因为后者的复杂度只有 20。

信息论中仅次于熵的另外两个重要的概念是“互信息”(Mutual Information) 和“相对熵”(Kullback-Leibler Divergence)。

“互 信息”是信息熵的引申概念,它是对两个随机事件相关性的度量。比如说今天随机事件北京下雨和随机变量空气湿度的相关性就很大,但是和姚明所在的休斯敦火箭 队是否能赢公牛队几乎无关。互信息就是用来量化度量这种相关性的。在自然语言处理中,经常要度量一些语言现象的相关性。比如在机器翻译中,最难的问题是词 义的二义性(歧义性)问题。比如 Bush 一词可以是美国总统的名字,也可以是灌木丛。(有一个笑话,美国上届总统候选人凯里 Kerry 的名字被一些机器翻译系统翻译成了"爱尔兰的小母牛",Kerry 在英语中另外一个意思。)那么如何正确地翻译这个词呢?人们很容易想到要用语法、要分析语句等等。其实,至今为止,没有一种语法能很好解决这个问题,真正 实用的方法是使用互信息。具体的解决办法大致如下:首先从大量文本中找出和总统布什一起出现的互信息最大的一些词,比如总统、美国、国会、华盛顿等等,当 然,再用同样的方法找出和灌木丛一起出现的互信息最大的词,比如土壤、植物、野生等等。有了这两组词,在翻译 Bush 时,看看上下文中哪类相关的词多就可以了。这种方法最初是由吉尔(Gale),丘奇(Church)和雅让斯基(Yarowsky)提出的。

当 时雅让斯基在宾西法尼亚大学是自然语言处理大师马库斯 (Mitch Marcus) 教授的博士生,他很多时间泡在贝尔实验室丘奇等人的研究室里。也许是急于毕业,他在吉尔等人的帮助下想出了一个最快也是最好地解决翻译中的二义性,就是上 述的方法,这个看上去简单的方法效果好得让同行们大吃一惊。雅让斯基因而只花了三年就从马库斯那里拿到了博士,而他的师兄弟们平均要花六年时间。

信息论中另外一个重要的概念是“相对熵”,在有些文献中它被称为成“交叉熵”。在英语中是 Kullback-Leibler Divergence, 是以它的两个提出者库尔贝克和莱伯勒的名字命名的。相对熵用来衡量两个正函数是否相似,对于两个完全相同的函数,它们的相对熵等于零。在自然语言处理中可 以用相对熵来衡量两个常用词(在语法上和语义上)是否同义,或者两篇文章的内容是否相近等等。利用相对熵,我们可以到处信息检索中最重要的一个概念:词频 率-逆向文档频率(TF/IDF)。我们下回会介绍如何根据相关性对搜索出的网页进行排序,就要用的餐TF/IDF 的概念。另外,在新闻的分类中也要用到相对熵和 TF/IDF。

对信息论有兴趣又有一定数学基础的读者,可以阅读斯坦福大学托马斯.科弗 (Thomas Cover) 教授的专著 "信息论基础"(Elements of Information Theory):
http://www.amazon.com/gp/product/0471062596/ref=nosim/103-7880775-7782209?n=283155
http://www.cnforyou.com/query/bookdetail1.asp?viBookCode=17909
科弗教授是当今最权威的信息论专家。