您现在的位置是:灿烂辉煌网 > 时尚
已过甲子之年的人工智能:现有成绩和待解难题一样多
灿烂辉煌网2026-08-25 11:24:25【时尚】9人已围观
简介导读:对于人工智能子项目之一的语音识别来说,下一个前沿是从识别走向理解,真正的人工智能仍然还在遥远的地平线上。日前,美国一家公司宣称专业速记员在记录对话时,转录词错率为5.1%,而该公司最新研发的语音
导读:对于人工智能子项目之一的已过语音识别来说,下一个前沿是甲之解难从识别走向理解,真正的人工人工智能仍然还在遥远的地平线上。
日前,成绩美国一家公司宣称专业速记员在记录对话时,和待转录词错率为5.1%,题样而该公司最新研发的已过语音识别系统词错率已达到5.5%,超越之前的甲之解难历史最佳水平,树立了新的人工里程碑。语音识别,成绩是和待人工智能领域的核心问题之一,0.4%的题样差距似乎意味着机器即将比肩人类。
已过“甲子”之年
斯坦福大学的已过相关研究者在2016年9月发布了一篇名为《2030年的人工智能与生活》的文章,提到:人工智能领域正式诞生于1956年夏天,甲之解难一场由约翰·麦卡锡组织的人工在美国达特茅斯暑期研究项目的研讨会,在多年以后被认定为全球人工智能研究的起点。
其实,对于人工智能子项目之一的语音识别来说,它的历史甚至比60年还要久。
语音识别的研究源头可追溯至1950年,计算机科学之父阿兰·图灵在《思想》(Mind)杂志上发表了题为“计算的机器和智能”的论文,首次提出了机器智能的概念,论文还提出了一种验证机器是否有智能的方法:让人和机器进行交流,如果人无法判断自己交流的对象是人还是机器,就说明这个机器有智能了,这就是后来鼎鼎有名的人工智能图灵测试。
图灵测试的概念极大影响了人工智能对于功能的定义,以此为途径,卡内基梅隆大学的两位科学家希尔伯特·西蒙和曼纽尔·布卢姆做了大量的前期工作,非常精妙地证明了罗素《数学原理》52道中的38道。西蒙甚至宣称在10年之内,机器就可以达到和人类智能一样的高度。
在这一时期,科学家们也将语音识别比作“机器的听觉系统”,该技术可以让机器通过识别和理解,把语音信号转变为相应的文本或命令。1952年,贝尔研究所、Davis等人研制了世界上第一个能识别10个英文数字发音的实验系统。1960年,英国的Denes等人研制了第一个计算机语音识别系统。
从“模拟”人脑到开创统计方法
当20世纪50年代明确了人工智能要模拟人类智慧这一大胆目标后,这一领域经历了近20年的辉煌。研究人员开展了一系列项目,表明计算机能够完成一系列原本只属于人类能力范畴之内的任务,例如证明定理、求解微积分、通过规划来响应命令、履行物理动作,甚至是模拟心理学家心理实验、作曲家谱曲这样的活动。
但是,过分简单的算法以及计算能力的限制,严重阻碍了人们使用人工智能来解决更加困难和多样化的问题。
这一阶段在人工智能的细分领域语音识别上,科学家们也走上了同样的弯路。他们认为,计算机要完成语音识别这类只有人才能做的事情,必须先让计算机理解自然语言,导致研究局限在人类学习语言的方式上了,即电脑模拟人脑,语言学者参与了大量的研究工作,但最后的成果却近乎为零。伴随着对未来继续努力的失望,人工智能包括语音识别都于20世纪70年代中期逐渐淡出公众视野。
转机出现在统计语言学的创立上。这不得不提一个关键性人物——德里克·贾里尼克和他领导的IBM华生实验室,他们创新的使用统计方法,将当时的语音识别率从70%迅速提升到90%,同时语音识别的规模从几百个单词上升到几万个单词,使得语音识别就有了从实验室走向实际应用的可能。
在贾里尼克之前,科学家们都把语音识别问题的核心归结为语言学中的规则问题,而贾里尼克将它当作通信问题后,用两个隐含马尔可夫模型(声学模型和语言模型)把语音识别重新概括清楚了。
这个框架结构至今仍对语音识别影响深远,它不仅从根本上使得语音识别有使用的可能,而且奠定了今天自然语言处理的基础。贾里尼克后来也因此当选美国工程院院士,并被某杂志评为20世纪100名发明家之一。
尽管贾里尼克在1972年就提出了新的研究范式,但模拟人脑与统计学的方法之争,却持续了近十五年时间,语音识别领域历经了十五年的新旧交替后,最大的成果其实是在技术的应用及产品化方面出现了进展。
大进步的催化剂
在互联网大爆发的20世纪90年代,人工智能的相关研究又一次停滞了。直到21世纪前10年,出现了一系列复兴人工智能研究进程的要素,尤其是下面这些重要的因素和核心技术:
大数据。得益于互联网、社交媒体、移动设备和廉价的传感器,这个世界产生的数据量急剧增加。大数据是人工智能发展的助推剂,这是因为有些人工智能技术使用统计模型来进行数据的概率推算,如语音识别,通过数据的海洋中丰富的语料,使得技术不断优化。
新算法。算法是解决一个设计程序或完成任务的路径方法。在一个完整的工业界语音识别系统里,最关键的是深度学习算法,还有很多工作是专业领域相关的算法,以及海量数据收集和工程系统架构的搭建。这些算法本身很重要,同时也是其他技术的推动者,比如机器学习算法Google的TensorFlow目前就被开源使用。
可以说,任何技术都有蓄能阶段和爆发阶段,人工智能包括语音识别技术的爆发都得益于以上条件。这也不难理解,从语音识别来看,它是需要经验、数据和用户反馈共同作用来提升表现的。需要利用用户的反馈总结出一些特点。
谷歌是最早在全球范围内大规模使用深度学习算法的公司,也最早开创了用互联网思维做语音识别。在这方面,科大讯飞受到谷歌的启发,迅速跟进成为国内第一个在商用系统里使用深度学习的公司。
现有成绩和待解难题一样多
语音识别技术已经发展了几十年,因为大数据和深度学习的应用,这一领域的传统强者成了谷歌、亚马逊、苹果和微软这些美国科技巨头,据统计,美国至少有26家公司在开发语音识别技术,而中国则有近50家公司研究这一领域。
尽管谷歌这些巨头在语音识别技术上的技术积累和先发优势让后来者似乎难以望其项背,但因为一些政策和市场方面的原因,当然也有部分原因是中文的复杂程度高于英语,所以国际巨头的语音识别主要偏向于英语,中文领域的语音智能机会则留给了科大讯飞、百度、搜狗等中国公司。在国内,这些本土化产品更为用户所熟知。
中文领域的识别难度在哪里?举个简单的例子,鲁迅《孔乙己》中的孔乙己之问:茴香豆的“茴”有几种写法?或者一个更有时代感的案例,如何形容物流很快?据说,在汉语里回答这个问题竟然至少有3600种说法,比如第二天就到了、物流很给力、给快递点赞等不尽其详。尽管语音识别在近些年来取得了巨大的进步,但其实仍然还有很多的工作要做。
此外,还有确保语音识别能在更为真实生活的环境中良好地工作。这些环境包括具有很多背景噪声的地方,比如聚会场所或在高速路上驾驶的时候;还有在多人交谈环境中将不同的说话人区分开。
还有一个更深层次的难题是,如果需要实现人机对话、人机写作,不只是需要用机器转录来自人类嘴巴的声音信号,更要理解人们所说的话。
从语音识别来看,下一个前沿是从识别走向理解,真正的人工智能仍然还在遥远的地平线上,在机器能理解其所听到或看到的事物的真正含义之前,还需要很长时间的工作,有很长的路要走。
或许也可以说,我们正在从一个人类必须理解计算机的世界,迈向一个计算机必须理解我们的世界。亚里士多德曾说过,如果机器能干很多活,岂不能让人类解放出来,或许这一解放的起点就是“理解”。
日前,成绩美国一家公司宣称专业速记员在记录对话时,和待转录词错率为5.1%,题样而该公司最新研发的已过语音识别系统词错率已达到5.5%,超越之前的甲之解难历史最佳水平,树立了新的人工里程碑。语音识别,成绩是和待人工智能领域的核心问题之一,0.4%的题样差距似乎意味着机器即将比肩人类。
已过“甲子”之年
斯坦福大学的已过相关研究者在2016年9月发布了一篇名为《2030年的人工智能与生活》的文章,提到:人工智能领域正式诞生于1956年夏天,甲之解难一场由约翰·麦卡锡组织的人工在美国达特茅斯暑期研究项目的研讨会,在多年以后被认定为全球人工智能研究的起点。
其实,对于人工智能子项目之一的语音识别来说,它的历史甚至比60年还要久。
语音识别的研究源头可追溯至1950年,计算机科学之父阿兰·图灵在《思想》(Mind)杂志上发表了题为“计算的机器和智能”的论文,首次提出了机器智能的概念,论文还提出了一种验证机器是否有智能的方法:让人和机器进行交流,如果人无法判断自己交流的对象是人还是机器,就说明这个机器有智能了,这就是后来鼎鼎有名的人工智能图灵测试。
图灵测试的概念极大影响了人工智能对于功能的定义,以此为途径,卡内基梅隆大学的两位科学家希尔伯特·西蒙和曼纽尔·布卢姆做了大量的前期工作,非常精妙地证明了罗素《数学原理》52道中的38道。西蒙甚至宣称在10年之内,机器就可以达到和人类智能一样的高度。
在这一时期,科学家们也将语音识别比作“机器的听觉系统”,该技术可以让机器通过识别和理解,把语音信号转变为相应的文本或命令。1952年,贝尔研究所、Davis等人研制了世界上第一个能识别10个英文数字发音的实验系统。1960年,英国的Denes等人研制了第一个计算机语音识别系统。
从“模拟”人脑到开创统计方法
当20世纪50年代明确了人工智能要模拟人类智慧这一大胆目标后,这一领域经历了近20年的辉煌。研究人员开展了一系列项目,表明计算机能够完成一系列原本只属于人类能力范畴之内的任务,例如证明定理、求解微积分、通过规划来响应命令、履行物理动作,甚至是模拟心理学家心理实验、作曲家谱曲这样的活动。
但是,过分简单的算法以及计算能力的限制,严重阻碍了人们使用人工智能来解决更加困难和多样化的问题。
这一阶段在人工智能的细分领域语音识别上,科学家们也走上了同样的弯路。他们认为,计算机要完成语音识别这类只有人才能做的事情,必须先让计算机理解自然语言,导致研究局限在人类学习语言的方式上了,即电脑模拟人脑,语言学者参与了大量的研究工作,但最后的成果却近乎为零。伴随着对未来继续努力的失望,人工智能包括语音识别都于20世纪70年代中期逐渐淡出公众视野。
转机出现在统计语言学的创立上。这不得不提一个关键性人物——德里克·贾里尼克和他领导的IBM华生实验室,他们创新的使用统计方法,将当时的语音识别率从70%迅速提升到90%,同时语音识别的规模从几百个单词上升到几万个单词,使得语音识别就有了从实验室走向实际应用的可能。
在贾里尼克之前,科学家们都把语音识别问题的核心归结为语言学中的规则问题,而贾里尼克将它当作通信问题后,用两个隐含马尔可夫模型(声学模型和语言模型)把语音识别重新概括清楚了。
这个框架结构至今仍对语音识别影响深远,它不仅从根本上使得语音识别有使用的可能,而且奠定了今天自然语言处理的基础。贾里尼克后来也因此当选美国工程院院士,并被某杂志评为20世纪100名发明家之一。
尽管贾里尼克在1972年就提出了新的研究范式,但模拟人脑与统计学的方法之争,却持续了近十五年时间,语音识别领域历经了十五年的新旧交替后,最大的成果其实是在技术的应用及产品化方面出现了进展。
大进步的催化剂
在互联网大爆发的20世纪90年代,人工智能的相关研究又一次停滞了。直到21世纪前10年,出现了一系列复兴人工智能研究进程的要素,尤其是下面这些重要的因素和核心技术:
大数据。得益于互联网、社交媒体、移动设备和廉价的传感器,这个世界产生的数据量急剧增加。大数据是人工智能发展的助推剂,这是因为有些人工智能技术使用统计模型来进行数据的概率推算,如语音识别,通过数据的海洋中丰富的语料,使得技术不断优化。
新算法。算法是解决一个设计程序或完成任务的路径方法。在一个完整的工业界语音识别系统里,最关键的是深度学习算法,还有很多工作是专业领域相关的算法,以及海量数据收集和工程系统架构的搭建。这些算法本身很重要,同时也是其他技术的推动者,比如机器学习算法Google的TensorFlow目前就被开源使用。
可以说,任何技术都有蓄能阶段和爆发阶段,人工智能包括语音识别技术的爆发都得益于以上条件。这也不难理解,从语音识别来看,它是需要经验、数据和用户反馈共同作用来提升表现的。需要利用用户的反馈总结出一些特点。
谷歌是最早在全球范围内大规模使用深度学习算法的公司,也最早开创了用互联网思维做语音识别。在这方面,科大讯飞受到谷歌的启发,迅速跟进成为国内第一个在商用系统里使用深度学习的公司。
现有成绩和待解难题一样多
语音识别技术已经发展了几十年,因为大数据和深度学习的应用,这一领域的传统强者成了谷歌、亚马逊、苹果和微软这些美国科技巨头,据统计,美国至少有26家公司在开发语音识别技术,而中国则有近50家公司研究这一领域。
尽管谷歌这些巨头在语音识别技术上的技术积累和先发优势让后来者似乎难以望其项背,但因为一些政策和市场方面的原因,当然也有部分原因是中文的复杂程度高于英语,所以国际巨头的语音识别主要偏向于英语,中文领域的语音智能机会则留给了科大讯飞、百度、搜狗等中国公司。在国内,这些本土化产品更为用户所熟知。
中文领域的识别难度在哪里?举个简单的例子,鲁迅《孔乙己》中的孔乙己之问:茴香豆的“茴”有几种写法?或者一个更有时代感的案例,如何形容物流很快?据说,在汉语里回答这个问题竟然至少有3600种说法,比如第二天就到了、物流很给力、给快递点赞等不尽其详。尽管语音识别在近些年来取得了巨大的进步,但其实仍然还有很多的工作要做。
此外,还有确保语音识别能在更为真实生活的环境中良好地工作。这些环境包括具有很多背景噪声的地方,比如聚会场所或在高速路上驾驶的时候;还有在多人交谈环境中将不同的说话人区分开。
还有一个更深层次的难题是,如果需要实现人机对话、人机写作,不只是需要用机器转录来自人类嘴巴的声音信号,更要理解人们所说的话。
从语音识别来看,下一个前沿是从识别走向理解,真正的人工智能仍然还在遥远的地平线上,在机器能理解其所听到或看到的事物的真正含义之前,还需要很长时间的工作,有很长的路要走。
或许也可以说,我们正在从一个人类必须理解计算机的世界,迈向一个计算机必须理解我们的世界。亚里士多德曾说过,如果机器能干很多活,岂不能让人类解放出来,或许这一解放的起点就是“理解”。
很赞哦!(46542)
上一篇: 三只小兔买蛋糕的故事
热门文章
站长推荐
友情链接
- 上影节将放映《阿基推》《环启仄洋》《魔兽》《猛禽小队》
- 《龙珠:超宇宙(Dragon Ball Xenoverse)》呆萌肥布欧新图 最强角色真力考证
- 国航新iPad终获进网问应 mini 3消掉 挪动端遭热酷
- 英国游戏销量周榜:《逝世化危急:村降》完胜《米托邦》重登真体销量第一
- 讲事性益智游戏《忆降谜境》Steam新史低 仅7元
- 特斯推国产Model 3战Model Y整部件国产化超90%
- 《一骑当千OL》新版跨服国战弄法提早掀秘
- 《血咒(BloodBrone)》新角色退场 脱戴锋利腰挂重挺机枪
- 《天中天下》的已出处微硬战乌曜石收受
- 改革卡牌体验 足游《三萌争霸》iOS版本日震惊上线
- 《大年夜掌门》新质料篇终北古墓嫡上线 齐新副本去袭
- 《辐射4》大年夜型MOD迈阿稀主线任务已完成建制
- 期盼已暂《战舰少女》新版本即将上线
- 客岁是裸奔过去的《时空猎人》秋季时髦达人法门
- 《暗乌粉碎神3》各职业新套拆表露
- 《指尖刀塔》初次表态NEST 指尖竞技风暴去袭
- 里具糖果 足游《兰陵王》万圣节新版即将暴光
- 《顿时三国》新质料篇上线 齐新弄法再战三国
- 《新梦境之乡》公开回应“回档”事件:初创“回档弄法”
- 《仙剑奇侠传5》BOSS公布第两辑:弄笑BOSS之黄山三怪
- 超萌Q版仙侠足游《古剑奇缘》IOS版本远期登岸
- 微硬新的图象标注AI即将散成到Office 支撑为图片天逝世描述笔墨
- 日台韩周销榜:《FIFA 21》上榜 但仍出法与老任对抗
- 《暴雨》将去有绝做?Quantic Dream没有反对将去重返老系列
- 古印度背景游戏《Raji:太古传奇》Steam特别好评
- 《巫师2》最新开辟日记 引擎先容及详细解释
- 《第一圣殿骑士(The First Templar)》最新截图放出
- 《圣水豪杰传》万圣节导弹活动
- 超出5G 好国运营商推下通、诺基亚建坐6G联盟
- 新做《心跳回念女逝世版4》公布 确认将登岸NS仄台
- PSP《噬神者:爆裂》建制人访讲 新人物先容
- 安妮海瑟薇《女巫》新短片公布 裂心女巫真可骇
- 人气日剧《教场2》新卡司公开 木村拓哉出演超宽教民
- 国粹级动做卡牌《面兵面将》内测尾周得胜
- PS4老友列表示正在会隐现对圆用的是哪款主机
- 次世代到去 《NBA 2k21》梦境球队第两季现已开启
- 没有给糖果便拆台 《神魔》万圣节欣喜派对
- 《齐仄易远斩仙》单仄台新质料片:上古凶兽录上线
- 脱足下玩挨制真际大年夜小黏土宝可梦 驱逐万圣节可面灯
- Arcade新做《漫绘脱越者:史马利上尉历险记》
- 索僧借会经由过程游戏更新静态节制PS5的电扇转速
- 索僧影业下层流露:《蜘蛛侠3》现已开拍 12月放动静
- 《暗乌粉碎神3》收止时候最新瞻看
- 《极品飞车14:热力遁踪》保时捷跑车新图
- 《保护之光》乌盒品鉴会,现场佳宾典范语录
- 《部降保卫战》新版测试资格本日可登岸微疑预定
- 《碧蓝胡念Versus》季票第两弹角色:卡莉奥斯特萝、尤艾我公布!
- 《主公莫慌》次世代好术尾曝,联盟体系即将上线
- 成龙制片&参与配音动绘《许愿神龙》公布新海报 2021年上映
- 《怪物猎人》电影导演非常对劲 但愿建制绝散
- 《龙珠:肝水收做2》体系新谍报及大年夜量绘里放出
- 猫猫大年夜魔王!玩家掀示《马里奥赛车真况》倒车遁窜操纵演示
- 《奇特专士2》公布新演员:小保母登上大年夜舞台
- 《保护之光》乌盒品鉴会29日开启 明面抢先看
- Arcade新做《Super Meat Boy》先容
- 三上真司:《逝世化1》本去是第一人称 喜好《逝世化危急7》、维罗妮卡值得有绝做
- 《龙腾世纪2》性感女刺客表态 最新截图公布
- 《星球大年夜战尽天:陨降的军人团》配角卡我光剑将什物出售 尾个游戏光剑周边化
- 《太极熊猫》单仄台开放测试将启 百万懦妇备战收壕礼
- 日本网友晒3倍超少柿种小整食 引20万面赞被称夏亚公用







