国内首次！这家中国企业的语言AI实力被公认全球No.2！仅次于谷歌

科技量子位· 2022-07-08

金磊发自凹非寺

量子位 | 公众号 QbitAI

AI成精，“逼疯”程序员；AI做高数，成绩超过博士；AI写代码，成功调教智能体……

看多了这种故事，你是不是也觉得，AI太卷了，要上天了。

今天回归本源，讲点不那么玄幻的。AI为什么会进化？底层其实没有秘密，无非是语言、视觉等几大基本功。

其中，语言能力对AI的智能水平有决定性影响。视觉研究怎么“看”，语言研究“听”、“说”和“理解”。

对人类来说，“听”、“说”、“理解”相加，基本等于思维能力，对AI，道理也差不多。

最近，咨询机构Gartner发布《云AI开发者服务关键能力报告》，对全球云服务商的AI能力做了排行。

语言AI这一项，第一名毫不意外是谷歌。

第二名比较惊喜，是阿里巴巴。这是榜单发布以来，中国公司在该领域第一次进入全球前三。

全球前十中，中国的BAT占了三席，成绩可谓是瞩目。

谷歌得分3.55，阿里得分3.48

语言AI，包含语音、语义两个大类。

语音负责让机器学会“听”和“说”；语义，也就是自然语言处理（NLP），负责让机器学会“理解”。

先来看看Gartner报告对语音语义的评判标准：

报告考察了云厂商语言AI的多个细分服务项，比如语音识别、语言理解等，并对每个服务项的功能实现程度进行评级。

Gartner将每种功能的程度分为5个等级，分别对应1-5分，分数越高则表明实力越强。

阿里云上的AI能力，主要包括：

阿里在语音识别、自然语言生成/语音合成、语言理解/处理、文本分析这几项关键能力都获得了最高分。

报告对每个细分项赋予权重，结合单项得分和项目权重计算总分，最终谷歌的语言AI以3.55的总分排名第一；阿里得分3.48，排名第二。

但除此之外更为细节的能力，Gartner的报告并未详细描述。

达摩院加持的云上AI

还是跟着Gartner报告，把“语言AI”一拆为二，看看什么是语音，什么是语义。

首先是语音层面的AI技术。

语音的应用，我们并不陌生，苹果Siri、微软小冰等AI助手，都是通过赋予机器语音能力，从而与人类产生交互。

每一个语音产品，背后都有一套语音技术软硬件作支撑。

阿里云所依托的，是达摩院在语音AI领域的深厚积累。

达摩院在语音AI领域最早以语音识别技术起家，技术能力涵盖语音识别声学模型和基础框架、说话人区分、语音合成声学模型和声码器、口语语言处理、联合优化的声学前端等。

2019年，阿里语音AI曾被MIT评选为当年度的“十大突破技术”，这背后的技术能力，就来自于达摩院。

以Gartner报告评估过的Speech to text、也就是我们常说的“语音识别”技术为例。

达摩院的语音AI，在常规的近场语音识别、远场语音场景、多人交谈“鸡尾酒会场景”语音识别技能之外，还有一些别致的长尾技能，比如“中英自由说”、“方言自由说”。

举个栗子，中英文混说——“借你的iPad给我看下paper”，这句话机器如何理解呢？

业界通行的端到端语音识别 (End-to-End ASR) 技术，在单语种任务上效果很好，但一切换到多语种混说（Code-Switch）场景下，还是不太理想。

针对这类问题问题，达摩院语音实验室借鉴混合专家系统（Mixture of Experts）的思想。

在端到端语音识别模型中，对中文和英文分别设计了一个子网络，最后通过门控模块对每个子网络的输出进行加权。

为了减少模型参数量，中、英文子网络采用底层共享，高层独立的方式。最终使模型在中文、英文、中英文混说场景下都能取得比较好的效果。

在此基础上，达摩院融合了其自研的端到端语音识别技术SAN-M网络结构，打造出新一代的端到端中英自由说语音识别系统。

最后的效果就是：阿里的语音AI能在没有语种信息的前提下，大幅提升中英文混说场景下的识别性能。

△ SAN-M网络结构框架

借鉴这套模型搭建思路，达摩院又解锁了“方言自由说”技能，打造了一套端到端方言自由说语音识别系统。

在不需要提供方言id的情况下，用一个模型就能识别14种常用方言，并且保证纯中文相对于单语模型的识别性能基本不降。

达摩院的AI技术主要通过阿里云对外提供服务，以“被集成”方式，广泛应用于运营商、电商、物流、电力等多个行业。

除了语音AI技术之外，阿里在语义层面同样形成了一套强大的技术体系。

语言本身就是“音”和“义”的结合体——“听到”诚可贵，“听懂”价更高。

人类语言并不难，几岁孩童便可轻松掌握一门语言。但计算机有自己的编程语言，要它理解人类语言难如登天。

NLP技术的进化，是AI从感知智能向认知智能演进的前提。而在过去十几年内，NLP技术进化最具标志性的事件，就是大规模预训练语言模型的出现。

阿里达摩院是业界最早开展大模型探索的团队之一，2019年就开始研发大规模预训练语言模型体系AliceMind，并以此作为技术底座，开展对内对外的技术服务。

“前大模型时代”，NLP技术解决问题的方法，是为每个任务单独设计模型。模型开发往往很复杂，缺乏算力、数据、技术力量的中小团队往往难以负担。

预训练语言模型出现后，AI的整体智能比过去大幅提升，NLP技术的赋能方式也逐渐变成“预训练+微调”范式。

也就是以通用的预训练模型为基础，加入简单的任务层、结合少量场景语料，以较低成本训练出优质的任务模型。

达摩院的阿里的大规模预训练语言模型体系，拥有阅读、写作、翻译、问答、搜索、摘要生成、对话等多种能力。

大模型通常并不直接用于解决应用问题，而是通过与具体任务、应用场景的结合，逐层孵化“中模型”、“小模型”。

在大模型体系基础上，达摩院语言技术实验室先后孵化了一系列“中模型”，包括：

通用预训练模型StructBERT

生成式预训练模型PALM

多语言预训练模型VECO

超大中文预训练模型PLUG

多模态预训练模型mPLUG

结构化预训练模型StructuralLM

预训练对话模型SPACE

表格预训练模型STAR等

这些模型各有专长，StructBERT、mPLUG和StructuralLM具备挖掘文本、图像、表格“结构”信息的能力，单语言生成模型PALM、多语言生成模型VECO、超大中文预训练模型PLUG都为语言生成任务（NLG）而生。

例如StructBERT，是达摩院在谷歌BERT模型基础之上所提出的优化模型，它可以让机器更好地掌握人类的语法、理解自然的语言。

StructBERT一经推出，便在当时GLUE基准上取得了SOTA（89.0分），并且还将SQuAD v1.1问题回答上的F1得分推至93.0的新高度。

再如多语言预训练模型VECO，曾拿下国际权威多语言榜单XTREME排名第一，成绩远超Meta和微软等国际巨头的模型。

多模态预训练模型mPLUG在视觉问答（VQA）任务上首次超过人类结果。对话预训练模型SPACE在10多个对话国际榜单和数据集上取得SOTA。

基于AliceMind技术，达摩院先后斩获了35个冠军，在某些领域的水平已经非常接近人类对语言理解的程度了。并且，该技术已面向全球开发者开源。

众所周知，大规模预训练模型开发成本极高，玩家通常集中于头部科技企业，但新的模型赋能范式，使得更多中小团队、个人开发者也能分享大模型的红利。

……

据了解，目前阿里达摩院语音语义领域的研究已有300百多篇论文被国际顶会收录，相关研究已应用于医疗、电力、电商等领域。

此前，IDC发布《2021H2中国AI云服务市场研究报告》中，阿里在语音和语义市场上的份额便取得了第一的成绩。

语音语义的前史和未来

在人工智能发展长河中，语音语义是最早起步的技术之一，也是人工智能的基石。

语音技术最早可以追溯到1952年，贝尔实验室的Davis等人研制出了世界上第一个能识别10个英文数字发音的实验系统Audry，从此拉开了语音识别发展的序幕。

语义技术更是可以追溯到1947年，当时英美科学家联手提出了利用计算机进行语言自动翻译的设想，机器翻译的诞生也正意味着打开了语义发展的大门。

于是，让机器“听到”、“听懂”人类语言这件事，便在那段时间起，成为了学界和产业界争相发展的技术高地。

各界的纷纷投入，也让工业界诞生了众多“史诗级”的产品，例如苹果在2011年发布的Siri，以及后来亚马逊、谷歌、微软等推出的Alexa、Google Assistant、Cortana等。

另一方面，这背后的技术也产生了革命性的迭代变迁，例如近几年Transformer、Bert等技术的爆发，极大地推动了语音语义技术的发展。

在这种大趋势的背后，更重要的意义在于语音语义已然是普通人“唾手可用”的技术。

以阿里为例，达摩院的机器翻译技术每天为国内200万中小商家翻译上亿文字，让不懂英语和小语种的商家也能把国货卖到全世界。

这样的技术还已应用到了“买票”场景。

去年年中，北京首都机场和大兴机场均开通了语音购票的服务，只需要乘客张张嘴说出目的地，便可以在1.6秒内快速完成选站。

事实上，未来任何硬件终端都可以集成语言AI技术，这样的应用空间是巨大的，这也正是国内外学者、科技巨头纷纷发力于此的原因。

就像中国计算机学会副理事长、澜舟科技创始人兼CEO周明所评价的那般：

自然语言技术是人工智能领域的核心技术，过去几年预训练模型的兴起已经让这一技术领域取得了质的飞跃，也加速了人工智能领域从感知智能走向认知智能的进程。

这一系列突破将给各行各业乃至个人生活带来巨大的价值，很高兴看到以阿里巴巴为代表的的中国科技公司在该领域进入了世界第一梯队。”

也正如Gartner在此次报告中所述：

企业正在开发大规模语言模型，以提供更广泛的语言服务。主要云服务商正在利用其云基础设施开发专有语言模型。较小的供应商正在利用开源软件、数据和机器学习模型进行竞争。

但纵观语音语义的发展，有一点是始终未曾变化的，那就是它的理想目标——和机器对话，像在跟人类交流。

前不久谷歌研究员爆料“AI具备人格”的事件在科技圈引发了热议，虽然后来谷歌对其已经进行了辟谣，但其背后无法掩盖的事实是AI正在逐渐向人类逼近。

那么在未来，语音语义技术又将如何颠覆人们的生活，是值得期待了。

本文来自网络，不代表趣头条立场，转载请注明出处：https://www.ngnnn.com/article/4_915.html

谷歌语言ai 人工智能语音识别自然语言处理

为您推荐

谷歌推出文本到图像模型Muse：生成图片质量更高、推理时间更短

作者 | 冬梅自 2021 年初以来，随着大量深度学习支持的文本到图像模型（例如 DALL-E-2、Stable Diffusion 和 Midjourney 等）的诞生，人工智能研究的进展发生了革命性的变化。近日，谷歌Muse AI 系统正式亮相。据谷歌 Muse AI 团队称，Muse 是一种文本到图像的 Transformer 模型，该模型可以实现先进的图像生成性能。我们提

盖茨盛赞ChatGPT：人工智能历史意义不亚于“PC或互联网诞生”

腾讯科技讯 2月3日消息，微软联合创始人比尔·盖茨表示，像ChatGPT这样的AI聊天机器人将变得与个人电脑或互联网同样重要。盖茨今日接受采访时表示:“AI将成为2023年最热门的话题。这是不可避免的。”他随后补充道:“ChatGPT将变得与个人电脑、互联网同样重要。”盖茨在20世纪80年代帮助开创了个人电脑时代。在微软和苹果等

谷歌街景独立 App 将于 2023 年停止运营

IT之家 11 月 2 日消息，安卓和 iOS 版谷歌街景 App 将于明年初停止运营，并将在未来几周从应用商店中删除。一位 Google 发言人证实，该应用将从 2023 年 3 月起停用。这是安卓和 iPhone 上的专用街景应用程序，允许用户使用谷歌公司的服务来获得世界各地的 360 度视图。需要注意的是，该功能不会从标准的谷歌地图应用中删

专访墨奇科技CEO邰骋：人工智能需要新的AI数据基础设施

“人工智能要发展到下一代，必然需要基础理论和基础设施的革新，特别是需要新的 AI 数据基础设施。”9月2日，新京报贝壳财经记者获悉，在近日举办的HICOOL2022全球创业者峰会上，AI（人工智能）基础技术和平台墨奇科技的项目团队获得“HICOOL 2022 全球创业大赛一等奖”。墨奇科技联合创始人、CEO 邰骋接受了新京报贝壳财

人工智能大会将举办智慧体育高峰论坛，发布AI＋体育蓝皮书

2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。主办方供图AI+体育，将成为世界人工智能大会的全新命题和新亮点。2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。论坛上将发布由上海人工智能研究院牵头，联合上海交通大学、上海体育学院、首都体育学院、同济大学等单位编制的国内首本《“AI+体育”蓝

大脑还有多少秘密？世界人工智能大会首开脑机接口主题论坛

在2022世界人工智能大会上，天桥脑科学研究院（简称TCCI）转化中心联合中国科学院上海微系统与信息技术研究所、脑虎科技、中国神经科学学会、上海市神经科学学会共同举办“脑·机智能融合-让大脑连接未来”论坛，这也是脑机接口首次以主题论坛的形式登陆世界人工智能大会。英国皇家工程院院士、上海交大医疗机器人研究院院

我国人工智能学科主要奠基人涂序彦逝世，享年 88 岁

IT之家 3 月 28 日消息，据北京科技大学消息，我国人工智能领域著名科学家、人工智能学科的主要奠基人、中国人工智能学会的主要创始人之一、第二和第三届中国人工智能学会理事长、北京科技大学计算机与通信工程学院教授涂序彦先生，因病医治无效，于 2023 年 1 月 1 日 0 时 10 分在北京逝世，享年 88 岁。IT之家附讣告原文

如何在特斯拉人工智能日上成功搭讪埃隆·马斯克

苹果谷歌牵头制定追踪行业规范草案防止功能遭滥用

【CNMO新闻】在2021年的春季发布会上，苹果推出了蓝牙追踪设备AirTag，该产品配合苹果设备的“查找”应用，可以追踪和查找重要物品。然而，也有用户发现这类设备可能会遭到滥用，例如将其放在他人不知情的地方，可以对个人进行跟踪。AirTag为了杜绝此类现象，苹果与谷歌宣布联合提交一份行业规范草案，帮助应对蓝牙定位追踪

梁建章：人工智能如何影响经济和各行各业

近日人工智能再次成为了热门话题。很多人好奇的是，人工智能未来到底会如何影响经济、人口和创新？今天，我跟大家分享个人的一些看法——谈谈人工智能对于经济以及各行各业的影响。自从深度神经网络出现以来，人工智能的发展速度超乎想象。ChatGPT的出现是个奇迹，超出了几乎所有计算机科学家的预料。一个简单的神经网络模

劈柴哥预告Bard将迎重磅升级，谷歌“最强大脑”能否超车ChatGPT？

财联社4月2日讯（编辑赵昊）上周，美国科技巨头谷歌公司推出了聊天机器人“巴德”（Bard）的测试版本。由于用户使用体验远不如ChatGPT，Bard反响平平。当地时间周五（3月31日），谷歌首席执行官"劈柴哥"桑达尔·皮查伊（Sundar Pichai）在播客节目中表示，这种状况可能很快就会改变，因为Bard将在未来几天从目前基于的LaM

科技巨头欧洲裁员不易，谷歌亚马逊设法“吸引”员工离职

勒紧裤腰带“过冬”的美国科技巨头现在碰到新的难题，想在欧洲搞大裁员谈何容易，特别是要在国内劳动法对员工保护力度位居欧盟成员国前列的法国和德国，更是难上加难。在美国，企业宣布大裁员后就能在几个月内解雇数百甚至数千名员工，许多公司已经这样做。而在欧洲，媒体发现，科技企业的大裁员已经停滞，因为在一些欧洲国

AI炒股新纪元？头部量化私募幻方宣布全力探索人工智能应用

头部量化私募幻方宣布成立新的独立的研究组织，探索AGI（即通用人工智能，Artificial General Intelligence）的本质。4月14日，幻方发布公告显示，幻方将集中资源和力量，全力投身到服务于全人类共同利益的人工智能之中，成立新的独立的研究组织，探索AGI的本质，“我们将充分而持续地投入，不做中庸的事，用最长期的眼光去

谷歌Stadia发布新试玩系统：玩家解锁特定成就完成试玩

【CNMO新闻】游戏试玩我们都曾有所接触，在过去游戏试玩版本通常是开发者在游戏上市之前发布的一个涵盖游戏部分内容的封包进行上传后，有意试玩的玩家进行下载测试，这样的方式已经延续了很久，其弊端就是玩家需要在游戏正式发布后在单独下载新的游戏包体，增加了重复下载的困扰。也有一些开发者选择游戏整包作为测试版本上

史上AI最高分！谷歌大模型创美国医师执照试题新纪录

杨净羿阁发自凹非寺量子位 | 公众号 QbitAI史上AI最高分，谷歌新模型刚刚通过美国医师执照试题验证！而且在科学常识、理解、检索和推理能力等任务中，直接与人类医生水平相匹敌。在一些临床问答表现中，最高超原SOTA模型17%以上。此进展一出，瞬间引爆学界热议，不少业内人士感叹：终于，它来了。广大网友在看完Med-PaL

谷歌计划打造全新搜索引擎应对必应等竞争推AI功能升级现有引擎

【美媒：谷歌计划打造全新搜索引擎应对必应等竞争将推出AI功能升级现有引擎】财联社4月17日电，据纽约时报消息，新必应等AI竞争者正成为25年来谷歌搜索业务的“最严重威胁”，作为回应，谷歌据悉正寻求打造一款由AI技术驱动的全新搜索引擎。查阅的内部文件显示，谷歌还在用AI功能升级现有引擎。据悉，谷歌正测试项目名为“

卷完模型卷芯片！为提升效率，微软准备推出专属人工智能芯片

在早期成功押注ChatGPT的研发公司OpenAI之后，市场发现，微软在其武器库中还拥有另一个秘密武器：自研人工智能芯片，这一芯片将为生成式AI背后的大型语言模型提供强大动力。4月18日周二，据媒体援引两位知情人士的话说，微软早在2019年就开始开发内部代号为Athena的AI芯片。其中一位知情人士称，一些微软和OpenAI的员工已经

真正的应用级量子人工智能距离我们还有多远？

·“量子科技是强国竞争的战略制高点，但不能一哄而上，低水平重复内卷，或片面追求发论文、抢专利，各自为战，闭门造车，而缺少真正的技术投入和系统配合。”·“当下量子系统的规模非常重要，而这很大程度上取决于芯片。”当前，发展量子计算和人工智能已成为世界各国的重要战略，两者交汇而生的量子人工智能更是发展迅速

消息称谷歌正测试一款类似ChatGPT的聊天机器人

鞭牛士 2月2日消息，据外媒报道，据知情人士表示，谷歌正在测试新的人工智能驱动的聊天产品，可能会影响未来公共产品的发布。这些产品包括一个新的聊天机器人，以及一种将其整合到搜索引擎的潜在方式。

负责人离职，谷歌AR似乎是要复刻Android模式

2022年年末ChatGPT的横空出世，让人工智能再次踏上了风口浪尖，甚至一众科技巨头也纷纷为之“倾倒”，仿佛错过它就错失了通往未来的船票。特别是在微软方面将ChatGPT与Bing搜索引擎结合、以挑战谷歌搜索之时，谷歌很快就成为了这些巨头中反应最激烈的一个，但与ChatGPT针锋相对的产品Bard，出道即遭遇了翻车。然而强如谷歌