您所在的位置：首页 » 新闻资讯 » 业界动态 » 为啥你总是抢不到语音红包？

为啥你总是抢不到语音红包？

文章来源：云栖社区上传时间：2017-11-08 浏览次数：

文章摘要：总也抢不到的红包一切都源自于一个红包，下午，朋友发消息给我说，让我领个红包。打开后，看到红包，我不禁笑了。想我**普通话水平等级测试一级乙等的水平，岂会怕一个小小的语音口令？我清了清嗓子，以**的“播音腔”，念了“四十是四十，十四是屎拾”，小程序冷笑了一声，返回给我了个“再接再厉，再录一次”。我以为是自己没说好，站起身，气沉丹田，再次念了一次“四十是四十，十四是屎拾”，旁人纷纷对我传来了异样的眼光...

总也抢不到的红包

一切都源自于一个红包，下午，朋友发消息给我说，让我领个红包。

打开后，看到红包，我不禁笑了。想我**普通话水平等级测试一级乙等的水平，岂会怕一个小小的语音口令？

我清了清嗓子，以**的“播音腔”，念了“四十是四十，十四是屎拾”，小程序冷笑了一声，返回给我了个“再接再厉，再录一次”。

我以为是自己没说好，站起身，气沉丹田，再次念了一次“四十是四十，十四是屎拾”，旁人纷纷对我传来了异样的眼光.....然而异样的眼光也并没有什么卵用。。。

我灰溜溜的走出房间，找了一处无人的地方，一次次的尝试去读“四十是四十，十四是屎拾”。然而努力是没有结果的，每次都是无功而返。

“我要说口令”背后的秘密

既然无法抢到红包，气急败坏的我开始想，为什么我这么**的普通话，还抢不到红包？

作为一个普通话一乙的北方人，如果我都领不了红包，岂不是只有一甲的播音员们才能抢到？问题肯定不在此。于是，我开始动用我身为程序员的本能，开始分析小程序背后的技术。

终于，我想到了，它之所以能够做到读对口令才能抢到红包，完全是依赖于背后的一项技术——“语音识别”

什么是语音识别？

语音识别背后有非常多的技术，我这里尽量简单的给你说明什么是语音识别。

首先，用户在 App 中按下按钮，录制语音，然后 App 会将音频上传到后台的服务器，后台的服务器对声音进行特征提取，传递给下个阶段的处理器，这个时候，我们的声音信号已经由声音信号转变为处理后的特征信号。

然后处理器再通过接入 “声学模型”，来获取不同的特征信号可能**的字词；再由“语言模型”，实现对所有可能字词的选择，得出可能的结果。

**终，经过一系列的处理，我们说话的一段语音信号，就变成了一句话 “你吃饭了么？”

英语流利说的语音识别

英语流利说的语音识别功能是非常厉害的，就如其广告中所说“会打分的人工智能英语老师”，英语流利说的依仗，便是其比别人更加的”声学模型“和”语言模型“

学员在手机上录音，录音经过上传，到云端进行特征提取，再由“模特声音训练过”的“声学模型”进行处理（这里的模特声音训练过非常重要，训练材料的不同会导致模型的天差地别），声学模型处理过后，文字会传递给语言模型，组合成句。在完成两处处理后，对声音信号和文字信号进行打分，如果你的准确率比较高，你就能够获得一个Nice！

语音上传部分我打了问号，是因为流利说本身也有离线打分引擎，所以可能我们的语音没有上传到云端，在本地就直接进行处理了。

更细致的信息你可以到「英语流利说」是如何进行比对评分的？ - 林晖的回答 - 知乎去看，林晖先生解释的很细致。

“我要说口令” 如何实现读口令抢红包的功能？

由于“我要说口令”小程序本身的功能要比英语流利说更为简单一些，不需要进行特殊模型训练，可以借助一些云计算服务商提供的 API 来实现功能。这里，我们拿“阿里云 ET 智能语音交互”服务来举例。

此处***我个人针对“我要说口令”小程序的分析，不**其官方架构。

小程序在手机上进行录音，然后将录音上传至开发者的服务器，服务器上的后台程序再将声音信号通过 API 传递给阿里云 ET 智能语音交互，并调用其中的智能语音识别接口，接口对语音信号进行处理后，返回识别的文字，比如在刚刚那个红包中，识别出来的文字是“四十是四十是四是屎拾”。开发者的服务器在受到服务器传回的文字后，和发红包的人设置的文字对比，看看两个文字是否相同。如果文字相同，就说明读对了，用户就可以拿到红包；如果文字不同，就要告诉用户“再接再励”了。