导读
近年来,AI智能语音应用在58同城广泛落地,从2018年开始,我们先后研发了语音对话机器人、语音内容分析平台,在各业务线销售、客服、产品、运营场景广泛使用,打造了多款AI应用,如销售智能外呼助手、呼叫中心语音质检系统、招聘面试机器人等。语音对话机器人、语音内容分析平台底层依赖语音识别技术,初期都由第三方语音厂商采买,2020年7月,我们自主研发的语音识别引擎正式上线,替换了第三方语音厂商,当前已接入了数十个不同业务场景,日均转写语音量达数万小时。
2021年8月31日18:30,由CCF中国计算机学会语音对话与听觉专委会、中国人工智能产业发展联盟评估组、58同城AI Lab、语音之家(北京)科技有限公司、北京希尔贝壳科技有限公司联合举办的《【语音之家】走进企业系列沙龙——语音技术在58同城的应用》将线上直播。
本次沙龙首先分享58同城语音识别引擎的自研历程,包括数据、算法和工程架构,然后分享我们在58同城本地服务(黄页)业务线下落地的一款智能语音应用——销售智能外呼助手。
主办方:CCF中国计算机学会语音对话与听觉专委会、中国人工智能产业发展联盟评估组、58同城AI Lab、语音之家(北京)科技有限公司、北京希尔贝壳科技有限公司
本次沙龙的视频录像、PPT资料如下。
开场介绍
分享嘉宾:

詹坤林
58同城TEG-AI Lab负责人,算法资深架构师,58技术委员会AI分会主席
詹坤林,现任TEG AI Lab负责人、算法资深架构师,兼任58技术委员会 AI分会主席。2012年硕士毕业于中国科学院大学,研究方向为数据挖掘。加入58前任腾讯高级工程师,从事推荐算法研发。
视频回顾:
https://v.qq.com/x/page/s3272uwr735.html
58同城语音识别自研之路
分享嘉宾:

李咏泽,58同城TEG-AI Lab算法资深工程师
李咏泽,58同城TEG-AI Lab算法资深工程师,2019年11月加入58,目前主要负责语音识别算法研发工作,曾就职于芋头科技,从事声纹识别算法研发。2018年10月硕士毕业于巴黎第六大学,研究方向为智能系统语音图像处理。

王焱,58同城TEG-AI Lab后端架构师
王焱,58同城TEG-AI Lab后端架构师,2017年2月加入58,目前主要负责语音识别引擎后端架构设计和开发工作,曾先后负责过推荐系统、语音机器人后端架构设计与开发工作,曾就职于汤森路透、H3C。2012年硕士毕业于华北计算机系统工程研究所。
视频回顾:
https://v.qq.com/x/page/a3272x9t0pa.html
观众:批量解码服务是异步的吗?输入是语音文件流吗?网卡压力怎么样?
王焱:服务是异步返回结果的,客户端调用成功后,即返回提交任务成功,等转写结束后,将结果异步提交给客户端。输入是音频链接,处理时进行音频下载即可,目前下载的流量对网卡压力不大。
观众:Kaldi的这两个解码器直接拉下来就可以用吗?需要修改吗?
王焱:不是直接拿来用的,而是做了修改,解码器本身仅提供了转写的过程性功能,而不能直接用来作为服务使用,也需要进行优化和调整,降低耗时,保证作为能够持续提供转写能力的服务。
观众:实时识别服务单机能支持多少路?
王焱:目前单机的并发路数,是和cpu机器的核数为一个量级的,如果并发超过量级范围,会有比较明显的转写时延。
观众:beam参数怎么优化的?能详细点吗?
王焱:目前来看,我们降低了beam和lattice-beam到之前的一半,而对CER基本上影响不大,只是万分位的差异。另外,是将内存操作由malloc改为tcmalloc。其它的一些调整的参数也有,这是对降低耗时比较明显的两个调整。
观众:并发的指标是基于什么样的服务器配置?
王焱:服务器配置就是我们一般的物理机配置,后续我们会尝试在虚拟部分资源情况下进行运行和部署。
观众:ASR测试集有多大?
詹坤林:不同业务场景下的ASR标准测试集在数小时到数十小时不等,我们会持续更新不同场景下的测试集以捕捉线上变化,我们有一个标注团队持续标注。
观众:58语音团队成立多久了?
詹坤林:我们在2019年11月正式开始自研语音识别,初期由3个研发工程师在大概半年的时间里上线自研语音识别,效果超过第三方厂商,替换了第三方厂商。
我们还是一个年轻的团队,在持续学习中,也欢迎感兴趣的同学加入我们。
我们的自研之路也可以参考文章《3人半年打造语音识别引擎——58同城语音识别自研之路》。
电销场景下智能外呼语音机器人落地实践
分享嘉宾:

李忠,58同城TEG-AI Lab-智能语音部负责人,算法高级架构师
李忠,58同城TEG-AI Lab智能语音部负责人,算法高级架构师,目前主要从事智能语音交互、自然语言处理等AI技术相关的研发工作,主要负责产品有智能语音机器人、智能语音分析平台、智能写稿等。2012年硕士毕业于中国科学院大学,研究方向为模式识别,机器学习。
视频回顾:https://v.qq.com/x/page/t3272gz1ji0.html
QA:
观众:每一套话术,节点是不是都不一样,所有节点都需要去配置吗?
李忠:是的,不同话术剧本设置的整体流程不一样,用户关心问题类型不一样,因此不同场景下的话术需要重新设计。比如在本地生活服务我们在设计话术开场白是询问用户行业,在招聘行业这里的开场白就是询问用户公司信息或是否有招聘意愿等。
观众:不同接入方的不同话术的 肯定、否定 节点,是用同一个识别模型吗?还是需要分别去配置?
李忠:是的,目前针对所有模型我们有一个统一的单句意图识别,意图识别类别体系涉及到肯定、否定、用户在忙、用户辱骂、问候语等,因此可以使用统一的单句意图识别模型,当然这里也可以针对特定的话术场景下单独训练一个模型。
观众:这里说的端到端跳转,是每一套话术一个模型吗?话术如果不断变化,这个模型是不是要不断变化?这里大概多少于语料,能达到什么效果?
李忠:端到端目的是基于用户的回复加上对话状态直接输出机器应该跳转到话术节点,由于不同话术剧本所涉及的话术节点内容不一样,节点数目不一样,因此如果话术结构发生了变化,这里模型需要做相应变化。因此新话术上线前一般是基于正则、意图、文本匹配来实验,等线上数据积累一点量再训练端到端到模型。这里训练样本一般到10000左右就可以,然后对数据做一些增强的方法就可以训练模型。这里相比传统策略机器响应正确率绝对提升至少5%。
观众:销售团队有多少人呢?这里机器人等价于多少销售呢?
李忠:目前在大部分城市下,机器人在拨打合规转出率指标上可达人工销售水平的80%+。
观众:我想问一下,回复策略是怎么做的,用的模型还是规则?
李忠:有基于规则、意图识别、文本匹配、端到端的方法。
观众:机器人商机分配模型这里是把适合机器人外呼的商机给到机器人?这里有差异吗?
李忠:是的。这里会有差异,如在用户角度,有人对机器人外呼不排斥、有人排斥,部分品类的商机可能适合机器人外呼,采用机器学习的方法给机器人分配商机相比随机策略,拨打合规转出率会更高。
观众:如果用户一上来就说不需要,对话难以进行,对话深度不深怎么办?
李忠:对话深度可以根据业务需求去迭代话术,比如增加一些挽留话术增加多一次交互的可能。
观众:这里的意图是基于识别后的文本进行的吧,如果asr错误会有影响,这里有做相关工作吗?
李忠:目前主要是反馈到ASR技术同学,技术同学根据该场景下的Case去迭代语言模型。
观众:语义理解和对话管理这一块有相关的技术文章吗?
李忠:有,可以关注58同城AI Lab公众号,查看历史文章,如:
加微信入讨论群
PPT下载:
嘉宾PPT链接:https://pan.baidu.com/s/1QwfpmMP_vCCIMeOYJLLI8w
提取码:0gz3
AI Lab部门简介
58同城AI Lab隶属TEG技术工程平台群,成立于2018年5月,目前部门人数规模70+,包括算法、后端、大数据、产品人员。AI Lab旨在推动AI技术在58同城的落地,打造AI中台能力,以提高前台业务人效、收入和用户体验。
