来源丨机器之心

扣子 Coze OpenAPI 具有低延时、定制化、随时打断和音色克隆等优势,同时整合了扣子的智能体生态。

下面我们就逐步演示一下可以如何使用扣子智能体平台和智能语音对话 OpenAPI 轻松构建一个 AI 技术问答应用(基于扣子提供的网页版 Playground)。有趣的是,这里的整个演示过程都是零代码的!


首先申请内测权限,你可以在这里免费申请:https://www.coze.cn/survey/7431180581536268314?FG_source=17

接下来,你需要构建一个智能体。基于扣子智能体平台,你只需要用一句话描述你的核心功能,剩下的交给 AI,就能轻松获得一个智能体。


当然,你也可以对 AI 创建的智能体进行更进一步的编排,优化其人设和回复逻辑,还能添加知识库以及设置开场白;更重要的是,还能为其设计工作流 —— 这个过程既能使用思维链(CoT)和检索增强式生成(RAG)等技术,还能将外部工具整合进来,比如集成外部知识库、调用外部模型和工具等等。

考虑到最近 Scaling Laws 是否撞墙的问题备受热议,我们也正好做过几篇报道,下面我们就把这几篇文章导入到这个智能体的知识库中。


智能体编排完成后,点击发布。这里注意我们需要勾选「Agent as API」以便后续我们通过 OpenAPI 调用该智能体。

然后我们就可以进入 Playground,获取权限后,调用该智能体,同时选取合适的音色。

之后,我们就可以通过扣子智能语音对话 OpenAPI 来了解所谓的「扩展律撞墙」是什么了。

不仅如此,扣子智能语音对话 OpenAPI 也支持用户传入文本或网络链接(只要对应的智能体配置了链接读取等合适的插件即可)。当然,由于这里演示的仅仅是 Playground,还不是完整的应用,因此在传入数据时还需要采用 json 格式,下面演示了其对我们最近发布的一篇文章的分析:

如此,一个简易版的实时语音技术问答助理就搭建完成了。实际上,只要搭配上好看的网页前端,这就可以作为一个小应用发布了。而通过配置具有更复杂工作流程的智能体,扣子智能语音对话 OpenAPI 也能实现更加复杂的应用。


五大优势

强大的 AI 智能体能力

智能体可能成为大规模应用大型语言模型(LLM)的新范式。它不仅限于作为问答工具,更能深入融入用户的数字或物理生活。正如著名AI研究者吴恩达所言,许多LLM的优化主要集中在回答问题,以提升消费者体验。而如今,已经可以将这些模型整合进复杂的智能体工作流程,创造出有价值的应用。当前的趋势是为智能体原生构建特定操作的LLM,这将显著提升其性能。预计在未来几年,智能体将在这一方向上取得重大进展。
扣子智能体平台正是这一愿景的实践者,其强大的智能体生态是扣子智能语音对话OpenAPI的一大优势。作为新一代AI大模型智能体开发平台,扣子整合了插件、长短期记忆、工作流和卡片等多种功能,帮助用户快速构建个性化或具备商业价值的智能体,并可发布到豆包、飞书等平台。该平台的使用门槛极低,用户无需具备编程能力,只需用自然语言简单描述需求,平台便能自动生成合适的智能体。


使用扣子商店右下角扣子助手,一句话创建智能体

通过整合智能体,扣子智能语音对话 OpenAPI 可让用户以语音方式完成各种不同的任务,比如执行订单、生成图像、执行重复性的工作流程等等。只要智能体能做到的,扣子智能语音对话 OpenAPI 都能将其整合进来。


识别精准

扣子智能语音对话OpenAPI在语音识别(ASR)领域应用了先进的大模型技术,使其具备出色的上下文理解和抗干扰能力,从而提供更为精准的语音转文本体验。该系统不仅能够识别常见对话内容,还能在多轮对话中进行上下文关联。当用户提到前文的名词或代称时,系统会根据对话背景自动进行关联,减少重复确认的需要。

在嘈杂或复杂的声学环境中,扣子智能语音对话的表现也相当出色,能够有效识别清晰文本,从而降低噪声引起的误识别率。针对特定行业,OpenAPI提供了专门的语料库支持,能够精准识别医疗、金融和法律等领域的专业术语。此外,该系统对中英文混合表达的识别同样表现良好,提高了其在多语种环境中的适应性。


稳健的实时通信能力

扣子智能语音对话OpenAPI使用火山引擎的RTC(Real-Time Communication)技术,能够有效降低通信延迟,实现即时响应,减少卡顿和延时。

火山引擎RTC优化了从声音采集到AI语音回复的全链路处理,延迟最低可达1秒,相较于之前几秒的处理时间,显著提高了响应速度。这使得该系统在客服、教育和远程协作等场景中能够迅速响应用户输入,保持流畅的多轮对话。

此外,火山引擎RTC在弱网环境下也能保持通话顺畅,避免因丢字造成的理解偏差。该技术支持智能体根据对话节奏实时“打断”当前输出,迅速响应用户指令,使对话更加灵活,特别是在用户提出新问题或修改需求时,系统能够快速调整对话流程。


语言效果自然

扣子智能语音对话OpenAPI在文本转语音(TTS)领域采用了大模型技术,使生成的语音更加自然和个性化。基于大模型的TTS引擎能够分析文本内容,并针对语句的情绪、意图和语气进行调整,从而使输出语音在语调、节奏和情感表达上接近真人。

此外,该系统支持中英文混合语句,可以在多语种表达场景中流畅切换。它能够根据不同应用场景自动调整语气,比如客服系统中的温和语调或播报系统中的激昂表达,避免了传统TTS的机械和单调。

生成的语音在韵律、气口和情感表达等方面也经过优化,使其适用于广告配音、客户服务等多种应用场景。


支持自定义音色

扣子智能语音对话 OpenAPI 不仅预置了丰富的音色(包括 20 多种中文音色以及一些英语、日语和西班牙语等其它语言的音色),还提供了一项特别的音色克隆功能,用户只需提供一小段语音录制,便可生成自己的专属音色。

目前,系统在内测期间允许每位用户创建一个专属音色。