发布于2026-08-17 阅读(0)
扫一扫,手机访问
最近,科大讯飞在语音交互领域又放了个大招——一项关于“人机交互对话系统的口音与风格控制方法及装置”的专利正式公布。从专利摘要来看,这事儿其实挺有意思的:它瞄准的正是当前智能语音系统在口音和风格动态调控方面的短板。
简单梳理一下核心逻辑。系统首先会接收用户的对话请求,然后判断这个请求里是否包含了口音和风格的控制需求。根据判断结果,系统会设置对应的“口音槽值”和“风格槽值”并存储起来。接下来,在对话推进的过程中,系统会根据当前轮次以及用户的实际需求,对这些槽值进行更新或继承。最后,系统根据对话意图生成文本回复,再调用对应的TTS(语音合成)模型,按照当前的口音和风格设定,把文本回复合成为带有特定腔调的语音输出给用户。
这套方案解决的痛点非常明确:过去的口音与风格控制方式,要么动态调控能力太弱,要么在多轮对话中无法继承之前的状态——比如用户上一轮说“用四川话回答”,下一轮系统可能又切回标准普通话了。此外,场景适配性不足、系统扩展成本高也是老问题。科大讯飞这次把“口音”和“风格”独立出槽位进行管理,相当于给语音交互系统装了一个可随时切换的语气调节器,实用性值得期待。

售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9