发布于2026-08-22 阅读(0)
扫一扫,手机访问
最近,Interspeech 2026的录用结果正式公布,江苏省语言计算及应用重点实验室有4篇论文被会议接收。Interspeech作为国际语音通信协会ISCA主办的老牌会议,长期被视为语音研究领域最具国际影响力的学术盛会之一。本届主题是“Speaking Together”,从录用成果来看,基本能摸清语音语言技术前沿的最新走向。
这个实验室的来头不小——由思必驰科技股份有限公司牵头,联合上海交通大学、苏州大学共同组建,是江苏省在通用人工智能领域布局的重要战略科技力量。它的运作模式很有意思:以思必驰的产业平台为基底,把上海交大和苏大的顶尖科研资源拧成一股绳,形成“产学研用”深度融合的创新共同体。核心聚焦语言计算技术,打通从基础理论到关键算法、再到产业落地的全链条。
本次被收录的成果主要集中在听觉感知、语言认知、大模型及智能体、全链路对话系统柔性定制等方向。这些研究直接增强了思必驰在复杂场景语音识别可靠性、语音大模型高效适配、以及面向部署工程化交付方面的核心能力,也支撑了智慧出行座舱交互、智慧办公会议转写、智慧物联远场对话等场景的体验升级,同时提升了面向多行业客户的标准化交付效率与可扩展能力。下面重点介绍其中一项代表性成果:
这项成果瞄准的是会议转写、车载指令等高安全场景中的“硬骨头”——识别错误被高置信度掩盖的问题。说白了,就是系统明明错了,但还自信满满地给出一个高分数,这对下游应用和用户来说都是隐患。传统的词错误率指标只衡量准确率,很难刻画结果的可靠性。
具体方案是这样的:他们提出了一种具备弃权感知能力的转录框架——让识别模型在不确定的片段上主动选择“弃权”,而不是硬着头皮输出结果。同时,提出了一个可靠性导向指标RAS,用来在转录信息量与错误规避之间做权衡,并且权衡参数还会根据人类偏好进行校准。训练过程分两步走:先用监督式自举完成初始化,再结合强化学习训练出具备弃权能力的识别模型。实验数据显示,这个方法在保持有竞争力识别准确率的同时,显著提升了转录结果的可靠性。对于高安全要求的语音交互来说,这算是提供了一层可控的质量保障。

上述研究方向正在加速转化为思必驰在三大领域的产品能力升级。具体来说:识别结果在噪声和歧义场景下更可信;多语种和新领域的适配速度更快;面向部署的模型选型与交付过程更可复现;语音反馈更自然及时;弱网和低功耗条件下的使用体验也更顺畅。依托这些能力,思必驰在多行业项目中的交付效率与场景适配速度持续提升,最终给客户带来更一致、更可靠的语音交互服务。
长期以来,思必驰在ICASSP、INTERSPEECH、ACL、EMNLP、AAAI、ICML、NeurIPS等顶级学术会议上的表现一直很活跃,屡次取得佳绩。持续产出的高质量科研成果,也印证了其在人工智能语音语言关键技术领域的深度探索和重大突破。秉持科研与产业应用紧密结合的理念,接下来思必驰会继续推进高水平科研成果向产品能力转化,围绕真实业务场景打磨可落地、可规模化、可持续优化的语音语言技术体系。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9