商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 千问大模型升级实时语音识别大模型Fun-ASR-Realtime 支持30种语言+16种方言

千问大模型升级实时语音识别大模型Fun-ASR-Realtime 支持30种语言+16种方言

  发布于2026-08-18 阅读(0)

扫一扫,手机访问

千问大模型升级实时语音识别:Fun-ASR-Realtime正式发布

7月6日,千问大模型正式推出了实时语音识别大模型Fun-ASR-Realtime。这是一款将首字延迟控制在百毫秒级别、识别准确率接近离线模型的流式语音识别产品,同时支持16种方言和30种语言——覆盖面在国内同类产品中相当少见。

语音识别模型其实分两类:离线和实时。离线模型处理的是已经录好的音频,准确度更高,但没法应对“边说边识别”的场景;实时模型则不同——边录边识,既得准又得够快,难度更大。但直播字幕、会议实时转写、客服通话这些低延迟场景,偏偏就需要这种能力。Fun-ASR-Realtime瞄准的正是后者:让“又快”和“又准”不再是一道选择题。

速度:首字百毫秒,尾字不掉队

在速度上,模型的首字时延控制在百毫秒级别——话音刚落,文字就已经开始浮现。即便是很长的句子,尾字输出的延迟也极低。举个例子,在“重返荒岛”的100小时直播中,两岛互动、多人频繁切换说话、赛制复杂还赶上暴雨——观众却能实时看到Tim和中国boy等嘉宾的发言字幕,观看体验直接被拉满。

准确率:接近离线模型,还能“越听越准”

在准确率方面,Fun-ASR-Realtime的表现已经很接近其离线版本Fun-ASR-Flash。它针对上下文做了专项强化——包括历史对话上下文和实时热词,使模型具备理解语境的能力。一个真实的直播案例:Tim说了“夜鹭”,最开始被识别成“叶鹿”,但紧接着上下文跟了一句“观鸟的朋友应该知道”,模型立刻自己纠正了过来。

多语言和方言:这是Fun-ASR-Realtime最能听的部分

Fun-ASR-Realtime最能打的,其实是多语言和方言能力。它支持16种方言和30种语言,覆盖了八大方言区。在方言识别测试中,平均字符准确率达到88.62%,有12类方言的识别准确率领先火山和腾讯的相关产品。特别是高难度的吴语系——上海话92.41%,苏州话89.21%,就连号称“最难懂方言”的温州话也达到了82.74%。福建话、客家话等复杂方言同样全面领先。

Fun-ASR-Realtime在16种方言识别测试中领先。CER为字符错误率,1-CER代表字符准确率。

复杂场景与多语种:从工业远场到出海市场

在5类工业中文和英文场景的语音识别横向测评中——包括复杂背景、远场嘈杂以及各种带口音的场景——Fun-ASR-Realtime依然表现抢眼,中文平均字符准确率88.42%,英文91.58%,均领先同类产品。此外,模型针对泰语等东亚、东南亚语言做了专项优化,识别准确率提升了20%,特别适合出海客服、国际会议等场景。

Fun-ASR-Realtime在5类工业中文和英文场景的语音识别横向测评中领先。

离线模型Fun-ASR-Flash:全球权威榜单第一

作为Fun-ASR-Realtime的离线版本,Fun-ASR-Flash近期也正式上线。在全球权威AI评测平台Artificial Analysis上,Fun-ASR-Flash(榜单上为曾用名“Fun-realtime-ASR-preview”)字错率仅为1.7%,位列全球第一。

本文转载于:https://www.163.com/dy/article/L15QHC2705198UNI.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注