您当前的位置 : 热点关注  >> 正文

云知声U2-ASR与U2-TTS全面升级,助力AI产业全球化落地

  全球AI产业加速出海,多语种语音交互已成为跨境数字化服务的核心刚需。当前行业普遍面临小语种服务薄弱、多模型部署繁琐、落地成本居高不下等难题,技术迭代与普惠服务难以兼顾。紧扣AI以人为本、向上向善的行业发展导向,云知声完成U2-ASR与U2-TTS多语种能力升级,通过识别与合成技术的双重突破,有效破解行业痛点,完善全球化语音交互体系,为AI跨境落地提供高效、低成本的全新解决方案。

  在“听”方面,针对不同语言在音素体系、发音节奏、语调规律及口音分布等方面的差异,U2-ASR通过统一联合建模,实现跨语言特征的协同学习与能力共享。

  在统一测试口径下,U2-ASR与Whisper Large V3 Turbo、FunASR、Seed-ASR等业界代表性模型进行了对比评测,并分别验证了“显式传入语种标签”与“不传入语种标签”两类场景下的识别表现。显式传入语种标签时:U2-ASR在13种语言工业级测试集上的平均字错率(CER)低至6.58%,12种语言CER低于8%,德语、西班牙语、印尼语、意大利语、越南语等5个重点语种更全部进入5%以内。

  在图示的对比评测中,U2-ASR均取得最低CER,实现全线领先。其中,越南语CER低至3.01%,俄语和印尼语分别低至5.26%和3.41%,展现出覆盖不同语系的稳定识别优势。与FunASR1.5、Seed-ASR、Whisperlarge-v3-turbo、Coheretranscribe、Qwen3-ASR-1.7B等模型相比,U2-ASR相较各语种表现最优的其他模型平均相对降错约30%;其中,越南语相对降错超过50%,俄语和印尼语分别降低约41%和37%,整体性能优势显著。不传入语种标签时,面对无标注的音频流,U2-ASR凭借自动语种识别与闭集路由能力,依然保持高准确率,有效避免了语种误判和错误率飙升。在跨境客服、国际会议、多语种内容审核等场景下,企业无需前置语言分类,即可获得稳定、可靠的识别结果。

  在“说”方面,此次升级中,U2-TTS重点强化东南亚多语种语音合成能力,新增支持:泰语、越南语、印尼语、马来语、缅甸语、柬埔寨语、菲律宾语、老挝语等8种语言。针对不同语言的发音规则、语调习惯、停顿节奏和韵律特征,U2-TTS进行了专项优化,让AI不仅能够“开口说”,还能够说得更加清晰、自然、流畅,更符合当地用户的语言习惯。

  从行业视角来看,此次迭代不仅是企业自身技术实力的跃升,也为国内智能语音企业全球化布局提供了成熟范式。其以硬核技术突破赋能产业升级、以普惠服务弥合语言数字鸿沟的发展思路,深度契合AI向上向善的发展内核,为全球人工智能产业协同、规范、普惠发展注入了新动能。

(责编:张凯)