📰 Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教
本次发布的Qwen-Audio-3.0-ASR-Flash在上下文一致性、行业词识别和热词定制化三个维度进行了系统性优化,并具备语音润色能力,能直接输出结构化文本。该系列已在会议纪要、实时字幕、教育录播、智能客服等场景得到验证,全球权威评测平台上曾以1.7%的错字率夺冠。新版本通过阿里云百炼平台开放调用,提供三种形态:离线转写、实时识别及非实时识别,且具备跨段落记忆和跨话题的上下文保持能力,能在长音频中持续听准专业词与英文术语。其行业词库覆盖医疗、IT、股票等领域,且热词定制机制实现即时生效,热词听中率普遍高于90%,部分场景甚至接近100%。同时,模型在语音润色方面可边识别边润色,去除口头禅、消除重复、纠正自我表达,输出更清晰的书面文本,且与两步润色相比在可读性和忠实度上差异不大。多语言识别能力亦被整合在同一模型中,支持中文、日语、韩语等多语言混合场景,并在多语言评测中表现优异,低延迟场景也保持高识别准确率。总之,Qwen-Audio-3.0-ASR-Flash致力于在复杂对话和专业领域中持续“听准、听对、润色到位”,并已开放调用,期待落地到会议、教育、客服、出海等实际场景。
🏷️ #语音识别 #行业词汇 #热词定制 #上下文记忆 #多语言
🔗 原文链接
📰 Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教
本次发布的Qwen-Audio-3.0-ASR-Flash在上下文一致性、行业词识别和热词定制化三个维度进行了系统性优化,并具备语音润色能力,能直接输出结构化文本。该系列已在会议纪要、实时字幕、教育录播、智能客服等场景得到验证,全球权威评测平台上曾以1.7%的错字率夺冠。新版本通过阿里云百炼平台开放调用,提供三种形态:离线转写、实时识别及非实时识别,且具备跨段落记忆和跨话题的上下文保持能力,能在长音频中持续听准专业词与英文术语。其行业词库覆盖医疗、IT、股票等领域,且热词定制机制实现即时生效,热词听中率普遍高于90%,部分场景甚至接近100%。同时,模型在语音润色方面可边识别边润色,去除口头禅、消除重复、纠正自我表达,输出更清晰的书面文本,且与两步润色相比在可读性和忠实度上差异不大。多语言识别能力亦被整合在同一模型中,支持中文、日语、韩语等多语言混合场景,并在多语言评测中表现优异,低延迟场景也保持高识别准确率。总之,Qwen-Audio-3.0-ASR-Flash致力于在复杂对话和专业领域中持续“听准、听对、润色到位”,并已开放调用,期待落地到会议、教育、客服、出海等实际场景。
🏷️ #语音识别 #行业词汇 #热词定制 #上下文记忆 #多语言
🔗 原文链接