搜索引擎 + AI 驱动的行业新闻
【覆盖行业】
信保 |出口 |金融
制造 |农业 |建筑 |地产
零售 |物流 |数智
【访问入口】
hangyexinwen.com
【新闻分享】
点击发布时间即可分享
【联系我们】
xinbaoren.com
(微信内打开提交表单)
【覆盖行业】
信保 |出口 |金融
制造 |农业 |建筑 |地产
零售 |物流 |数智
【访问入口】
hangyexinwen.com
【新闻分享】
点击发布时间即可分享
【联系我们】
xinbaoren.com
(微信内打开提交表单)
📰 Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教
本次发布的Qwen-Audio-3.0-ASR-Flash在上下文一致性、行业词识别和热词定制化三个维度进行了系统性优化,并具备语音润色能力,能直接输出结构化文本。该系列已在会议纪要、实时字幕、教育录播、智能客服等场景得到验证,全球权威评测平台上曾以1.7%的错字率夺冠。新版本通过阿里云百炼平台开放调用,提供三种形态:离线转写、实时识别及非实时识别,且具备跨段落记忆和跨话题的上下文保持能力,能在长音频中持续听准专业词与英文术语。其行业词库覆盖医疗、IT、股票等领域,且热词定制机制实现即时生效,热词听中率普遍高于90%,部分场景甚至接近100%。同时,模型在语音润色方面可边识别边润色,去除口头禅、消除重复、纠正自我表达,输出更清晰的书面文本,且与两步润色相比在可读性和忠实度上差异不大。多语言识别能力亦被整合在同一模型中,支持中文、日语、韩语等多语言混合场景,并在多语言评测中表现优异,低延迟场景也保持高识别准确率。总之,Qwen-Audio-3.0-ASR-Flash致力于在复杂对话和专业领域中持续“听准、听对、润色到位”,并已开放调用,期待落地到会议、教育、客服、出海等实际场景。
🏷️ #语音识别 #行业词汇 #热词定制 #上下文记忆 #多语言
🔗 原文链接
📰 Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教
本次发布的Qwen-Audio-3.0-ASR-Flash在上下文一致性、行业词识别和热词定制化三个维度进行了系统性优化,并具备语音润色能力,能直接输出结构化文本。该系列已在会议纪要、实时字幕、教育录播、智能客服等场景得到验证,全球权威评测平台上曾以1.7%的错字率夺冠。新版本通过阿里云百炼平台开放调用,提供三种形态:离线转写、实时识别及非实时识别,且具备跨段落记忆和跨话题的上下文保持能力,能在长音频中持续听准专业词与英文术语。其行业词库覆盖医疗、IT、股票等领域,且热词定制机制实现即时生效,热词听中率普遍高于90%,部分场景甚至接近100%。同时,模型在语音润色方面可边识别边润色,去除口头禅、消除重复、纠正自我表达,输出更清晰的书面文本,且与两步润色相比在可读性和忠实度上差异不大。多语言识别能力亦被整合在同一模型中,支持中文、日语、韩语等多语言混合场景,并在多语言评测中表现优异,低延迟场景也保持高识别准确率。总之,Qwen-Audio-3.0-ASR-Flash致力于在复杂对话和专业领域中持续“听准、听对、润色到位”,并已开放调用,期待落地到会议、教育、客服、出海等实际场景。
🏷️ #语音识别 #行业词汇 #热词定制 #上下文记忆 #多语言
🔗 原文链接
📰 语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率
今天凌晨,微软研究院开源了VibeVoice-1.5B,这是一款创新的音频合成模型,突破了许多技术瓶颈。该模型能够连续合成90分钟的超长语音,而以往的模型通常只能达到60分钟,且存在音色漂移和语义断裂的问题。此外,VibeVoice最多支持4名发言人,而之前的模型仅支持2名。它的压缩效率也非常惊人,能够对24kHz原始音频实现3200倍的累计压缩,同时保持高保真的语音效果。
VibeVoice的技术优势体现在其双tokenizer架构上,分别是声学tokenizer和语义tokenizer。声学tokenizer负责音频特征的提取和压缩,而语义tokenizer则确保文本与语音的语义一致性。这种设计不仅提高了模型的性能,还有效解决了传统模型在音色与语义匹配上的问题。此外,该模型采用预训练的大语言模型Qwen2.5作为核心,能够解析复杂的用户输入并生成后续的上下文状态。
VibeVoice-1.5B的训练过程采用课程学习策略,从小的输入序列逐步增加到长达65536个token,以适应超长音频的需求。这种方法大幅提升了训练效率,缩短了训练周期,同时保证了特征提取模块的稳定性。未来,微软计划开源更大参数的语音模型,继续推动语音合成技术的发展。
🏷️ #微软 #音频模型 #VibeVoice #语音合成 #技术突破
🔗 原文链接
📰 语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率
今天凌晨,微软研究院开源了VibeVoice-1.5B,这是一款创新的音频合成模型,突破了许多技术瓶颈。该模型能够连续合成90分钟的超长语音,而以往的模型通常只能达到60分钟,且存在音色漂移和语义断裂的问题。此外,VibeVoice最多支持4名发言人,而之前的模型仅支持2名。它的压缩效率也非常惊人,能够对24kHz原始音频实现3200倍的累计压缩,同时保持高保真的语音效果。
VibeVoice的技术优势体现在其双tokenizer架构上,分别是声学tokenizer和语义tokenizer。声学tokenizer负责音频特征的提取和压缩,而语义tokenizer则确保文本与语音的语义一致性。这种设计不仅提高了模型的性能,还有效解决了传统模型在音色与语义匹配上的问题。此外,该模型采用预训练的大语言模型Qwen2.5作为核心,能够解析复杂的用户输入并生成后续的上下文状态。
VibeVoice-1.5B的训练过程采用课程学习策略,从小的输入序列逐步增加到长达65536个token,以适应超长音频的需求。这种方法大幅提升了训练效率,缩短了训练周期,同时保证了特征提取模块的稳定性。未来,微软计划开源更大参数的语音模型,继续推动语音合成技术的发展。
🏷️ #微软 #音频模型 #VibeVoice #语音合成 #技术突破
🔗 原文链接