<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>语音识别 | 行业新闻_地产（点击查看更多）</title><description>搜索引擎 + AI 驱动的行业新闻【覆盖行业】信保 ｜出口 ｜金融 制造 ｜农业 ｜建筑 ｜地产  零售 ｜物流 ｜数智【访问入口】hangyexinwen.com【新闻分享】点击发布时间即可分享【联系我们】xinbaoren.com（微信内打开提交表单）</description><link>https://dichan.hangyexinwen.com</link><item><title>⁣📰 Qwen-Audio-3.0-ASR-Flash：长音频不丢词，行业词不用教本次发布的Qwen-Audio-3.0-ASR-Flash在上下文一致性、行业词识别和热词定制化三个维度进行了系统性优化，并具备语音润色能力，能直接输出结构化文本</title><link>https://dichan.hangyexinwen.com/posts/7023</link><guid isPermaLink="true">https://dichan.hangyexinwen.com/posts/7023</guid><pubDate>Fri, 31 Jul 2026 23:05:45 GMT</pubDate><content:encoded>⁣&lt;br /&gt;&lt;b&gt;&lt;i&gt;&lt;b&gt;📰&lt;/b&gt;&lt;/i&gt; Qwen-Audio-3.0-ASR-Flash：长音频不丢词，行业词不用教&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;本次发布的Qwen-Audio-3.0-ASR-Flash在上下文一致性、行业词识别和热词定制化三个维度进行了系统性优化，并具备语音润色能力，能直接输出结构化文本。该系列已在会议纪要、实时字幕、教育录播、智能客服等场景得到验证，全球权威评测平台上曾以1.7%的错字率夺冠。新版本通过阿里云百炼平台开放调用，提供三种形态：离线转写、实时识别及非实时识别，且具备跨段落记忆和跨话题的上下文保持能力，能在长音频中持续听准专业词与英文术语。其行业词库覆盖医疗、IT、股票等领域，且热词定制机制实现即时生效，热词听中率普遍高于90%，部分场景甚至接近100%。同时，模型在语音润色方面可边识别边润色，去除口头禅、消除重复、纠正自我表达，输出更清晰的书面文本，且与两步润色相比在可读性和忠实度上差异不大。多语言识别能力亦被整合在同一模型中，支持中文、日语、韩语等多语言混合场景，并在多语言评测中表现优异，低延迟场景也保持高识别准确率。总之，Qwen-Audio-3.0-ASR-Flash致力于在复杂对话和专业领域中持续“听准、听对、润色到位”，并已开放调用，期待落地到会议、教育、客服、出海等实际场景。&lt;br /&gt;&lt;br /&gt;&lt;i&gt;&lt;b&gt;🏷️&lt;/b&gt;&lt;/i&gt; &lt;a href=&quot;/search/%23%E8%AF%AD%E9%9F%B3%E8%AF%86%E5%88%AB&quot;&gt;#语音识别&lt;/a&gt; &lt;a href=&quot;/search/%23%E8%A1%8C%E4%B8%9A%E8%AF%8D%E6%B1%87&quot;&gt;#行业词汇&lt;/a&gt; &lt;a href=&quot;/search/%23%E7%83%AD%E8%AF%8D%E5%AE%9A%E5%88%B6&quot;&gt;#热词定制&lt;/a&gt; &lt;a href=&quot;/search/%23%E4%B8%8A%E4%B8%8B%E6%96%87%E8%AE%B0%E5%BF%86&quot;&gt;#上下文记忆&lt;/a&gt; &lt;a href=&quot;/search/%23%E5%A4%9A%E8%AF%AD%E8%A8%80&quot;&gt;#多语言&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;i&gt;&lt;b&gt;🔗&lt;/b&gt;&lt;/i&gt; &lt;a href=&quot;https://www.53ai.com/news/MultimodalLargeModel/2026073142870.html&quot; target=&quot;_blank&quot;&gt;原文链接&lt;/a&gt;</content:encoded></item><item><title>⁣📰 语音界Sora！微软刚开源新模型，一次生成90分钟语音、3200倍压缩率今天凌晨，微软研究院开源了VibeVoice-1.5B，这是一款创新的音频合成模型，突破了许多技术瓶颈</title><link>https://dichan.hangyexinwen.com/posts/50</link><guid isPermaLink="true">https://dichan.hangyexinwen.com/posts/50</guid><pubDate>Tue, 26 Aug 2025 06:01:19 GMT</pubDate><content:encoded>⁣&lt;br /&gt;&lt;b&gt;&lt;i&gt;&lt;b&gt;📰&lt;/b&gt;&lt;/i&gt; 语音界Sora！微软刚开源新模型，一次生成90分钟语音、3200倍压缩率&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;今天凌晨，微软研究院开源了VibeVoice-1.5B，这是一款创新的音频合成模型，突破了许多技术瓶颈。该模型能够连续合成90分钟的超长语音，而以往的模型通常只能达到60分钟，且存在音色漂移和语义断裂的问题。此外，VibeVoice最多支持4名发言人，而之前的模型仅支持2名。它的压缩效率也非常惊人，能够对24kHz原始音频实现3200倍的累计压缩，同时保持高保真的语音效果。&lt;br /&gt;&lt;br /&gt;VibeVoice的技术优势体现在其双tokenizer架构上，分别是声学tokenizer和语义tokenizer。声学tokenizer负责音频特征的提取和压缩，而语义tokenizer则确保文本与语音的语义一致性。这种设计不仅提高了模型的性能，还有效解决了传统模型在音色与语义匹配上的问题。此外，该模型采用预训练的大语言模型Qwen2.5作为核心，能够解析复杂的用户输入并生成后续的上下文状态。&lt;br /&gt;&lt;br /&gt;VibeVoice-1.5B的训练过程采用课程学习策略，从小的输入序列逐步增加到长达65536个token，以适应超长音频的需求。这种方法大幅提升了训练效率，缩短了训练周期，同时保证了特征提取模块的稳定性。未来，微软计划开源更大参数的语音模型，继续推动语音合成技术的发展。&lt;br /&gt;&lt;br /&gt;&lt;i&gt;&lt;b&gt;🏷️&lt;/b&gt;&lt;/i&gt; &lt;a href=&quot;/search/%23%E5%BE%AE%E8%BD%AF&quot;&gt;#微软&lt;/a&gt; &lt;a href=&quot;/search/%23%E9%9F%B3%E9%A2%91%E6%A8%A1%E5%9E%8B&quot;&gt;#音频模型&lt;/a&gt; &lt;a href=&quot;/search/%23VibeVoice&quot;&gt;#VibeVoice&lt;/a&gt; &lt;a href=&quot;/search/%23%E8%AF%AD%E9%9F%B3%E5%90%88%E6%88%90&quot;&gt;#语音合成&lt;/a&gt; &lt;a href=&quot;/search/%23%E6%8A%80%E6%9C%AF%E7%AA%81%E7%A0%B4&quot;&gt;#技术突破&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;i&gt;&lt;b&gt;🔗&lt;/b&gt;&lt;/i&gt; &lt;a href=&quot;https://www.53ai.com/news/OpenSourceLLM/2025082641279.html&quot; target=&quot;_blank&quot;&gt;原文链接&lt;/a&gt;</content:encoded></item></channel></rss>