
阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,让 AI 更好听懂专业词汇
阿里巴巴发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,优化行业词识别与热词定制,医疗场景听中率突破 95%,支持输出结构化文本。
资讯解读
阿里巴巴正式推出 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,旨在解决 AI 在处理专业领域语音内容时的理解难题。该模型专注于提升语音转文本的准确性,特别是针对行业术语和冷门词汇的识别能力进行了系统性优化。
技术层面,该模型在上下文一致性、行业词识别和热词定制化三个维度实现了突破。此外,模型还具备语音润色功能,能够直接输出结构化文本,减少了后续人工整理的成本,提升了信息处理的效率。
在垂直领域应用方面,研究团队从医疗、IT 编程、股票及社会名人等领域挖掘专业词汇,构建了高质量词库。内部评测显示,新模型在医疗场景下的专业词听中率已突破 95%,显著优于通用模型。
这一发布标志着语音识别技术在垂直行业落地能力的增强。随着专业词汇识别精度的提升,AI 助手在医疗记录、代码转录等高精度要求场景中的应用价值将进一步凸显,有助于推动行业智能化进程。
本站展示内容为基于公开信息的资讯解读与整理,不代表原文转载。如需核实细节或获取完整报道,请通过下方链接访问原始来源。