模型简介
qwen3-asr-flash 是阿里巴巴 / 阿里云的语音识别模型,将语音内容转换为文本,适用于字幕、录音整理和语音交互中的转写环节。
这个型号的模式为 非实时;API为 HTTP(OpenAI兼容);情感识别为 支持。该型号属于系列中的效率取向分支。选择时可以重点记录等待时间、连续任务吞吐和单次任务成本,同时使用相同材料检查输出质量,避免只凭名称判断速度或准确率。
这个版本怎样理解
使用时以完整型号 qwen3-asr-flash 为准。同一系列的其他版本可能改变输入范围、默认行为或运行配置,升级前可先对照下方参数与官方说明。
版本与模型标识
| 模型名称 | qwen3-asr-flash |
|---|---|
| 模型 / 资源标识 | qwen3-asr-flash |
| 版本标识 | qwen3-asr-flash |
| 版本状态 | 官方目录收录 |
能力与参数
| 模式 | 非实时 |
|---|---|
| API | HTTP(OpenAI兼容) |
| 精度增强 | 不支持 |
| 情感识别 | 支持 |
| 说话人分离 | 不支持 |
| 支持语言 | 多语种及方言 |
| 音频最大时长/大小 | 5分钟 / 10MB |
用真实录音检查识别
准备含有背景噪声、多人说话、专业名词和数字的录音,检查转写与原声是否一致。会议整理还应关注说话人和时间定位,以便回听和纠正。
实际使用时重点看什么
语音识别输出的是声音中的文字,不等于对内容完成了事实核实。专有名称与关键数字应重点复核,领域专用转写也应保留人工校对环节。
价格与计费说明
查看官方计费与使用条件 ↗。API、产品订阅与自行部署是不同使用方式;开放权重不等于免费托管调用。
官方网址与文档
同厂商模型
- qwen-audio-3.0-tts-plus · 官方目录收录
- cosyvoice-v3.5-plus · 官方目录收录
- cosyvoice-v3-plus · 官方目录收录
- qwen-audio-3.0-tts-flash · 官方目录收录
- cosyvoice-v3.5-flash · 官方目录收录
- cosyvoice-v3-flash · 官方目录收录
- cosyvoice-v2 · 官方目录收录
- cosyvoice-v1 · 官方目录收录
资料来源
型号、版本与参数依据以上官方公开资料整理。
