模型简介
豆包流式语音识别 1.0 是字节跳动 / 火山引擎的语音识别模型,将语音内容转换为文本,适用于字幕、录音整理和语音交互中的转写环节。
这个型号的模型名称参数为 model_name = bigmodel;默认音频规格为 16000Hz、16bit、单声道;支持的格式见接口文档;资源标识用途为 duration 为小时版,concurrent 为并发计费版。豆包是字节跳动的大模型品牌,开发者通过火山引擎接入不同任务的模型服务。
这个版本怎样理解
使用时以完整型号 volc.bigasr.sauc.duration 为准。同一系列的其他版本可能改变输入范围、默认行为或运行配置,升级前可先对照下方参数与官方说明。
用真实录音检查识别
准备含有背景噪声、多人说话、专业名词和数字的录音,检查转写与原声是否一致。会议整理还应关注说话人和时间定位,以便回听和纠正。
实际使用时重点看什么
语音识别输出的是声音中的文字,不等于对内容完成了事实核实。专有名称与关键数字应重点复核,领域专用转写也应保留人工校对环节。
版本与状态
| 项目 | 信息 |
|---|---|
| 模型系列 | 豆包流式语音识别 |
| 版本标识 | 1.0 |
| API 模型 / 资源 ID | volc.bigasr.sauc.duration |
| 兼容标识 | volc.bigasr.sauc.concurrent |
| 目录状态 | 历史版本资料 |
这些标识对应同一模型的兼容名称或不同计费方式,共用本页。具体请求参数和计费模式请查看官方文档。
支持能力与适用场景
- 实时语音转文本
- 流式识别
- 标点与文本规整
适用人群与场景:语音助手、音频创作与智能硬件开发团队。
参数与使用限制
| 参数 | 官方公开信息 |
|---|---|
| 模型名称参数 | model_name = bigmodel |
| 默认音频规格 | 16000Hz、16bit、单声道;支持的格式见接口文档 |
| 资源标识用途 | duration 为小时版,concurrent 为并发计费版 |
| 上下文 / 规格 | 按语音服务规格,详见参数说明 |
限额为官方文档列示值,具体账号可用额度和开通条件以控制台为准。参数规模、固定发布日期和权重下载地址未获官方明确披露的,不作推测。
价格与计费方式
按调用后付费:推理服务-API调用 4.5元/小时。资源包、音色槽位和并发扩容另见官方计费。
| 按调用后付费计费项 | 人民币单价 |
|---|---|
| 推理服务-API调用 | 4.5元/小时 |
预付费资源包
| 有效期 | 资源包规格 | 资源包价格(元) | 折算单价 |
|---|---|---|---|
| 1年 | 30小时 | 132 | 4.4元/小时 |
| 1年 | 1000小时 | 4000 | 4元/小时 |
| 1年 | 10000小时 | 32000 | 3.2元/小时 |
| 1年 | 100000小时 | 280000 | 2.8元/小时 |
| 1年 | 300000小时 | 720000 | 2.4元/小时 |
计费表使用的系列名称:大模型流式语音识别。本页按官方系列价目记录,账户折扣、活动、增值服务和税费口径以官方结算为准。
官方网址与接入文档
| 项目 | 信息 |
|---|---|
| 官方模型页面 | 官方模型页面 |
| 官方接入 / 参数文档 | 官方接入 / 参数文档 |
| 官方价格说明 | 官方价格说明 |
| 豆包产品总览 | 豆包产品总览 |
同系列与其他模型
- 豆包流式语音识别 2.0 · 官方推荐
资料来源
本页依据火山引擎公开模型目录与官方产品文档整理。官网公布的能力和限制不等于本站实测评分,价格与服务状态可能调整。
