次浏览

豆包流式语音识别 2.0

AI 资源
AI音频AI模型与工具导航

更新时间:

豆包流式语音识别 2.0 是字节跳动 / 火山引擎的语音识别模型,将语音内容转换为文本,适用于字幕、录音整理和语音交互中的转写环节。

资源信息

所属机构
字节跳动 / 火山引擎
适用对象
语音助手、音频创作与智能硬件开发团队

豆包流式语音识别 2.0 资源介绍

模型简介

豆包流式语音识别 2.0 是字节跳动 / 火山引擎的语音识别模型,将语音内容转换为文本,适用于字幕、录音整理和语音交互中的转写环节。

这个型号的模型名称参数为 model_name = bigmodel;默认音频规格为 16000Hz、16bit、单声道;支持的格式见接口文档;资源标识用途为 duration 为小时版,concurrent 为并发计费版。豆包是字节跳动的大模型品牌,开发者通过火山引擎接入不同任务的模型服务。

这个版本怎样理解

使用时以完整型号 volc.seedasr.sauc.duration 为准。同一系列的其他版本可能改变输入范围、默认行为或运行配置,升级前可先对照下方参数与官方说明。

用真实录音检查识别

准备含有背景噪声、多人说话、专业名词和数字的录音,检查转写与原声是否一致。会议整理还应关注说话人和时间定位,以便回听和纠正。

实际使用时重点看什么

语音识别输出的是声音中的文字,不等于对内容完成了事实核实。专有名称与关键数字应重点复核,领域专用转写也应保留人工校对环节。

版本与状态

项目信息
模型系列豆包流式语音识别
版本标识2.0
API 模型 / 资源 IDvolc.seedasr.sauc.duration
兼容标识volc.seedasr.sauc.concurrent
目录状态官方推荐

这些标识对应同一模型的兼容名称或不同计费方式,共用本页。具体请求参数和计费模式请查看官方文档。

支持能力与适用场景

  • 实时语音转文本
  • 流式识别
  • 标点与文本规整

适用人群与场景:语音助手、音频创作与智能硬件开发团队。

参数与使用限制

参数官方公开信息
模型名称参数model_name = bigmodel
默认音频规格16000Hz、16bit、单声道;支持的格式见接口文档
资源标识用途duration 为小时版,concurrent 为并发计费版
上下文 / 规格按语音服务规格,详见参数说明

限额为官方文档列示值,具体账号可用额度和开通条件以控制台为准。参数规模、固定发布日期和权重下载地址未获官方明确披露的,不作推测。

价格与计费方式

按调用后付费:推理服务-API调用 1元/小时。资源包、音色槽位和并发扩容另见官方计费。

按调用后付费计费项人民币单价
推理服务-API调用1元/小时

预付费资源包

有效期资源包规格资源包价格(元)折算单价
1年30小时28~0.93元/小时
1年1000小时9000.9元/小时
1年10000小时88000.88元/小时
1年100000小时850000.85元/小时
1年300000小时2400000.8元/小时

计费表使用的系列名称:豆包流式语音识别模型2.0。本页按官方系列价目记录,账户折扣、活动、增值服务和税费口径以官方结算为准。

查看官方计费说明

官方网址与接入文档

项目信息
官方模型页面官方模型页面
官方接入 / 参数文档官方接入 / 参数文档
官方价格说明官方价格说明
豆包产品总览豆包产品总览

同系列与其他模型

查看豆包完整模型与版本目录

资料来源

本页依据火山引擎公开模型目录与官方产品文档整理。官网公布的能力和限制不等于本站实测评分,价格与服务状态可能调整。

GEO导航 · AI 资源发现适合你的 AI 工具

探索工具分类,了解功能与应用场景。

GEO优化知识

更多