基本介绍
Deepgram 提供语音识别等音频模型,Flux 和 Nova 等系列把实时或录制音频转成文字。它们常用于字幕、会议转写、电话录音和语音交互,其中某些型号针对特定领域或音频场景设计。
实时交互与录音整理
实时识别需要判断停顿与说话轮次,录音整理则更关注完整转写、时间戳和专有词。会议、电话和医疗等场景有不同的声音条件,应使用自己的录音评估。
选择语言与专用分支
英语、多语言以及领域型号的支持范围不同。Deepgram 的 Flux 是语音识别模型,与 Black Forest Labs 的 FLUX 图像模型属于不同厂商与任务。
模型与版本目录
AI音频 · 29 项
价格与使用条件
官方价格与使用条件 ↗。产品订阅、按量调用与自行部署具有不同成本,选择前结合任务量和所需功能计算。