模型简介
nemotron-voicechat 是NVIDIA的音频模型,处理声音相关输入或输出,参与音频理解、生成与交互任务。
NVIDIA 的模型目录包括 Nemotron 语言与推理模型,以及文档解析、语音和其他专用方向。
这个版本怎样理解
使用时以完整型号 nvidia/nemotron-voicechat 为准。同一系列的其他版本可能改变输入范围、默认行为或运行配置,升级前可先对照下方参数与官方说明。
版本与模型标识
| 模型名称 | nemotron-voicechat |
|---|---|
| 模型 / 资源标识 | nvidia/nemotron-voicechat |
| 版本标识 | nemotron-voicechat |
| 版本状态 | 官方模型目录 |
NVIDIA 目录同时包含下载权重与托管推理服务,具体交付方式、许可和资源要求以模型卡为准。
先确认输入输出方向
识别音频、生成语音和实时对话需要不同接口。准备任务时应明确是需要文字、声音还是连续交互,再确认型号支持的格式和工作方式。
实际使用时重点看什么
音频时长、语言、采样率和流式方式都可能影响服务使用。使用自己的录音或样稿检查结果,关注延迟与信息完整性。
价格与计费说明
查看官方计费与使用条件 ↗。API、产品订阅与自行部署是不同使用方式;开放权重不等于免费托管调用。
官方网址与文档
同厂商模型
- parakeet-tdt-0.6b · 官方模型目录
- nemotron-asr-streaming · 官方模型目录
- parakeet-ctc-0.6b-zh-tw · 官方模型目录
- parakeet-ctc-0.6b-zh-cn · 官方模型目录
- parakeet-ctc-0.6b-es · 官方模型目录
- parakeet-ctc-0.6b-vi · 官方模型目录
- parakeet-tdt-0.6b-v2 · 官方模型目录
资料来源
型号、版本与参数依据以上官方公开资料整理。