模型简介
Gemini 2.5 Flash TTS 是Google DeepMind的语音合成模型,把文字转成可播放的语音,适用于旁白、朗读和语音交互中的声音输出。
这个型号的最大输入为 8,192 tokens;最大输出为 16,384 tokens;输入为 文本。该型号属于系列中的效率取向分支。选择时可以重点记录等待时间、连续任务吞吐和单次任务成本,同时使用相同材料检查输出质量,避免只凭名称判断速度或准确率。
这个版本怎样理解
使用时以完整型号 gemini-2.5-flash-preview-tts 为准。同一系列的其他版本可能改变输入范围、默认行为或运行配置,升级前可先对照下方参数与官方说明。
版本与模型标识
| 模型名称 | Gemini 2.5 Flash TTS |
|---|---|
| 模型 / 资源标识 | gemini-2.5-flash-preview-tts |
| 版本标识 | gemini-2.5-flash-preview-tts |
| 版本状态 | 预览版本 |
能力与参数
| 最大输入 | 8,192 tokens |
|---|---|
| 最大输出 | 16,384 tokens |
| 输入 | 文本 |
| 输出 | 音频 |
从样稿到完整配音
先用包含数字、姓名、缩写和中外文混读的短稿试听,检查发音、停顿和语速。再处理完整段落,观察长句是否连贯以及不同段落的音色是否稳定。
实际使用时重点看什么
音色与模型版本是不同设置。配音制作更关注表达和一致性,实时应用还要关注首段声音的等待时间;不能只通过一句试听判断全部场景。
价格与计费说明
查看官方计费与使用条件 ↗。API、产品订阅与自行部署是不同使用方式;开放权重不等于免费托管调用。
官方网址与文档
同厂商模型
- Gemini 3.5 Live Translate · 预览版本
- Gemini 3.1 Flash Live · 预览版本
- Gemini 3.1 Flash TTS · 预览版本
- Gemini 3.5 Transcribe · 官方目录收录
- Gemini 3.5 Transcribe Live · 官方目录收录
- Gemini 2.5 Flash Live · 预览版本
- Gemini 2.5 Pro TTS · 预览版本
- Lyria 3.5 · 官方目录收录
资料来源
型号、版本与参数依据以上官方公开资料整理。