MOSS-TTS-v1.5-Flash
推荐语音生成MOSS-TTS-v1.5-Flash 面向低延迟流式语音生成,在提供高保真的音色克隆能力和语音控制能力的同时,支持通过 stream=true 持续返回音频分片。
ENDPOINT
POST /v1/audio/speech
当前调用路径
输入
文本 + voice_id
请求可接受的内容
输出
音频
成功返回的内容
模型概览
单人文本转语音模型。默认使用稳定模型 ID moss-tts-1.5-flash;如需复现固定版本,可在 model 中传 moss-tts-1.5-flash-2026-06-26。
计费
本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。
项目单价说明
模型调用
见计费标准按实际请求与输出统计,以控制台账单为准。模态支持
文文本仅输入
音音频仅输出
图图片不支持
视视频不支持
支持的 Endpoint
单人语音生成
/v1/audio/speech支持多人对话语音生成
/v1/audio/speech/speakers不支持音频转写
/v1/audio/transcriptions不支持音色设计
/v1/audio/voice/generations不支持多模态理解
/v1/responses不支持能力
性能较高
推理速度中
流式 支持
异步 支持
- 32768 上下文窗口长度
- 最大输出7500个Token
- 支持粤语
- 支持30+种多语言
- 支持音素级发音控制&Token级时长控制
版本与快照
Model ID
moss-tts-1.5-flash快照
moss-tts-1.5-flash-2026-06-26流式版本