控制台

模型列表MOSS-TTS-v1.5-Flash

MOSS-TTS-v1.5-Flash

推荐语音生成

MOSS-TTS-v1.5-Flash 面向低延迟流式语音生成,在提供高保真的音色克隆能力和语音控制能力的同时,支持通过 stream=true 持续返回音频分片。

ENDPOINT

POST /v1/audio/speech

当前调用路径

输入

文本 + voice_id

请求可接受的内容

输出

音频

成功返回的内容

模型概览

单人文本转语音模型。默认使用稳定模型 ID moss-tts-1.5-flash;如需复现固定版本,可在 model 中传 moss-tts-1.5-flash-2026-06-26。

计费

本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。

项目单价说明
模型调用见计费标准按实际请求与输出统计,以控制台账单为准。

模态支持

文本仅输入
音频仅输出
图片不支持
视频不支持

支持的 Endpoint

单人语音生成/v1/audio/speech支持
多人对话语音生成/v1/audio/speech/speakers不支持
音频转写/v1/audio/transcriptions不支持
音色设计/v1/audio/voice/generations不支持
多模态理解/v1/responses不支持

能力

性能较高
推理速度
流式 支持
异步 支持
  • 32768 上下文窗口长度
  • 最大输出7500个Token
  • 支持粤语
  • 支持30+种多语言
  • 支持音素级发音控制&Token级时长控制

版本与快照

Model IDmoss-tts-1.5-flash
快照moss-tts-1.5-flash-2026-06-26流式版本