控制台

模型列表MOSS-TTS-v1.0-Pro

MOSS-TTS-v1.0-Pro

历史语音生成

MOSS-TTS 是我们最新的旗舰级文本转语音模型,提供高保真的音色克隆能力,能够精准复现说话人的身份特征、语气与韵律,生成自然、生动且富有表现力的语音。

ENDPOINT

POST /v1/audio/speech

当前调用路径

输入

文本 + voice_id

请求可接受的内容

输出

音频

成功返回的内容

模型概览

单人文本转语音模型。默认使用稳定模型 ID moss-tts-1.0-pro;如需复现固定版本,可在 model 中传 moss-tts-1.0-pro-2026-02-07。

计费

本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。

项目单价说明
模型调用见计费标准按实际请求与输出统计,以控制台账单为准。

模态支持

文本仅输入
音频仅输出
图片不支持
视频不支持

支持的 Endpoint

单人语音生成/v1/audio/speech支持
多人对话语音生成/v1/audio/speech/speakers不支持
音频转写/v1/audio/transcriptions不支持
音色设计/v1/audio/voice/generations不支持
多模态理解/v1/responses不支持

能力

性能
推理速度
流式 不支持
异步 支持
  • 65,536 上下文窗口长度
  • 最大输出45,000个Token
  • 支持15+种多语言
  • 支持音素级发音控制&Token级时长控制

版本与快照

Model IDmoss-tts-1.0-pro
快照moss-tts-1.0-pro-2026-02-07最新版本