MOSS-TTS-v1.0-Pro
历史语音生成MOSS-TTS 是我们最新的旗舰级文本转语音模型,提供高保真的音色克隆能力,能够精准复现说话人的身份特征、语气与韵律,生成自然、生动且富有表现力的语音。
ENDPOINT
POST /v1/audio/speech
当前调用路径
输入
文本 + voice_id
请求可接受的内容
输出
音频
成功返回的内容
模型概览
单人文本转语音模型。默认使用稳定模型 ID moss-tts-1.0-pro;如需复现固定版本,可在 model 中传 moss-tts-1.0-pro-2026-02-07。
计费
本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。
项目单价说明
模型调用
见计费标准按实际请求与输出统计,以控制台账单为准。模态支持
文文本仅输入
音音频仅输出
图图片不支持
视视频不支持
支持的 Endpoint
单人语音生成
/v1/audio/speech支持多人对话语音生成
/v1/audio/speech/speakers不支持音频转写
/v1/audio/transcriptions不支持音色设计
/v1/audio/voice/generations不支持多模态理解
/v1/responses不支持能力
性能高
推理速度中
流式 不支持
异步 支持
- 65,536 上下文窗口长度
- 最大输出45,000个Token
- 支持15+种多语言
- 支持音素级发音控制&Token级时长控制
版本与快照
Model ID
moss-tts-1.0-pro快照
moss-tts-1.0-pro-2026-02-07最新版本