控制台

模型列表MOSS-TTSD

MOSS-TTSD

最新语音生成

MOSS-TTSD(text to spoken dialogue)是一个开源的中英双语口语对话合成模型,可以将包含两位说话人的对话脚本转换为自然、富有表现力的对话语音。MOSS-TTSD支持双说话人零样本音色克隆与长时间单段语音生成,非常适合播客,访谈,聊天等对话场景。

ENDPOINT

POST /v1/audio/speech/speakers

当前调用路径

输入

文本

请求可接受的内容

输出

音频

成功返回的内容

模型概览

多人对话语音合成模型。默认使用稳定模型 ID moss-ttsd-1.0;如需复现固定版本,可在 model 中传 moss-ttsd-1.0-2026-03-20。

计费

本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。

项目单价说明
模型调用见计费标准按实际请求与输出统计,以控制台账单为准。

模态支持

文本仅输入
音频仅输出
图片不支持
视频不支持

支持的 Endpoint

单人语音生成/v1/audio/speech不支持
多人对话语音生成/v1/audio/speech/speakers支持
音频转写/v1/audio/transcriptions不支持
音色设计/v1/audio/voice/generations不支持
多模态理解/v1/responses不支持

能力

性能
推理速度
流式 不支持
异步 支持
  • 最大输出长度—40分钟音频
  • 零样本双说话人克隆

版本与快照

Model IDmoss-ttsd-1.0
快照moss-ttsd-1.0-2026-03-20最新版本