MOSS-TTSD
最新语音生成MOSS-TTSD(text to spoken dialogue)是一个开源的中英双语口语对话合成模型,可以将包含两位说话人的对话脚本转换为自然、富有表现力的对话语音。MOSS-TTSD支持双说话人零样本音色克隆与长时间单段语音生成,非常适合播客,访谈,聊天等对话场景。
ENDPOINT
POST /v1/audio/speech/speakers
当前调用路径
输入
文本
请求可接受的内容
输出
音频
成功返回的内容
模型概览
多人对话语音合成模型。默认使用稳定模型 ID moss-ttsd-1.0;如需复现固定版本,可在 model 中传 moss-ttsd-1.0-2026-03-20。
计费
本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。
项目单价说明
模型调用
见计费标准按实际请求与输出统计,以控制台账单为准。模态支持
文文本仅输入
音音频仅输出
图图片不支持
视视频不支持
支持的 Endpoint
单人语音生成
/v1/audio/speech不支持多人对话语音生成
/v1/audio/speech/speakers支持音频转写
/v1/audio/transcriptions不支持音色设计
/v1/audio/voice/generations不支持多模态理解
/v1/responses不支持能力
性能高
推理速度中
流式 不支持
异步 支持
- 最大输出长度—40分钟音频
- 零样本双说话人克隆
版本与快照
Model ID
moss-ttsd-1.0快照
moss-ttsd-1.0-2026-03-20最新版本