API 平台

多人对话语音生成

将多角色对话文本合成为完整对话音频,适合播客、角色扮演、有声书和课程对话。

操作流程

POST /v1/audio/speech/speakers

Endpoint

moss-ttsd

模型

  1. 创建 API Key

    进入 API Key 管理平台,创建 API Key,并保存为环境变量。不要把 API Key 写进客户端代码或提交到仓库。

    示例
    export MOSS_API_KEY="<your-api-key>"
    
  2. 准备请求输入

    model 指定模型,用 speakers 声明每个说话人(id + 已创建的 voice_id),再用 segments 按说话人分句给出台词。

    speakers:说话人 id 与 voice_id 的映射 segments:按说话人分句的台词 delivery_method 与 response_format:控制返回 URL 或音频

    request.json
    {
      "model": "moss-ttsd",
      "speakers": [
        { "id": "A", "voice_id": "<speaker_a_voice_id>" },
        { "id": "B", "voice_id": "<speaker_b_voice_id>" }
      ],
      "segments": [
        { "speaker": "A", "text": "今天进度如何?" },
        { "speaker": "B", "text": "已经完成接口联调。" }
      ],
      "delivery_method": "url",
      "response_format": "mp3"
    }
    
  3. 发起第一次请求

    POST /v1/audio/speech/speakers 发起请求。delivery_method=url 时同步返回 JSON 和结果 URL。

    curl https://api.mosi.cn/v1/audio/speech/speakers \
      -H "Authorization: Bearer $MOSS_API_KEY" \
      -H "Content-Type: application/json" \
      -d @request.json
    
  4. 获取结果

    delivery_method=url 时,从同步响应的 JSON 中读取结果 URL。如果任务较长,可传 async=truewebhook_url 创建异步任务,再用返回的 task_id 查询。

    查询任务
    curl https://api.mosi.cn/v1/audio/tasks/$TASK_ID \
      -H "Authorization: Bearer $MOSS_API_KEY"
    
  5. 验证成功

    成功标志:拿到完整对话音频(delivery_method=audio)或结果 URL(delivery_method=url),可下载或播放。

下一步