API 平台

多说话人转写

将多说话人音频转为带说话人信息的转写结果,适合会议、访谈和播客。

操作流程

POST /v1/audio/transcriptions

Endpoint

moss-transcribe-diarize

模型

  1. 创建 API Key

    进入 API Key 管理平台,创建 API Key,并保存为环境变量。不要把 API Key 写进客户端代码或提交到仓库。

    示例
    export MOSS_API_KEY="<your-api-key>"
    
  2. 准备请求输入

    多说话人转写复用转写 endpoint:把 model 指定为 moss-transcribe-diarize 并传 diarize=true,给出待转写的多说话人音频。

    file / file_id / url / audio_url:待转写音频 model:moss-transcribe-diarize diarize:true

    request.json
    {
      "model": "moss-transcribe-diarize",
      "file_id": "<file_id>",
      "diarize": true,
      "response_format": "json"
    }
    
  3. 发起第一次请求

    POST /v1/audio/transcriptions 发起请求,同步请求直接返回带说话人信息的转写结果。

    curl https://api.mosi.cn/v1/audio/transcriptions \
      -H "Authorization: Bearer $MOSS_API_KEY" \
      -H "Content-Type: application/json" \
      -d @request.json
    
  4. 获取结果

    同步请求直接返回结果。如果传了 async=true,接口会先返回 task_id,再用它查询转写任务。

    查询转写任务
    curl https://api.mosi.cn/v1/audio/transcriptions/$TASK_ID \
      -H "Authorization: Bearer $MOSS_API_KEY"
    
  5. 验证成功

    成功标志:拿到带说话人信息的转写结果。成功响应可包含 segments,每个 segment 含 startendtextspeaker

下一步