控制台

模型列表MOSS-Transcribe-Diarize-Pro

MOSS-Transcribe-Diarize-Pro

推荐语音识别

MOSS-Transcribe-Diarize-Pro 是一款能够同时输出高精度转写文本、说话人身份及其对应时间戳的模型,适用于会议、访谈、播客以及影视内容等多说话人场景。

ENDPOINT

POST /v1/audio/transcriptions

当前调用路径

输入

音频

请求可接受的内容

输出

文本

成功返回的内容

模型概览

多说话人转写模型,最长支持 60 分钟音频。调用时使用 model ID moss-transcribe-diarize-pro,服务端始终提供最新版本。

计费

计费方式人民币价格实际扣除
按输入音视频时长¥2.00 / 小时40 积分 / 小时

单次调用按实际用量计算,人民币金额用于价格理解,最终以积分账单为准。 查看完整计费标准

模态支持

文本仅输出
音频仅输入
图片不支持
视频不支持

支持的 Endpoint

单人语音生成/v1/audio/speech不支持
多人对话语音生成/v1/audio/speech/speakers不支持
音频转写/v1/audio/transcriptions支持
音色设计/v1/audio/voice/generations不支持
多模态理解/v1/responses不支持

能力

性能
推理速度
流式 支持
异步 支持
  • 最长支持60分钟音频
  • 超长上下文—32k
  • 最大输出长度—16k
  • 强大的抗噪与重叠音频处理能力
  • 支持热词增强,适合专有名词、人名、品牌名和业务术语识别

版本与快照

Model IDmoss-transcribe-diarize-pro