MOSS-Transcribe-Diarize-Pro
推荐语音识别MOSS-Transcribe-Diarize-Pro 是一款能够同时输出高精度转写文本、说话人身份及其对应时间戳的模型,适用于会议、访谈、播客以及影视内容等多说话人场景。
ENDPOINT
POST /v1/audio/transcriptions
当前调用路径
输入
音频
请求可接受的内容
输出
文本
成功返回的内容
模型概览
多说话人转写模型,最长支持 60 分钟音频。调用时使用 model ID moss-transcribe-diarize-pro,服务端始终提供最新版本。
计费
计费方式人民币价格实际扣除
按输入音视频时长
¥2.00 / 小时40 积分 / 小时单次调用按实际用量计算,人民币金额用于价格理解,最终以积分账单为准。 查看完整计费标准
模态支持
文文本仅输出
音音频仅输入
图图片不支持
视视频不支持
支持的 Endpoint
单人语音生成
/v1/audio/speech不支持多人对话语音生成
/v1/audio/speech/speakers不支持音频转写
/v1/audio/transcriptions支持音色设计
/v1/audio/voice/generations不支持多模态理解
/v1/responses不支持能力
性能高
推理速度中
流式 支持
异步 支持
- 最长支持60分钟音频
- 超长上下文—32k
- 最大输出长度—16k
- 强大的抗噪与重叠音频处理能力
- 支持热词增强,适合专有名词、人名、品牌名和业务术语识别
版本与快照
Model ID
moss-transcribe-diarize-pro