控制台

模型列表MOSS-Transcribe

MOSS-Transcribe

最新语音识别

MOSS-Transcribe-1.0 是一款能够输出高精度转写文本的模型,能够应对老人、小孩等不同年龄段及音色特征的说话人,适用于会议、访谈、播客以及影视内容等场景,确保在复杂语音环境下依然能提供清晰、准确的转写结果。

ENDPOINT

POST /v1/audio/transcriptions

当前调用路径

输入

音频

请求可接受的内容

输出

文本

成功返回的内容

模型概览

普通音频转写模型。默认使用稳定模型 ID moss-transcribe-1.0;如需复现固定版本,可在 model 中传 moss-transcribe-1.0-2026-07-22。

计费

本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。

项目单价说明
模型调用见计费标准按实际请求与输出统计,以控制台账单为准。

模态支持

文本仅输出
音频仅输入
图片不支持
视频不支持

支持的 Endpoint

单人语音生成/v1/audio/speech不支持
多人对话语音生成/v1/audio/speech/speakers不支持
音频转写/v1/audio/transcriptions支持
音色设计/v1/audio/voice/generations不支持
多模态理解/v1/responses不支持

能力

性能
推理速度
流式 不支持
异步 支持
  • 高精度转写:提供高质量文本转录结果
  • 多音色适配:精准识别不同音色、语调及发音特征的说话人
  • 多场景适用:覆盖会议、访谈、播客及影视等多样场景

版本与快照

Model IDmoss-transcribe-1.0
快照moss-transcribe-1.0-2026-07-22最新版本