MOSS-Transcribe
最新语音识别MOSS-Transcribe-1.0 是一款能够输出高精度转写文本的模型,能够应对老人、小孩等不同年龄段及音色特征的说话人,适用于会议、访谈、播客以及影视内容等场景,确保在复杂语音环境下依然能提供清晰、准确的转写结果。
ENDPOINT
POST /v1/audio/transcriptions
当前调用路径
输入
音频
请求可接受的内容
输出
文本
成功返回的内容
模型概览
普通音频转写模型。默认使用稳定模型 ID moss-transcribe-1.0;如需复现固定版本,可在 model 中传 moss-transcribe-1.0-2026-07-22。
计费
本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。
项目单价说明
模型调用
见计费标准按实际请求与输出统计,以控制台账单为准。模态支持
文文本仅输出
音音频仅输入
图图片不支持
视视频不支持
支持的 Endpoint
单人语音生成
/v1/audio/speech不支持多人对话语音生成
/v1/audio/speech/speakers不支持音频转写
/v1/audio/transcriptions支持音色设计
/v1/audio/voice/generations不支持多模态理解
/v1/responses不支持能力
性能高
推理速度中
流式 不支持
异步 支持
- 高精度转写:提供高质量文本转录结果
- 多音色适配:精准识别不同音色、语调及发音特征的说话人
- 多场景适用:覆盖会议、访谈、播客及影视等多样场景
版本与快照
Model ID
moss-transcribe-1.0快照
moss-transcribe-1.0-2026-07-22最新版本