控制台

模型列表MOSS-VL

MOSS-VL

最新多模态理解

MOSS-VL 支持文本指令与图片、视频或多图输入,可用于图片理解、视频理解、OCR、文档解析、视觉问答和跨媒体内容分析。当前每次请求最多支持 5 张图片或 1 个视频,不支持图片与视频混合输入。

ENDPOINT

POST /v1/responses

当前调用路径

输入

文本 + 图片 / 视频

请求可接受的内容

输出

文本

成功返回的内容

模型概览

多模态理解模型。默认使用稳定模型 ID moss-vl-1.0;如需复现固定版本,可在 model 中传 moss-vl-1.0-2026-07-08。

计费

本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。

项目单价说明
模型调用见计费标准按实际请求与输出统计,以控制台账单为准。

模态支持

文本输入与输出
音频不支持
图片仅输入
视频仅输入

支持的 Endpoint

单人语音生成/v1/audio/speech不支持
多人对话语音生成/v1/audio/speech/speakers不支持
音频转写/v1/audio/transcriptions不支持
音色设计/v1/audio/voice/generations不支持
多模态理解/v1/responses支持

能力

性能
推理速度
流式 不支持
异步 不支持
  • 支持图片描述、OCR 与文档内容理解
  • 支持视频摘要、事件理解与问答
  • 单次最多 5 张图片或 1 个视频
  • 支持文件 ID 和 URL 输入

版本与快照

Model IDmoss-vl-1.0
快照moss-vl-1.0-2026-07-08最新版本