MOSS-VL
最新多模态理解MOSS-VL 支持文本指令与图片、视频或多图输入,可用于图片理解、视频理解、OCR、文档解析、视觉问答和跨媒体内容分析。当前每次请求最多支持 5 张图片或 1 个视频,不支持图片与视频混合输入。
ENDPOINT
POST /v1/responses
当前调用路径
输入
文本 + 图片 / 视频
请求可接受的内容
输出
文本
成功返回的内容
模型概览
多模态理解模型。默认使用稳定模型 ID moss-vl-1.0;如需复现固定版本,可在 model 中传 moss-vl-1.0-2026-07-08。
计费
本页面不写入设计占位价格;实际计费单位和单价以控制台计费标准与账单为准。
项目单价说明
模型调用
见计费标准按实际请求与输出统计,以控制台账单为准。模态支持
文文本输入与输出
音音频不支持
图图片仅输入
视视频仅输入
支持的 Endpoint
单人语音生成
/v1/audio/speech不支持多人对话语音生成
/v1/audio/speech/speakers不支持音频转写
/v1/audio/transcriptions不支持音色设计
/v1/audio/voice/generations不支持多模态理解
/v1/responses支持能力
性能高
推理速度中
流式 不支持
异步 不支持
- 支持图片描述、OCR 与文档内容理解
- 支持视频摘要、事件理解与问答
- 单次最多 5 张图片或 1 个视频
- 支持文件 ID 和 URL 输入
版本与快照
Model ID
moss-vl-1.0快照
moss-vl-1.0-2026-07-08最新版本