图片与视频理解
使用 MOSS-VL 理解图片或视频,并以 Responses API 对象返回文本结果。每次请求必须同时包含文本指令和媒体。
Endpoint
POST
/v1/responses模型名称
moss-vl-1.0创建 API Key
进入API Key 管理平台创建 API Key,并保存为环境变量。不要写进客户端代码或提交到仓库。
环境变量 MOSS_API_KEY=<your_api_key_here>准备请求输入
准备一条非空文本指令,并选择图片或视频的
file_id,或服务端可访问的公网/签名 URL;同一次请求不能混合传入图片和视频。字段类型要求说明moss-vl-1.0;如需锁定快照,可使用 moss-vl-1.0-2026-07-08
必须包含一条 user 消息,content 中同时包含 input_text 和有效媒体
控制最大输出 Token 数
请求体 { "model": "moss-vl-1.0", "input": [ { "role": "user", "content": [ { "type": "input_text", "text": "请描述图片中的主要内容。" }, { "type": "input_image", "file_id": "<image_file_id>" } ] } ], "max_output_tokens": 1024 }发起第一次请求
向
/v1/responses发起 JSON 请求。接口同步返回 Responses API 对象,当前输出为文本。请求示例 curl https://api.mosi.cn/v1/responses \ -H "Authorization: Bearer $MOSS_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "moss-vl-1.0", "input": [ { "role": "user", "content": [ { "type": "input_text", "text": "请描述图片中的主要内容。" }, { "type": "input_image", "file_id": "<image_file_id>" } ] } ], "max_output_tokens": 1024 }'读取响应结果
请求完成后读取
output[].content[].text。如果返回status=incomplete,说明输出可能被max_output_tokens截断。核心结果字段示例 { "status": "completed", "output": [ { "type": "message", "role": "assistant", "content": [ { "type": "output_text", "text": "图片中有四颗坚果。" } ] } ] }验证成功
成功标准:响应状态为
completed,且output[].content[].text中包含模型生成的文本结果。