控制台

模型列表MOSS-VL-Realtime

MOSS-VL-Realtime

Beta多模态理解

MOSS-VL-Realtime 通过一条 WebSocket 连接持续接收 JPEG、PNG 或 WebP 图像帧,并返回增量文本回答,适用于摄像头、屏幕等持续画面理解场景。

ENDPOINT

WebSocket /v1/realtime

当前调用路径

输入

连续图片帧 + 文本

请求可接受的内容

输出

增量文本

成功返回的内容

模型概览

实时视频理解模型,Beta。连接时在 model 查询参数中使用 moss-vl-realtime-1.0;如需固定版本,使用 moss-vl-realtime-1.0-2026-09-09。

计费

限时免费。

0 积分 查看完整计费标准

模态支持

文文本输入与输出
音音频不支持
图图片仅输入
视视频不支持

支持的 Endpoint

单人语音生成/v1/audio/speech不支持
多人对话语音生成/v1/audio/speech/speakers不支持
音频转写/v1/audio/transcriptions不支持
音色设计/v1/audio/voice/generations不支持
多模态理解/v1/responses不支持
实时视频理解/v1/realtime支持

能力

性能高
推理速度实时交互
流式 支持
异步 不支持
  • WebSocket 双向事件协议
  • 支持 JPEG、PNG、WebP 图像帧
  • 支持静默、打断与多段回答
  • 支持会话级 Token 用量上报
  • 不支持完整视频文件、音频输入或语音输出

版本与快照

Model IDmoss-vl-realtime-1.0
快照moss-vl-realtime-1.0-2026-09-09最新版本