MOSS-VL-Realtime
Beta多模态理解MOSS-VL-Realtime 通过一条 WebSocket 连接持续接收 JPEG、PNG 或 WebP 图像帧,并返回增量文本回答,适用于摄像头、屏幕等持续画面理解场景。
ENDPOINT
WebSocket /v1/realtime
当前调用路径
输入
连续图片帧 + 文本
请求可接受的内容
输出
增量文本
成功返回的内容
模型概览
实时视频理解模型,Beta。连接时在 model 查询参数中使用 moss-vl-realtime-1.0;如需固定版本,使用 moss-vl-realtime-1.0-2026-09-09。
计费
限时免费。
0 积分 查看完整计费标准
模态支持
文文本输入与输出
音音频不支持
图图片仅输入
视视频不支持
支持的 Endpoint
单人语音生成
/v1/audio/speech不支持多人对话语音生成
/v1/audio/speech/speakers不支持音频转写
/v1/audio/transcriptions不支持音色设计
/v1/audio/voice/generations不支持多模态理解
/v1/responses不支持实时视频理解
/v1/realtime支持能力
性能高
推理速度实时交互
流式 支持
异步 不支持
- WebSocket 双向事件协议
- 支持 JPEG、PNG、WebP 图像帧
- 支持静默、打断与多段回答
- 支持会话级 Token 用量上报
- 不支持完整视频文件、音频输入或语音输出
版本与快照
Model ID
moss-vl-realtime-1.0快照
moss-vl-realtime-1.0-2026-09-09最新版本