Model List
Current models cover speech generation, speech recognition, and multimodal understanding. model selects the capability. To pin a version, pass a snapshot model ID as model.
Model nameDescriptionPricingStreaming outputAsync
moss-tts-1.5-flashRecommendedsnapshot: moss-tts-1.5-flash-2026-06-26Single-speaker text-to-speech model · Text + voice_id → AudioPOST /v1/audio/speechCNY 2.00 / 10K characters40 credits / 10K characters✓✓moss-tts-1.0-proLegacysnapshot: moss-tts-1.0-pro-2026-02-07Single-speaker text-to-speech model · Text + voice_id → AudioPOST /v1/audio/speechCNY 2.00 / 10K characters40 credits / 10K characters—✓moss-ttsd-1.0Latestsnapshot: moss-ttsd-1.0-2026-03-20Multi-speaker dialogue speech synthesis model · Text → AudioPOST /v1/audio/speech/speakersCNY 2.00 / 10K characters40 credits / 10K characters—✓moss-voice-generator-1.0Latestsnapshot: moss-voice-generator-1.0-2026-07-22Generate speech from text and voice instructions · Text + instruction → AudioPOST /v1/audio/voice/generationsCNY 2.00 / 10K characters40 credits / 10K characters—✓moss-transcribe-1.0Latestsnapshot: moss-transcribe-1.0-2026-07-22Standard audio transcription model · Audio → TextPOST /v1/audio/transcriptionsCNY 0.80 / hour16 credits / hour—✓moss-transcribe-diarize-proRecommendedsnapshot: moss-transcribe-diarize-pro-2026-07-03Multi-speaker transcription model, supports audio up to 60 minutes · Audio → TextPOST /v1/audio/transcriptionsCNY 2.00 / hour40 credits / hour✓✓moss-vl-1.0Betasnapshot: moss-vl-1.0-2026-07-08Multimodal understanding model, Beta · Text instructions + image/video → TextPOST /v1/responsesFree for a limited time0 credits——