帮你快速理解、总结文档立即下载

语音模型调用概览

最近更新时间:2026-09-24 21:20:30
我的收藏

概述

TokenHub 语音模型提供语音识别、语音合成、音色复刻与设计、AI 配音、音乐生成等能力,覆盖从音频输入到多模态输出的完整链路。本文为各能力的快速导航与模型选型指引。

模型支持的协议概览

说明:
各接口的详细参数、请求示例与返回字段请跳转对应文档查阅。计费说明请参阅 TokenHub 模型价格说明。
能力分类
模型名称
简要说明
model 参数值
接口类型
端点
详细调用指南
语音识别
WAND 同步 ASR
实时将短音频转写为文字,低延迟同步返回识别结果。
wand-asr-v1
同步
/v1/wand/asrproxy/sync_transcribe
WAND 异步 ASR
适用于长音频文件转写,提交任务后轮询获取结果。
wand-asr-v1
异步
/v1/wand/wx-asr/async-asr
语音合成
MiniMax-Speech-2.8-HD
高保真语音合成,音质细腻自然,适合对音质要求高的场景。
minimax-speech-2.8-hd
同步
/v1/wand/minimax-tts/sync-tts
MiniMax-Speech-2.8-Turbo
在音质与速度间取得平衡,合成更快,适合实时或对时延敏感的场景。
minimax-speech-2.8-turbo
同步
/v1/wand/minimax-tts/sync-tts
MiniMax-Speech-2.6-HD
高保真语音合成,音质细腻自然。
minimax-speech-2.6-hd
同步
/v1/wand/minimax-tts/sync-tts
MiniMax-Speech-2.6-Turbo
平衡音质与合成速度,适合对时延有一定要求的场景。
minimax-speech-2.6-turbo
同步
/v1/wand/minimax-tts/sync-tts
MiniMax-Speech-02-HD
高保真语音合成,音质细腻自然。
minimax-speech-02-hd
同步
/v1/wand/minimax-tts/sync-tts
MiniMax-Speech-02-Turbo
平衡音质与合成速度,适合对时延有一定要求的场景。
minimax-speech-02-turbo
同步
/v1/wand/minimax-tts/sync-tts
MiniMax 音色复刻
通过一段参考音频快速复刻出相似音色,用于个性化 TTS 合成。
试听模型取 minimax-speech-* 系列
同步
/v1/wand/minimax-tts/sync_clone
MiniMax 音色设计
通过文本描述(prompt)生成全新音色,无需参考音频即可试听。
minimax-voice-design
同步
/v1/wand/minimax-tts/sync_design
AI 配音
WAND AI 配音 V1
视频翻译、克隆配音,将原音替换为目标语言音色。
wand-dubbing-clone-v1
异步
/v1/wand/dubbing/async_generation
WAND AI 配音 V2
视频翻译、克隆配音,效果与稳定性升级的 V2 版本。
wand-dubbing-clone-v2
异步
/v1/wand/dubbing/async_generation
音乐生成
MiniMax 音乐生成
歌曲生成(人声)/ 纯音乐 / 自动写词
minimax-music-v2.6
同步
/v1/wand/minimax-music/generation
歌曲生成(人声)/ 纯音乐 / 自动写词
minimax-music-v3.0
同步
/v1/wand/minimax-music/generation
Mureka 音乐生成
歌词生成歌曲 / 提示词生成歌曲 / 生成纯音乐
mureka-music-v9
同步
v1/wand/mureka-music/generation