语言模型
模型名称 | model(调用参数) | 能力支持 | 上下文窗口 (Token) | 最大输入 (Token) | 最大输出 (Token) |
Hy3 | hy3 | 深度思考(保留式思考) 结构化输出 Function Calling Cache 缓存 | 256k | 192k | 128k |
Hy3 preview (2026-08-31下线) | hy3-preview | 深度思考(交错式思考) 结构化输出 Function Calling Cache 缓存 | 256k | 192k | 128k |
Hy-MT2-Pro | hy-mt2-pro | 混元翻译旗舰模型,适合专业领域等对译文质量要求高的场景 | 8k | 4k | 4k |
Hy-MT2-Plus | hy-mt2-plus | 混元翻译模型,翻译效果领先,有优秀的指令遵循能力 | 8k | 4k | 4k |
Hy-MT2-Lite | hy-mt2-lite | 混元翻译轻量级模型,适合对耗时有高要求的场景 | 8k | 4k | 4k |
Hy-Role-Latest | hunyuan-role-latest | 角色扮演模型 深度优化聊天体验与剧情互动 | 32k | 28k | 4k |
Hy-Role | hy-role | 角色扮演模型 贴合各种人设、剧情演绎 | 32k | 28k | 4k |
DeepSeek-V4-Flash 0731 正式版 原厂直供 | deepseek-v4-flash-202605 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Pro 0813 正式版 原厂直供 | deepseek-v4-pro-202606 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Flash | deepseek-v4-flash | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Pro | deepseek-v4-pro | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
GLM-5.2 | glm-5.2 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 128k |
GLM-5.1 | glm-5.1 | 深度思考 结构化输出 Function Calling Cache 缓存 | 200k | 200k | 128k |
GLM-5V-Turbo | glm-5v-turbo | 深度思考 结构化输出 Function Calling Cache 缓存 | 200k | 200k | 128k |
GLM-5-Turbo | glm-5-turbo | 深度思考 结构化输出 Function Calling Cache 缓存 | 200k | 200k | 128k |
GLM-5 | glm-5 | 深度思考 Function Calling Cache 缓存 | 200k | 200k | 128k |
Kimi K2.7 Code HighSpeed | kimi-k2.7-code-highspeed | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 256k | 256k |
Kimi K3 | kimi-k3 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 1M |
Kimi K2.7 Code | kimi-k2.7-code | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 256k | 256k |
Kimi-K2.6 | kimi-k2.6 | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 256k | 256k |
Kimi-K2.5 | kimi-k2.5 | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 256k | 256k |
MiniMax-M3 | minimax-m3 | 深度思考 Function Calling Cache 缓存 | 1M | 1M | - |
MiniMax-M2.7 | minimax-m2.7 | 深度思考 Function Calling Cache 缓存 | 200k | 200k | 128k |
Qwen3.5-Flash | qwen3.5-flash | 深度思考 Function Calling Cache 缓存 | 991k | 983k | 64k |
Qwen3.5-Plus | qwen3.5-plus | 深度思考 Function Calling Cache 缓存 | 991k | 983k | 64k |
MiMo-V2.5-Pro | mimo-v2.5-pro | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 128k |
视觉模型
图像生成
模型名称 | model(调用参数) | 模型介绍 | 任务类型 | 默认并发数 |
Hy-Image-3.0 | hy-image-v3 | 混元 Image-3.0 生图模型,能够去思考图像的布局、构图、笔触,利用世界知识去推理常识性的画面。同时可以解析千字级别的复杂语义,生成长文本文字、复杂漫画、表情包,还能生成生动有趣的科普插画。 | 文生图 图生图 | 5 |
Vidu-Image-q2 | vidu-image-q2 | 支持参考生图、文生图、图片编辑,对中英文字的精准渲染、UI/图表等设计细节的像素级还原,适合制作海报、信息图等。 | 文生图 图生图 | 5 |
HY-Image-V3.0 (2026-09-15下线) | hy-image-v3.0 | 基于混元大模型,能够思考图像的布局、构图、笔触,利用世界知识去推理常识性的画面。同时可以解析千字级别的复杂语义,支持生成长文本文字、漫画、表情包等内容。 | 文生图 图生图 | 1 |
HY-Image-Lite (2026-09-15下线) | hy-image-lite | 采用超高压缩编解码器,实现图像生成快速响应与高品质输出。适用于电商、设计、游戏等场景。 | 文生图 | 1 |
视频生成
模型名称 | model(调用参数) | 模型介绍 | 任务类型 | 默认并发数 |
MiniMax-Video-H3 | minimax-video-h3 | 原生多模态理解与生成:支持文字、图片、音频、视频多种输入输出,完成一体化内容创作; 多模态精准编辑与控制:支持替换、参考等细节修改,让内容调整更可控; 商用级多场景内容生成:覆盖影视、广告、游戏、品牌、电商等高频场景,支持内容生产交付。 | 文生视频 图生视频 参考生视频 | 5 |
MiniMax-Video-v2.3 | minimax-video-v2.3 | Minimax-v2.3生视频模型,在肢体动作自然度、风格化表现力与角色微表情刻画上大幅提升,物理运动表现较好、复杂指令遵循能力强,适用于广告营销、创意短片与数字人内容制作。 | 文生视频 图生视频 | 5 |
MiniMax-Video-v2.3-fast | minimax-video-v2.3-fast | Minimax-v2.3-fast 生视频模型,通过推理优化在保持核心画质表现的同时提升生成速度、降低调用成本,适用于对时效要求高的营销素材批量生产与快速迭代场景。 | 文生视频 图生视频 | 5 |
Kling-Video-V3 | kling-video-v3 | 可灵 V3 生视频模型,支持智能分镜与15秒长视频生成,最高4K Ultra 画质输出,可实现场景切换与连续叙事,适用于企业广告营销与专业影视创作。 | 文生视频 图生视频 | 5 |
Kling-Video-V3-omni | kling-video-v3-omni | Kling 3.0 Omni 是可灵 3.0 系列的全能多模态视频模型,支持文本、图片、视频等输入,具备角色语音驱动、原生音频输出和分镜叙事能力,适合复杂故事化视频、多主体一致性和音画同步创作。 | 文生视频 图生视频 参考生视频 | 5 |
Kling-Video-V3-turbo | kling-video-v3-turbo | 可灵 3.0 系列的高性价比快速版本,支持文本和图片输入,在保持稳定生成效果的同时提升生成效率,适合快速出片、营销短片、创意预览和成本敏感的视频生产场景。 | 文生视频 图生视频 | 5 |
Kling-Video-V2.6 | kling-video-v2.6 | 可灵 V2.6 生视频模型,支持画面与语音、音效、环境音同步生成,运动控制能力增强,适用于有声广告、短视频与多媒体内容创作。 | 文生视频 图生视频 | 5 |
Kling-Video-V2.5-turbo | kling-video-v2.5-turbo | 最新可灵 V2.5-turbo 生视频模型。支持文本与图像输入,在生成稳定性与创意想象力上全面升级,兼顾高性能与高性价比,适用于大批量视频生成与企业级内容生产。 | 文生视频 图生视频 | 5 |
Kling-Video-O1 | kling-video-o1 | 可灵统一视频模型,支持文本、图片等多模态输入,能够通过自然语言统一理解复杂创作指令,适合多模态参考、主体一致性、复杂场景生成和高一致性视频创作。 | 文生视频 图生视频 参考生视频 | 5 |
Kling-Video-v3 (2026-09-15下线) | kl-video-v3 | 支持智能分镜与15秒长视频生成,可实现场景切换与连续叙事,适用于企业广告营销与影视创作。 | 文生视频 图生视频 | 5 |
Kling-Video-v2.6 (2026-09-15下线) | kl-video-v2-6 | 支持画面与语音、音效、环境音同步生成,适用于有声广告、短视频与多媒体内容创作。 | 文生视频 图生视频 | 5 |
Kling-Video-v2.5-turbo (2026-09-15下线) | kl-video-v2-5-turbo | 支持文本与图像输入,兼顾性能与性价比,适用于大批量视频生成。 | 文生视频 图生视频 | 5 |
Kling-Video-v2.1-master (2026-09-15下线) | kl-video-v2-1-master | 支持文本与图像输入,面向专业创作场景深度优化,1080P 适用于影视短片与精品内容制作。 | 文生视频 图生视频 | 5 |
Kling-Video-v2.1 (2026-09-15下线) | kl-video-v2-1 | 支持图像输入,提供标准/高质量/大师三档质量模式,适用于大规模图生视频业务场景。 | 文生视频 图生视频 | 5 |
Kling-Video-v2-master (2026-09-15下线) | kl-video-v2-master | 支持文本与图像输入,适用于品牌广告与创意内容制作。 | 文生视频 图生视频 | 5 |
Kling-Video-v1.6 (2026-09-15下线) | kl-video-v1-6 | 支持文本、图像及多图参考输入,提供标准与高品质双模式,适用于多角色交互与复杂场景的视频创作。 | 文生视频 图生视频 | 5 |
Kling-Video-v1.5 (2026-09-15下线) | kl-video-v1-5 | 支持图像输入生成1080P 视频,适用于产品展示与创意内容场景。 | 文生视频 图生视频 | 5 |
Kling-Video-v1 (2026-09-15下线) | kl-video-v1 | 支持文本与图像输入生成最高1080P 视频,覆盖通用视频生成基础能力,适用于内容创作与营销素材生产。 | 文生视频 图生视频 | 5 |
Vidu-Video-q3.0-pro | vidu-video-q3-pro | Vidu-q3.0-pro 生视频模型,在音视频一体生成基础上全面强化,画面保真度、音画同步精度与多角色叙事连贯性均达到更高水准,可一次生成16秒1080P 音视频直出成片,适用于对画质与声音表现有要求的短剧、广告与专业影视内容制作。 | 文生视频 图生视频 | 5 |
Vidu-Video-q3.0-turbo | vidu-video-q3-turbo | Vidu-q3.0-turbo 生视频模型,以更快生成速度和更低调用成本实现16秒音视频直出,适用于规模化内容生产与高频迭代场景。 | 文生视频 图生视频 参考生视频 | 5 |
Vidu-Video-q3.0 | vidu-video-q3 | 支持参考生视频能力,可基于多张参考图和提示词生成主体一致的视频,支持智能切镜和音画同出,多机位一致性更好,适合多图参考、主体保持和复杂场景视频创作。 | 文生视频 图生视频 参考生视频 | 5 |
Vidu-Video-q2.0 | vidu-video-q2 | Vidu-q2.0生视频模型,以细腻人物表情生成为核心能力,支持图像与首尾帧输入,可实现微表情与演技级动态刻画,时长2-8秒可选,适用于数字人、人物特写与情感表达类内容创作。 | 文生视频 图生视频 参考生视频 | 5 |
Vidu-Video-q2.0-pro | vidu-video-q2-pro | Vidu-q2.0-pro 生视频模型,支持文本、图像、参考图等多模态输入,在表情还原度、运镜流畅性与语义理解深度上全面增强,可呈现电影级短片效果,适用于高品质广告与专业内容创作。 | 文生视频 图生视频 参考生视频 | 5 |
Vidu-Video-q2.0-turbo | vidu-video-q2-turbo | Vidu-q2.0-turbo 生视频模型,以生成速度与最低调用成本为核心优势,适用于大规模批量生产与快速原型验证场景。 | 文生视频 图生视频 | 5 |
Vidu-Video-q3-pro (2026-09-15下线) | vd-video-q3-pro | 画面保真度、音画同步精度与多角色叙事连贯性提升,可一次生成16秒1080P 音视频直出成片,适用于对画质与声音表现要求高的专业创作。 | 文生视频 图生视频 | 5 |
Vidu-Video-q3-turbo (2026-09-15下线) | vd-video-q3-turbo | 支持16秒音视频直出,适用于规模化内容生产与高频迭代场景。 | 文生视频 图生视频 | 5 |
Vidu-Video-q2-pro (2026-09-15下线) | vd-video-q2-pro | 支持文本、图像、参考图等多模态输入,可用于高质量短片、专业内容创作。 | 文生视频 图生视频 | 5 |
Vidu-Video-q2-pro-fast (2026-09-15下线) | vd-video-q2-pro-fast | 通过优化的推理架构,在保持高画质输出的同时提升生成速度,适用于对出片效率有要求的营销素材与快速迭代场景。 | 文生视频 图生视频 | 5 |
Vidu-Video-q2-turbo (2026-09-15下线) | vd-video-q2-turbo | 生成成本低,速度快,适用于大规模批量生产与快速原型验证场景。 | 文生视频 图生视频 | 5 |
Vidu-Video-q2 (2026-09-15下线) | vd-video-q2 | 支持图像与首尾帧输入,可实现微表情动态刻画,时长2-8秒可选,适用于数字人、人物特写与情感表达类内容创作。 | 文生视频 图生视频 | 5 |
PixVerse-Video-v6 | pixverse-video-v6.0 | 支持电影级摄像机控制、原生音频生成与多镜头连续输出,适用于专业影视创作与高品质广告制作。 | 文生视频 图生视频 | 5 |
PixVerse-Video-v5.6 | pixverse-video-v5.6 | 在电影级画面美学与人声表现力上进一步增强,动态控制更加精细,适用于对画面质感与人声效果有高要求的专业内容制作。 | 文生视频 图生视频 | 5 |
PixVerse-Video-c1 | pixverse-video-c1 | 面向影视行业深度优化,支持文本、图像、首尾帧及多宫格分镜参考等多模态输入,可直出15秒1080P 音画同步视频,具备工业级动作表现与影视级特效渲染能力,适用于短剧、动漫、仙侠特效与影视前期分镜制作场景。 | 文生视频 图生视频 | 5 |
HY-Video-1.5 | hy-video-1.5 | 支持文本、图像多模态输入生成高清视频,可实现场景切换与多角色交互,简化制作流程、降低成本,应用于企业广告营销与个人创意落地场景。 | 文生视频 图生视频 | 5 |
YT-Video-2.0 | yt-video-2.0 | 支持生成动态连贯性高、画面过渡自然的视频,适用于对质量要求较高的广告创意、影视片段和产品展示等场景。 | 图生视频 | 5 |
YT-Video-HumanActor | yt-video-humanactor | 单张参考照片即可驱动生成动态人像视频,精准还原表情、姿态,支持写实、二次元等多风格切换。 | 图生视频 | 5 |
YT-Video-FX | yt-video-fx | 通过上传图片和选择特效模板,生成一段特效视频,将静态图像转化为充满活力、动感、有趣的视频画面。 | 图生视频 | 5 |
以上性能及效果相关表述来源于 2026 年腾讯内部实验测试结果,测试基于特定环境、条件及时间范围,仅反映相应测试场景下的情况,实际效果可能因输入内容、参数配置及使用场景不同而存在差异。
3D 生成
模型名称 | model(调用参数) | 模型介绍 | 任务类型 | 默认并发数 |
HY-3D-3.0 | hy-3d-3.0 | 采用混元生3D 3.0模型,可生成更高精度以及更高质量的3D 模型,支持文生3D、图生3D、多视图生3D、单几何生成(白模),草图生3D、智能拓扑生3D 功能。 | 文生3D 图生3D | 3 |
HY-3D-3.1 | hy-3d-3.1 | 采用混元生3D 3.1模型,可生成更高精度以及更高质量的3D 模型,支持文生3D、图生3D、八视图生3D、单几何生成(白模)功能。 | 文生3D 图生3D | 3 |
HY-3D-Express | hy-3d-express | 采用混元生3D 极速版模型,可将生成模型时间缩短至1分30秒内,可在较短时间内生成3D 模型文件。 | 文生3D 图生3D | 1 |
语音模型
模型类型 | 模型名称 | model(调用参数) | 模型介绍 | 默认并发数 |
音乐生成 | MiniMax-Music-v2.6 | minimax-music-v2.6 | MiniMax Music 2.6 高质量音乐生成模型 | 5 |
语音合成 | MiniMax-Speech-2.8-HD | minimax-speech-2.8-hd | MiniMax-Speech 系列语音模型服务 | 5 |
| MiniMax-Speech-2.8-Turbo | minimax-speech-2.8-turbo | | 5 |
| MiniMax-Speech-2.6-HD | minimax-speech-2.6-hd | | 5 |
| MiniMax-Speech-2.6-Turbo | minimax-speech-2.6-turbo | | 5 |
| MiniMax-Speech-02-HD | minimax-speech-02-hd | | 5 |
| MiniMax-Speech-02-Turbo | minimax-speech-02-turbo | | 5 |
| MiniMax-Voice-Clone | minimax-voice-clone | MiniMax 音色复刻能力 (请注意合法使用、尊重他人知识产权) | 5 |
| MiniMax-Voice-Design | minimax-voice-design | MiniMax 音色设计能力 | 5 |
AI 配音 | WAND-Dubbing-Clone-v1 | wand-dubbing-clone-v1 | 腾讯云 WAND AI 配音 V1,视频翻译克隆配音模型,将原音替换为目标语言音色,一键生成多语种配音成片。 | 5 |
| WAND-Dubbing-Clone-v2 | wand-dubbing-clone-v2 | WAND AI 配音 V2,视频翻译克隆配音升级模型,情绪表现、音色相似度与长视频稳定性全面增强。 | 5 |
语音识别 | WAND-ASR-v1 | wand-asr-v1 | 腾讯云 WAND ASR 模型,音视频转写文本并输出字幕与时间戳。 | 5 |
| Hy-ASR-3.0-Preview | hy-asr-3.0-preview | Hy-ASR-3.0-Preview:中文普通话+英语+多方言混合引擎,除中英外,支持多种方言,包括粤语、东北话、河南话、陕西话、成都话、重庆话、武汉话、贵阳话、青岛话、济南话、长沙话、合肥话等。 | 5 |
多模态理解模型
模型名称 | model(调用参数) | 模型介绍 | 上下文窗口 (Token) | 最大输入 (Token) | 最大输出 (Token) |
YT-VITA | youtu-vita | VITA 是一款多模态理解模型,支持对视频和图片内容进行分析,可用于视频结构解析、图像目标检测等场景。 | 128k | 100k | 15k |
HY-Vision-2.0-Instruct | hy-vision-2.0-instruct | 快思考模型,适用通用图生文场景。相比上代模型在基础感知、内容识别、知识、OCR、STEM、推理、图表理解等维度有明显提升。 | 44k | 24k | 16k |
HY-Vision-1.5-Thinking | hunyuan-t1-vision-20250916 | 深度思考模型,适用通用图文问答、视觉定位、OCR、图表、拍题解题、看图创作等任务,且优化了英文及小语种能力。 | 40k | 16k | 24k |
HY-Vision-Video | hunyuan-turbos-vision-video-20250728 | 视频理解模型,支持视频描述、视频内容问答等基本的视频理解能力。 | 32k | 24k | 8k |
向量模型
模型名称 | model(调用参数) | 模型介绍 | 输出维度 | 上下文窗口(Token) |
Kinfra-Text-Embedding-0.6b | kinfra-text-embedding-0.6b | 轻量文本向量模型,适合大规模文本召回、延迟敏感、成本敏感场景。 | 1024 | 32k |
Kinfra-Text-Embedding-4b | kinfra-text-embedding-4b | 高质量文本向量模型,适合高质量文本检索、深层语义理解场景。 | 2560 | 32k |
Kinfra-VL-Embedding-2b | kinfra-vl-embedding-2b | 轻量多模态向量模型,支持文本、图片、视频输入,适合多模态在线检索、视频检索、响应速度优先场景。 | 2048 | 32k |
Kinfra-VL-Embedding-8b | kinfra-vl-embedding-8b | 高精度多模态向量模型,支持文本、图片、视频输入,适合高精度多模态检索、精度优先场景。 | 4096 | 32k |
说明:
以上模型均支持 30 余种主流语言,包括中文、英语、日语、韩语、法语、德语、俄语、葡萄牙语、西班牙语等。
能力说明
深度思考
模型在生成最终回答前,先进行内部思维链(Chain-of-Thought)推理,通过逐步分析和拆解问题,提升复杂任务(如数学、逻辑推理、代码生成等)的回答准确性。
结构化输出
模型支持按照指定的格式(如 JSON Schema)输出结构化数据,便于下游程序直接解析和使用,适用于信息抽取、数据填充、API 响应构建等场景。
Function Calling
模型支持函数调用能力,可在推理过程中根据用户意图自动识别并触发预定义的外部工具或 API,实现查询数据库、调用第三方服务等扩展操作。
Cache 缓存
模型 Cache 缓存能力可复用历史请求中的上下文计算结果,减少重复计算开销,从而提升响应速度并降低调用成本。