帮你快速理解、总结文档立即下载
文档中心>Elasticsearch Service>购买指南>智能搜索开发服务定价

智能搜索开发服务定价

最近更新时间:2026-09-17 16:31:00
我的收藏
基于腾讯云 ES 引擎和生态优势,帮助客户通过更轻量的研发和运维投入,轻松构建 RAG、AI 搜索等应用。本文档将详细说明各原子服务以及发布独享服务的计费方式和单价策略,遵循按需付费原则,提供预付费资源包与按量计费两种方式,帮助客户根据实际业务场景精细化成本管理。
计费方式
说明
按量计费
按照实际调用接口消耗的资源量进行计费,每小时对腾讯云账户进行结算和扣费,正式使用前请保证账户处于非欠费状态。
包年包月 LLM 套餐包
采用按月订阅 + 积分制,购买时设定月预算,预算按 100 积分 = 1 元 折算为积分额度,调用套餐内模型时按实际用量从积分池中实时扣减。

免费额度

通过实名认证的主账号开通智能搜索开发原子服务后,将拥有所有原子服务总共 100 次免费测试额度,超过 100 次后将自动转为计费。如您有更多的测试需求,请 联系我们


购买方式

在账单结算时,系统将按照“免费体验次数 > 后付费/包年包月”的顺序进行结算。
计费内容包含直接调用 API 和在控制台使用相关原子服务在线体验,调用失败不计费

开通后付费

当开通智能搜索开发原子服务后,默认情况下会自动打开后付费,免费体验次数使用完后,若未购买预付费资源包,将会自动转入后付费。如需开启或关闭后付费模式结算,请前往控制台 > 资源管理 > 后付费设置 开通或关闭后付费。

说明:
后付费设置每月仅能变更 5 次,变更后约 10s 后生效,请不要频繁变更。

按量计费定价

文档解析(Document Parsing)

文档解析服务按原始文档成功解析的页数计费,单价如下:
服务
刊例(元/页)
doc-llm
0.2
说明:
doc-llm 文档解析服务是按页收费,对不同文档计费规则如下:
doc、docx、ppt、pptx、pdf 按页计量。
jpeg、png 等图片格式以一张图为一页。
xlsx、txt、md、csv 以 1 份为一页。

文本切片(Text Chunking)

文本切片服务按千 token 计费,单价如下:
服务
刊例(元/千 tokens)
doc-tree-chunk
0.03
doc-chunk
0.00002
说明:
doc-tree-chunk 服务是基于 doc-llm 文档解析服务实现的文档切片,默认会分为解析和分片的两种费用,具体如下:
输入文件为 pdf/docx/doc/ppt/pptx 文档格式和 jpg/png 等图片格式时,需要计算文档解析费用(按页计费)
输入文件为 txt/md/xlsx/xls 格式时,仅需工程解析,不需要付费。
两种方式输入的文件都需要计算拆分消耗的费用,按 token 消耗数量计费。
doc-chunk 服务是基于分隔符、文本长度进行切片,适用于规则性较强的文本,这里统计的 token 为原始文本的字符长度。

向量化(Embedding)

纯文本 Embedding 服务按千 token 计费,单价如下:
模型
维度
token 限制
语言
刊例(元/千 tokens)
bge-base-zh-v1.5
768
512
中文
0.0005
bge-large-zh-v1.5
1024
512
中文
0.0005
KaLM-embedding-multilingual-mini-v1
896
131072
多语言
0.0005
bge-m3
1024
8194
多语言
0.0005
Conan-embedding-v1
1792
512
中文
0.0005
图文 Embedding 服务支持文本和图片两种模态输入,分别以 token 和图片数量计费,单价如下:
模型
维度
token 限制
语言
刊例
WeProduct
768
-
-
图片:0.0005 元/张
WeCLIPv2-Base
768
72
多语言,中文最优
文本:0.0005 元/千 tokens
图片:0.0003 元/张
WeCLIPv2-Large
768
72
多语言,中文最优
文本:0.0005 元/千 tokens
图片:0.0005 元/张

重排序(Rerank)

重排序服务按千 token 计费,单价如下:
模型
token 限制
语言
刊例(元/千 tokens)
bge-reranker-large
514
中文、英文
0.0001
bge-reranker-v2-m3
8194
多语言
0.0005

联网搜索(Online Search)

联网搜索服务按调用次数计费,可结合大模型进行使用,单价如下:
服务
刊例(元/千次)
Sogou
65
Bing(关停)
65
Baidu(关停)
65
说明:
推荐您使用 Sogou 服务,提供稳定的联网搜索服务,Bing 和 Baidu 服务由三方服务厂商提供,受限于三方服务,有关停风险,请酌情使用。

应用发布资源

应用发布为独享服务时,系统将根据您实际的负载合理分配资源,按照 CPU 和内存使用情况按量付费。单价如下:
资源
地域
刊例
CPU
北京
0.121875元/核/小时
内存
北京
0.06102778元/GB/小时

LLM 套餐定价

设定 月预算(元/月),系统自动折算为积分额度。例如月预算 1,000 元对应 100,000 积分。套餐内可调用的模型如下,不同模型的积分消耗不同,下表以 月预算 1,000 元(100,000 积分) 为例展示综合单价与预估可得 Token 量。
模型
综合单价(元/百万 tokens)
预估可得 Token 量(百万)
Hy3
0.74
1,351
DeepSeek-V4-Flash
0.70
1,429
DeepSeek-V4-Pro
9.26
108
GLM-5
4.40
227
GLM-5-Turbo
3.40
294
GLM-5.1
3.80
263
GLM-5.2
4.40
227
Kimi-K2.6
2.80
357
MiniMax-M2.7
1.00
1,000
MiniMax-M3
2.50
400
说明:
预估 Token 量仅为单一模型视角的参考值,基于运营经验值测算,仅作为预算规划参考,不代表实际可使用的 Token 数量,实际可调用数量受缓存命中率、输入/输出 Token 比例、多模型混合使用等因素影响,以实际调用扣减为准。

积分抵扣规则

积分是 LLM 套餐的用量计费单位。每次调用按输入、输出 Token 的实际消耗量折算为积分,从套餐积分池中扣减。模型价格参考 Tokenhub 模型定价

抵扣公式

单次请求的积分消耗按三段分别折算后加总:
积分消耗 = (缓存命中输入 token 数 × 命中缓存输入价
+ 未命中缓存输入 token 数 × 未命中缓存输入价
+ 输出 token 数 × 输出价) / 1,000,000
三段 Token 的含义:
Token 分类
说明
缓存命中输入
请求输入中命中模型侧上下文缓存的部分,按更低的命中价格折算
未命中缓存输入
请求输入中未命中缓存的部分
输出
模型生成的回答内容

计费示例

以某模型为例(假设抵扣价:缓存命中输入 100 积分/百万 tokens、未命中缓存输入 400 积分/百万 tokens、输出 1,800 积分/百万 tokens),单次请求消耗输入 10,000 tokens(其中缓存命中 6,000)、输出 2,000 tokens,则本次请求的积分消耗为:
(6,000 × 100 + 4,000 × 400 + 2,000 × 1,800) / 1,000,000
= (600,000 + 1,600,000 + 3,600,000) / 1,000,000
= 5.8 积分

老原子服务资源包定价(已不支持新购)

资源类型维度的定价

资源类型
资源包规格
刊例价
文档解析
1千页
200
1万页
1700
10万页
9800
100万页
75000
文本切片
1千万 tokens
300
1亿 tokens
2850
10亿 tokens
27000
文本向量化
10亿 tokens
500
100亿 tokens
4750
1000亿 tokens
45000
图片向量化
100万张
500
1000万张
4750
1亿张
45000
重排序
10亿 tokens
500
100亿 tokens
4750
1000亿 tokens
45000
大模型生成
1万点
100
10万点
950
100万点
9000
1000万点
85000
联网搜索
1万次
650
10万次
6200
100万次
58500

抵扣系数

各个模型的抵扣系数不同,实际资源包的消耗根据抵扣系数进行换算,换算公式:资源包用量 = 实际用量 * 抵扣系数。
计费计算示例:
1. 客户甲用了 bge-reranker-large 1百万 token,用了 bge-reranker-v2-m3 2百万 token,那么换算下来抵扣的资源包:1百万 * 0.2 + 2百万 * 1 = 2.2百万 token。
2. 客户乙在用了 deepseek-r1 输入1百万 token、输出2百万 token,同时用了 hunyuan-turbo 输入3百万、输出4百万,那么换算下来抵扣的资源包:1百万 * 0.4 + 2百万 * 1.6 + 3百万 * 0.24 + 4百万 * 0.96 = 8160 点(注意:点横向对标 token 的单位为千 token
以下是各个资源类型的抵扣系数:
资源类型
模型服务
抵扣系数
文档解析
doc-llm
1
文本切片
doc-tree-chunk
1
doc-chunk
0.00066667
文本向量化
bge-base-zh-v1.5
1
bge-large-zh-v1.5
1
KaLM-embedding-multilingual-mini-v1
1
bge-m3
1
conan-embedding-v1
1
图片向量化
WeCLIPv2-Base
0.6
WeCLIPv2-Large
1
重排序
bge-reranker-large
0.2
bge-reranker-v2-m3
1
大模型生成
deepseek-r1(自动路由 deepseek-v4)
输入:0.4,输出:1.6
deepseek-v3(自动路由 deepseek-v4)
输入:0.2,输出:0.8
deepseek-r1-distill-qwen-32b(已下线)
输入:0.2,输出:0.6
hunyuan-turbo(已下线)
输入:0.24,输出:0.96
hunyuan-large(已下线)
输入:0.4,输出:1.2
hunyuan-large-longcontext(已下线)
输入:0.6,输出:1.8
hunyuan-standard(已下线)
输入:0.08,输出:0.2
hunyuan-standard-256K(已下线)
输入:0.05,输出:0.2
联网搜索
sogou
1
bing(关停)
1
baidu(关停)
1
抵扣系数说明:
抵扣系数是一种用于统一不同模型服务计费标准的换算比率。以向量化服务为例:当您不确定哪个 embedding 模型最适合业务需求时,可以直接购买通用的"向量化资源包"。该资源包支持所有 Embedding 模型,系统会根据实际调用模型的抵扣系数(例如:模型 A 的1次调用 = 1.2 个资源单位,模型 B 的 1 次调用 = 0.8 个资源单位)自动折算消耗的资源量。这种设计既避免了前期选型困难,又能确保资源的高效利用。