帮你快速理解、总结文档立即下载
文档中心>腾讯云培训认证

腾讯云大数据工程师认证考试指南

最近更新时间:2026-07-23 17:42:30
我的收藏

认证概述

腾讯云面向大数据从业者推出的专业认证,重点考查考生对大数据核心概念、Hadoop 生态、分布式存储、批处理与流计算、检索与查询分析、数据湖与数据仓等领域的整体掌握程度,以及在常见业务场景下进行选型与方案设计的能力。
建议报名该认证的考生具备以下知识或经验:
了解 Linux 基本操作与 Shell 命令。
掌握至少一种数据库使用与基本 SQL。
对分布式系统、并行计算的基本概念有一定了解。
了解 Java / Scala / Python 中至少一种语言。

基本信息

考试类型:理论考试。
考试形式:线下。
题型与题量:单选题40道、多选题20道。
通过/满分分数:70/100分。
考试时长:90分钟。
考试语言:简体中文。
其他注意事项:
1. 多选题错选、漏选不得分。
2. 考试报名和考试预约指引:报名和考试指引
3. 成绩查询:考试结束后可通过腾讯云培训认证的 个人中心-认证考试 页面查看成绩,理论考试成绩3天内公布。

建议的学习资源

资源类别
资源地址
视频讲解
社区生态
Apache Hadoop / Spark / Flink / Iceberg / Kafka 等开源社区官方文档

知识点占比与考核重点

知识点
比例
考核重点
大数据概述
5%
大数据基本概念与发展历程。
大数据 4V 特性(Volume / Variety / Velocity / Value)。
大数据与传统数据的差异。
大数据典型行业应用场景。
大数据技术 Hadoop 及其生态
8%
Hadoop 项目定位与发展历史。
Hadoop 1.x / 2.x / 3.x 主要差异。
Hadoop 主要发行版本。
Hadoop 生态全景(HDFS / YARN / MapReduce / Hive / HBase / Sqoop / Flume / ZooKeeper 等)。
腾讯云大数据解决方案与 EMR 概览。
大数据存储
20%
分布式存储设计目标。
行存与列存适用场景。
HDFS 架构(NameNode / DataNode / 数据块 / 副本)与读写流程。
HBase 列族存储与 RowKey 设计。
对象存储特点与典型场景。
分布式存储一致性与容错机制。
大数据计算概述
3%
大数据计算的分类(批处理 / 流处理 / 交互式查询 / 图计算等)。
批处理与流处理的差异。
常见大数据计算组件全景。
大数据批处理计算
27%
MapReduce 编程模型与执行流程。
Map / Shuffle / Reduce 各阶段职责。
YARN 资源调度(Capacity / Fair Scheduler)。
常见数据倾斜成因与优化(盐值打散 / 二次聚合 / Combiner)。
Spark 核心抽象(RDD / DataFrame / Dataset)与 DAG 执行模型。
Spark 与 MapReduce 的差异。
Spark 容错与内存执行优化。
大数据流计算
10%
流计算与批计算差异。
Flink 整体架构(JobManager / TaskManager)。
事件时间与水位线。
Window / Join / Aggregate 等常用算子。
Checkpoint 与状态后端。
Exactly-Once 语义。
流计算 Oceanus / Kafka 等典型组件定位。
大数据检索
5%
全文检索基本概念与倒排索引。
ElasticSearch 集群基本架构(Cluster / Node / Index / Shard)。
常见接入方式(REST API / 客户端 SDK / Logstash / Beats / Kibana)。
典型检索业务场景。
大数据查询分析
7%
OLAP 与 OLTP 的差异。
Hive / Impala / Presto / Trino / Spark SQL 等查询分析组件定位。
Trino 体系架构(Coordinator / Worker / Connector)。
跨源查询与查询性能影响因素。
交互式查询与离线 ETL 的取舍。
数据湖与数据仓
12%
数据湖与数据仓的差异与演进。
湖仓一体的概念与价值。
Iceberg / Hudi / Delta Lake 表格式核心特性。
Iceberg 元数据管理与 Schema 演化。
数据湖典型查询引擎。
腾讯云数据湖计算(DLC)与云数据仓库(CDW)定位。
大数据应用综合实践
3%
离线 + 实时数据分析综合场景。
ETL 加工与数据建模基本套路。
数据质量与数据治理初阶。
典型大数据业务方案(实时数仓 / 数据中台 / 用户画像)选型考量。