认证概述
腾讯云面向大数据从业者推出的专业认证,重点考查考生对大数据核心概念、Hadoop 生态、分布式存储、批处理与流计算、检索与查询分析、数据湖与数据仓等领域的整体掌握程度,以及在常见业务场景下进行选型与方案设计的能力。
建议报名该认证的考生具备以下知识或经验:
了解 Linux 基本操作与 Shell 命令。
掌握至少一种数据库使用与基本 SQL。
对分布式系统、并行计算的基本概念有一定了解。
了解 Java / Scala / Python 中至少一种语言。
基本信息
考试类型:理论考试。
考试形式:线下。
题型与题量:单选题40道、多选题20道。
通过/满分分数:70/100分。
考试时长:90分钟。
考试语言:简体中文。
其他注意事项:
1. 多选题错选、漏选不得分。
2. 考试报名和考试预约指引:报名和考试指引。
3. 成绩查询:考试结束后可通过腾讯云培训认证的 个人中心-认证考试 页面查看成绩,理论考试成绩3天内公布。
建议的学习资源
资源类别 | 资源地址 |
视频讲解 | |
社区生态 | Apache Hadoop / Spark / Flink / Iceberg / Kafka 等开源社区官方文档 |
知识点占比与考核重点
知识点 | 比例 | 考核重点 |
大数据概述 | 5% | 大数据基本概念与发展历程。 大数据 4V 特性(Volume / Variety / Velocity / Value)。 大数据与传统数据的差异。 大数据典型行业应用场景。 |
大数据技术 Hadoop 及其生态 | 8% | Hadoop 项目定位与发展历史。 Hadoop 1.x / 2.x / 3.x 主要差异。 Hadoop 主要发行版本。 Hadoop 生态全景(HDFS / YARN / MapReduce / Hive / HBase / Sqoop / Flume / ZooKeeper 等)。 腾讯云大数据解决方案与 EMR 概览。 |
大数据存储 | 20% | 分布式存储设计目标。 行存与列存适用场景。 HDFS 架构(NameNode / DataNode / 数据块 / 副本)与读写流程。 HBase 列族存储与 RowKey 设计。 对象存储特点与典型场景。 分布式存储一致性与容错机制。 |
大数据计算概述 | 3% | 大数据计算的分类(批处理 / 流处理 / 交互式查询 / 图计算等)。 批处理与流处理的差异。 常见大数据计算组件全景。 |
大数据批处理计算 | 27% | MapReduce 编程模型与执行流程。 Map / Shuffle / Reduce 各阶段职责。 YARN 资源调度(Capacity / Fair Scheduler)。 常见数据倾斜成因与优化(盐值打散 / 二次聚合 / Combiner)。 Spark 核心抽象(RDD / DataFrame / Dataset)与 DAG 执行模型。 Spark 与 MapReduce 的差异。 Spark 容错与内存执行优化。 |
大数据流计算 | 10% | 流计算与批计算差异。 Flink 整体架构(JobManager / TaskManager)。 事件时间与水位线。 Window / Join / Aggregate 等常用算子。 Checkpoint 与状态后端。 Exactly-Once 语义。 流计算 Oceanus / Kafka 等典型组件定位。 |
大数据检索 | 5% | 全文检索基本概念与倒排索引。 ElasticSearch 集群基本架构(Cluster / Node / Index / Shard)。 常见接入方式(REST API / 客户端 SDK / Logstash / Beats / Kibana)。 典型检索业务场景。 |
大数据查询分析 | 7% | OLAP 与 OLTP 的差异。 Hive / Impala / Presto / Trino / Spark SQL 等查询分析组件定位。 Trino 体系架构(Coordinator / Worker / Connector)。 跨源查询与查询性能影响因素。 交互式查询与离线 ETL 的取舍。 |
数据湖与数据仓 | 12% | 数据湖与数据仓的差异与演进。 湖仓一体的概念与价值。 Iceberg / Hudi / Delta Lake 表格式核心特性。 Iceberg 元数据管理与 Schema 演化。 数据湖典型查询引擎。 腾讯云数据湖计算(DLC)与云数据仓库(CDW)定位。 |
大数据应用综合实践 | 3% | 离线 + 实时数据分析综合场景。 ETL 加工与数据建模基本套路。 数据质量与数据治理初阶。 典型大数据业务方案(实时数仓 / 数据中台 / 用户画像)选型考量。 |