概述
Apache Kudu 是面向结构化数据的列式存储引擎,支持快速 OLAP 分析的同时具备随机读写能力,常与 Impala、Spark 配合使用。DataBuddy 数据接入支持将 Kudu 作为来源端,覆盖离线同步场景。本文介绍其连接配置、能力支持范围、前提条件与常见问题。
支持的版本
类型 | 支持版本 |
Kudu | 1.10 / 1.12 / 1.15 |
读取能力
能力 | 支持情况 | 说明 |
离线同步(读 / 写) | ✓ / - | 支持作为离线同步任务的源端读取数据;DataBuddy 数据源仅支持接入读取,不支持写入 |
使用限制
限制项 | 说明 |
认证方式 | 支持 Kerberos / Simple |
表结构 | 需建表时定义列 Schema |
支持的字段类型
字段类型 | 说明 |
INT8 / INT16 / INT32 / INT64 | 有符号整数 |
FLOAT / DOUBLE | 浮点数 |
DECIMAL | 定点数 |
STRING | 字符串 |
BINARY | 二进制 |
BOOL | 布尔 |
UNIXTIME_MICROS | 微秒时间戳 |
DATE | 日期 |
前提条件
Kerberos 认证(推荐用于安全集群)
配置项 | 说明 |
Principal | Kerberos principal |
Keytab | 客户端认证的 keytab 文件 |
krb5.conf | Kerberos 配置文件 |
请确保 DataBuddy 运行环境与 Kudu Master 网络连通,且拥有目标表的读取权限。
创建数据源
操作步骤
1. 登录 DataBuddy 控制台。
2. 在顶部切换到目标地域和 Workspace。
3. 进入 数据集成 > 数据源管理(或 平台管理 > 数据源管理)。
4. 点击 添加数据源,选择 Kudu。
5. 填写连接配置与认证信息,详见 参数说明。
6. 点击 连通性测试(参见 数据源连通性测试)。
7. 测试通过后点击 保存 或 保存 & 创建任务。
参数说明
参数 | 说明 | 是否必填 | 默认值 |
数据源名称 | 数据源在工作空间内的唯一标识 | 是 | — |
Kudu Master 地址 | Kudu Master 地址,格式 host1:7051,host2:7051 | 是 | — |
认证方式 | Kerberos / Simple | 是 | Simple |
Principal | Kerberos 认证下的 principal | 认证方式为 Kerberos 时必填 | — |
Keytab | Kerberos 认证下的 keytab 文件 | 认证方式为 Kerberos 时必填 | — |
krb5.conf | Kerberos 配置文件 | 认证方式为 Kerberos 时必填 | — |
Kudu Master 地址示例:
10.0.0.1:7051,10.0.0.2:7051
在数据接入任务中使用
离线单表
配置项 | 说明 |
数据来源 | 已配置的 Kudu 数据源 |
表 | 从列表中选择目标表 |
筛选条件 | 支持按主键范围等条件过滤 |
最佳实践
实践 | 建议 |
认证方式 | 安全集群优先使用 Kerberos |
主键设计 | 合理设计主键避免热点 |
网络打通 | 确保与 Kudu Master / Tablet Server 网络连通 |
常见问题
Q:连接 Kudu Master 失败?
A:检查 Master 地址与端口可达性,确认 Kerberos 配置正确。
Q:读取表时列缺失?
A:确认目标表 Schema 中的列存在且账号具备读取权限。