概述
Google BigQuery 是 Google Cloud 提供的全托管企业级数据仓库,支持 PB 级数据的快速分析。DataBuddy 数据接入支持将 BigQuery 作为来源端,覆盖离线同步场景。本文介绍其连接配置、能力支持范围、前提条件与常见问题。
读取能力
能力 | 支持情况 | 说明 |
离线同步(读 / 写) | ✓ / - | 支持作为离线同步任务的源端读取数据;DataBuddy 数据源仅支持接入读取,不支持写入 |
使用限制
限制项 | 说明 |
认证方式 | 需提供服务账号 JSON 密钥文件 |
数据集 | 以项目(Project)/ 数据集(Dataset)/ 表为读取粒度 |
支持的字段类型
字段类型 | 说明 |
INT64 | 整数 |
FLOAT64 | 浮点数 |
NUMERIC / BIGNUMERIC | 定点数 |
BOOL | 布尔 |
STRING | 字符串 |
BYTES | 二进制 |
DATE / DATETIME / TIME / TIMESTAMP | 时间类型 |
GEOGRAPHY | 地理类型 |
JSON | JSON 类型 |
ARRAY / STRUCT | 复杂嵌套类型 |
前提条件
配置服务账号
1. 在 Google Cloud 控制台创建服务账号,并授予 BigQuery Data Viewer(
roles/bigquery.dataViewer)角色。2. 下载服务账号的 JSON 密钥文件。
3. 在 DataBuddy 创建数据源时上传该 JSON 密钥文件。
注意:
请确保 DataBuddy 运行环境可访问 Google Cloud 网络。
创建数据源
操作步骤
1. 登录 DataBuddy 控制台。
2. 在顶部切换到目标地域和 Workspace。
3. 进入 数据集成 > 数据源管理(或 平台管理 > 数据源管理)。
4. 点击 添加数据源,选择 BigQuery。
5. 填写连接配置与认证信息,详见 参数说明。
6. 点击 连通性测试(参见 数据源连通性测试)。
7. 测试通过后点击 保存 或 保存 & 创建任务。
参数说明
参数 | 说明 | 是否必填 | 默认值 |
数据源名称 | 数据源在工作空间内的唯一标识 | 是 | — |
项目 ID | Google Cloud 项目 ID | 是 | — |
凭证文件 | 服务账号 JSON 密钥文件 | 是 | — |
高级参数 | 连接级扩展参数 | 否 | — |
在数据接入任务中使用
离线单表
配置项 | 说明 |
数据来源 | 已配置的 BigQuery 数据源 |
数据集 / 表 | 从列表中选择数据集与表 |
筛选条件 | 标准 WHERE 语法,支持时间参数 |
最佳实践
实践 | 建议 |
权限最小化 | 服务账号仅授 BigQuery Data Viewer 角色 |
分区表 | 读取分区表时按时间分区过滤,降低扫描量 |
网络打通 | 确保与 Google Cloud 网络连通 |
常见问题
Q:认证失败?
A:检查服务账号 JSON 密钥文件是否正确,且已授予
BigQuery Data Viewer 角色。Q:读取数据量较大时成本较高?
A:利用分区字段过滤,按时间分区增量读取,降低全表扫描成本。