帮你快速理解、总结文档立即下载

BigQuery 数据源

最近更新时间:2026-09-29 10:24:00
我的收藏

概述

Google BigQuery 是 Google Cloud 提供的全托管企业级数据仓库,支持 PB 级数据的快速分析。DataBuddy 数据接入支持将 BigQuery 作为来源端,覆盖离线同步场景。本文介绍其连接配置、能力支持范围、前提条件与常见问题。

读取能力


能力
支持情况
说明
离线同步(读 / 写)
✓ / -
支持作为离线同步任务的源端读取数据;DataBuddy 数据源仅支持接入读取,不支持写入
完整数据源能力对照参见 支持的数据源与读取能力。

使用限制

限制项
说明
认证方式
需提供服务账号 JSON 密钥文件
数据集
以项目(Project)/ 数据集(Dataset)/ 表为读取粒度

支持的字段类型

字段类型
说明
INT64
整数
FLOAT64
浮点数
NUMERIC / BIGNUMERIC
定点数
BOOL
布尔
STRING
字符串
BYTES
二进制
DATE / DATETIME / TIME / TIMESTAMP
时间类型
GEOGRAPHY
地理类型
JSON
JSON 类型
ARRAY / STRUCT
复杂嵌套类型

前提条件

配置服务账号

1. 在 Google Cloud 控制台创建服务账号,并授予 BigQuery Data Viewer(roles/bigquery.dataViewer)角色。
2. 下载服务账号的 JSON 密钥文件。
3. 在 DataBuddy 创建数据源时上传该 JSON 密钥文件。
注意:
请确保 DataBuddy 运行环境可访问 Google Cloud 网络。

创建数据源

操作步骤

1. 登录 DataBuddy 控制台。
2. 在顶部切换到目标地域和 Workspace。
3. 进入 数据集成 > 数据源管理(或 平台管理 > 数据源管理)。
4. 点击 添加数据源,选择 BigQuery。
5. 填写连接配置与认证信息,详见 参数说明。
6. 点击 连通性测试(参见 数据源连通性测试)。
7. 测试通过后点击 保存 或 保存 & 创建任务。

参数说明

参数
说明
是否必填
默认值
数据源名称
数据源在工作空间内的唯一标识
是
—
项目 ID
Google Cloud 项目 ID
是
—
凭证文件
服务账号 JSON 密钥文件
是
—
高级参数
连接级扩展参数
否
—

在数据接入任务中使用

离线单表

配置项
说明
数据来源
已配置的 BigQuery 数据源
数据集 / 表
从列表中选择数据集与表
筛选条件
标准 WHERE 语法,支持时间参数
详细任务配置参见 表到表同步。

最佳实践

实践
建议
权限最小化
服务账号仅授 BigQuery Data Viewer 角色
分区表
读取分区表时按时间分区过滤,降低扫描量
网络打通
确保与 Google Cloud 网络连通

常见问题

Q:认证失败?

A:检查服务账号 JSON 密钥文件是否正确,且已授予 BigQuery Data Viewer 角色。

Q:读取数据量较大时成本较高?

A:利用分区字段过滤,按时间分区增量读取,降低全表扫描成本。

相关文档