首页
学习
活动
专区
圈层
工具
发布

袋鼠云产品功能更新报告03期丨产品体验全面优化,请查收!

5.Spark SQL 临时查询展示任务执行进度Spark SQL 临时查询展示任务执行进度并实时打印日志。 6....支持项目层面的统一配置项支持在项目层设置是否在周期和手动任务 / 临时查询中允许 ddl 操作。7....数据同步向导模式支持 CustomSQL 填写在数据同步任务中,针对 RDB 类数据源(oracle、MySQL、pg、sqlserver、tdsql、gp、db2、达梦 oracle&MySQL、kingbase...其他体验优化项体验优化说明・Spark 引擎支持 3.0 版本:Spark SQL/Spark/PySpark 任务支持用 3.0 版本的 Spark 引擎运行・Hive 支持代理账号提交任务:在控制台...实时采集支持自定义 SQL间隔轮询模式下的实时采集任务,支持用户自定义 SQL 对采集源表进行过滤、关联、计算等计算,然后再写入结果表。

1.2K00
  • 您找到你想要的搜索结果了吗?
    是的
    没有找到

    开源AI、BI工具DataEase 连接Cloudera CMP 7.3(或类 CDP 的 CMP 7.13 平台,如华为鲲鹏 ARM 版)支持Hadoop大数

    需手动上传驱动,填写自定义 JDBC URLSpark SQL✅ Thrift Server (JDBC)spark-thriftserver-jdbc.jar 或 hive-jdbc需启动 Spark...Thrift ServerHBase⚠️ 间接支持通过 Phoenix JDBC需部署 Apache Phoenix 提供 SQL 接口Kudu❌ 不直接支持—可通过 Impala 查询 Kudu 表.../ Oracle / SQL Server✅ 原生内置,开箱即用华为 GaussDB✅ 支持(通过 PostgreSQL 或 MySQL 模式)阿里云 AnalyticDB✅ 支持(MySQL 或 PostgreSQL...),否则无法识别;查询性能:避免在 DataEase 中执行全表扫描,建议在 Hive/Impala 中预计算或分区裁剪。...✅ 总结:DataEase 对 CMP 7.3 生态的支持矩阵组件是否支持推荐度连接方式Hive✅ 强支持⭐⭐⭐⭐⭐JDBC(HiveServer2)Impala✅ 支持⭐⭐⭐⭐自定义 JDBCSpark

    70010

    基于Apache Hudi的多库多表实时入湖最佳实践

    在多库多表的场景下(比如:百级别库表),当我们需要将数据库(mysql,postgres,sqlserver,oracle,mongodb等)中的数据通过CDC的方式以分钟级别(1minute+)延迟写入...架构设计与解析 2.1 CDC数据实时写入MSK 图中标号1,2是将数据库中的数据通过CDC方式实时发送到MSK(Amazon托管的Kafka服务)。...,oracle,sqlserver,postgres,mongodb,documentdb等)的CDC支持,支持可视化的CDC任务配置,运行,管理,监控。...虽然对于单表写入使用上很方便,不用编程只需要写SQL即可,但也带来了一些限制,由于写入Hudi时是通过SQL先建表,Schema在建表时已将定义,如果源端Schema变更,通过SQL方式是很难实现下游Hudi...,数据已经写入到S3 -- 向MySQL的user表中添加一列,并插入一条新数据, 查询hudi表,可以看到新列和数据已经自动同步到user表,注意以下SQL在MySQL端执行 alter table

    3.7K10

    基于 Spark + Delta Lake 的数据中台搭建实践总结

    数据源管理数据源管理模块支持添加和配置多种类型的数据源,包括 MySQL、PostgreSQL、Oracle、SQL Server 等。...2.1 组件建模画布图2:组件建模画布 - 可视化拖拽式建模界面,支持多种数据处理组件2.2 记录清洗组件记录清洗组件用于对数据进行过滤、转换和清洗操作,支持配置多种清洗规则和条件。...图6:主题表输入组件 - 选择数据源表并配置字段2.5 敏捷建模上下合并敏捷建模支持上下合并功能,可以将多个数据源的数据进行纵向合并(UNION)。..., dc_role主题表 (Subject Tables):来源:基于物理表的业务建模存储:Spark 临时视图 (Temporary View)特点:业务逻辑加工,多表关联示例:user_dept_view...: 连接 Hive Metastore5.5 Spark SQL 系统表创建在调试功能时发现系统依赖两张 Spark SQL 系统表,这些表用于跟踪 Kafka 消费偏移量和流查询状态。

    47611

    高吞吐实时事务数仓方案调研 flink kudu+impala hbase等

    、SQL Server、Oracle、PostgreSQL、HDFS、Hive、HBase数据增量更新或者离线更新至云数仓PGSQL。...并支持通过SQL方式将需要的数据导入至云数仓PGSQL。若有多个数据源可配置多个DataX任务进行数据接入。...2.2.2 事务性 Kudu可以保证单行操作的原子性 Kudu不支持多行的事务操作,不支持回滚事务 2.2.3 ETL 在多表聚合ETL可使用impala view创建不同数据源的临时表,再使用实时与离线任务加载不同数据源聚合的宽表...3.3 聚合处理 Flink可以通过创建view即临时表,实现对多个业务表进行聚合,且结果不会存储,并可以按需聚合。...业务可以按需写SQL进行查询view,且不需要写spark程序,不需要每次使用spark在hive建立宽表再进行查询,流程会简单许多。 若有复杂运算支持UDF。

    4.9K86

    开源数据交换(client)

    数据源管理,目前支持Mysql,Oracle,Hive,Neo4j,Elasticsearch,Gbase,File。 多传输引擎支持(扩展引擎),目前支持Java,Spark,Flink引擎。...近实时任务管控 支持无结构化传输 任务状态自检 各个源根据事件互通传输 教程 Beam官网 Apache Beam 大数据处理一站式分析 二.编译部署 2.1 客户端 环境准备 JDK (1.8.0...六.开发规范 6.1 客户端传参规范 入口 参数 含义 fromName 起始数据源(hive,oracle,mysql,es,file,gbase,neo4j) toName 目标数据源...(hive,oracle,mysql,es,file,gbase,neo4j) runner 引擎名称(SparkRunner,FlinkRunner) 更多引擎参数 FlinkPipelineOptions...用户名 hivePassword 密码 hiveTableName 表名称 hiveDatabase 库名称 hiveTableEmpty 是否清空目标表数据,默认不清空(false) hiveSQL

    1.3K20

    OnZoom基于Apache Hudi的流批一体架构实践

    其中Kafka数据通过Spark Streaming job实时消费,MySQL数据通过Spark Batch job定时同步, 将source数据Sink到AWS S3。...之后定时调度Spark Batch Job进行数仓开发。最终按照实际业务需求或使用场景将数据Sink到合适的存储。...初版架构问题 •MySQL通过sql方式获取数据并同步到S3是离线处理,并且某些场景下(比如物理删除)只能每次全量同步•Spark Streaming job sink到S3需要处理小文件问题•默认S3...2.1 Canal MySQL Binlog即二进制日志,它记录了MySQL所有表结构和表数据变更。...临时方案是每次需要rerun数据的时候暂停实时任务,因为0.8.0版本已经支持并发写,后续考虑升级。3.一开始我们任务变更Hudi表数据时每次都默认同步hive元数据。

    2.5K40

    Spark SQL

    Spark SQL作为Spark生态的一员继续发展,而不再受限于Hive,只是兼容Hive Hive on Spark是一个Hive的发展计划,该计划将Spark作为Hive的底层引擎之一,也就是说,Hive...SparkSession支持从不同的数据源加载数据,并把数据转换成DataFrame,并且支持把DataFrame转换成SQLContext自身中的表,然后使用SQL语句来操作数据。...Spark SQL可以支持Parquet、JSON、Hive等数据源,并且可以通过JDBC连接外部数据源。...-p #屏幕会提示你输入密码 输入下面SQL语句完成数据库和表的创建: mysql> create database spark; mysql> use spark; mysql>...数据库写入数据 在MySQL数据库中已经创建了一个名称为spark的数据库,并创建了一个名称为student的表 创建后,查看一下数据库内容: 现在开始编写程序,创建一个

    3.8K10

    干货 | 百万QPS,秒级延迟,携程基于实时流的大数据基础层建设

    4)缺乏对DELETE的支持:业务库做了DELETE操作后,只有整表全量拉取,才能在Hive镜像里体现。...2)canal负责binlog采集 ,写入kafka ;其中kafka在多地部署,并通过专线实现topic的实时同步。 3)spark-streaming 负责将binlog写入HDFS。...因此增加了一个环节(Step2),过滤出当前批次里的“大表",将这些大表的数据分散写入多个HDFS文件里。...3)判断业务库是否发生了归档操作,以决定后续合并时是否忽略DELETE事件。...系统上线初期,我们等待业务或DBA通知,然后手工处理,比较繁琐,很多时候会有通知不到位的情况,导致Hive数据缺失历史数据。

    2.3K10

    Apache Hive 3架构概述

    优化共享文件和YARN容器中的工作负载 默认情况下,CDP私有云基础版将Hive数据存储在HDFS上,CDP公共云将Hive数据默认存储在S3上。在公有云中,Hive仅将HDFS用于存储临时文件。...简化的应用程序开发,具有强大事务保证的操作以及SQL命令的简单语义 您不需要对ACID表分桶。 重写的物化视图 自动的查询缓存 高级优化 ?...整合Spark Spark和Hive表使用Hive Warehouse Connector进行互操作。 您可以使用Hive Warehouse Connector从Spark访问ACID表和外部表。...您不需要Hive Warehouse Connector即可从Spark读取Hive外部表并从Spark写入Hive外部表。您不需要HWC即可读取或写入Hive外部表。...Spark用户只是直接从Hive中读取或写入。您可以读取ORC或Parquet格式的Hive外部表。但您只能以ORC格式写Hive的外部表。 ?

    2.1K10

    企业是如何选择技术栈来做离线数仓

    ,MySQL、oracle,SQL server 该选择那个一个那?...MySQL、oracle、SQL server 对比 MySQL优缺点优 它使用的核心线程是完全多线程,支持多处理器。...你可以在同一查询中混来自不同数据库的表。 支持ANSI SQL的LEFT 0UTER JOIN和ODBC。 所有列都有缺省值。...Unix或Linux 自行安装 免费 、Unix或Linux 第三方安装 200美元, oraclet优缺点 优 开放性:oracle 能所有主流平台上运行(包括 windows)完全支持所有工业标准采用完全开放策略使客户选择适合解决方案对开发商全力支持...3.1 当前技术栈 生产环境的数据可以大致分成三类: 业务数据,主要存储在MySQL和SQLServer,在这些关系型数据库里面有数以万计的表承接着各种生产服务的业务数据写入; 基础数据,也是存储在MySQL

    1.4K10

    基于 Spark 的数据分析实践

    SQLContext.sql 即可执行 Hive 中的表,也可执行内部注册的表; 在需要执行 Hive 表时,只需要在 SparkSession.Builder 中开启 Hive 支持即可(enableHiveSupport...指 hive 库的数据表名 sqlContext.sql(“select * from db.tableName”) 可左右滑动查看代码 SparkSQL ThriftServer //首先打开 Hive...支持从 Hive 获得数据; 支持文件:JSON,TextFile(CSV),ParquetFile,AvroFile 支持RDBMS数据库:PostgreSQL, MySQL,Oracle 支持...支持 type 为:db、mysql、oracle、postgres、mssql; tablename 为该数据表的抽象 table 名称(视图); url、driver、user,password 为数据库...,Hive 表可不存在也可存在,sparksql 会根据 DataFrame 的数据类型自动创建表; savemode 默认为 overwrite 覆盖写入,当写入目标已存在时删除源表再写入;支持 append

    2.7K20

    袋鼠云产品功能更新报告04期丨2023年首次,产品升级“狂飙”

    一个 Calalog 只允许绑定一个 Hive MetaStore,Spark Thrift 用于 Iceberg 表创建、数据入湖转表任务,用户可以使用 Calalog 进行业务部门数据隔离。...; ・支持选择是否关闭重试; ・补数据支持选择未来时间。...整库同步功能优化 ・整库同步支持选择:Oracle MySQL DB2 Hive TiDB PostgreSQL ADB Doris Hana 作为整库同步目标端; ・高级设置能查看历史配置,针对同一数据源和...10.Greenplum 任务调整 ・Greemplum SQL 和 Inceptor SQL 临时运行复杂 SQL 和包含多段 SQL 时运行逻辑从同步运行修改为异步运行; ・表查询中可查看 Greenplum...表管理 用户痛点:之前每个实时任务的开发,都需要临时映射 Flink 表,开发效率较低;之前提供的 Hive catalog 表管理,需要用户维护 Hive Metastore,对原 Hive 有一定的入侵

    1.8K20

    使用 Spark | 手把手带你十步轻松拿下 Spark SQL 使用操作

    1.2 读取数据源进行创建 Spark SQL 支持的数据源包括:文件、数据库、Hive 等。 1.2.1....Spark SQL 的具体发展史详见下图: Spark SQL 发展历史 可见,Spark 原生就对 Hive 的兼容十分友好,且其还内置了 Hive 组件,Spark SQL 可以通过内置 Hive...Local Temporary View 使用 createOrReplaceTempView() 或 createTempView()方法可以将表注册成 Local Temporary View(局部临时视图...Global Temporary View 使用 createGlobalTempView() 方法可以将表注册成 Global Temporary View(全局临时视图),这种方式注册的表可以在不同的...需要注意的是,使用 SQL 语句访问该表时,要加上 global_temp 作为前缀来引用,因为全局临时视图是绑定到系统保留的数据库 global_temp 上的。

    11.4K51

    基于Hive进行数仓建设的资源元数据信息统计

    Hive和Spark支持的Hive库表元数据信息统计 2.1 Hive 2.1.1 语法支持 默认情况下,在对Hive表进行数据insert时,会自动更新元数据库表中的统计信息,但主要是文件数、占用...默认不统计文件数 2.2.1 语法支持 1)分区表 Spark对Hive分区表元数据统计,跟Hive原生对分区表的统计支持略有不同。...-- Hive目前不支持直接这样解析分区表 -- 注意:执行该SQL不会处理表中具体分区统计信息 analyze table tab_partition COMPUTE STATISTICS; --...Hive和Spark对Hive库表元数据信息统计的主要区别 对Hive表元数据信息统计的SQL语法支持不同 如Spark支持对Hive分区表进行表级别的统计,但Hive需要指定到具体分区 对Hive表元数据信息统计在...将TABLE_PARAMS、DBS、TBLS、PARTITIONS、PARTITION_PARAMS注册为临时表 -- load jdbc.

    4.2K31

    干货 | 携程数据血缘构建及应用

    二、构建血缘的方案 2.1 收集方式 方案一:只收集SQL,事后分析。 当SQL执行结束,收集SQL到DB或者Kafka。...缺点:重放SQL的时候可能元数据发生改变,比如临时表可能被Drop,没有临时自定义函数UDF,或者SQL解析失败。 方案二:运行时分析SQL并收集。...其中Hive Hook支持表和列级别血缘,Spark需要使用GitHub的hortonworks-spark/spark-atlas-connector,不支持列级别,Presto则不支持。...在17年引入Spark2后,大部分Hive作业迁移到Spark引擎上,这时候针对Spark SQL CLI快速开发一个类似Hive Hook机制,收集表级别的血缘关系。...通过重写MySqlASTVisitor、SQLServerASTVisitor来解析MySQL / SQLServer的查询SQL,获得列级别的关系。

    6.3K20

    查询hudi数据集

    数据集同步到Hive Metastore后,它将提供由Hudi的自定义输入格式支持的Hive外部表。...一旦提供了适当的Hudi捆绑包, 就可以通过Hive、Spark和Presto之类的常用查询引擎来查询数据集。 具体来说,在写入过程中传递了两个由table name命名的Hive表。...这与插入更新一起使用,对于构建某些数据管道尤其有用,包括将1个或多个源Hudi表(数据流/事实)以增量方式拉出(流/事实) 并与其他表(数据集/维度)结合以写出增量到目标Hudi数据集。...该工具使用Hive JDBC运行hive查询并将其结果保存在临时表中,这个表可以被插入更新。...读优化表 {#spark-ro-view} 要使用SparkSQL将RO表读取为Hive表,只需按如下所示将路径过滤器推入sparkContext。

    2.5K30
    领券