Loading [MathJax]/jax/output/CommonHTML/config.js
首页
学习
活动
专区
圈层
工具
发布
首页
学习
活动
专区
圈层
工具
MCP广场
社区首页 >专栏 >hive自定义udf实现md5功能

hive自定义udf实现md5功能

作者头像
我是攻城师
发布于 2018-05-14 08:30:38
发布于 2018-05-14 08:30:38
2.9K00
代码可运行
举报
文章被收录于专栏:我是攻城师我是攻城师
运行总次数:0
代码可运行

Hive自定义UDF实现md5算法

Hive发展至今,自身已经非常成熟了,但是为了灵活性,还是提供了各种各样的 插件的方式,只有你想不到的,没有做不到的,主流的开源框架都有类似的机制,包括Hadoop,Solr,Hbase,ElasticSearch,这也是面向抽象编程的好处,非常容易扩展。

最近在使用hive1.2.0的版本,因为要给有一列的数据生成md5签名,便于查重数据使用,看了下hive的官网文档发现是支持的,后来在Hue里面试了下,发现不支持,还以为是Hue的问题于是在后台hive命令行里面试了下,发现同样不支持,官网的文档应该是Hive2.x的了所以不支持也有可能,但也没必要为了使用个md5函数就把hive升级到最新版本,那样有点本末倒置,那就写个UDF解决吧,以前写过Pig的UDF,非常简单,Hive的应该也不会太难,看了官网文档,果然非常easy,下面看下步骤:

(1) 继承UDF类,定义evaluate方法

注意,这里用的是maven项目,只需要引入hive-exec包即可:

代码语言:javascript
代码运行次数:0
运行
AI代码解释
复制
<dependency>
            <groupId>org.apache.hive</groupId>
            <artifactId>hive-exec</artifactId>
            <version>1.2.1</version>
            <scope>provided</scope>
        </dependency>

evaluate方法并不是重写的方法,而是一个新的方法,Pig里面是需要重写exec方法,来完成自定义逻辑的,代码如下:

代码语言:javascript
代码运行次数:0
运行
AI代码解释
复制
package com.easy.md5;import com.google.common.base.Strings;import com.google.common.hash.Hashing;import org.apache.hadoop.hive.ql.exec.UDF;/**
 * Created by qindongliang on 2016/5/23.
 * Hive自定义UDF,计算md5值
 */public class MD5 extends UDF {    /**
     * @param s 传入参数
     * @return md5值
     */
    public String evaluate(final String s) {        if(Strings.isNullOrEmpty(s.trim())){            return null;
        }        return Hashing.md5().hashString(s.trim()).toString();
    }
}

(2)注册Hive的UDF的jar包

程序完成后,打包成jar,然后上传到对应的机器上,开始注册自己的UDF函数,这里有两种方式:


A:临时注册

执行hive命令,进入终端:

代码语言:javascript
代码运行次数:0
运行
AI代码解释
复制
add jar /home/hive/udfs/hive-md5-guava-1.0.0.jar;create temporary function md5 as 'com.easy.md5.MD5';select md5('hadoop');--结果: 3abb766da6c2c2d7739f3cb7799a4caa

B:永久注册(hive0.13之后支持)

在linux上,上传jar包至HDFS

代码语言:javascript
代码运行次数:0
运行
AI代码解释
复制
hadoop fs -put hive-md5-guava-1.0.0.jar /user/tez/

进入hive终端

代码语言:javascript
代码运行次数:0
运行
AI代码解释
复制
CREATE FUNCTION md5 AS 'com.easy.md5.MD5' USING JAR 'hdfs:///user/tez/hive-md5-guava-1.0.0.jar' ;select md5('hadoop');--结果: 3abb766da6c2c2d7739f3cb7799a4caa--删除临时函数DROP TEMPORARY FUNCTION [IF EXISTS] function_name;--删除永久函数DROP FUNCTION [IF EXISTS] function_name;--重新加载函数 hive1.2.0之后支持RELOAD FUNCTION;

这样就不用每次打开终端都需要注册了

(3)如何在Hue中注册

Hue是一款基于Web可视化提交任务的框架,由python编写,如果想要在hue中,使用自定义的UDF函数,需要稍作配置,否则使用过程中可能会报错,即使你在服务端已经注册过了。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2016-05-24,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 我是攻城师 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
暂无评论
推荐阅读
编辑精选文章
换一批
Hive之UDFs(User-Defined Functions )
在hive0.13之后可以将功能函数注册到元数据中,无需每次创建session重新创建临时功能函数。
王小雷
2019/05/26
4.1K0
Hive自定义UDF
UDF全称:User-Defined Functions,即用户自定义函数,在Hive SQL编译成MapReduce任务时,执行java方法,类似于像MapReduce执行过程中加入一个插件,方便扩展。
码客说
2022/11/22
1.4K0
Hive快速入门系列(11) | Hive的自定义函数
  我们可以看到hive自带的函数就有两百多个,但我们平时经常用到的可能就那么几个,并且自带的函数功能还十分受限!有时候,为了更好的实现业务需求,这时就需要我们去自定义Hive!在介绍自定义函数之前,还是要把系统内置函数的使用方法介绍一下。
不温卜火
2020/10/28
4K0
Hive快速入门系列(11) | Hive的自定义函数
Hive自定义UDF函数详解
UDF全称:User-Defined Functions,即用户自定义函数,在Hive SQL编译成MapReduce任务时,执行java方法,类似于像MapReduce执行过程中加入一个插件,方便扩展。
程序狗
2021/12/14
8.5K0
hive自定义函数之UDF代码
文章目录 创建maven项目,导入jar包 创建一个java类继承UDF,并重载evaluate方法 将项目打包,上传到集群上 在hive里添加jar包 设置函数与自定义函数关联 使用自定义函数 创建maven项目,导入jar包 <repositories> <repository> <id>cloudera</id> <url>https://repository.cloudera.com/artifactory/cloudera-rep
用户4870038
2021/02/05
7260
hive自定义函数之UDF代码
用户自定义函数UDF
Hive支持的函数除了内置函数,允许编写用户自定义函数(User Define Function)来扩充函数的功能。
十里桃花舞丶
2021/09/10
3.1K0
快速学习-Hive函数
1)Hive 自带了一些函数,比如:max/min 等,但是数量有限,自己可以通过自定义 UDF来方便的扩展。 2)当 Hive 提供的内置函数无法满足你的业务处理需要时,此时就可以考虑使用用户自定义函数(UDF:user-defined function)。 3)根据用户自定义函数类别分为以下三种:
cwl_java
2020/02/21
7120
Hive 创建自定义函数(UDF)
当Hive中的内置函数不满足我们需求的时候,我们可以自定义我们自己的Hive函数,来满足我们的需求。
ZHANGHAO
2018/12/19
3.5K0
Spark UDF实现demo
使用Spark开发代码过程时,很多时候当前库中的算子不能满足业务需求。此时,UDFs(user defined functions) 派上非常大的作用。基于DataFrame(或者DataSet) 的Java(或Python、Scale) 可以轻松的定义注册UDF,但是想在SQL(SparkSQL、Hive) 中自定义或者想共用就遇到困难。这时,可以先按照一定规约自定义函数,再向Spark(或Hive)注册为永久函数,实现在Spark和Hive共享UDF的目的。
mikeLiu
2020/07/31
4.1K0
2021年大数据Hive(八):Hive自定义函数
Hive 自带了一些函数,比如:max/min等,但是数量有限,自己可以通过自定义UDF来方便的扩展。
Lansonli
2021/10/11
1.1K0
【详解】Hive自定义函数
Apache Hive 是一个基于 Hadoop 的数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的 SQL 查询功能,可以将 SQL 语句转换为 MapReduce 任务进行运行。其优点是学习成本低,可以通过类 SQL 语法快速分析海量数据。
大盘鸡拌面
2025/07/08
1510
Hive java实现简单UDF函数
https://cwiki.apache.org/confluence/display/Hive/HivePlugins
esse LL
2024/05/28
3910
Hive的自定义函数与通过reflect调用java方法
发现hive自带的函数就有近一百个,但我们平时经常用到的可能就那么几个,并且自带的函数功能还十分受限!有时候,为了更好的实现业务需求,可能就需要我们去自定义Hive! 根据用户自定义函数类别分为以下三种:
大数据梦想家
2021/01/22
1.7K0
Hive的自定义函数与通过reflect调用java方法
Hadoop基础教程-第12章 Hive:进阶(12.2 自定义函数)(草稿)
本文介绍了Hadoop基础教程-第12章 Hive:进阶的相关内容。主要讲解了Hive中自定义函数的实现,包括UDP、自定义UDF以及UDAF。通过案例展示了如何调用自定义函数进行查询。
程裕强
2018/01/02
7670
【Apache Doris】自定义函数之JAVA UDF详解
导读 本文主要分享 Apache Doris 1.2版本之后如何构建 JAVA UDF。
一臻数据
2024/12/24
1.1K0
【Apache Doris】自定义函数之JAVA UDF详解
hive学习笔记之九:基础UDF
如果您不想自己搭建kubernetes环境,推荐使用腾讯云容器服务TKE:无需自建,即可在腾讯云上使用稳定, 安全,高效,灵活扩展的 Kubernetes 容器平台;
程序员欣宸
2021/07/11
6090
hive学习笔记之九:基础UDF
HIVE的UDF以及JDBC编程
HIVE的UDF以及JDBC编程 一、UDF     UDF是用来对HIVE函数库进行扩展的,可以利用java代码进行自定义的功能需求。 1、步骤     1.新建java工程。     2.导入HIVE相关包,jar包在HIVE安装程序的lib目录下,只需要拷贝jar包即可。     3.创建类继承UDF类。     4.自己编写一个名为evaluate方法,返回值和参数任意,但是方法名字必须是evluate。     为了能让mapreduce处理,String要用Text处理。     5.将写好的类
云飞扬
2018/05/11
1.3K0
大数据-UDF开发实例
3.3. UDF 开发实例 3.3.1. Step 1 创建 Maven 工程 <dependencies> <!-- https://mvnrepository.com/artifact/org.apache.hive/hive-exec --> <dependency> <groupId>org.apache.hive</groupId> <artifactId>hive-exec</artifactId>
cwl_java
2019/12/26
7100
大数据-UDF开发实例
Hadoop数据分析平台实战——140Hive函数以及自定义函数讲解离线数据分析平台实战——140Hive函数以及自定义函数讲解
离线数据分析平台实战——140Hive函数以及自定义函数讲解 Hive函数介绍 HQL内嵌函数只有195个函数(包括操作符,使用命令show functions查看),基本能够胜任基本的hive开发,但是当有较为复杂的需求的时候,可能需要进行定制的HQL函数开发。 HQL支持三种方式来进行功能的扩展(只支持使用java编写实现自定义函数),分别是:UDF(User-Defined Function)、UDAF(User-Defined Aggregate Function)和UDTF(User-Defin
Albert陈凯
2018/04/08
7010
(五)Hive的UDF、UDAF和UDTF自定义函数
order by(全局排序):不经常用 sort by+distrbutre by :经常用
wolf
2020/09/20
1K0
相关推荐
Hive之UDFs(User-Defined Functions )
更多 >
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档