HIVE小结 HIVE基本语法，大数据基础知识理解_技术 _ 頭條網

HIVE和Mysql十分类似
建表规则

1，CREATE TABLE 创建一个指定名字的表。如果相同名字的表已经存在，则抛出异常；用户可以用 IF NOT EXIST 选项来忽略这个异常

2，EXTERNAL 关键字可以让用户创建一个外部表，在建表的同时指定一个指向实际数据的路径（LOCATION）

3.LIKE 允许用户复制现有的表结构，但是不复制数据

4.COMMENT可以为表与字段增加描述

创建表
hive> CREATE TABLE IF NOT EXISTS test1
> (id INT,name STRING);

删除表
drop table test1;
查看表结构
desc test1;
修改表名
alter table test1 rename to test2;
修改表结构
alter table test1 add columns(address string ,grade string);
创建和已知表相同结构的表
create table test3 like test1;

加载本地数据
load date local inpath '/home/date/' into table test1;
注意可以在into 前面添加overwrite表示覆盖之前在test1的数据，如果没有就表示加载本地数据在原始数据的后面
加载hdfs的文件
首先将文件上传到hdfs文件系统对对应的目录上
hadoop fs -put /home/.txt /usr/
然后加载hdfs中的数据
load data inpath /usr/ into table test1;

插入数据
insert overwrite table test2 select * from test1;
查询数据
和mysql语法上没甚没区别

查询单个字段的数据

where条件查询

all和distinct

limit限制查询

group by

order by

sort bu

distribute by

cluster by

HIVE分区

hive分区是为了更方便数据管理，常见的有时间分区和业分区

需要注意的是分区字段不能和表中的字段重复，否则就会报错：

我们在加载数据的时候也可以分区加载

之后我们再将同一份数据加载到不同的分区中

查询一下数据 select * from t1;

创建分区除了在创建表的时候启动partition by实现，还可以
alter table t1 add partition (pt_d string)
这样就创建了一个分区，这时会看到hive在hdfs中创建了相应的文件夹

查询相应的分区的数据

添加分区，增加一个分区文件

删除分区（删除对应的分区文件）
注意，对于外表进行drop partition并不会删除hdfs上的文件，并且通过msck repair table table_name同步回hdfs上的分区。

内部表和外部表的区别

Hive中表与外部表的区别：
1、在导入数据到外部表，数据并没有移动到自己的数据仓库目录下，也就是说外部表中的数据并不是由它自己来管理的！而表则不一样；
2、在删除表的时候，Hive将会把属于表的元数据和数据全部删掉；而删除外部表的时候，Hive仅仅删除外部表的元数据，数据是不会删除的！
那么，应该如何选择使用哪种表呢？在大多数情况没有太多的区别，因此选择只是个人喜好的问题。但是作为一个经验，如果所有处理都需要由Hive完成，那么你应该创建表，否则使用外部表！

原文：

觉得文章不错也想从事IT的朋友可关注我，微信公众号：程序员理想

相關文章:

Hadoop数据仓库框架-Hive v3.1.2系统架构

hive复杂结构之array,map,struct

三分钟读懂hadoop、hbase、hive、spark分布式系统架构

Hive 热门数据分析面试题解析

数仓就这么难吗？那你可能是缺这两个：HBase+Hive

《大数据分析教程-Hive》

Hive SQL基本使用详解

03.05 Hive SQL基本使用详解

03.04 Hive 基础知识大补

03.01 Hive JDBC操作

03.01 Hive WordCount实现示例

01.29 Hive 用户指南 v1.0

01.29 2. HIVE 基本操作

优化 Hive ETL 任务(参数篇)

01.18 优化 Hive ETL 任务(参数篇)

大数据 Hive 笔记大全 收藏+转发+关注

java JDBC连接Impala（impala使用一篇解决）

60TB 数据量的作业从 Hive 迁移到 Spark 在 Facebook 的实践

12.24 60TB 数据量的作业从 Hive 迁移到 Spark 在 Facebook 的实践

12.20 Hive 和 Impala的比较

11.24 美团 MySQL 数据实时同步到 Hive 的架构与实践

Hive 自定UDF函数，生成 32 位随机数

Hadoop 生态之 MapReduce 及 Hive 简介

hive的窗口函数

hive 基础SQL

hive on spark,spark sql 对比测试结果相差很大

知道hive的这些ddl和dml操作语句，离从一个小白变大神就不远了

【HIVE】不会Java也能操作Hadoop，常用HQL语句，收藏就是赚了。

【HIVE】程序员不会大数据Hadoop？你会SQL语句就学会一半了。

hive日期函数

Apache Hive 联邦查询（Query Federation）

Hive 体系

基于 Hive UDF 的机器学习算法工具 Apache Hivemall 荐

一个数据仓库时代开始——Hive

09.03 我自己总结的Pandas数据分析库的使用技巧（简洁）

Hadoop、Hive、Zookeeper、Pig、HBase和Mahout等，都要认真学习

了解hive的默认数据库：default数据库

hive分桶表创建表导入数据和删除数据操作

执行hive存储过程的hplsql的下载和安装

SQL使得Hive和SparkSQL使用存储过程

执行Hive存储过程的hplsql命令行使用方法

hadoop上gz压缩格式文件加载到hive表：数据分析87篇

第二章 IoC容器和Bean配置

运算里不得不说的python模块—math

Devops度量--DevOps 现状快速检查表

SOP是什么（解读）

还不知道交换机上如何配置DHCP，赶紧过来围观吧，一分钟包你学会

还在手动配置IP地址吗？太Low了，一分钟教会您如何配置DHCP

Python爬虫自学笔记：分析头条文章网页源文件

DNS侦查工具

国人开源的异步 Python ORM：GINO

程序测评：Create React App 3.3中有哪些酷炫新功能？

“明学”的魅力？我只要我觉得：驾驭终端，提高生产力

（必收藏系列）Linux面试题——命令集

五分钟学会如何在 IPFS 上部署网站

「正点原子NANO STM32F103开发板资料连载」第29章 内存管理实验

小白怎么学Web前端开发 如何成为技术达人

如何开发一个web静态服务器

学Java编程还有前景吗 如何才能拿到高薪

Python网络爬虫之配置篇（一）

SpringBoot 整合SpringSecurity示例实现前后分离权限注解+JWT登录认证

Python的运行效率太低？几行代码快速提升！

python的优点是什么？最新Python400集视频（附教程）

MySQL中OOM故障应如何下手-爱可生

像专家一样使用 panic

30种不同的编程语言怎么写“Hello, World”

percona QAN 介绍

面试官：你可以用纯CSS判断鼠标进入的方向吗？

网络工程师职业生涯中，哪两点是最重要的？

交换机中相关术语代表什么意思，有必要弄清楚

由浅入深了解以太坊 2.0：最常见问题和最全学习清单

【Linux简单实用小命令001】CentOS 7、8的防火墙端口开放

吃透这些IPFS硬核知识点，日后抢头矿随时“弯道超车”

Hive分桶表

Spring中资源的加载原来是这么一回事啊！

自己动手搭建邮件系统：怎样让Exchange Server 发出第一封邮件？

【MySQL】RDS物理备份文件(.idb\.frm)恢复到MySQL自建数据库

NLP算法入门系列：隐含马尔可夫链(HMM)模型的简单介绍

第一章 Spring Framework概述

大数据 Hive 笔记大全收藏+转发+关注

「正点原子NANO STM32F103开发板资料连载」第29章内存管理实验

小白怎么学Web前端开发如何成为技术达人

学Java编程还有前景吗如何才能拿到高薪