一, 简介
hive 由 Facebook 开源用于解决海量结构化日志的数据统计. hive 是基于 Hadoop 的一个数据仓库工具, 是基于 Hadoop 之上的, 文件是存储在 HDFS 上的, 底层运行的是 MR 程序. hive 可以将结构化的数据文件映射成一张表, 并提供类 SQL 查询功能.
二, HIVE 特点
构建在 Hadoop 之上的数据仓库
使用 HQL 作为查询接口
使用 HDFS 存储
使用 MapReduce 计算
本质: 将 HQL 转化成 MapReduce 程序
灵活性和扩展性比较好: 支持 UDF, 自定义存储格式等
适合离线数据处理
hive 在 Hadoop 生态系统中的位置:
三, hive 体系结构
用户接口:
ClientCLI(hive shell),JDBC/ODBC(java 访问 hive),webUI(浏览器访问 hive)
元数据: Metastore
元数据包括: 表名, 表所属数据库, 表的拥有者, 列 / 分区字段, 表的类型(是否外部表), 表数据所在目录等
Hadoop
使用 HDFS 存储, 使用 MR 计算
驱动器: Driver
包含: 解析器, 编译器, 优化器, 执行器
解析器
将 SQL 字符串转换成抽象语法书 AST, 这一步一般都用第三方工具库完成, 比如 antlr; 对 AST 进行语法分析, 比如表是否存在, 字段是否存在, SQL 语义是否有误等
编译器
将 AST 编译生成逻辑执行计划
优化器
对逻辑执行计划进行优化
执行器
把逻辑执行计划转化成可以运行的物理计划. 对 hive 来说, 就是 MR/TEZ/SPARK
四, hive 优点
操作接口采用类 SQL 语法, 提供快速开发的能力(简单, 容易上手)
避免了去写 MR, 减少开发人员的学习成本
统一的元数据管理, 可以与 impala/spark 等共享元数据
易扩展(HDFS+MR: 可以扩展集群规模; 支持 UDF,UDAF,UDTF 等自定义函数)
五, 使用场景
数据的离线处理, 比如: 日志分析, 海量结构化数据离线分析...
Hive 的执行延迟比较高, 因此 hive 常用于数据分析的, 对实时性要求不高的场合
Hive 的优势在于处理大数据, 对于小数据没有优势, 因为 Hive 的执行延迟比较高
六, hive 部署安装
* 注意: 安装部署 hive 之前, 首先要安装完成 jdk 和 hadoop. 如有需要, 可以查看博客: Haoop2.5.0 伪分布式环境搭建 https://www.cnblogs.com/tangxc8282/p/10791436.html .
step1: 解压安装包
tar -xzvf apache-hive-0.13.1-bin.tar.gz -C /opt/software/
step2: 在 hdfs 上创建 hive 所需要的目录及权限修改
- hdfs dfs -mkdir /tmp
- hdfs dfs -mkdir -p /user/hive/warehouse
- hdfs dfs -chmod g+w /tmp
- hdfs dfs -chmod g+w /user/hive/warehouse
step3: 修改 hive-env.sh 中 HADOOP_HOME 及 HIVE_CONF_DIR 属性值, 注意改名
- # Set HADOOP_HOME to point to a specific hadoop install directory
- HADOOP_HOME=/opt/software/hadoop-2.5.0
- # Hive Configuration Directory can be controlled by:
- export HIVE_CONF_DIR=/opt/software/hive-0.13.1-bin/conf
step4:hive 元数据信息默认是使用的 Derby 数据库, derby 数据库只支持一个 hive 连接, 修改为使用关系型数据库 MySQL 存储 hive 元数据信息.
1. 安装 MySQL 数据库
- # 查询系统中没有 MySQL
- sudo rpm -qa | grep MySQL
- # 卸载自带的 MySQL 库
- sudo rpm -e --nodeps MySQL-libs-5.1.66-2.el6_3.x86_64
- # 使用 yum 进行 MySQL 的安装
- sudo yum -y install MySQL-server
- # 查看 mysqld 服务是否开启
- sudo service mysqld status
- # 启动 MySQL 服务
- sudo service mysqld start
- # 设置开机启动 mysqld
- sudo chkconfig mysqld on
- # 设置 MySQL 管理员 root 的密码
- mysqladmin -u root password '123456'
2. 设置 MySQL 的连接权限
- MySQL -uroot -p # 进入 MySQL 命令行
- grant all privileges on *.* to 'root'@'%' identified by '123456' with grant option;
- flush privileges; # 刷新
- quit; # 退出
- sudo service mysqld restart # 重启 MySQL 服务
3. 自定义 hive 的配置文件, 从默认的文件 (hive-default.xml.template) 拷贝一份过来, 重命名为 hive-site.xml, 然后删除其中的内容, 添加以下内容:
- <?xml version="1.0" encoding="UTF-8" standalone="no"?>
- <?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
- <!--
- Licensed to the Apache Software Foundation (ASF) under one or more
- contributor license agreements. See the NOTICE file distributed with
- this work for additional information regarding copyright ownership.
- The ASF licenses this file to You under the Apache License, Version 2.0
- (the "License"); you may not use this file except in compliance with
- the License. You may obtain a copy of the License at
- http://www.apache.org/licenses/LICENSE-2.0
- Unless required by applicable law or agreed to in writing, software
- distributed under the License is distributed on an "AS IS" BASIS,
- WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
- See the License for the specific language governing permissions and
- limitations under the License.
- -->
- <configuration>
- <property>
- <name>hive.exec.mode.local.auto</name>
- <value>true</value>
- </property>
- <property>
- <name>hive.exec.mode.local.auto.input.files.max</name>
- <value>100</value>
- </property>
- <property>
- <name>hive.exec.mode.local.auto.inputbytes.max</name>
- <value>13421772800000</value>
- </property>
- <property>
- <name>hive.cli.print.header</name>
- <value>true</value>
- </property>
- <property>
- <name>hive.cli.print.current.db</name>
- <value>true</value>
- </property>
- <property>
- <name>javax.jdo.option.ConnectionDriverName</name>
- <value>com.MySQL.jdbc.Driver</value>
- </property>
- <property>
- <name>javax.jdo.option.ConnectionURL</name>
- <value>jdbc:MySQL://bigdata01:3306/hive?createDatabaseIfNotExist=true&useSSL=true&useUnicode=true&characterEncoding=UTF-8</value>
- </property>
- <property>
- <name>javax.jdo.option.ConnectionUserName</name>
- <value>hive</value>
- </property>
- <property>
- <name>javax.jdo.option.ConnectionPassword</name>
- <value>hive</value>
- </property>
- <property>
- <name>hive.metastore.uris</name>
- <value>thrift://bigdata01:9083</value>
- </property>
- <property>
- <name>hive.server2.thrift.port</name>
- <value>10013</value>
- </property>
- </configuration>
4. 拷贝 MySQL 驱动到 / opt/software/hive-0.13.1-bin/lib / 目录下
至此, hive 部署完成, 即可通过命令行输入 hive 进入 hive 环境.
来源: http://www.linuxidc.com/Linux/2019-04/158391.htm