大数据分析查询引擎Impala

发布时间：2021-03-05 16:34:27 所属栏目：大数据来源：网络整理

导读：来自标点符的《大数据分析查询引擎Impala》作者：标点符（钱魏 Way）链接：http://www.biaodianfu.com/impala.html Impala是Cloudera公司主导开发的新型查询系统，它提供SQL语义，能查询存储在Hadoop的HDFS和HBase中的PB级大数据。已有的Hive系统虽然也提

提供给用户查询使用的命令行工具（Impala Shell使用python实现），同时Impala还提供了Hue，JDBC， ODBC使用接口。该客户端工具提供一个交互接口，供使用者发起数据查询或管理任务，比如连接到impalad。这些查询请求会传给ODBC这个标准查询接口。说白了，就是一个命令行客户端。

与Hive的关系

Impala与Hive都是构建在Hadoop之上的数据查询工具各有不同的侧重适应面，但从客户端使用来看Impala与Hive有很多的共同之处，如数据表元数据、ODBC/JDBC驱动、SQL语法、灵活的文件格式、存储资源池等。Impala与Hive在Hadoop中的关系下图所示。Hive适合于长时间的批处理查询分析，而Impala适合于实时交互式SQL查询，Impala给数据分析人员提供了快速实验、验证想法的大数据分析工具。可以先使用hive进行数据转换处理，之后使用Impala在Hive处理后的结果数据集上进行快速的数据分析。

大数据分析查询引擎Impala

SQL支持度：

支持SQL92中的大部分select语句，以及SQL2003标准中的分析函数。不支持DELETE和UPDATE，但是支持批量装载数据（insert into select,LOAD DATA) 和批量删除数据（drop partition）。除此之外，用户也可直接操作HDFS文件实现数据装载和清理。

查询执行

impalad分为frontend和backend两个层次， frondend用java实现（通过JNI嵌入impalad），负责查询计划生成，而backend用C++实现，负责查询执行。

大数据分析查询引擎Impala

frontend生成查询计划分为两个阶段：（1）生成单机查询计划，单机执行计划与关系数据库执行计划相同，所用查询优化方法也类似。（2）生成分布式查询计划。根据单机执行计划，生成真正可执行的分布式执行计划，降低数据移动，尽量把数据和计算放在一起。

大数据分析查询引擎Impala

上图是SQL查询例子，该SQL的目标是在三表join的基础上算聚集，并按照聚集列排序取topN。 impala的查询优化器支持代价模型：利用表和分区的cardinality，每列的distinct值个数等统计数据， impala可估算执行计划代价，并生成较优的执行计划。上图左边是frontend查询优化器生成的单机查询计划，与传统关系数据库不同，单机查询计划不能直接执行，必须转换成如图右半部分所示的分布式查询计划。该分布式查询计划共分成6个segment（图中彩色无边框圆角矩形），每个segment是可以被单台服务器独立执行的计划子树。

impala支持两种分布式join方式，表广播和哈希重分布：表广播方式保持一个表的数据不动，将另一个表广播到所有相关节点（图中t3）；哈希重分布的原理是根据join字段哈希值重新分布两张表数据(譬如图中t1和t2）。分布式计划中的聚集函数分拆为两个阶段执行。第一步针对本地数据进行分组聚合（Pre-AGG）以降低数据量，并进行数据重分步，第二步，进一步汇总之前的聚集结果（mergeAgg）计算出最终结果。与聚集函数类似， topN也是分为两个阶段执行，（1）本地排序取topN，以降低数据量；（2） merge sort得到最终topN结果。

Backend从frontend接收plan segment并执行，执行性能非常关键，impala采取的查询性能优化措施有

向量执行。一次getNext处理一批记录，多个操作符可以做pipeline。
LLVM编译执行， CPU密集型查询效率提升5倍以上。
IO本地化。利用HDFS short-circuit local read功能，实现本地文件读取
Parquet列存，相比其他格式性能最高提升5倍。

资源管理

impala通常与MR等离线任务运行在一个集群上，通过YARN统一管理资源，如何同时满足交互式查询和离线查询两种需求具有较大挑战性。 YARN通过全局唯一的Resource Mananger调度资源，好处是RM拥有整个集群全局信息，能做出更好调度决策，缺点是资源分配的性能不足。 Impala每个查询都需要分配资源，当每秒查询数上千时， YARN资源分配的响应时间变的很长，影响到查询性能。目前通过两个措施解决这个问题：（1）引入快速、非集中式的查询准入机制，控制查询并发度。（2）LLAM（low latency application master）通过缓存资源，批量分配，增量分配等方式实现降低资源分配延时

Impala相对于Hive所使用的优化技术

没有使用MapReduce进行并行计算，虽然MapReduce是非常好的并行计算框架，但它更多的面向批处理模式，而不是面向交互式的SQL执行。与MapReduce相比：Impala把整个查询分成一执行计划树，而不是一连串的MapReduce任务，在分发执行计划后，Impala使用拉式获取数据的方式获取结果，把结果数据组成按执行树流式传递汇集，减少的了把中间结果写入磁盘的步骤，再从磁盘读取数据的开销。Impala使用服务的方式避免每次执行查询都需要启动的开销，即相比Hive没了MapReduce启动时间。
使用LLVM产生运行代码，针对特定查询生成特定代码，同时使用Inline的方式减少函数调用的开销，加快执行效率。
充分利用可用的硬件指令（2）。
更好的IO调度，Impala知道数据块所在的磁盘位置能够更好的利用多磁盘的优势，同时Impala支持直接数据块读取和本地代码计算checksum。
通过选择合适的数据存储格式可以得到最好的性能（Impala支持多种存储格式）。
最大使用内存，中间结果不写磁盘，及时通过网络以stream的方式传递。

Impala与Hive的异同

相同点：

数据存储：使用相同的存储数据池都支持把数据存储于HDFS,HBase。
元数据：两者使用相同的元数据。
SQL解释处理：比较相似都是通过词法分析生成执行计划。

不同点：

执行计划：

（编辑：威海站长网）

【声明】本站内容均来自网络，其相关言论仅代表作者个人观点，不代表本站立场。若无意侵犯到您的权利，请及时与联系站长删除相关内容!

3/9

首页

尾页

HDFS 为什么在大数据领	从人工智能到团队协作
为啥给文本和数据挖掘	结合数据和知识多样性