hive3.1核心源码思路

系列文章目录

大数据主要组件核心源码解析

文章目录

系列文章目录
- 大数据主要组件核心源码解析
前言
一、HQL转化为MR 核心思路
二、核心代码
- 1. 入口类，生命线
- 2. 编译代码
- 3. 执行代码
总结

前言

提示：这里可以添加本文要记录的大概内容：

对大数据几个核心组件的源码，记录一下生命线

提示：以下是本篇文章正文内容，下面案例可供参考

一、HQL转化为MR 核心思路

在这里插入图片描述

二、核心代码

1. 入口类，生命线

CliDriver.mainrun()executeDriver()cli.processLine(ss.execString);--hive -e 和 hive读取命令CliDriver.processLine()List<String> commands = splitSemiColon(line);processCmd(command);processLocalCmd(cmd, proc, ss)if (proc instanceof IDriver) IDriver qp = (IDriver) proc;qp.run(cmd)Driver.run()runInternal(command, alreadyCompiled：false);compileInternal(command, true); --关键代码1：编译sqlexecute();                      --关键代码2： 执行hql

2. 编译代码

--关键代码1：编译sqlDriver.compileInternal(command, true); compile(command, true, deferClose);  ASTNode tree = ParseUtils.parse(command, ctx);  --解析器工作// Do semantic analysis and plan generationBaseSemanticAnalyzer sem = SemanticAnalyzerFactory.get(queryState, tree); --编译器、优化器工作sem.analyze(tree, ctx);// get the output schemaschema = getSchema(sem, conf);plan = new QueryPlan(queryStr, sem, perfLogger.getStartTime(PerfLogger.DRIVER_RUN), queryId, queryState.getHiveOperation(), schema);

3. 执行代码

	 --关键代码2： 执行hql		   Driver.execute(); TaskRunner runner = launchTask(task, queryId, noName, jobname, jobs, driverCxt);TaskRunner tskRun = new TaskRunner(tsk);tskRun.start();TaskRunner.run()runSequential()tsk.executeTask(ss == null ? null : ss.getHiveHistory());--tsk的各种实现类运行  ExecDriver（MR任务的driver类） 、CopyTask, DDLTask, MapRedTask等int retval = execute(driverContext);	--不同的task实现执行ExecDriver（MR任务的driver类） mr任务构造、提交