Python进阶编程 --- 2.MySQL、pymysql、PySpark

文章目录

    • 第一章:SQL基础入门
      • 1.1 数据库
        • 数据库如何存储数据
      • 1.2 数据库和SQL的关系
      • 1.3 MySQL版本
      • 1.4 命令提示符内使用MySQL
      • 1.5 SQL概述
        • 1.5.1 SQL语言分类
        • 1.5.2 SQL语言特性
      • 1.6 DDL
          • 库管理
          • 表管理
      • 1.7 DML - 数据操作
      • 1.8 DQL - 查询和计算数据
        • 1.8.1 基础数据查询
        • 1.8.2基础数据查询 - 过滤
        • 1.8.3 分组聚合
        • 1.8.4 结果排序
        • 1.8.5 结果分页限制
      • 1.9 Python - MySQL
        • 1.9.1 pymysql
        • 1.9.2 数据插入
    • 第二章:PySpark基础入门
      • 2.1 PySpark库的安装
      • 2.2 PySpark编程步骤
      • 2.3 PySpark编程模型
      • 2.4 数据输入
        • 2.4.1 RDD对象
        • 2.4.2 Python数据容器转RDD对象
        • 2.4.3 读取文件转RDD对象
      • 2.5 数据计算
        • 2.5.1 map方法

第一章:SQL基础入门

1.1 数据库

在这里插入图片描述

数据库如何存储数据

在这里插入图片描述

1.2 数据库和SQL的关系

数据库用来存储数据,在该过程中,将会涉及:

  • 新增数据

  • 删除数据

  • 修改数据

  • 查询数据

  • 数据库、数据表的管理

SQL语言是一种对数据库、数据进行操作、管理、查询的工具。

1.3 MySQL版本

  • 社区版(免费)

  • 集群版(免费)

  • 商业版(收费)

  • 高级集群版(收费)

1.4 命令提示符内使用MySQL

打开命令提示符程序,输入:mysql -uroot -p,回车输入密码,即可进入命令行环境

  • show database; //查看有哪些数据库

  • use 数据库名 //使用某个数据库

  • show tables //查看数据库内有哪些表

  • exit //退出MySQL的命令行环境

1.5 SQL概述

SQL:结构化查询语言,用于访问和处理数据库的标准的计算机语言

1.5.1 SQL语言分类
  • 数据定义:DDL

     库的创建删除、表的删除创建等
    
  • 数据操纵:DML

      新增数据、删除数据、修改数据等
    
  • 数据控制:DCL

      新增用户、删除用户、密码修改、权限管理等
    
  • 数据查询:DQL

      基于需求查询和计算数据
    
1.5.2 SQL语言特性
  • 大小写不敏感

  • 可单行或多行书写,;号结束

  • 支持注释
    单行注释: – 注释内容(–后面要有一个空格)
    单行注释:# 注释内容

    多行注释:/* 注释内容 */
    

1.6 DDL

库管理
  • 查看数据库:SHOW DATATBASES;

  • USE 数据库名;

  • CREATE DATABASE 数据库名 [CHARSET UTF8];

  • DROP DATABASE 数据库名;

  • SELECT DATABASE();

在这里插入图片描述

表管理
  • 查看表:SHOW TABLES; # 使用前需先选择数据库

  • 删除表:DROP TABLE 表名;

                     DROP TABLE IF EXISTS 表名;
    
  • 创建表:CREATE TABLE 表名(
    列名称 列类型,
    列名称 列类型

    );

    列类型说明
    int整数
    float浮点数
    varchar(长度)文本,长度为数字,为最大长度限制
    date日期
    timestamp时间戳

在这里插入图片描述
在这里插入图片描述

1.7 DML - 数据操作

  • 插入INSERT:INSERT INTO表[(列1,列2,…,列N)] VALUES(值1,值2,…,值N) [,(值1,值2,…,值N),…,(值1,值2,…,值N)];

  • 删除DELETE:DELETE FROM 表名 [WHERE 条件判断];

  • 更新UPDATE:UPDATE 表名 SET 列=值 [WHERE 条件判断];

  • 在这里插入图片描述

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

1.8 DQL - 查询和计算数据

1.8.1 基础数据查询

语法:SELECT 字段列表 |* FROM 表
在这里插入图片描述
在这里插入图片描述

1.8.2基础数据查询 - 过滤

语法:SELECT 字段列表 |* FROM 表 WHERE 条件判断

在这里插入图片描述

1.8.3 分组聚合

语法:SELECT 字段| 聚合函数 FROM 表 [WHERE 条件] GROUP BY 列

聚合函数:

  • SUM(列) 求和

  • AVG(列) 求平均值

  • MIN(列) 求最小值

  • MAX(列) 求最大值

  • COUNT(列|*) 求数量

在这里插入图片描述

1.8.4 结果排序

语法

SELECT 列|聚合函数|* FROM 表

WHERE …

GROUP BY …

ORDER BY … [ASC | DESC]
在这里插入图片描述

1.8.5 结果分页限制

语法

SELECT 列|聚合函数|* FROM 表

WHERE …

GROUP BY …

ORDER BY … [ASC | DESC]

LIMIT n[, m]

在这里插入图片描述

执行顺序:FROM->WHERE->GROUP BY与聚合函数 -> SELECT -> ORDER BY -> LIMIT

1.9 Python - MySQL

1.9.1 pymysql

基础使用

安装:pip install pymysql

创建到MySQL的数据库链接

from pymysql import Connection
# 获取到MySQL数据库的链接对象
conn = Connection(host="localhost",    # 主机名port=3306,           # 端口user="root",         # 账户名password="123456"    # 密码
)print(conn.get_server_info()) # 打印MySQL数据库信息conn.close() # 关闭到数据库的链接

执行SQL语句

from pymysql import Connection
# 获取到MySQL数据库的链接对象
conn = Connection(host="localhost",    # 主机名port=3306,           # 端口user="root",         # 账户名password="123456"    # 密码
)cursor = conn.cursor() # 获取游标对象
conn.select_db("world") # 选择数据库
cursor.execute("select * from student") # 用游标对象,执行SQL语句
results: tuple = cursor.fetchall() # 获取查询结果
for r in results:print(r)
conn.close() # 关闭到数据库的链接
1.9.2 数据插入

commit提交

pymysql在执行数据插入或其他产生数据更改的SQL语句时,默认是需要提交更改的,通过代码确认该更改行为

链接对象.commit()即可确认此行为

from pymysql import Connection
# 获取到MySQL数据库的链接对象
conn = Connection(host="localhost",    # 主机名port=3306,           # 端口user="root",         # 账户名password="123456"    # 密码
)cursor = conn.cursor() # 获取游标对象
conn.select_db("world") # 选择数据库
cursor.execute("insert into student values(7, '小东', 20)") # 用游标对象,执行SQL语句
conn.commit() # 确认
conn.close() # 关闭到数据库的链接

自动commit

conn = Connection(host="localhost",    # 主机名port=3306,           # 端口user="root",         # 账户名password="123456",   # 密码autocommit= True     # 设置自动提交  
)

第二章:PySpark基础入门

Spark:Apache Spark是用于大规模数据处理的同一分析引擎。

Spark是一款分布式的计算框架,用于调度成百上千的服务器集群,计算海量数据

PySpark是由Spark官方开发的Python语言第三方库

2.1 PySpark库的安装

安装:pip install pyspark

构建PySpark执行环境入口对象

执行环境入口对象:类 SparkContext的 类对象

from pyspark import SparkConf,SparkContext # 导包conf = SparkConf().setMaster("local[*]").setAppName(("test_spark")) # 创建SparkConf类对象sc = SparkContext(conf=conf) # 基于SparkConf类对象创建SparkContext类对象print(sc.version) # 打印PySpark的运行版本sc.stop() # 停止SparkContext对象的运行

SparkContext类对象,是PySpark编程中一切功能的入口

2.2 PySpark编程步骤

PySpark编程,主要分三大步骤:

  • 数据输入:通过SparkContext类对象的成员方法完成对数据的读取操作,读取后获得RDD类对象

  • 数据处理计算:通过RDD类对象的成员方法,完成各种数据计算的需求

  • 数据输出:将处理完的RDD对象,调用各种成员方法完成写出文件、转换为list等操作

2.3 PySpark编程模型

在这里插入图片描述

  • 通过SparkContext对象完成数据输入

  • 输入数据后得到RDD对象,对RDD对象进行迭代计算

  • 最终通过RDD对象的成员方法完成数据输出

2.4 数据输入

2.4.1 RDD对象

RDD全称为:弹性分布式数据集

PySpark针对数据的处理,都以RDD对象作为载体

  • 数据存储在RDD内

  • 各类数据的计算方法,也都为RDD的成员方法

  • RDD的数据计算方法,返回值依然是RDD对象

2.4.2 Python数据容器转RDD对象

通过SparkContext对象的parallelize成员方法,将list\tuple\set\dict\str转为PySpark的RDD对象

在转换时,需注意字符串会被拆成一个个的字符,存入RDD对象中,字典仅有key会被存入RDD对象中。

from pyspark import SparkConf,SparkContext # 导包
conf = SparkConf().setMaster("local[*]").setAppName(("test_spark")) # 创建SparkConf类对象
sc = SparkContext(conf=conf) # 基于SparkConf类对象创建SparkContext类对象rdd1 = sc.parallelize([1, 2, 3])
rdd2 = sc.parallelize((1, 2, 3))
rdd3 = sc.parallelize("hello")
rdd4 = sc.parallelize({1, 2, 3})
rdd5 = sc.parallelize({"key1":1, "key2": 2})print(rdd1.collect()) # 输出RDD内容
print(rdd2.collect()) # 输出RDD内容
print(rdd3.collect()) # 输出RDD内容
print(rdd4.collect()) # 输出RDD内容
print(rdd5.collect()) # 输出RDD内容sc.stop() # 停止SparkContext对象的运行
2.4.3 读取文件转RDD对象

通过SparkContext入口对象,读取文件,构建出RDD对象

from pyspark import SparkConf,SparkContext # 导包
conf = SparkConf().setMaster("local[*]").setAppName(("test_spark")) # 创建SparkConf类对象
sc = SparkContext(conf=conf) # 基于SparkConf类对象创建SparkContext类对象
rdd = sc.textFile("E:/learn - coding/Python/2024_04_13/hello.txt")
print(rdd.collect())
sc.stop() # 停止SparkContext对象的运行

2.5 数据计算

2.5.1 map方法

PySpark的数据计算,都基于RDD对象进行的,依赖于RDD对象中内置丰富的成员方法(算子)

map算子:将RDD的数据一条条处理,返回新的RDD

语法

rdd.map(func)
# func: f:(T) -> U
# f:表示这是一个函数或方法
# (T) -> U 表示的是方法的定义
# () 表示传入参数,(T)表示传入1个参数,()表示没有传入参数
# T 泛型的代称,在这表示任意类型
# U 泛型的代称,在这表示任意类型
# -> U 表示返回值
# (T) -> U 表示这是个方法,该方法接受一个参数传入,传入参数类型不限,返回一个返回值,返回值类型不限
# (A) -> A 表示这是个方法,该方法接受一个参数传入,传入参数类型不限,返回一个返回值,返回值类型和传入参数类型一致

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/310478.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

gitlab(docker)安装及使用

GitLab GitLab 是一个用于仓库管理系统的开源项目,使用Git作为代码管理工具,并在此基础上搭建起来的Web服务。 下载(docker) 查询docker镜像gitlab-ce gitlab-ce是它的社区版 [rootlocalhost ~]# docker search gitlab-ce NAME …

《Kubernets证书篇:基于Kylin V10+ARM架构CPU修改K8S 1.26.15版本证书时间限制》

一、背景 Kubernetes 默认的证书有效期只有1年,因此需要每年手动更新一次节点上面的证书,特别麻烦而且更新过程中可能会出现问题,因此我们要对 Kubernetes 的 SSL 证书有效期进行修改,这里将证书的时间限制修改为100年。 环境信息…

快速掌握Spring监控(Spring Boot admin)

监控 监控可视化监控平台Admin底层逻辑info 自定义端点 监控 监控的作用: 监控服务状态是否宕机监控服务运行指标(内存,虚拟机,线程,请求等)监控日志管理服务(服务下线) 监控的实…

【Linux】磁盘管理和文件系统

目录 一、硬盘 1.硬盘结构 2.结构类型 二、MBR与磁盘分区 1.MBR主引导记录 2.磁盘分区结构 三、文件系统类型 四、linux系统添加并使用新硬盘的步骤 1.添加新的硬盘 2.刷新识别 3.进行分区 4.格式化,创建文件系统 5.挂载使用 一、硬盘 1.硬盘结构…

部署项目的时候的一些错误

项目打jar包&#xff0c;找不到资源&#xff0c;连接不上数据库 项目打包后无法运行 直接在idea运行可以 解决方法&#xff1a;pom文件中增加&#xff08;配置文件如果是yml&#xff0c;写yml&#xff09; <resources><resource><directory>src/main/java&…

物联网的核心价值是什么?——青创智通

工业物联网解决方案-工业IOT-青创智通 物联网&#xff0c;这个词汇在当今的科技领域已经变得耳熟能详。但当我们深入探索物联网的核心价值时&#xff0c;我们会发现它远不止是一个简单的技术概念&#xff0c;而是一种能够彻底改变我们生活方式和工作方式的革命性力量。 物联网…

Niobe WiFi IoT开发板OpenHarmony内核编程开发——message

本示例将演示如何在Niobe WiFi IoT开发板上使用cmsis 2.0 接口进行消息队列开发 message API分析 osThreadNew() osThreadId_t osThreadNew(osThreadFunc_t func, void *argument,const osThreadAttr_t *attr )描述&#xff1a; 函数osThreadNew通过将线程添加到活动线程列表…

游戏生成式 AI:编织梦想,避开阴影

想象一下&#xff0c;一个沉浸式的游戏世界中玩家遇到的每个 NPC 都由 AI 驱动&#xff0c;他们能与玩家进行互动&#xff0c;从改变游戏体验。据 Inword 一项研究显示&#xff0c;绝大多数游戏玩家渴望这种互动&#xff0c;愿意投入更多的时间和金钱来玩这种由 AI 驱动的游戏。…

ActiveMQ主从架构和集群架构的介绍及搭建

一、主从和集群架构的特点 1.1 主从架构的-Master/slave模式特点 读写分离&#xff0c;纵向扩展&#xff0c;所有的写操作一般在master上完成&#xff0c;slave只提供一个热备 1.2 集群架构-Cluster模式特点 分布式的一种存储&#xff0c;水平的扩展&#xff0c;消息的分布…

idm线程越多越好吗 idm线程数多少合适 IDM百度云下载 IDM下载器如何修改线程数

IDM&#xff08;Internet Download Manager&#xff09;是一款流行的网络下载器&#xff0c;它支持多线程下载&#xff0c;这意味着它可以同时建立多个连接来下载文件的不同部分&#xff0c;从而提高下载速度。我们在使用IDM的时候总是有很多疑问&#xff0c;今天我们学习IDM线…

STM32H7上实现AD5758驱动

目录 概述 1 下载ADI 5758 Demo 2 AD5758驱动的移植 2.1 使用STM32CubeMX创建工程 2.2 接口函数实现 2.2.1 驱动接口列表 2.2.2 函数实现 2.2.3 修正ad5758驱动 3 AD5758应用程序 3.1 编写测试程序 3.1.1 配置参数结构 3.1.2 配置参数函数 3.1.3 读取参数函数 3.…

docker-compose部署RabbitMQ(一步到位)

docker-compose如下 version: 3.1 services:rabbitmq:restart: alwaysimage: rabbitmq:managementcontainer_name: rabbitmqhostname: rabbitports:- 5672:5672- 15672:15672environment:TZ: Asia/ShanghaiRABBITMQ_DEFAULT_USER: rabbitRABBITMQ_DEFAULT_PASS: 123456volumes…

SpringBoot 启动分析

一、序言 本文简单分析一下 SpringBoot 的启动流程。 二、SpringBoot 启动源码分析 public ConfigurableApplicationContext run(String... args) {// 记录当前时间的纳秒数&#xff0c;用于计算应用程序启动所花费的时间long startTime System.nanoTime();// 创建一个默认…

蓝桥杯2024年第十五届省赛

E:宝石组合 根据给的公式化简后变为gcd(a,b,c)根据算数基本定理&#xff0c;推一下就可以了 然后我们对1到mx的树求约数&#xff0c;并记录约数的次数&#xff0c;我们选择一个最大的且次数大于等3的就是gcd int mx; vector<int> g[N]; vector<int> cnt[N]; int…

VSCode中vue的packag.json报错:unable to load schema from‘ http://json.schema‘...问题解决

package.json有这个报错&#xff0c;类似于这种问题一般是网络连接有问题&#xff0c;无法加载重启一下就好。 但是如果是没有网络或者云桌面等环境不能连接外网&#xff0c;就在设置中把这个设置一下&#xff0c;这样就不报错了&#xff0c;根据需要选择处理。

MybatisPlus实现数据权限隔离

引言 Mybatis Plus对Mybatis做了无侵入的增强&#xff0c;非常的好用&#xff0c;今天就给大家介绍它的其中一个实用功能&#xff1a;数据权限插件。 数据权限插件的应用场景和多租户的动态拦截拼接SQL一样。建议点赞收藏关注&#xff0c;方便以后复习查阅。 依赖 首先导入M…

X-314智能合约:金融创新的强大引擎

&#x1f4a5;火爆到烫手的X-314智能合约&#x1f525; X-314智能合约是基于以太坊区块链开发的&#xff0c;具有高度可定制性和灵活性。 ave开单独板块&#xff1b;详细资料已经准备好&#xff1b;对web3感兴趣的大佬货&#xff1b;多交流多指导&#x1f91d; ​X-314智能合…

Android Studio通过修改文件gradle-wrapper.properties内容下载gradle

一、问题描述 在Android Studio中新建项目后会下载你所新建的项目的activity/gradle/wrapper目录下所配置的gradle-7.3.3-bin.zip包&#xff08;笔者的是该版本包&#xff09;&#xff0c;而大多数时候会下载失败&#xff0c;如下 二、解决办法 新建工程后&#xff0c;取消下…

GPT的使用

个人笔记&#xff08;整理不易&#xff0c;有帮助点个赞&#xff09; 笔记目录&#xff1a;学习笔记目录_pytest和unittest、airtest_weixin_42717928的博客-CSDN博客 个人随笔&#xff1a;工作总结随笔_8、以前工作中都接触过哪些类型的测试文档-CSDN博客 网站sms-activate.or…

【AngularJs】前端使用iframe预览pdf文件报错

<iframe style"width: 100%; height: 100%;" src"{{vm.previewUrl}}"></iframe> 出现报错信息&#xff1a;Cant interpolate: {{vm.previewUrl}} 在ctrl文件中信任该文件就可以了 vm.trustUrl $sce.trustAsResourceUrl(vm.previewUrl);//信任…