当前位置：首页 > 文章列表 > 数据库 > MySQL > 如何使 Spark SQL 支持 MySQL 的 Update 操作？

如何使 Spark SQL 支持 MySQL 的 Update 操作？

来源：亿速云 2023-04-29 07:15:07 0浏览收藏

各位小伙伴们，大家好呀！看看今天我又给各位带来了什么文章？本文标题是《如何使 Spark SQL 支持 MySQL 的 Update 操作？》，很明显是关于数据库的文章哈哈哈，其中内容主要会涉及到等等，如果能帮到你，觉得很不错的话，欢迎各位多多点评和分享！

除了支持：Append、Overwrite、ErrorIfExists、Ignore；还要在支持update操作

1、首先了解背景

spark提供了一个枚举类，用来支撑对接数据源的操作模式

如何使 Spark SQL 支持 MySQL 的 Update 操作？

通过源码查看，很明显，spark是不支持update操作的

2、如何让sparkSQL支持update

关键的知识点就是：

我们正常在sparkSQL写数据到mysql的时候：

大概的api是：

dataframe.write
          .format("sql.execution.customDatasource.jdbc")
          .option("jdbc.driver", "com.mysql.jdbc.Driver")
          .option("jdbc.url", "jdbc:mysql://localhost:3306/test?user=root&password=&useUnicode=true&characterEncoding=gbk&autoReconnect=true&failOverReadOnly=false")
          .option("jdbc.db", "test")
          .save()

那么在底层中，spark会通过JDBC方言JdbcDialect ，将我们要插入的数据翻译成：

insert into student (columns_1 , columns_2 , ...) values (? , ? , ....)

那么通过方言解析出的sql语句就通过PrepareStatement的executeBatch()，将sql语句提交给mysql，然后数据插入；

那么上面的sql语句很明显，完全就是插入代码，并没有我们期望的 update操作，类似：

UPDATE table_name SET field1=new-value1, field2=new-value2

但是mysql独家支持这样的sql语句：

INSERT INTO student (columns_1,columns_2）VALUES ('第一个字段值','第二个字段值') ON DUPLICATE KEY UPDATE columns_1 = '呵呵哒',columns_2 = '哈哈哒';

大概的意思就是，如果数据不存在则插入，如果数据存在，则执行update操作；

因此，我们的切入点就是，让sparkSQL内部对接JdbcDialect的时候，能够生成这种sql：

INSERT INTO 表名称 (columns_1,columns_2）VALUES ('第一个字段值','第二个字段值') ON DUPLICATE KEY UPDATE columns_1 = '呵呵哒',columns_2 = '哈哈哒';

3、改造源码前，需要了解整体的代码设计和执行流程

首先是：

dataframe.write

调用write方法就是为了返回一个类：DataFrameWriter

主要是因为DataFrameWriter是sparksql对接外部数据源写入的入口携带类，下面这些内容是给DataFrameWriter注册的携带信息

如何使 Spark SQL 支持 MySQL 的 Update 操作？

然后在出发save()操作后，就开始将数据写入；

接下来看save()源码：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

在上面的源码里面主要是注册DataSource实例，然后使用DataSource的write方法进行数据写入

实例化DataSource的时候：

def save(): Unit = {
    assertNotBucketed("save")
    val dataSource = DataSource(
      df.sparkSession,
      className = source,//自定义数据源的包路径
      partitionColumns = partitioningColumns.getOrElse(Nil),//分区字段
      bucketSpec = getBucketSpec,//分桶(用于hive)
      options = extraOptions.toMap)//传入的注册信息
    //mode：插入数据方式SaveMode ， df：要插入的数据
    dataSource.write(mode, df)
  }

然后就是dataSource.write(mode, df)的细节，整段的逻辑就是：

根据providingClass.newInstance()去做模式匹配，然后匹配到哪里，就执行哪里的代码；

如何使 Spark SQL 支持 MySQL 的 Update 操作？

然后看下providingClass是什么：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

如何使 Spark SQL 支持 MySQL 的 Update 操作？

拿到包路径.DefaultSource之后，程序进入：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

那么如果是数据库作为写入目标的话，就会走：dataSource.createRelation，直接跟进源码：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

很明显是个特质，因此哪里实现了特质，程序就会走到哪里了；

实现这个特质的地方就是：包路径.DefaultSource ，然后就在这里面去实现数据的插入和update的支持操作；

4、改造源码

根据代码的流程，最终sparkSQL 将数据写入mysql的操作，会进入：包路径.DefaultSource这个类里面；

也就是说，在这个类里面既要支持spark的正常插入操作(SaveMode)，还要在支持update；

如果让sparksql支持update操作，最关键的就是做一个判断，比如：

if(isUpdate){
    sql语句：INSERT INTO student (columns_1,columns_2）VALUES ('第一个字段值','第二个字段值') ON DUPLICATE KEY UPDATE columns_1 = '呵呵哒',columns_2 = '哈哈哒';
}else{
    insert into student (columns_1 , columns_2 , ...) values (? , ? , ....)
}

但是，在spark生产sql语句的源码中，是这样写的：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

没有任何的判断逻辑，就是最后生成一个:

INSERT INTO TABLE (字段1 ， 字段2....) VALUES (? , ? ...)

所以首要的任务就是，怎么能让当前代码支持：ON DUPLICATE KEY UPDATE

可以做个大胆的设计，就是在insertStatement这个方法中做个如下的判断

def insertStatement(conn: Connection, savemode:CustomSaveMode , table: String, rddSchema: StructType, dialect: JdbcDialect)
      : PreparedStatement = {
    val columns = rddSchema.fields.map(x => dialect.quoteIdentifier(x.name)).mkString(",")
    val placeholders = rddSchema.fields.map(_ => "?").mkString(",")
    if(savemode == CustomSaveMode.update){
        //TODO 如果是update，就组装成ON DUPLICATE KEY UPDATE的模式处理
        s"INSERT INTO $table ($columns) VALUES ($placeholders) ON DUPLICATE KEY UPDATE $duplicateSetting"
    }esle{
        val sql = s"INSERT INTO $table ($columns) VALUES ($placeholders)"
        conn.prepareStatement(sql)
    }
    
  }

这样，在用户传递进来的savemode模式，我们进行校验，如果是update操作，就返回对应的sql语句！

所以按照上面的逻辑，我们代码这样写：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

这样我们就拿到了对应的sql语句；

但是只有这个sql语句还是不行的，因为在spark中会执行jdbc的prepareStatement操作，这里面会涉及到游标。

即jdbc在遍历这个sql的时候，源码会这样做：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

看下makeSetter：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

所谓有坑就是：

insert into table (字段1 , 字段2, 字段3) values (? , ? , ?)

那么当前在源码中返回的数组长度应该是3：

val setters: Array[JDBCValueSetter] = rddSchema.fields.map(_.dataType)
        .map(makeSetter(conn, dialect, _)).toArray

但是如果我们此时支持了update操作，既：

insert into table (字段1 , 字段2, 字段3) values (? , ? , ?) ON DUPLICATE KEY UPDATE 字段1 = ?,字段2 = ?,字段3=?;

那么很明显，上面的sql语句提供了6个？，但在规定字段长度的时候只有3

如何使 Spark SQL 支持 MySQL 的 Update 操作？

这样的话，后面的update操作就无法执行，程序报错！

所以我们需要有一个识别机制，既：

if(isupdate){
    val numFields = rddSchema.fields.length * 2
}else{
    val numFields = rddSchema.fields.length
}

如何使 Spark SQL 支持 MySQL 的 Update 操作？

row[1,2,3] setter(0,1) //index of setter , index of row setter(1,2) setter(2,3) setter(3,1) setter(4,2) setter(5,3)

所以在prepareStatment中的占位符应该是row的两倍，而且应该是类似这样的一个逻辑

因此，代码改造前样子：

如何使 Spark SQL 支持 MySQL 的 Update 操作？

如何使 Spark SQL 支持 MySQL 的 Update 操作？

改造后的样子：

try {
      if (supportsTransactions) {
        conn.setAutoCommit(false) // Everything in the same db transaction.
        conn.setTransactionIsolation(finalIsolationLevel)
      }
//      val stmt = insertStatement(conn, table, rddSchema, dialect)
      //此处采用最新自己的sql语句，封装成prepareStatement
      val stmt = conn.prepareStatement(sqlStmt)
      println(sqlStmt)
      /**
        * 在mysql中有这样的操作：
        * INSERT INTO user_admin_t (_id,password) VALUES ('1','第一次插入的密码')
        * INSERT INTO user_admin_t (_id,password）VALUES ('1','第一次插入的密码') ON DUPLICATE KEY UPDATE _id = 'UpId',password = 'upPassword';
        * 如果是下面的ON DUPLICATE KEY操作，那么在prepareStatement中的游标会扩增一倍
        * 并且如果没有update操作，那么他的游标是从0开始计数的
        * 如果是update操作，要算上之前的insert操作
        * */
        //makeSetter也要适配update操作，即游标问题

      val isUpdate = saveMode == CustomSaveMode.Update
      val setters: Array[JDBCValueSetter] = isUpdate match {
        case true =>
          val setters: Array[JDBCValueSetter] = rddSchema.fields.map(_.dataType)
            .map(makeSetter(conn, dialect, _)).toArray
          Array.fill(2)(setters).flatten
        case _ =>
          rddSchema.fields.map(_.dataType)
      val numFieldsLength = rddSchema.fields.length
      val numFields = isUpdate match{
        case true => numFieldsLength *2
        case _ => numFieldsLength
      val cursorBegin = numFields / 2
      try {
        var rowCount = 0
        while (iterator.hasNext) {
          val row = iterator.next()
          var i = 0
          while (i 
                  //row.isNullAt 判空,则设置空值
                  if (row.isNullAt(i)) {
                    stmt.setNull(i + 1, nullTypes(i))
                  } else {
                    setters(i).apply(stmt, row, i, 0)
                  }
                  //说明走到了update阶段
                case false =>
                  if (row.isNullAt(i - cursorBegin)) {
                    //pos - offset
                    stmt.setNull(i + 1, nullTypes(i - cursorBegin))
                    setters(i).apply(stmt, row, i, cursorBegin)
              }
            }else{
              if (row.isNullAt(i)) {
                stmt.setNull(i + 1, nullTypes(i))
              } else {
                setters(i).apply(stmt, row, i ,0)
            }
            //滚动游标
            i = i + 1
          }
          stmt.addBatch()
          rowCount += 1
          if (rowCount % batchSize == 0) {
            stmt.executeBatch()
            rowCount = 0
        }
        if (rowCount > 0) {
          stmt.executeBatch()
      } finally {
        stmt.close()
        conn.commit()
      committed = true
      Iterator.empty
    } catch {
      case e: SQLException =>
        val cause = e.getNextException
        if (cause != null && e.getCause != cause) {
          if (e.getCause == null) {
            e.initCause(cause)
          } else {
            e.addSuppressed(cause)
        throw e
    } finally {
      if (!committed) {
        // The stage must fail.  We got here through an exception path, so
        // let the exception through unless rollback() or close() want to
        // tell the user about another problem.
        if (supportsTransactions) {
          conn.rollback()
        conn.close()
      } else {
        // The stage must succeed.  We cannot propagate any exception close() might throw.
        try {
          conn.close()
        } catch {
          case e: Exception => logWarning("Transaction succeeded, but closing failed", e)

// A `JDBCValueSetter` is responsible for setting a value from `Row` into a field for
  // `PreparedStatement`. The last argument `Int` means the index for the value to be set
  // in the SQL statement and also used for the value in `Row`.
  //PreparedStatement, Row, position , cursor
  private type JDBCValueSetter = (PreparedStatement, Row, Int , Int) => Unit

  private def makeSetter(
      conn: Connection,
      dialect: JdbcDialect,
      dataType: DataType): JDBCValueSetter = dataType match {
    case IntegerType =>
      (stmt: PreparedStatement, row: Row, pos: Int,cursor:Int) =>
        stmt.setInt(pos + 1, row.getInt(pos - cursor))
    case LongType =>
        stmt.setLong(pos + 1, row.getLong(pos - cursor))
    case DoubleType =>
        stmt.setDouble(pos + 1, row.getDouble(pos - cursor))
    case FloatType =>
        stmt.setFloat(pos + 1, row.getFloat(pos - cursor))
    case ShortType =>
        stmt.setInt(pos + 1, row.getShort(pos - cursor))
    case ByteType =>
        stmt.setInt(pos + 1, row.getByte(pos - cursor))
    case BooleanType =>
        stmt.setBoolean(pos + 1, row.getBoolean(pos - cursor))
    case StringType =>
//        println(row.getString(pos))
        stmt.setString(pos + 1, row.getString(pos - cursor))
    case BinaryType =>
        stmt.setBytes(pos + 1, row.getAs[Array[Byte]](pos - cursor))
    case TimestampType =>
        stmt.setTimestamp(pos + 1, row.getAs[java.sql.Timestamp](pos - cursor))
    case DateType =>
        stmt.setDate(pos + 1, row.getAs[java.sql.Date](pos - cursor))
    case t: DecimalType =>
        stmt.setBigDecimal(pos + 1, row.getDecimal(pos - cursor))
    case ArrayType(et, _) =>
      // remove type length parameters from end of type name
      val typeName = getJdbcType(et, dialect).databaseTypeDefinition
        .toLowerCase.split("\\(")(0)
        val array = conn.createArrayOf(
          typeName,
          row.getSeq[AnyRef](pos - cursor).toArray)
        stmt.setArray(pos + 1, array)
    case _ =>
      (_: PreparedStatement, _: Row, pos: Int,cursor:Int) =>
        throw new IllegalArgumentException(
          s"Can't translate non-null value for field $pos")
  }

好了，本文到此结束，带大家了解了《如何使 Spark SQL 支持 MySQL 的 Update 操作？》，希望本文对你有所帮助！关注golang学习网公众号，给大家分享更多数据库知识！

mysql FTP服务软件 Update

版本声明

本文转载于：亿速云如有侵犯，请联系study_golang@163.com删除

如何精通 MySQL 多表操作？

如何精通 MySQL 多表操作？

上一篇: 如何精通 MySQL 多表操作？

如何创建MySQL触发器并进行使用？

下一篇: 如何创建MySQL触发器并进行使用？

查看更多

最新文章

数据库 · MySQL | 7小时前 | MySQL · 唯一约束 · 数据库设计 · mysql 唯一索引生成列 NULL 数据约束

MySQL 唯一索引遇到 NULL 为什么没拦住重复：从复现到生成列修复

109浏览收藏
数据库 · MySQL | 1天前 | MySQL · 慢查询 · 索引优化 · COUNT查询 · 汇总表 · 联合索引覆盖索引汇总表 MySQL COUNT慢 COUNT(*)优化

MySQL COUNT(*) 总数查询变慢怎么办：从扫描行数到汇总表的完整治理流程

329浏览收藏
数据库 · MySQL | 1天前 | MySQL · 数据库 · 查询优化 · 索引优化 · mysql 索引 like 执行计划模糊查询前缀匹配

MySQL LIKE 模糊查询变慢怎么办：从左通配符到前缀索引一步步排查

308浏览收藏
数据库 · MySQL | 1天前 | MySQL · 数据库 · 联合索引 · ORDER BY · 慢查询排查 · mysql order by explain 慢查询联合索引 filesort

MySQL ORDER BY 排序变慢怎么办：从 filesort 到联合索引一步步排查

203浏览收藏
数据库 · MySQL | 2天前 | MySQL · 数据库 · SQL · 数据归档 · 大表优化 · mysql 数据校验历史数据归档大表治理分批迁移

MySQL 历史数据归档实战：按时间分批搬迁，避免大表越查越慢

261浏览收藏
数据库 · MySQL | 3天前 | MySQL · 事务 · 隔离级别 · InnoDB · 间隙锁 · mysql innodb 事务隔离可重复读幻读间隙锁

MySQL 事务隔离级别实战：用两个会话看懂可重复读和幻读

455浏览收藏
数据库 · MySQL | 3天前 | MySQL · 数据库 · 性能优化 · SQL · 索引优化 · mysql explain 性能优化联合索引覆盖索引回表查询

MySQL 覆盖索引实战：少一次回表，查询为什么会更快

381浏览收藏
数据库 · MySQL | 3天前 | MySQL · 数据库 · 性能优化 · SQL · 分页 · mysql 缓存 COUNT优化大表分页总数统计汇总表

MySQL COUNT 优化实战：大表分页总数不要每次全量统计

336浏览收藏
数据库 · MySQL | 3天前 | MySQL · 数据库 · SQL · 索引优化 · 性能排查 · mysql 字段类型 SQL优化慢查询隐式转换索引失效

MySQL 隐式转换排查实战：字段类型不一致为什么索引失效

152浏览收藏
数据库 · MySQL | 3天前 | MySQL · 数据库 · 性能优化 · 连接池 · 故障排查 · mysql 连接池长事务连接数打满 PROCESSLIST 数据库排查

MySQL 连接数打满排查实战：从连接池到 PROCESSLIST 定位慢请求

404浏览收藏
数据库 · MySQL | 3天前 | MySQL · 索引 · 数据库 · 性能优化 · SQL · mysql SQL优化分页优化延迟关联深分页覆盖索引

MySQL 深分页优化实战：用延迟关联减少无效扫描

339浏览收藏
数据库 · MySQL | 3天前 | MySQL · 数据库 · InnoDB · 死锁排查 · mysql innodb 死锁事务锁等待 SHOW ENGINE INNODB STATUS

MySQL 死锁排查实战：从现象定位到固定加锁顺序

429浏览收藏

查看更多

课程推荐

前端进阶之JavaScript设计模式

设计模式是开发人员在软件开发过程中面临一般问题时的解决方案，代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景，打造一站式知识长龙服务，适合有JS基础的同学学习。

543次学习
GO语言核心编程课程

本课程采用真实案例，全面具体可落地，从理论到实践，一步一步将GO核心编程技术、编程思想、底层实现融会贯通，使学习者贴近时代脉搏，做IT互联网时代的弄潮儿。

516次学习
简单聊聊mysql8与网络通信

如有问题加微信：Le-studyg；在课程中，我们将首先介绍MySQL8的新特性，包括性能优化、安全增强、新数据类型等，帮助学生快速熟悉MySQL8的最新功能。接着，我们将深入解析MySQL的网络通信机制，包括协议、连接管理、数据传输等，让

500次学习
JavaScript正则表达式基础与实战

在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。

487次学习
从零制作响应式网站—Grid布局

本系列教程将展示从零制作一个假想的网络科技公司官网，分为导航，轮播，关于我们，成功案例，服务流程，团队介绍，数据部分，公司动态，底部信息等内容区块。网站整体采用CSSGrid布局，支持响应式，有流畅过渡和展现动画。

485次学习

查看更多

AI推荐

ljg-skills

ljg-skills 是李继刚开源的 AI 技能与提示词集合，面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板，适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。

91次使用
MELO音乐

MELO音乐是一站式AI视频与音乐制作助手，对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐，MELO为你免费谱曲，轻松做同款！

112次使用
UniScribe

UniScribe 是一款 AI 音视频转文字与内容整理工具，支持上传音频、视频文件或粘贴 YouTube 链接，自动生成转写文本、摘要、思维导图和关键问题，并支持多格式导出，适合会议记录、课程学习、访谈整理和内容创作复盘。

104次使用
剧云

剧云是专业中文剧本创作平台，安全稳定运行十余年，集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能，数据安全防护，轻松高效创作剧本。

247次使用
万象有声

万象有声，一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具，可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验，让有声书制作更简单！

252次使用

查看更多

相关文章

MySQL主从切换的超详细步骤

2023-01-01 501浏览
Mysql-普通索引的 change buffer

2023-01-25 501浏览
MySQL高级进阶sql语句总结大全

2022-12-31 501浏览
Mysql报错：message from server: * is blocked because of many

2023-02-24 501浏览
腾讯云大佬亲码“redis深度笔记”，不讲一句废话，全是精华

2023-02-22 501浏览

Golang学习网：公益在线Go学习平台，帮助Go学习者快速成长！

技术交流群

Copyright 2023 http://www.17golang.com/ All Rights Reserved ｜苏ICP备2023003363号-1

关注公众号

Golang学习网

微信登录更方便

密码登录
注册账号

登录即同意用户协议和隐私政策

返回登录

重置密码