SpringBoot怎么整合dataworks
对于一个文章开发者来说,牢固扎实的基础是十分重要的,golang学习网就来带大家一点点的掌握基础知识点。今天本篇文章带大家了解《SpringBoot怎么整合dataworks》,主要介绍了,希望对大家的知识积累有所帮助,快点收藏起来吧,否则需要时就找不到了!
注意事项
这里测试主要是调用拉取dataworks上拉取的脚本,并存储到本地。
脚本包含两部分
1、开发的odps脚本(通过OpenApi获取)2、建表语句脚本(通过dataworks信息去连接maxCompute获取建立语句)
阿里云Dataworks的openApi分页查询限制,一次最多查询100条。我们拉取脚本需要分多页查询
该项目使用到了MaxCompute的SDK/JDBC方式连接,SpringBoot操作MaxCompute SDK/JDBC连接
整合实现
实现主要是编写工具类,如果需要则可以配置成SpringBean,注入容器即可使用
依赖引入
1.8 0.40.8-public 3.0.1 3.4.2 4.5.20 org.springframework.boot spring-boot-starter-web org.springframework.boot spring-boot-configuration-processor true org.projectlombok lombok true com.aliyun.odps odps-sdk-core ${max-compute-sdk.version} com.aliyun.odps odps-jdbc ${max-compute-jdbc.version} jar-with-dependencies com.aliyun aliyun-java-sdk-core ${aliyun-java-sdk.version} com.aliyun aliyun-java-sdk-dataworks-public ${dataworks-sdk.version}
请求参数类编写
/**
* @Description
* @Author itdl
* @Date 2022/08/09 15:12
*/
@Data
public class DataWorksOpenApiConnParam {
/**
* 区域 eg. cn-shanghai
*/
private String region;
/**
* 访问keyId
*/
private String aliyunAccessId;
/**
* 密钥
*/
private String aliyunAccessKey;
/**
* 访问端点 就是API的URL前缀
*/
private String endPoint;
/**
* 数据库类型 如odps
*/
private String datasourceType;
/**
* 所属项目
*/
private String project;
/**
* 项目环境 dev prod
*/
private String projectEnv;
}工具类编写
基础类准备,拉取脚本之后的回调函数
为什么需要回调函数,因为拉取的是所有脚本,如果合并每次分页结果的话,会导致内存溢出,而使用回调函数只是每次循环增加处理函数
/**
* @Description
* @Author itdl
* @Date 2022/08/09 15:12
*/
@Data
public class DataWorksOpenApiConnParam {
/**
* 区域 eg. cn-shanghai
*/
private String region;
/**
* 访问keyId
*/
private String aliyunAccessId;
/**
* 密钥
*/
private String aliyunAccessKey;
/**
* 访问端点 就是API的URL前缀
*/
private String endPoint;
/**
* 数据库类型 如odps
*/
private String datasourceType;
/**
* 所属项目
*/
private String project;
/**
* 项目环境 dev prod
*/
private String projectEnv;
}初始化操作
主要是实例化dataworks openApi接口的客户端信息,maxCompute连接的工具类初始化(包括JDBC,SDK方式)
private static final String MAX_COMPUTE_JDBC_URL_FORMAT = "http://service.%s.maxcompute.aliyun.com/api";
/**默认的odps接口地址 在Odps中也可以看到该变量*/
private static final String defaultEndpoint = "http://service.odps.aliyun.com/api";
/**
* dataworks连接参数
*
*/
private final DataWorksOpenApiConnParam connParam;
/**
* 可以使用dataworks去连接maxCompute 如果连接的引擎是maxCompute的话
*/
private final MaxComputeJdbcUtil maxComputeJdbcUtil;
private final MaxComputeSdkUtil maxComputeSdkUtil;
private final boolean odpsSdk;
/**
* 客户端
*/
private final IAcsClient client;
public DataWorksOpenApiUtil(DataWorksOpenApiConnParam connParam, boolean odpsSdk) {
this.connParam = connParam;
this.client = buildClient();
this.odpsSdk = odpsSdk;
if (odpsSdk){
this.maxComputeJdbcUtil = null;
this.maxComputeSdkUtil = buildMaxComputeSdkUtil();
}else {
this.maxComputeJdbcUtil = buildMaxComputeJdbcUtil();
this.maxComputeSdkUtil = null;
}
}
private MaxComputeSdkUtil buildMaxComputeSdkUtil() {
final MaxComputeSdkConnParam param = new MaxComputeSdkConnParam();
// 设置账号密码
param.setAliyunAccessId(connParam.getAliyunAccessId());
param.setAliyunAccessKey(connParam.getAliyunAccessKey());
// 设置endpoint
param.setMaxComputeEndpoint(defaultEndpoint);
// 目前只处理odps的引擎
final String datasourceType = connParam.getDatasourceType();
if (!"odps".equals(datasourceType)){
throw new BizException(ResultCode.DATA_WORKS_ENGINE_SUPPORT_ERR);
}
// 获取项目环境,根据项目环境连接不同的maxCompute
final String projectEnv = connParam.getProjectEnv();
if ("dev".equals(projectEnv)){
// 开发环境dataworks + _dev就是maxCompute的项目名
param.setProjectName(String.join("_", connParam.getProject(), projectEnv));
}else {
// 生产环境dataworks的项目名和maxCompute一致
param.setProjectName(connParam.getProject());
}
return new MaxComputeSdkUtil(param);
}
private MaxComputeJdbcUtil buildMaxComputeJdbcUtil() {
final MaxComputeJdbcConnParam param = new MaxComputeJdbcConnParam();
// 设置账号密码
param.setAliyunAccessId(connParam.getAliyunAccessId());
param.setAliyunAccessKey(connParam.getAliyunAccessKey());
// 设置endpoint
param.setEndpoint(String.format(MAX_COMPUTE_JDBC_URL_FORMAT, connParam.getRegion()));
// 目前只处理odps的引擎
final String datasourceType = connParam.getDatasourceType();
if (!"odps".equals(datasourceType)){
throw new BizException(ResultCode.DATA_WORKS_ENGINE_SUPPORT_ERR);
}
// 获取项目环境,根据项目环境连接不同的maxCompute
final String projectEnv = connParam.getProjectEnv();
if ("dev".equals(projectEnv)){
// 开发环境dataworks + _dev就是maxCompute的项目名
param.setProjectName(String.join("_", connParam.getProject(), projectEnv));
}else {
// 生产环境dataworks的项目名和maxCompute一致
param.setProjectName(connParam.getProject());
}
return new MaxComputeJdbcUtil(param);
}调用OpenApi拉取所有脚本
/**
* 根据文件夹路径分页查询该路径下的文件(脚本)
* @param pageSize 每页查询多少数据
* @param folderPath 文件所在目录
* @param userType 文件所属功能模块 可不传
* @param fileTypes 设置文件代码类型 逗号分割 可不传
*/
public void listAllFiles(Integer pageSize, String folderPath, String userType, String fileTypes, CallBack.FileCallBack callBack) throws ClientException {
pageSize = setPageSize(pageSize);
// 创建请求
final ListFilesRequest request = new ListFilesRequest();
// 设置分页参数
request.setPageNumber(1);
request.setPageSize(pageSize);
// 设置上级文件夹
request.setFileFolderPath(folderPath);
// 设置区域和项目名称
request.setSysRegionId(connParam.getRegion());
request.setProjectIdentifier(connParam.getProject());
// 设置文件所属功能模块
if (!ObjectUtils.isEmpty(userType)){
request.setUseType(userType);
}
// 设置文件代码类型
if (!ObjectUtils.isEmpty(fileTypes)){
request.setFileTypes(fileTypes);
}
// 发起请求
ListFilesResponse res = client.getAcsResponse(request);
// 获取分页总数
final Integer totalCount = res.getData().getTotalCount();
// 返回结果
final List resultList = res.getData().getFiles();
// 计算能分几页
long pages = totalCount % pageSize == 0 ? (totalCount / pageSize) : (totalCount / pageSize) + 1;
// 只有1页 直接返回
if (pages <= 1){
callBack.handle(resultList);
return;
}
// 第一页执行回调
callBack.handle(resultList);
// 分页数据 从第二页开始查询 同步拉取,可以优化为多线程拉取
for (int i = 2; i <= pages; i++) {
//第1页
request.setPageNumber(i);
//每页大小
request.setPageSize(pageSize);
// 发起请求
res = client.getAcsResponse(request);
final List tableEntityList = res.getData().getFiles();
if (!ObjectUtils.isEmpty(tableEntityList)){
// 执行回调函数
callBack.handle(tableEntityList);
}
}
} 内部连接MaxCompute拉取所有DDL脚本内容
DataWorks工具类代码,通过回调函数处理
/**
* 获取所有的DDL脚本
* @param callBack 回调处理函数
*/
public void listAllDdl(CallBack.DdlCallBack callBack){
if (odpsSdk){
final List tableInfos = maxComputeSdkUtil.getTableInfos();
for (TableMetaInfo tableInfo : tableInfos) {
final String tableName = tableInfo.getTableName();
final String sqlCreateDesc = maxComputeSdkUtil.getSqlCreateDesc(tableName);
callBack.handle(tableName, sqlCreateDesc);
}
}
} MaxCompute工具类代码,根据表名获取建表语句, 以SDK为例, JDBC直接执行show create table即可拿到建表语句
/**
* 根据表名获取建表语句
* @param tableName 表名
* @return
*/
public String getSqlCreateDesc(String tableName) {
final Table table = odps.tables().get(tableName);
// 建表语句
StringBuilder mssqlDDL = new StringBuilder();
// 获取表结构
TableSchema tableSchema = table.getSchema();
// 获取表名表注释
String tableComment = table.getComment();
//获取列名列注释
List columns = tableSchema.getColumns();
/*组装成mssql的DDL*/
// 表名
mssqlDDL.append("CREATE TABLE IF NOT EXISTS ");
mssqlDDL.append(tableName).append("\n");
mssqlDDL.append(" (\n");
//列字段
int index = 1;
for (Column column : columns) {
mssqlDDL.append(" ").append(column.getName()).append("\t\t").append(column.getTypeInfo().getTypeName());
if (!ObjectUtils.isEmpty(column.getComment())) {
mssqlDDL.append(" COMMENT '").append(column.getComment()).append("'");
}
if (index == columns.size()) {
mssqlDDL.append("\n");
} else {
mssqlDDL.append(",\n");
}
index++;
}
mssqlDDL.append(" )\n");
//获取分区
List partitionColumns = tableSchema.getPartitionColumns();
int partitionIndex = 1;
if (!ObjectUtils.isEmpty(partitionColumns)) {
mssqlDDL.append("PARTITIONED BY (");
}
for (Column partitionColumn : partitionColumns) {
final String format = String.format("%s %s COMMENT '%s'", partitionColumn.getName(), partitionColumn.getTypeInfo().getTypeName(), partitionColumn.getComment());
mssqlDDL.append(format);
if (partitionIndex == partitionColumns.size()) {
mssqlDDL.append("\n");
} else {
mssqlDDL.append(",\n");
}
partitionIndex++;
}
if (!ObjectUtils.isEmpty(partitionColumns)) {
mssqlDDL.append(")\n");
}
// mssqlDDL.append("STORED AS ALIORC \n");
// mssqlDDL.append("TBLPROPERTIES ('comment'='").append(tableComment).append("');");
mssqlDDL.append(";");
return mssqlDDL.toString();
} 测试代码
public static void main(String[] args) throws ClientException {
final DataWorksOpenApiConnParam connParam = new DataWorksOpenApiConnParam();
connParam.setAliyunAccessId("您的阿里云账号accessId");
connParam.setAliyunAccessKey("您的阿里云账号accessKey");
// dataworks所在区域
connParam.setRegion("cn-chengdu");
// dataworks所属项目
connParam.setProject("dataworks所属项目");
// dataworks所属项目环境 如果不分环境的话设置为生产即可
connParam.setProjectEnv("dev");
// 数据引擎类型 odps
connParam.setDatasourceType("odps");
// ddataworks接口地址
connParam.setEndPoint("dataworks.cn-chengdu.aliyuncs.com");
final DataWorksOpenApiUtil dataWorksOpenApiUtil = new DataWorksOpenApiUtil(connParam, true);
// 拉取所有ODPS脚本
dataWorksOpenApiUtil.listAllFiles(100, "", "", "10", files -> {
// 处理文件
for (ListFilesResponse.Data.File file : files) {
final String fileName = file.getFileName();
System.out.println(fileName);
}
});
// 拉取所有表的建表语句
dataWorksOpenApiUtil.listAllDdl((tableName, tableDdlContent) -> {
System.out.println("=======================================");
System.out.println("表名:" + tableName + "内容如下:\n");
System.out.println(tableDdlContent);
System.out.println("=======================================");
});
}测试结果
test_001脚本
test_002脚本
test_003脚本
test_004脚本
test_005脚本
=======================================
表名:test_abc_info内容如下:CREATE TABLE IF NOT EXISTS test_abc_info
(
test_abc1 STRING COMMENT '字段1',
test_abc2 STRING COMMENT '字段2',
test_abc3 STRING COMMENT '字段3',
test_abc4 STRING COMMENT '字段4',
test_abc5 STRING COMMENT '字段5',
test_abc6 STRING COMMENT '字段6',
test_abc7 STRING COMMENT '字段7',
test_abc8 STRING COMMENT '字段8'
)
PARTITIONED BY (p_date STRING COMMENT '数据日期'
)
;
=======================================
Disconnected from the target VM, address: '127.0.0.1:59509', transport: 'socket'
本篇关于《SpringBoot怎么整合dataworks》的介绍就到此结束啦,但是学无止境,想要了解学习更多关于文章的相关知识,请关注golang学习网公众号!
Java 并发集合实战指南:轻松开发高并发系统
- 上一篇
- Java 并发集合实战指南:轻松开发高并发系统
- 下一篇
- win11声卡驱动装不上怎么解决_win11声卡驱动装不上如何处理
-
- 文章 · java教程 | 2天前 |
- Java 虚拟线程连接池改造的资源边界
- 236浏览 收藏
-
- 文章 · java教程 | 2天前 | Java · 虚拟线程 · java UncaughtExceptionHandler 虚拟线程 Thread.Builder.OfVirtual
- Java Thread.Builder.OfVirtual 设置线程异常处理器
- 139浏览 收藏
-
- 文章 · java教程 | 2天前 | 数据处理 · Java教程 · java windowFixed Stream Gatherer 事件窗口
- Java Stream Gatherer 组合短窗口事件的实现步骤
- 495浏览 收藏
-
- 文章 · java教程 | 3天前 | 并发 · Java · 随机数 · RandomGeneratorFactory Java随机算法 随机数并发
- Java RandomGeneratorFactory 怎么按能力选择随机算法
- 244浏览 收藏
-
- 文章 · java教程 | 3天前 |
- Java HexFormat 怎么在字节数组和十六进制文本间转换
- 361浏览 收藏
-
- 文章 · java教程 | 3天前 | 文件处理 · nio · Java教程 · java 文件比较 Files.mismatch 字节偏移
- Java Files.mismatch 怎么定位两个文件首个差异
- 342浏览 收藏
-
- 文章 · java教程 | 3天前 | Java ·
- Java Base64 流式编码怎么避免一次加载大文件
- 182浏览 收藏
-
- 文章 · java教程 | 3天前 | Java · 可观测性 ·
- Java JFR EventStream 怎么实时消费运行事件
- 145浏览 收藏
-
- 文章 · java教程 | 3天前 | Java ·
- Java Class-File API 怎么读取类文件结构
- 419浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 286次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 339次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 338次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 304次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 126次使用
-
- Java try-with-resources 多个资源关闭顺序是什么
- 2026-09-10 501浏览
-
- 矩阵主副对角线快速定位技巧
- 2026-05-31 501浏览
-
- Java多态优化流程代码与行为分发改进
- 2026-05-26 501浏览
-
- JVM 类元数据双亲委派链表深度解析
- 2026-05-21 501浏览
-
- 反射异常处理:InvocationTargetException解析与应用
- 2026-05-16 501浏览
