八月头条:Python 正在追赶 Java 的记录 本月,Python 的排名首次超过 18%。上一次有语言超过 18% 还是 2016 年 11 月的 Java。Java 也是有史以来排名最高的语言:2001 年 6 月达到了 26.49%。排名第二的 C++ 目前落后 Python 正好是 8%,而第一名和第二名之间的差距......
自适应查询执行(Adaptive Query Execution),简称为 AQE。它是对 Spark 执行计划的优化,它可以基于任务运行时统计的数据指标动态修改 Spark 的执行计划。自适应查询执行主要带来了下面这 3 点优化功能: 自适应调整 Shuffle 分区数量。 动态调整 Join 策略......
1,HuggingChat 介绍 (1)HuggingChat 是国外知名机器学习社区 Huggingface 发布的开源 AI 聊天机器人,完全免费。 (2)HuggingChat 这款机器人类似于 ChatGPT,用户可以请求自然语言或以特定格式生成文本。HuggingChat 响应速度快,性能与 GPT-3.5-turbo 大致相当......
一、基本介绍 1,ChatGLM3 介绍 (1)ChatGLM3 是智谱 AI 和清华大学 KEG 实验室联合发布的对话预训练模型。 (2)ChatGLM3-6B 是 ChatGLM3 系列中的开源模型,在保留了前两代模型对话流畅、部署门槛低等众多优秀特性的基础上,ChatGLM3-6B 引入了如下特性......
六、算子优化1:map vs mapPartitions 1,基本介绍 (1)map 操作:对 RDD 中的每个元素进行操作,一次处理一条数据。 (2)mapPartitions 操作:对 RDD 中每个 partition 进行操作,一次处理一个分区的数据。 2,二者对比 (1)OOM 方面对比: map 操作......
五、数据本地化 1,基本介绍 (1)数据本地化,指的是数据离计算它的代码有多近。数据本地化对于 Spark Job 性能有着巨大的影响。 如果数据以及要计算它的代码是在一起的,那么性能当然会非常高。 但是,如果数据和计算它的代码是分开的,那么其中之一必须到另外一方的机器上......
四、提高并行度 1,并行度介绍 (1)Spark 会自动设置以文件作为输入源的 RDD 的并行度,依据其大小,比如 HDFS,就会给每一个 block 创建一个 partition,也依据这个设置并行度。对于 reduceByKey 等会发生 shuffle 操作的算子,会使用并行度最大的父 RDD 的并行度......
三、JVM 垃圾回收调优 1,Java 中的 GC 介绍 (1)Java 堆空间被划分成了两块空间:一个是年轻代,一个是老年代。 年轻代放的是短时间存活的对象,占堆内存的 1/3。 老年代放的是长时间存活的对象,占堆内存的 2/3。 (2)其中年轻代又被划分了三块,Eden、Survivor1、Survivor2......
1,问题描述 (1)最近在给项目中的一个 echarts 图表添加了 toolbox 工具栏: option = { toolbox: { feature: { saveAsImage: {}, // 导出图片......
二、使用高性能序列化类库 1,基本介绍 (1)Spark 默认会在一些地方对数据进行序列化,如果我们的算子函数使用到了外部的数据(比如 Java 中的自定义类型),那么也需要让其可序列化,否则程序在执行的时候是会报错的,提示没有实现序列化......