- 博客(265)
- 资源 (1)
- 收藏
- 关注
原创 【一文速通】五个主流过拟合解决方法
过拟合是一个需要解决的问题,因为它会让我们无法有效地使用现有数据。有时我们也可以在构建模型之前,预估到会出现过拟合的情况。通过查看数据、收集数据的方式、采样方式,错误的假设,错误表征能够发现过拟合的预兆。为避免这种情况,请在建模之前先检查数据。但有时在预处理过程中无法检测到过拟合,而是在构建模型后才能检测出来。
2023-02-20 09:57:31
532
转载 【神器】提取时间序列技术指标的神器
如果只需要使用像移动平均线这样的简单指标,这种方法实现起来比较轻松,但当我们需要使用更复杂的数学模型时,此时就会想到想是否有这样的python库来轻松实现,其实这就是API的作用,它们调解低级代码的复杂性,提供一个简化的高级接口。我们可以看到,每当我运行该算法时,就会产生一个新的时间序列,有4个维度,每个维度代表股票的一个OCHL数据。我们的假设是,当趋势的导数(也就是瞬时变化率)根据我们的参数达到最大容忍度时,是股票反转趋势的适当时机。应用该策略后,我们可以看到新的列是如何被添加到我们的原始数据集中的。
2023-02-19 08:45:39
1356
原创 神经网络损失函数分布可视化神器
作者主要想研究几个问题:1. 为什么我们能够最小化高度非凸神经损失函数?2. 为什么得到的最小值这个结果具有泛化性?3. 不同的神经网络网络架构如何影响损失函数分布 (loss landascape),以及训练的超参数参数如何影响损失函数分布
2023-02-12 11:45:20
1226
原创 【一文速通】各种机器学习算法的特点及应用场景
近邻 (Nearest Neighbor)KNN算法的核心思想是,如果一个样本在特征空间中的K个最相邻的样本中的大多数属于某一个类别,则该样本也属于这个类别,并具有这个类别上样本的特性。该方法在确定分类决策上只依据最邻近的一个或者几个样本的类别来决定待分样本所属的类别。KNN方法在类别决策时,只与极少量的相邻样本有关。适用情景:由于KNN方法主要靠周围有限的邻近的样本,而不是靠判别类域的方法来确定所属类别的,因此对于类域的交叉或重叠较多的待分样本集来说,KNN方法较其他方法更为适合。
2023-02-10 18:27:11
1037
转载 一文解答为什么时序预测很难
时空数据是一个常见的例子,每个观察值都在两个维度上相关,因此数据具有自身的滞后(时间依赖性)和附近位置的滞后(空间依赖性)。平稳性是时间序列的核心概念,如果时间序列的趋势(例如平均水平)不随时间变化,则该时间序列是平稳的。时间序列往往都只包含少量的观察值,可能没有足够的数据来构建足够的模型。多步预测最简单的方法是递归形式,训练单个模型进行单步预测,然后将模型与其先前的预测结果作为输入得到后续的输出。时间序列多步预测需要预测未来多个值, 提前预测许多步骤具有重要的实际优势,多步预测减少了长期的不确定性。
2023-02-08 09:45:03
1711
原创 【附代码】python绘图集锦-偏差 (Deviation)关系图
python绘图集锦系列共7篇文章,本文为偏差 (Deviation)关系图。
2023-02-02 20:49:44
502
原创 【附代码】python绘图集锦-组成(Composition)关系图
python绘图集锦系列共7篇文章,本文为组成(Composition)关系图。【附代码】python绘图集锦-组成(Composition)关系图。1.华夫饼图(Waffle Chart)类似饼图的效果,面积大小反应变量大小。华夫饼图(Waffle Chart)展示较大数据集中的各个组的组成。4.柱状图(Bar Chart)2.饼图(Pie Chart)3.树状图(Treemap)您的支持是我坚持的动力~饼图(Pie Chart)柱状图(Bar Chart。树状图(Treemap)
2023-01-31 11:09:00
545
原创 【附代码】python绘图集锦-分布(Distribution)关系图
python绘图集锦系列共7篇文章,本文为分布(Distribution)关系图。
2023-01-28 10:08:55
801
原创 【附代码】python绘图集锦-关系Correlation图
python绘图集锦系列共7篇,本文为第1篇关系图。包括散点图,边界气泡图,散点图添加趋势线,分面散点图添加趋势线,抖动图,计数图,边缘直方图
2023-01-23 10:00:00
2294
原创 【附代码】十大经典排序算法
从时间复杂度选择:平方阶 (O(n2)) 排序:各类简单排序,直接插入、直接选择和冒泡排序;线性对数阶 (O(nlog2n)) 排序:快速排序、堆排序和归并排序;希尔排序:O(n1+§)) 排序,§ 是介于 0 和 1 之间的常数;线性阶 (O(n)) 排序:基数排序,此外还有桶、箱排序。从稳定性选择:排序后 2 个相等键值的顺序和排序之前它们的顺序相同。稳定的排序算法:冒泡排序、插入排序、归并排序和基数排序。不是稳定的排序算法:选择排序、快速排序、希尔排序、堆排序。
2023-01-21 10:00:00
1572
转载 LSTM模型结构的可视化
上面的图表示包含2个隐含层的LSTM网络,在T=1时刻看,它是一个普通的BP网络,在T=2时刻看也是一个普通的BP网络,只是沿时间轴展开后,T=1训练的隐含层信息H,C会被传递到下一个时刻T=2,如下图所示。这样的数据立方体很多,比如天气预报数据,把样本理解成城市,时间轴是日期,特征是天气相关的降雨风速PM2.5等,这个数据立方体就很好理解了。实际上,右图中,我们看Xt表示序列,下标t是时间轴,所以,A的数量表示的是时间轴的长度,是同一个神经元在不同时刻的状态(Ht),不是隐含层神经元个数。
2023-01-19 10:00:00
999
转载 9个时间序列交叉验证方法的介绍和对比
K-fold交叉验证(图6)是一种用于评估模型性能的流行技术。时间序列交叉验证(及其变体)是一个很好的选择。但是在某些情况下,K-fold交叉验证对时间序列是有用的。但是整个过程是在观测是独立的假设下进行的。所以最好选择一种尊重观察的时间顺序的交叉验证方法。改进的K-Fold交叉验证保留了过程中的打乱部分(图9)。与TimeSeriesSplits不同,每个迭代中的验证原点是随机选择的。这种方法的主要优点是所有的观测结果都在某个时刻被用于验证。一些专门设计的技术用于扩展时间序列的K-Fold交叉验证。
2023-01-17 10:00:00
3729
原创 【附代码】十大主流聚类算法
使用 make _ classification ()函数创建一个测试二分类数据集。数据集将有1000个示例,每个类有两个输入要素和一个群集。这些群集在两个维度上是可见的,因此我们可以用散点图绘制数据,并通过指定的群集对图中的点进行颜色绘制。高斯混合模型总结了一个多变量概率密度函数,顾名思义就是混合了高斯概率分布。均值漂移聚类涉及到根据特征空间中的实例密度来寻找和调整质心。使大数据集的更新速度更快,并且可能对统计噪声更健壮。光谱聚类是一类通用的聚类方法,取自线性线性代数。,您的支持是我坚持的动力~
2023-01-17 09:06:57
1156
原创 14种可用于时间序列预测的损失函数
当误差被平方时,离群值被赋予更多的权重,为较小的误差创建一个平滑的梯度。鉴于错误是平方的,MSE 永远不会是负数,错误的值可以是 0 到无穷大之间的任何值。当您的预测被证明是错误的时,会出现增强的 RRMSE,并且该错误由 RRMSE 相对或以百分比表示。MSLE 将粗略地处理小的实际值和预期值之间的微小差异以及大的真实值和预测值之间的巨大差异。用于时间序列预测的机器学习或深度学习模型的一个重要组成部分是损失函数,模型的性能是根据损失函数来衡量的,促使了模型参数的更新。偏差的唯一可能方向是正向或负向。
2023-01-15 10:00:00
3621
原创 【一文速通】机器学习样本不均衡/数据分布不同怎么办?
我们通过解决样本不均衡,可以减少模型学习样本比例的先验信息,以获得能学习到辨别好坏本质特征的模型。可以将不均衡解决方法归结为:通过某种方法使得不同类别的样本对于模型学习中的Loss(或梯度)贡献是比较均衡的。具体可以从数据样本、模型算法、目标函数、评估指标等方面进行优化,其中数据增强、代价敏感学习及采样+集成学习是比较常用的,效果也是比较明显的。其实,不均衡问题解决也是结合实际再做方法选择、组合及调整,在验证中调优的过程。
2023-01-13 10:00:00
1415
原创 【一文速通】数据分布不同解决办法
虽然个人建议的是删除分布不一致但不太重要的特征,但有时避免不了碰到分布不一致但又很重要的特征,这时候其实就需要自行trade off特征分布和特征重要性的关系了,比如在第四届工业大数据创新竞赛-注塑成型工艺的虚拟量测中,第5名团队保留了sensor1_mean特征而删除了pack_press_2特征,尽管他们发现pack_press_2从实际生产角度和相关性角度都非常重要,可为了提升模型在测试集的泛化能力和分数,他们没用pack_press_2特征,如图 (,如果引入低置信度样本,会带来很大的噪声。
2023-01-11 10:00:00
956
原创 【一文讲通】样本不均衡问题解决--下
1欠采样、过采样欠采样:减少多数类的数量(如随机欠采样、NearMiss、ENN)。过采样:尽量多地增加少数类的的样本数量(如随机过采样、以及2.1.2数据增强方法),以达到类别间数目均衡。还可结合两者做混合采样(如Smote+ENN)。具体还可以参见【scikit-learn的以及github的awesome-imbalanced-learning】2数据增强。
2023-01-09 10:00:00
875
原创 【一文讲通】如何检测数据满足同分布
1 统计指标的方法1.1群体稳定性指标(Population Stability Index,PSI)群体稳定性指标(Population Stability Index,PSI), 衡量未来的样本(如测试集)及训练样本评分的分布比例是否保持一致,以评估数据/模型的稳定性(按照经验值,PSI
2023-01-07 16:57:45
1096
原创 【可视化】无法理解PCA,条件概率,最小二乘回归?可视化帮你!
在下面的示例中,原始数据以3D的形式绘制,但可以通过不同的视角,将其投射到2D空间。下面,OLS是在幕后进行的,以产生回归方程。这是一个很好的迹象,我们所看到的结构反映了现实世界地理的一个重要事实北爱尔兰是四个国家中唯一一个不在大不列颠岛上的。例如,假设我们一开始就知道 "样本人口 "中一群人的身高和手掌大小,并且我们想找出一种方法,从身高预测不在样本中的人的手掌大小。下面,误差的平方表示为正方形,你的工作是选择betas(回归线的斜率和截距),使所有正方形的总面积(误差的平方之和)尽可能的小。
2023-01-05 21:11:43
470
2
转载 【超详细】深度聚类
经典聚类即数据通过各种表示学习技术以矢量化形式表示为特征。随着数据变得越来越复杂和复杂,浅层(传统)聚类方法已经无法处理高维数据类型。为了解决该问题,深度聚类的概念被提出,即联合优化表示学习和聚类。
2023-01-05 20:38:24
16072
转载 NeurIPS 2022 | Dropout中丢掉的位置真的都有助于缓解过拟合吗?
Dropout中丢掉的位置真的都有助于缓解过拟合吗?新型Dropout方法介绍
2022-12-25 20:17:43
506
原创 【已解决】运行GAN时Torch报错
RuntimeError: one of the variables needed for gradient computation has been modified by an inplace operation: [torch.cuda.FloatTensor [2048]] is at version 4; expected version 3 instead. Hint: enable anomaly detection to find the operation that failed to c
2022-12-14 15:33:10
594
原创 【聚类】超详细的性能度量和相似度方法总结
聚类算法是非监督学习最常用的一种方法,性能度量是衡量学习模型优劣的指标,也可作为优化学习模型的目标函数。聚类性能度量根据训练数据是否包含标记数据分为两类,一类是将聚类结果与标记数据进行比较,称为“外部指标”;另一类是直接分析聚类结果,称为内部指标。本文对这两类的性能度量以及相似度方法作一个详细总结。
2022-11-23 15:47:33
793
转载 最大熵模型算法总结
介绍基于条件概率分类的两种模型算法:逻辑斯蒂(logistic)回归与最大熵模型,其中,logistic回归模型和最大熵模型分别是基于最大似然函数和熵来估计模型P(y|x)。
2022-11-23 15:19:43
1349
11种数据降维方法-代码与结果.rar
2026-07-08
深度学习Hopular代码结构与运行指南:模型参数调整及数据处理流程详解
2025-05-08
多源异构输入-分支网络模型
2025-05-08
sobol敏感性分析 python实现
2022-08-17
手把手教你使用SHAP(数据+代码+注释)
2022-05-09
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅