自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(265)
  • 资源 (1)
  • 收藏
  • 关注

原创 【一文速通】五个主流过拟合解决方法

过拟合是一个需要解决的问题,因为它会让我们无法有效地使用现有数据。有时我们也可以在构建模型之前,预估到会出现过拟合的情况。通过查看数据、收集数据的方式、采样方式,错误的假设,错误表征能够发现过拟合的预兆。为避免这种情况,请在建模之前先检查数据。但有时在预处理过程中无法检测到过拟合,而是在构建模型后才能检测出来。

2023-02-20 09:57:31 532

转载 【神器】提取时间序列技术指标的神器

如果只需要使用像移动平均线这样的简单指标,这种方法实现起来比较轻松,但当我们需要使用更复杂的数学模型时,此时就会想到想是否有这样的python库来轻松实现,其实这就是API的作用,它们调解低级代码的复杂性,提供一个简化的高级接口。我们可以看到,每当我运行该算法时,就会产生一个新的时间序列,有4个维度,每个维度代表股票的一个OCHL数据。我们的假设是,当趋势的导数(也就是瞬时变化率)根据我们的参数达到最大容忍度时,是股票反转趋势的适当时机。应用该策略后,我们可以看到新的列是如何被添加到我们的原始数据集中的。

2023-02-19 08:45:39 1356

原创 【机器学习数据集】如何获得机器学习的练习数据?

【机器学习数据集】如何获得机器学习和深度学习的练习数据?

2023-02-16 09:48:29 943

转载 常用统计检验Python代码!

常用统计检验Python代码!

2023-02-14 09:02:03 2777 2

原创 神经网络损失函数分布可视化神器

作者主要想研究几个问题:1. 为什么我们能够最小化高度非凸神经损失函数?2. 为什么得到的最小值这个结果具有泛化性?3. 不同的神经网络网络架构如何影响损失函数分布 (loss landascape),以及训练的超参数参数如何影响损失函数分布

2023-02-12 11:45:20 1226

原创 【一文速通】各种机器学习算法的特点及应用场景

近邻 (Nearest Neighbor)KNN算法的核心思想是,如果一个样本在特征空间中的K个最相邻的样本中的大多数属于某一个类别,则该样本也属于这个类别,并具有这个类别上样本的特性。该方法在确定分类决策上只依据最邻近的一个或者几个样本的类别来决定待分样本所属的类别。KNN方法在类别决策时,只与极少量的相邻样本有关。适用情景:由于KNN方法主要靠周围有限的邻近的样本,而不是靠判别类域的方法来确定所属类别的,因此对于类域的交叉或重叠较多的待分样本集来说,KNN方法较其他方法更为适合。

2023-02-10 18:27:11 1037

转载 一文解答为什么时序预测很难

时空数据是一个常见的例子,每个观察值都在两个维度上相关,因此数据具有自身的滞后(时间依赖性)和附近位置的滞后(空间依赖性)。平稳性是时间序列的核心概念,如果时间序列的趋势(例如平均水平)不随时间变化,则该时间序列是平稳的。时间序列往往都只包含少量的观察值,可能没有足够的数据来构建足够的模型。多步预测最简单的方法是递归形式,训练单个模型进行单步预测,然后将模型与其先前的预测结果作为输入得到后续的输出。时间序列多步预测需要预测未来多个值, 提前预测许多步骤具有重要的实际优势,多步预测减少了长期的不确定性。

2023-02-08 09:45:03 1711

原创 【附代码】python绘图集锦-排序 (Ranking)关系图

【附代码】python绘图集锦共7篇内容,本文为排序 (Ranking)关系图。

2023-02-04 09:55:41 858

原创 【附代码】python绘图集锦-偏差 (Deviation)关系图

python绘图集锦系列共7篇文章,本文为偏差 (Deviation)关系图。

2023-02-02 20:49:44 502

原创 【附代码】python绘图集锦-组成(Composition)关系图

python绘图集锦系列共7篇文章,本文为组成(Composition)关系图。【附代码】python绘图集锦-组成(Composition)关系图。1.华夫饼图(Waffle Chart)类似饼图的效果,面积大小反应变量大小。华夫饼图(Waffle Chart)展示较大数据集中的各个组的组成。4.柱状图(Bar Chart)2.饼图(Pie Chart)3.树状图(Treemap)您的支持是我坚持的动力~饼图(Pie Chart)柱状图(Bar Chart。树状图(Treemap)

2023-01-31 11:09:00 545

原创 【附代码】python绘图集锦-变化(Change)关系图

python绘图集锦系列共7篇文章,本文为变化(Change)关系图。

2023-01-29 14:17:15 620

原创 【附代码】python绘图集锦-分布(Distribution)关系图

python绘图集锦系列共7篇文章,本文为分布(Distribution)关系图。

2023-01-28 10:08:55 801

原创 【附代码】python绘图集锦-分组( Groups)关系图

python绘图集锦系列共7篇文章,本文为分组( Groups)关系图

2023-01-25 11:36:24 1575

原创 【附代码】python绘图集锦-关系Correlation图

python绘图集锦系列共7篇,本文为第1篇关系图。包括散点图,边界气泡图,散点图添加趋势线,分面散点图添加趋势线,抖动图,计数图,边缘直方图

2023-01-23 10:00:00 2294

原创 【附代码】十大经典排序算法

从时间复杂度选择:平方阶 (O(n2)) 排序:各类简单排序,直接插入、直接选择和冒泡排序;线性对数阶 (O(nlog2n)) 排序:快速排序、堆排序和归并排序;希尔排序:O(n1+§)) 排序,§ 是介于 0 和 1 之间的常数;线性阶 (O(n)) 排序:基数排序,此外还有桶、箱排序。从稳定性选择:排序后 2 个相等键值的顺序和排序之前它们的顺序相同。稳定的排序算法:冒泡排序、插入排序、归并排序和基数排序。不是稳定的排序算法:选择排序、快速排序、希尔排序、堆排序。

2023-01-21 10:00:00 1572

转载 LSTM模型结构的可视化

上面的图表示包含2个隐含层的LSTM网络,在T=1时刻看,它是一个普通的BP网络,在T=2时刻看也是一个普通的BP网络,只是沿时间轴展开后,T=1训练的隐含层信息H,C会被传递到下一个时刻T=2,如下图所示。这样的数据立方体很多,比如天气预报数据,把样本理解成城市,时间轴是日期,特征是天气相关的降雨风速PM2.5等,这个数据立方体就很好理解了。实际上,右图中,我们看Xt表示序列,下标t是时间轴,所以,A的数量表示的是时间轴的长度,是同一个神经元在不同时刻的状态(Ht),不是隐含层神经元个数。

2023-01-19 10:00:00 999

转载 9个时间序列交叉验证方法的介绍和对比

K-fold交叉验证(图6)是一种用于评估模型性能的流行技术。时间序列交叉验证(及其变体)是一个很好的选择。但是在某些情况下,K-fold交叉验证对时间序列是有用的。但是整个过程是在观测是独立的假设下进行的。所以最好选择一种尊重观察的时间顺序的交叉验证方法。改进的K-Fold交叉验证保留了过程中的打乱部分(图9)。与TimeSeriesSplits不同,每个迭代中的验证原点是随机选择的。这种方法的主要优点是所有的观测结果都在某个时刻被用于验证。一些专门设计的技术用于扩展时间序列的K-Fold交叉验证。

2023-01-17 10:00:00 3729

原创 【附代码】十大主流聚类算法

使用 make _ classification ()函数创建一个测试二分类数据集。数据集将有1000个示例,每个类有两个输入要素和一个群集。这些群集在两个维度上是可见的,因此我们可以用散点图绘制数据,并通过指定的群集对图中的点进行颜色绘制。高斯混合模型总结了一个多变量概率密度函数,顾名思义就是混合了高斯概率分布。均值漂移聚类涉及到根据特征空间中的实例密度来寻找和调整质心。使大数据集的更新速度更快,并且可能对统计噪声更健壮。光谱聚类是一类通用的聚类方法,取自线性线性代数。,您的支持是我坚持的动力~

2023-01-17 09:06:57 1156

原创 14种可用于时间序列预测的损失函数

当误差被平方时,离群值被赋予更多的权重,为较小的误差创建一个平滑的梯度。鉴于错误是平方的,MSE 永远不会是负数,错误的值可以是 0 到无穷大之间的任何值。当您的预测被证明是错误的时,会出现增强的 RRMSE,并且该错误由 RRMSE 相对或以百分比表示。MSLE 将粗略地处理小的实际值和预期值之间的微小差异以及大的真实值和预测值之间的巨大差异。用于时间序列预测的机器学习或深度学习模型的一个重要组成部分是损失函数,模型的性能是根据损失函数来衡量的,促使了模型参数的更新。偏差的唯一可能方向是正向或负向。

2023-01-15 10:00:00 3621

原创 【一文速通】机器学习样本不均衡/数据分布不同怎么办?

我们通过解决样本不均衡,可以减少模型学习样本比例的先验信息,以获得能学习到辨别好坏本质特征的模型。可以将不均衡解决方法归结为:通过某种方法使得不同类别的样本对于模型学习中的Loss(或梯度)贡献是比较均衡的。具体可以从数据样本、模型算法、目标函数、评估指标等方面进行优化,其中数据增强、代价敏感学习及采样+集成学习是比较常用的,效果也是比较明显的。其实,不均衡问题解决也是结合实际再做方法选择、组合及调整,在验证中调优的过程。

2023-01-13 10:00:00 1415

原创 【一文速通】数据分布不同解决办法

虽然个人建议的是删除分布不一致但不太重要的特征,但有时避免不了碰到分布不一致但又很重要的特征,这时候其实就需要自行trade off特征分布和特征重要性的关系了,比如在第四届工业大数据创新竞赛-注塑成型工艺的虚拟量测中,第5名团队保留了sensor1_mean特征而删除了pack_press_2特征,尽管他们发现pack_press_2从实际生产角度和相关性角度都非常重要,可为了提升模型在测试集的泛化能力和分数,他们没用pack_press_2特征,如图 (,如果引入低置信度样本,会带来很大的噪声。

2023-01-11 10:00:00 956

原创 【一文讲通】样本不均衡问题解决--下

1欠采样、过采样欠采样:减少多数类的数量(如随机欠采样、NearMiss、ENN)。过采样:尽量多地增加少数类的的样本数量(如随机过采样、以及2.1.2数据增强方法),以达到类别间数目均衡。还可结合两者做混合采样(如Smote+ENN)。具体还可以参见【scikit-learn的以及github的awesome-imbalanced-learning】2数据增强。

2023-01-09 10:00:00 875

原创 【一文讲通】如何检测数据满足同分布

1 统计指标的方法1.1群体稳定性指标(Population Stability Index,PSI)群体稳定性指标(Population Stability Index,PSI), 衡量未来的样本(如测试集)及训练样本评分的分布比例是否保持一致,以评估数据/模型的稳定性(按照经验值,PSI

2023-01-07 16:57:45 1096

原创 【可视化】无法理解PCA,条件概率,最小二乘回归?可视化帮你!

在下面的示例中,原始数据以3D的形式绘制,但可以通过不同的视角,将其投射到2D空间。下面,OLS是在幕后进行的,以产生回归方程。这是一个很好的迹象,我们所看到的结构反映了现实世界地理的一个重要事实北爱尔兰是四个国家中唯一一个不在大不列颠岛上的。例如,假设我们一开始就知道 "样本人口 "中一群人的身高和手掌大小,并且我们想找出一种方法,从身高预测不在样本中的人的手掌大小。下面,误差的平方表示为正方形,你的工作是选择betas(回归线的斜率和截距),使所有正方形的总面积(误差的平方之和)尽可能的小。

2023-01-05 21:11:43 470 2

转载 【超详细】深度聚类

经典聚类即数据通过各种表示学习技术以矢量化形式表示为特征。随着数据变得越来越复杂和复杂,浅层(传统)聚类方法已经无法处理高维数据类型。为了解决该问题,深度聚类的概念被提出,即联合优化表示学习和聚类。

2023-01-05 20:38:24 16072

原创 【超详细】LightGBM介绍与应用

【超详细】LightGBM介绍与应用

2023-01-03 13:32:36 2144

原创 Attention九层塔:注意力机制的九重理解

有意思的Attention理解:Attention九层塔:注意力机制的九重理解

2022-12-25 20:28:55 400 3

转载 NeurIPS 2022 | Dropout中丢掉的位置真的都有助于缓解过拟合吗?

Dropout中丢掉的位置真的都有助于缓解过拟合吗?新型Dropout方法介绍

2022-12-25 20:17:43 506

转载 卷积神经网络压缩方法

卷积神经网络的6种压缩方法

2022-12-25 19:59:15 845

原创 【机器学习】23个初中高级机器学习实战项目(附源码)

23个初中高级机器学习实战项目(附源码)

2022-12-25 19:14:26 1248

原创 【超详细】聚类中性能度量和相似度方法总结

超详细的聚类中性能度量和相似度方法总结

2022-12-25 17:17:57 1033

原创 【一文讲通】样本不均衡问题解决--上

分类模型中类别不均衡问题解决--完整版记录

2022-12-25 12:23:41 903

原创 【已解决】运行GAN时Torch报错

RuntimeError: one of the variables needed for gradient computation has been modified by an inplace operation: [torch.cuda.FloatTensor [2048]] is at version 4; expected version 3 instead. Hint: enable anomaly detection to find the operation that failed to c

2022-12-14 15:33:10 594

原创 【超全面】机器学习中的超参优化方法总结

【超全面】机器学习中的超参优化方法总结

2022-12-06 13:46:46 1692

原创 【分类特征编码】11种分类特征编码方法

11种分类特征编码方法

2022-11-30 15:11:08 694

原创 【异常检测三件套】系列1--14种异常检测算法

14种异常检测算法

2022-11-30 14:56:56 2843

原创 【聚类】超详细的性能度量和相似度方法总结

聚类算法是非监督学习最常用的一种方法,性能度量是衡量学习模型优劣的指标,也可作为优化学习模型的目标函数。聚类性能度量根据训练数据是否包含标记数据分为两类,一类是将聚类结果与标记数据进行比较,称为“外部指标”;另一类是直接分析聚类结果,称为内部指标。本文对这两类的性能度量以及相似度方法作一个详细总结。

2022-11-23 15:47:33 793

转载 8个常见的机器学习算法的计算复杂度总结

8个常见的机器学习算法的计算复杂度总结

2022-11-23 15:26:29 1308

转载 最大熵模型算法总结

介绍基于条件概率分类的两种模型算法:逻辑斯蒂(logistic)回归与最大熵模型,其中,logistic回归模型和最大熵模型分别是基于最大似然函数和熵来估计模型P(y|x)。

2022-11-23 15:19:43 1349

原创 【时序】时间序列数据预处理

时间序列数据预处理

2022-11-20 21:02:20 3222 1

11种数据降维方法-代码与结果.rar

本资源系统梳理了机器学习与数据挖掘领域中11种最常用的数据降维算法。内容涵盖线性降维、非线性降维、特征提取与矩阵分解等核心方法。 【1】包含算法清单: 线性降维:PCA(主成分分析)、LDA(线性判别分析)、SVD(奇异值分解)、ICA(独立成分分析) 非线性降维(流形学习):ISOMAP(等距映射)、LLE(局部线性嵌入)、LE(拉普拉斯特征映射)、LPP(局部保持投影) 经典投影与可视化:MDS(多维缩放)、t-SNE(t-分布随机邻域嵌入) 无监督与自编码:AutoEncoder(自编码器)、 【2】适用人群: 机器学习/数据挖掘初学者,希望系统掌握降维理论 数据分析师、算法工程师,需要进行特征工程或数据可视化预处理 在校学生,用于课程作业、毕业论文或面试复习 下载后请给个好评,支持持续更新!如有问题,欢迎私信交流。

2026-07-08

深度学习Hopular代码结构与运行指南:模型参数调整及数据处理流程详解

内容概要:本文档《Hopular代码运行须知.docx》详细介绍了Hopular项目的代码结构、主要文件的功能以及运行时需要注意的关键事项。 适合人群:具有Python编程基础,尤其是对PyTorch有一定了解,从事机器学习或深度学习研究和开发的技术人员。 使用场景及目标:①帮助开发者快速理解和上手Hopular项目;②指导用户根据自身需求修改模型参数和数据集,以达到更好的实验效果;③为研究人员提供详细的代码运行指南,确保实验结果的准确性和可复现性。 阅读建议:由于Hopular项目涉及多个文件和复杂的配置,建议读者首先通读整个文档,了解各部分功能后,再针对具体任务深入研究相关文件的具体实现细节。特别是对于初次使用者,应重点关注如何正确设置和划分数据集,以及如何调整模型参数以适应不同的应用场景。

2025-05-08

现代化Hopfield网络模型

针对表格数据的现代化Hopfield网络模型。适用于小数据。

2025-05-08

多源异构输入-分支网络模型

1. 同名博客:Keras: 多输入及混合数据输入的神经网络模型 2. 实例讲解,包括数据+代码 4. 基于keras,python代码,可运行 5. 若有疑问,可在同名博客https://blog.csdn.net/allein_STR/article/details/107408164?spm=1001.2014.3001.5502评论区说明,也可添加v:boboangang(备注来意)。

2025-05-08

sobol敏感性分析 python实现

1. sobol敏感性分析 python实现方法。 代码目的是通过sobol敏感性分析方法评估机器学习模型中不同因素的影响大小。 结果分为一阶敏感性,二阶敏感性和总阶敏感性三种。 2. 实例详细讲解,包括(数据+代码+注释) 3. 可自定义图的标签、字体大小等设置 4. python代码,可直接运行。环境:python==3.6.5,tensorflow==1.9.0 5. RF.model为训练结束后保存的RF模型。用户可自定义替换 6. 结果图中为样本数是128,256,512,1024和2048五种情况下的结果。一般而言,样本数越多,结果越准确。 7. 若有疑问,可通过2900045856@qq.com或关注CSDN博主allein_STR后咨询或购买(备注“CSDN资源”)。

2022-08-17

手把手教你使用SHAP(数据+代码+注释)

1. 同名博客:手把手教你使用SHAP 2. 实例讲解,包括(数据+代码+注释) 3. 可自定义图的标签、字体大小等设置 4. 基于jupyter,python代码,可直接运行 5. 若有疑问,可在同名博客https://blog.csdn.net/allein_STR/article/details/121459159?spm=1001.2014.3001.5502评论区说明。

2022-05-09

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除