当前位置:

首页 > 业界资讯 > 机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

​数据科学和机器学习正变得越来越流行。进入这个领域的人数,每天都在增长。这意味着,很多数据科学家在构建第一个机器学习模型时,并没有丰富的经验,所以很容易发生错误。以下就是机器学习解决方案中一些最常见的初学者错误。在需要的地方没有使用数据归一化对初学者来说,把特征放入模型,然后等着它给出预测,这似乎是一件很容易的事。但是在某些情况下,得到的结果可能会令人失望,因为你遗漏了一个非常重要的步骤。某些类型的模型需要让数据归一化,包括线性回归、经典神经网络等。这些类型的模型使用特征值乘以训练的权重。如果特征没有被归

​数据科学和机器学习正变得越来越流行。

进入这个领域的人数,每天都在增长。

这意味着,很多数据科学家在构建第一个机器学习模型时,并没有丰富的经验,所以很容易发生错误。

以下就是机器学习解决方案中一些最常见的初学者错误。

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

在需要的地方没有使用数据归一化

对初学者来说,把特征放入模型,然后等着它给出预测,这似乎是一件很容易的事。

但是在某些情况下,得到的结果可能会令人失望,因为你遗漏了一个非常重要的步骤。

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

某些类型的模型需要让数据归一化,包括线性回归、经典神经网络等。这些类型的模型使用特征值乘以训练的权重。如果特征没有被归一化,可能会发生一个特征的可能值范围与另一个特征的可能值范围非常不同的情况。

假设,一个特征的值在[0, 0.001]范围内,另一个特征的值在[100000, 200000]范围内。对于两个特征同等重要的模型,第一个特征的权重将是第二个特征的权重的100'000'000倍。巨大的权重可能会给模型带来严重的问题。例如,存在一些异常值。

此外,估计各种特征的重要性会变得非常困难,因为大权重可能意味着该特征很重要,或者可能仅仅意味着它具有较小的值。

而在归一化后,所有特征都在相同的值范围内,通常是[0, 1]或[-1, 1]。在这种情况下,权重将处于相似的范围内,并且将与每个特征的真正重要性密切对应。

总体而言,在需要的地方使用数据归一化,将产生更好、更准确的预测结果。

认为特征越多越好

有人可能认为加入的特征越多越好,这样模型就会自动选择和使用最好的特征。

在实践中,并不是这样的。在大多数情况下,具有精心设计和选择特征的模型将显著优于具有10倍以上特征的类似模型。

模型的特征越多,过拟合的风险就越大。即使在完全随机的数据中,模型也能够找到一些信号——有时更弱,有时更强。

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

当然,随机噪声中没有真正的信号。但是,如果我们有足够多的噪声列,那么该模型就有可能根据检测到的错误信号使用其中的一部分。发生这种情况时,模型预测质量会降低,因为它们将部分基于随机噪声。

的确存在各种用于特征选择的技术,它们可以在这种情况下提供帮助。但本文不讨论它们。

记住,最重要的是——你应该能够解释你拥有的每一个特征,明白为什么这个特性会帮助你的模型。

在需要外推法时使用基于树的模型

树模型受到欢迎的最主要原因除了它是实力担当,还有就是因为它很好用。

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

但是,它并不是百试百灵的。在某些情况下,使用基于树的模型很可能会是一个错误。

树模型没有推断能力。这些模型永远不会给出大于训练数据中看到的最大值的预测值。他们也永远不会输出比训练中的最小值更小的预测。

但在某些任务中,外推能力或许占据主要作用。比如,如果利用该模型预测股票价格,有可能未来的股票价格将比以往任何时候都高。所以在这种情况下,基于树的模型将不再适用,因为它们的预测结果将被限制在接近历史最高价格的水平。

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

那这个问题又该怎么解决呢?

其实,条条大路通罗马!

一种选择是预测变化或差异,而不是直接预测值。

另一种解决方案是对此类任务使用不同的模型类型,比如能够外推的线性回归或神经网络。

多此一举的归一化

大家一定不陌生数据归一化的重要性。但是不同的任务需要不同的归一化方式,倘若类型按错了,那便会得不偿失!

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

基于树的模型不需要数据归一化,因为特征原始值不会用作乘数,并且异常值也不会影响它们。

神经网络可能也不需要归一化——例如,如果网络已经包含内部处理归一化的层(例如Keras库的BatchNormalization)。

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

在某些情况下,线性回归可能也不需要数据归一化。这是指所有特征都在相似的值范围内,并且具有相同的含义。例如,如果模型应用于时间序列数据,并且所有特征都是同一参数的历史值。

在实践中,应用不需要的数据归一化不一定会损害模型。大多数情况下,这些情况下的结果将与跳过的归一化非常相似。但是,进行额外的不必要的数据转换会使解决方案复杂化,并且会增加引入一些错误的风险。

所以,具体是用,还是不用,实践出真知!

数据泄露

数据泄露,要比我们想象得更容易。

请看以下代码段:

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

实际上,「sum_feature」和「diff_feature」这两个特征都是不正确的。

它们正在「泄漏」信息,因为在拆分为训练/测试集后,具有训练数据的部分将包含测试行中的一些信息。这虽然会得到更好的验证结果,但当应用于实际数据模型时,就会性能暴跌。

正确的做法是首先进行训练/测试拆分。然后才应用特征生成功能。一般来说,分别处理训练集和测试集是一种很好的特征工程模式。

在某些情况下,必须在两者之间传递一些信息——例如,我们可能希望测试集使用相同的StandardScaler ,该StandardScaler用于训练集并在其上进行了训练。但这只是个别案例,所以,我们还是需要具体问题具体分析!

机器学习天降福音!数据科学家、Kaggle大师发布「ML避坑宝典」

从错误中吸取教训是件好事。但最好从别人的错误中学习——希望本文所提供的错误示例能帮助到你。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 解决方案 机器学习
相关文章 更多
机器学习之父MichaelJordan:AGl是炒作,AI的下一个战场是经济学
机器学习之父MichaelJordan:AGl是炒作,AI的下一个战场是经济学

机器学习奠基人MichaelJordan认为AGI是公关炒作,AI的真正挑战在于让系统学会协调。他主张机器学习必须与经济学结合,关注不确定性、激励机制和数据流动等社会系统性问题,而非单纯追求模型能力。

加州大学圣地亚哥分校找到世界模型为何会
加州大学圣地亚哥分校找到世界模型为何会"说谎"的答案和解决方案

加州大学圣地亚哥分校研究发现世界模型产生幻觉的根源是训练数据覆盖不足,归纳为感知幻觉、动作边缘化幻觉和场景发散幻觉三类,并提出三种预测信号及覆盖感知训练、针对性数据收集两种干预方案。

行业首发「3+N」批量部署行业解决方案亮相WRC 2026
行业首发「3+N」批量部署行业解决方案亮相WRC 2026

WRC 2026 乐聚「3+N」全场景实干方案亮相2026年8月20日,世界机器人大会(WRC)于北京盛大开幕。乐聚机器人此次带来了行业首发的全栈国产化「3 + N」批量部署行业解决方案,其展台更是本届展会中唯一能实现全场景、全自主、全天候机器人不停机作业的。该展台展示内容涵盖科研、商服、工业三大领

跨越异构鸿沟,Redis迁移同步过程中的挑战与解决方案
跨越异构鸿沟,Redis迁移同步过程中的挑战与解决方案

随着云计算十余年的高速发展,作为目前可见的最新阶段,多云正在快步大踏步前进。而多云趋势所带来得数据云间迁移,也逐步常态化。因此,缓存 Redis 已成为高并发场景下提升数据访问速度的标配。不仅是数据云间迁移,目前大型系统对于缓存强依赖,致使大多数企业都会面临大量并发读写数据时访问速度慢、数据库压力大

手写线程池,对照学习ThreadPoolExecutor线程池实现原理!
手写线程池,对照学习ThreadPoolExecutor线程池实现原理!

持续坚持原创输出,点击蓝字关注我吧 ❝ 沉淀、分享、成长,让自己和他人都能有所收获! ❞ 目录 一、前言二、面试题三、线程池讲解1. 先看个例子2. 手写一个线程池3. 线程池源码分析四、总结五、系列推荐一、前言人看手机,机器学习!正好是2020年,看到这张图还是蛮有意思的。以前小时候总会看到一些科

云原生全链路灰度发布:阿里云MSE+ZadigX解决方案
云原生全链路灰度发布:阿里云MSE+ZadigX解决方案

01、企业发布现状痛点目前企业在选择和实施发布策略时面临以下困境:缺乏云原生能力:由于从传统部署转变为云原生模式后,技术架构改造需要具备相关能力的人才。这使得企业在发布策略方面难以入手。缺乏自动化平台支持:即使找到适合产品现状的发布策略,仍然依赖手工逐步执行。这可能导致流程遗漏或人工操作失误,造成生

破解器官移植供体短缺难题,组织器官生物制造未来将提供解决方案
破解器官移植供体短缺难题,组织器官生物制造未来将提供解决方案

杨华勇院士等专家探讨组织器官生物制造前沿进展。我国发明专利和科研产出居世界前列,骨科植入物等已进入临床。预计未来5-6年功能性皮肤、15-20年大型脏器、30年复杂器官有望临床应用。AI赋能与伦理问题引发关注。

南芯科技亮相慕展:高端消费全场景端到端解决方案
南芯科技亮相慕展:高端消费全场景端到端解决方案

南芯科技在2026慕尼黑上海电子展展出高端消费电子、汽车电子等产品线,覆盖AI眼镜、机器人、智能手机、笔记本电脑、电视、可穿戴及移动电源等领域,提供从电源管理到电机控制的端到端解决方案。

广立微打造3D IC 良率解决方案 助力韬定律生态发展
广立微打造3D IC 良率解决方案 助力韬定律生态发展

后摩尔时代,韬定律通过逻辑折叠、超细间距混合键合与TSV多层堆叠提升芯片性能,但面临键合缺陷、晶圆参数失配及DFT测试效率瓶颈。广立微打造涵盖DFM仿真、高速电性测试、AI晶圆配对及3D专用DFT的全链路国产方案,助力3DIC规模化量产。

Torna 1.35.6 & 2.1.20 发布,接口文档解决方案
Torna 1.35.6 & 2.1.20 发布,接口文档解决方案

Torna1.35.6与2.1.20版本发布,优化单值返回结果展示逻辑,修复接口名称为空时Tab标签消失问题,新增点击接口名称跳转预览页面,改进Markdown渲染。Torna是一款接口文档管理工具,支持多人协同编辑、多源文档统一归档,扩展了Swagger的易用性与集成性。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。