Looking up...
对收集的原始数据进行筛选、修正、去重等操作,以提高数据质量的过程
数据清理包括处理缺失值、删除重复记录和纠正格式错误。
数据清理涉及多个步骤,确保数据集的一致性和完整性。
机器学习项目的第一步通常是数据清理,否则模型训练效果会大打折扣。
数据质量直接影响机器学习模型的性能,数据清理是关键环节。
数据清理是数据科学和大数据处理中的基础步骤,通常占据整个项目60-80%的时间。
始终保留原始数据备份,在清理过程中记录每一步操作,确保数据可追溯性和可重复性。
先处理缺失值和重复项,再纠正格式错误,最后进行异常值分析。
清理后的数据必须通过统计检验(如均值、方差)确认质量提升。
由"数据"(shùjù,指数字化信息)和"清理"(qīnglǐ,指清除无用或错误内容)组合而成,源于计算机科学和数据管理领域。
在中文技术文献中,"数据清理"与"数据清洗"常互换使用,但"清理"更强调系统性的处理过程,而"清洗"可能更侧重于去除脏数据。