Looking up...
在机器学习和数据科学中,通过对现有数据进行变换、扩充或合成,生成新的数据样本以增强数据集规模和多样性的技术方法
图像数据增强常用于计算机视觉任务,如旋转、翻转、调整亮度等操作。
计算机视觉任务中,图像数据增强通过旋转、镜像或亮度调整等方式扩展数据集。
文本数据增强可以通过同义词替换、回译或生成式模型实现。
文本数据增强常用同义词替换、回译或生成式AI来增加样本多样性。
数据增强是提升模型泛化能力的关键手段,但需避免引入噪声或偏见数据。
数据增强基于现有数据生成变体,而数据合成可能完全创造新样本(如GAN生成图像)。增强强调保留原始数据特征,合成则可能引入全新模式。
增强后的数据应保持与原始数据分布一致,避免引入不合理的噪声或异常值,否则可能损害模型性能。
由"数据"(shùjù,data)和"增强"(zēngqiáng,augmentation)组合而成,源于机器学习领域的术语,首次出现于2010年代中期。
常用于AI训练场景,需注意增强后数据的真实性与标签一致性。