版权所有@杭州高谱成像技术有限公司 浙ICP备19040412号-2 网站地图
Design By: Yushangweb
新闻资讯
别急着建模:高光谱数据预处理,才是模型效果的第一道分水岭

发布时间:2026-08-21

前言:做高光谱项目,大家最关心的永远是一件事:模型到底准不准?


拿到高光谱数据集,很多人第一反应就是上手跑算法:PLS、SVM、随机森林、深度学习轮番试一遍。但实际落地我们会发现:决定模型好坏的,不只有算法。相同样品、同样一套模型,仅仅因为采集环境变化、前期校正不到位、预处理选择不同,最终预测结果就会天差地别。


一套能够稳定落地的高光谱解决方案,从来不是单靠一台相机就可以实现。它需要高质量成像硬件、稳定的采集环境、标准化校正流程、专业的数据预处理,再搭配建模分析能力,各个环节环环相扣,才能真正完成物质检测、目标识别、分类与定量分析。


图片

一、高光谱数据,为什么不能直接拿来建模?

高光谱图像看着是一张图片,但它远比普通图像复杂。一份高光谱数据同时承载两类信息:

•  空间信息:目标样品 “在哪里” 

•  光谱信息:样品在各个波长下独有的物质 “指纹特征”


但在真实现场采集时,原始光谱总会被各类外部因素干扰:

•  光源强度波动

•  相机暗电流、传感器固有噪声

•  样品表面粗糙度、颗粒大小、含水率差异

•  拍摄距离、角度带来的偏差

•  阴影、反光、背景区域带来的干扰

•  不同批次样品之间的整体基线差异


以上大部分干扰,和样品本身成分品质毫无关系。如果直接把原始光谱喂给模型,算法会把噪声、散射、光照偏差一并当成有效特征去学习。


最后的结局就是:实验室测试效果很漂亮,换到实地、换一批样品,模型直接翻车,稳定性大打折扣。


所以做高光谱建模,第一件事并不是疯狂调参换算法,而是把原始光谱数据处理到位。


对于高精度高光谱相机来说,硬件可以捕捉到极其丰富细腻的光谱细节,但与此同时,光源、散射、传感器带来的干扰信号也会被一同记录下来。预处理的意义,就是保留样品真实的物质特征,剔除采集环节引入的无关噪声,把硬件本身的性能充分释放出来。


二、十大预处理方法详解(按功能分为四大类)


第一类:平滑降噪类(消除传感器随机噪声,优先使用)


1、Savitzky——Golay 平滑(SG)


① 核心优势:

与普通移动平均不同,SG平滑在去噪的同时能够最大程度保留光谱的峰形特征——吸收峰的位置、宽度和高度不会因平滑而过度失真。这是因为多项式拟合能够跟随光谱的局部变化趋势,而非简单取平均。


② 关键参数:

•  窗口宽度:决定参与拟合的数据点数量,必须为奇数。窗口越大,平滑效果越强,但可能抹平真实峰形;窗口太小则去噪不充分。

•  多项式阶数:通常取2或3。阶数越高,拟合越精确,但计算量增大。


③ 适用场景

绝大多数高光谱实测数据,是行业通用的首选预处理方法。


④ 何时优先选用

数据存在明显的高频抖动噪声,但样品本身的光谱特征峰较为精细、不希望被平滑算法破坏时。

图片1.png

SG效果图

图注:SG 平滑后,光谱高频噪声被抑制,物质吸收峰的形态完整保留。


2、移动平均平滑(MA)


① 什么是移动平均平滑?

移动平均对窗口内的光谱数据点取算术平均值,用平均值替代窗口中心点的值。窗口沿光谱方向滑动,逐个完成所有点的替换。


② 与SG平滑的区别:

MA的计算非常简单——就是算平均数。而SG平滑在窗口内做多项式拟合,能更好地追踪光谱的局部变化趋势。因此,MA在去噪的同时更容易将真实的光谱细节特征一同抹平。


③ 适用场景

低噪声、对细节要求不高的粗粒度光谱数据,或作为初步预览时的快速降噪手段。


④ 缺点

吸收峰容易被钝化,峰宽被拉宽,对于需要精细解析的任务不推荐。

图片2.png

MA效果图


第二类:散射与基线校正类(解决颗粒、光照带来基线偏移)


3、标准正态变换(SNV)


① 什么是SNV?

SNV对每一条光谱进行逐样本标准化处理:减去该样本所有波段反射率的均值,再除以该样本的标准差。

SNV是逐样本独立计算的,不依赖于其他样本。


② 数学原理:

变换后,每条光谱的均值为0、标准差为1。这样就消除了因颗粒大小、表面散射、光程差异带来的光谱幅值整体缩放效应——不同物理状态的同一样品,光谱会被校准到相近的尺度上。


③ 适用场景

粉末、颗粒类样品,如土壤、粮食、药粉等相机实拍数据。


④ 何时优先选用

不同批次、不同位置的同种样品,其光谱曲线形态相似但反射率整体高低不一致时,说明存在散射效应,应优先考虑SNV。

图片3.png

SNV 效果图

图注:SNV 处理后,消除样本间散射带来的整体偏移,光谱分布被重新缩放。


4、多元散射校正(MSC)


① 什么是MSC?

MSC以全体样本的平均光谱作为“理想参考光谱”,将每个样本的光谱对参考光谱进行线性回归,得到该样本的截距和斜率,再用回归系数对原始光谱进行校正。


② 与SNV的区别:

  • SNV逐样本独立处理,不需要参考其他样本。

  • MSC依赖全体样本的平均光谱作为参考,体现了“多元”的含义——综合考虑所有样本的信息。

两者效果接近,MSC理论上能更好地保留与成分相关的光谱信息,但计算略复杂。


③ 适用场景:多批次采集的粉体、固体样品。


④ 何时优先选用:样品批次多、物理状态一致性较差,且已有大量历史光谱数据可以计算可靠的平均参考光谱时。

图片4.png

MSC效果图

图注:MSC 校正,对所有样本的基线和散射进行统一修正。


5、趋势校正(DT——Detrending)


① 什么是趋势校正?

趋势校正通过最小二乘法对光谱拟合一整条线性趋势线(即整体倾斜的基线),然后从原始光谱中逐点减去该趋势线的对应值。


② 核心价值:

野外或田间采集的光谱数据,常因太阳高度角变化、云层遮挡、仪器温度漂移等因素导致光谱整体向某一方向倾斜。趋势校正只移除这种缓慢变化的基线漂移,不影响快速变化的光谱吸收特征。


③ 适用场景

野外、田间高光谱相机采集的数据,存在明显倾斜基线的光谱

图片5.png

DT效果图

图注:DT 去趋势,移除光谱整体倾斜的线性基线。


第三类:尺度归一类(统一数据幅值、消除量纲影响)


6、均值中心化(CT)


① 什么是均值中心化?

每条光谱减去自身所有波段的均值。变换后,每条光谱的均值为0,但数据围绕零点的分布形态不变。


② 核心价值:

消除样本间的整体偏移,使不同样本在相同尺度上可比,同时放大样本之间的相对差异——原本被整体偏移掩盖的细微特征会变得更加突出。


③ 适用场景

PCA主成分分析、各类光谱建模的常用前置处理。

图片6.png

CT效果图


7、最大最小值归一化(MMS)


① 什么是最大最小值归一化?

将每条光谱的反射率值按比例缩放到0到1之间。具体做法:找出该样本的最大值和最小值,每个数据点减去最小值后除以极差(最大值减最小值)。

变换后,每条光谱的最小值变为0、最大值变为1,其他值按比例落在[0,1]区间内,光谱的分布形态完整保留。


② 适用场景

CNN、自编码器等深度学习模型的输入(这些模型对输入数据的尺度敏感)。

图片7.png

MMS效果图


8、数据标准化(SS)


① 什么是数据标准化?

对每条光谱进行标准化处理:减去该样本的均值,再除以标准差(与SNV的数学操作完全一致,但应用目的不同)。


② 与SNV的区别:

SNV用于消除散射效应,而数据标准化是作为一种通用的尺度归一化手段,目的是让不同特征处于同一数量级。


③ 适用场景

SVM、PLS等传统机器学习模型,这类模型依赖特征间的距离计算,尺度差异过大会导致模型偏向于量级较大的特征。

图片8.png

SS效果图

图注:StandardScaler 标准化,数据变换为均值 0 方差 1 分布。


第四类:特征增强——导数变换(分离重叠峰、消除基线)

⚠️重要提醒:①导数会改变数据维度!一阶导数波段数- 1,二阶导数波段数- 2;②建模、绘图时波长数组必须同步裁剪,否则维度报错。

一阶导数(D1) 作用:消除常数基线,放大光谱变化斜率,分离部分重叠吸收峰。


9、一阶导数(D1)


① 什么是一阶导数?

一阶导数计算相邻波段之间反射率的变化率,即光谱曲线的斜率。数学上就是相邻两个波段的反射率差值除以波长间隔。


② 核心价值:

•  消除常数基线:如果光谱整体有一个恒定的背景偏移(如暗电流),一阶导数可以将其完全消除。

•  放大变化信息:把原本平缓的光谱变化转换为明显的峰谷信号,更容易被模型识别。

•  分离重叠峰:两个相互重叠的吸收峰,在一阶导数中可能被解析为两个独立的极值点。


③ 典型效果

原本平坦的基线被归零,吸收峰位置对应导数的过零点,峰位识别更精准。


④ 适用场景

需要突出光谱变化斜率、消除恒定基线干扰时。

图片9.png

D1效果图

图注:一阶导数光谱,消除恒定基线,突出光谱变化斜率信息。


10、二阶导数(D2)


① 什么是二阶导数?

二阶导数是一阶导数的导数,反映光谱曲线斜率的变化率,即曲率信息。


② 核心价值:

•  同时消除常数基线和线性基线——比一阶导数更进一步。

•  进一步拆分重叠峰——两个极其接近的吸收峰在二阶导数中可能被解析为截然分开的独立信号。


③ 使用铁律

必须先做平滑降噪(建议SG平滑),再做二阶导数。否则噪声主导的结果将毫无意义。


④ 适用场景

需要精细解析重叠吸收峰时,如混合物中多个成分的特征峰相互覆盖的情况。

图片10.png

D2效果图

图注:二阶导数光谱,基线被完全去除,细微峰形被放大,噪声也同步放大。


三、每种方法的用途及常见叠加方式


问题

优先考虑的方法

噪声大

SG、MA

散射明显

SNV、MSC

基线漂移

D1、D2、DT

量纲差异大

MMS、SS、CT

想保留峰形

SG


预处理通用原则:先降噪,再校正散射/基线,最后做导数或者尺度变换。不是预处理叠加越多效果就越好,过度处理会抹掉样品真实光谱特征。

实际项目成熟叠加组合:

•  SG+D1

•  SG+D2

•  SNV+SG

•  MSC+SG

•  SNV+SG+D1

•  MSC+SG+D1


一般来说,先降噪,再求导是比较常见的思路。如果数据散射比较明显,可以先做SNV或MSC,再结合SG或导数方法一起比较效果。


需要注意的是,D1和D2会改变数据维度,做图和建模时要记得同步处理波长轴。另外,叠加不是越多越好,最后还是要看验证集表现,选择稳定的方案。


光谱预处理看起来只是建模前的一步,但它往往决定了后面模型能不能稳、准、好用。


四、结语


在高光谱项目落地中,硬件采集是基础,预处理算法是打通从原始图像到可用模型的关键环节。再好的高光谱相机,也离不开适配的预处理流程,把采集到的原始数据,转化为稳定可靠的特征,才能真正实现工业检测、定性定量分析落地。



留言

如果您想与我们取得联系,请填写下面的表格,以便您的查询可以直接联系到适合的联系人。
电话
0571-83729176
手机
15305811932 (微信同号)
邮箱
sales@hhitgroup.com
地址
浙江省杭州市西湖区转塘街道云栖小镇海思科创园总部园区2幢503室

版权所有@杭州高谱成像技术有限公司 浙ICP备19040412号-2 网站地图

Design By: Yushangweb