主成分回归 (PCR) 与偏最小二乘回归 (PLS)#

本示例通过一个简单的玩具数据集比较了主成分回归 (PCR) 和偏最小二乘回归 (PLS)。我们的目标是展示当目标变量与数据中方差较小的某些方向存在强相关性时,PLS 如何能够优于 PCR。

PCR 是一种包含两个步骤的回归器:首先,对训练数据应用 PCA(主成分分析),并可能进行降维;然后,在转换后的样本上训练一个回归器(例如线性回归器)。在 PCA 中,这种转换是纯无监督的,意味着不使用任何关于目标变量的信息。因此,在目标变量与方差较小的“方向”高度相关的某些数据集中,PCR 的表现可能较差。事实上,PCA 的降维是将数据投影到一个低维空间,并在该空间中沿每个轴贪婪地最大化投影数据的方差。尽管方差较小的方向可能对目标变量具有最强的预测能力,但它们会被丢弃,最终的回归器将无法利用这些信息。

PLS 既是转换器也是回归器,它与 PCR 非常相似:在将线性回归器应用于转换后的数据之前,它也对样本进行降维处理。与 PCR 的主要区别在于,PLS 的转换是有监督的。因此,正如我们将在此示例中看到的,它不会遇到我们刚才提到的问题。

# Authors: The scikit-learn developers
# SPDX-License-Identifier: BSD-3-Clause

数据#

我们首先创建一个具有两个特征的简单数据集。在深入研究 PCR 和 PLS 之前,我们先拟合一个 PCA 估计器来显示该数据集的两个主成分,即解释数据中最大方差的两个方向。

import matplotlib.pyplot as plt
import numpy as np

from sklearn.decomposition import PCA

rng = np.random.RandomState(0)
n_samples = 500
cov = [[3, 3], [3, 4]]
X = rng.multivariate_normal(mean=[0, 0], cov=cov, size=n_samples)
pca = PCA(n_components=2).fit(X)


plt.scatter(X[:, 0], X[:, 1], alpha=0.3, label="samples")
for i, (comp, var) in enumerate(zip(pca.components_, pca.explained_variance_)):
    comp = comp * var  # scale component by its variance explanation power
    plt.plot(
        [0, comp[0]],
        [0, comp[1]],
        label=f"Component {i}",
        linewidth=5,
        color=f"C{i + 2}",
    )
plt.gca().set(
    aspect="equal",
    title="2-dimensional dataset with principal components",
    xlabel="first feature",
    ylabel="second feature",
)
plt.legend()
plt.show()
2-dimensional dataset with principal components

为了本示例的目的,我们现在定义目标变量 y,使其与方差较小的方向强相关。为此,我们将 X 投影到第二个主成分上,并为其添加一些噪声。

y = X.dot(pca.components_[1]) + rng.normal(size=n_samples) / 2

fig, axes = plt.subplots(1, 2, figsize=(10, 3))

axes[0].scatter(X.dot(pca.components_[0]), y, alpha=0.3)
axes[0].set(xlabel="Projected data onto first PCA component", ylabel="y")
axes[1].scatter(X.dot(pca.components_[1]), y, alpha=0.3)
axes[1].set(xlabel="Projected data onto second PCA component", ylabel="y")
plt.tight_layout()
plt.show()
plot pcr vs pls

单成分投影与预测能力#

现在我们创建两个回归器:PCR 和 PLS,为了演示目的,我们将成分数量设置为 1。在将数据送入 PCR 的 PCA 步骤之前,我们首先按照最佳实践对其进行标准化处理。PLS 估计器具有内置的缩放功能。

对于这两个模型,我们绘制投影到第一个成分上的数据与目标变量的对比图。在这两种情况下,这些投影数据都是回归器将用作训练数据的内容。

from sklearn.cross_decomposition import PLSRegression
from sklearn.decomposition import PCA
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler

X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=rng)

pcr = make_pipeline(StandardScaler(), PCA(n_components=1), LinearRegression())
pcr.fit(X_train, y_train)
pca = pcr.named_steps["pca"]  # retrieve the PCA step of the pipeline

pls = PLSRegression(n_components=1)
pls.fit(X_train, y_train)

fig, axes = plt.subplots(1, 2, figsize=(10, 3))
axes[0].scatter(pca.transform(X_test), y_test, alpha=0.3, label="ground truth")
axes[0].scatter(
    pca.transform(X_test), pcr.predict(X_test), alpha=0.3, label="predictions"
)
axes[0].set(
    xlabel="Projected data onto first PCA component", ylabel="y", title="PCR / PCA"
)
axes[0].legend()
axes[1].scatter(pls.transform(X_test), y_test, alpha=0.3, label="ground truth")
axes[1].scatter(
    pls.transform(X_test), pls.predict(X_test), alpha=0.3, label="predictions"
)
axes[1].set(xlabel="Projected data onto first PLS component", ylabel="y", title="PLS")
axes[1].legend()
plt.tight_layout()
plt.show()
PCR / PCA, PLS

正如预期的那样,PCR 的无监督 PCA 转换丢弃了第二个成分(即方差最小的方向),尽管它是最具预测性的方向。这是因为 PCA 是一种完全无监督的转换,导致投影数据对目标变量的预测能力很低。

另一方面,PLS 回归器成功捕捉到了方差最小方向的影响,这归功于它在转换过程中使用了目标变量信息:它可以识别出该方向实际上是预测能力最强的。请注意,第一个 PLS 成分与目标变量呈负相关,这是因为特征向量的符号是任意的。

我们还打印了两个估计器的 R 平方分数,这进一步证实了在这种情况下,PLS 是比 PCR 更好的选择。负的 R 平方值表明 PCR 的表现不如直接预测目标均值的简单回归器。

print(f"PCR r-squared {pcr.score(X_test, y_test):.3f}")
print(f"PLS r-squared {pls.score(X_test, y_test):.3f}")
PCR r-squared -0.026
PLS r-squared 0.658

最后需要说明的是,使用 2 个成分的 PCR 表现与 PLS 一样好:这是因为在这种情况下,PCR 能够利用对目标变量具有最强预测能力的第二个成分。

pca_2 = make_pipeline(PCA(n_components=2), LinearRegression())
pca_2.fit(X_train, y_train)
print(f"PCR r-squared with 2 components {pca_2.score(X_test, y_test):.3f}")
PCR r-squared with 2 components 0.673

脚本运行总时间:(0 分 0.483 秒)

相关示例

比较交叉分解方法

比较交叉分解方法

特征缩放的重要性

特征缩放的重要性

Iris 数据集上的主成分分析(PCA)

Iris 数据集上的主成分分析(PCA)

将数据映射到正态分布

将数据映射到正态分布

由 Sphinx-Gallery 生成的图库