pairwise_distances#

sklearn.metrics.pairwise_distances(X, Y=None, metric='euclidean', *, n_jobs=None, ensure_all_finite=True, **kwds)[source]#

计算特征数组 X 和可选 Y 的距离矩阵。

该函数接受一个或两个特征数组或距离矩阵,并返回一个距离矩阵。

  • 如果 X 是一个形状为 (n_samples_X, n_features) 的特征数组,且:

    • YNonemetric 不为 ‘precomputed’,则返回 X 与其自身的成对距离。

    • Y 是一个形状为 (n_samples_Y, n_features) 的特征数组,则返回 XY 之间的成对距离。

  • 如果 X 是一个形状为 (n_samples_X, n_samples_X) 的距离矩阵,则 metric 应设为 ‘precomputed’。此时 Y 会被忽略,并直接返回 X

如果输入是包含非数值数据的集合(例如字符串列表或布尔数组),则必须传入自定义的度量标准。

此方法提供了一种以距离矩阵作为输入的安全方式,同时保持了与许多其他接受向量数组的算法的兼容性。

度量的有效值包括:

  • 来自 scikit-learn 的度量:[‘cityblock’, ‘cosine’, ‘euclidean’, ‘l1’, ‘l2’, ‘manhattan’, ‘nan_euclidean’]。除 ‘nan_euclidean’ 外,所有度量均支持稀疏矩阵输入。

  • 来自 scipy.spatial.distance 的度量:[‘braycurtis’, ‘canberra’, ‘chebyshev’, ‘correlation’, ‘dice’, ‘hamming’, ‘jaccard’, ‘kulsinski’, ‘mahalanobis’, ‘minkowski’, ‘rogerstanimoto’, ‘russellrao’, ‘seuclidean’, ‘sokalmichener’, ‘sokalsneath’, ‘sqeuclidean’, ‘yule’]。这些度量不支持稀疏矩阵输入。

注意

'kulsinski' 在 SciPy 1.9 中已弃用,并将在 SciPy 1.11 中移除。

注意

'matching' 已在 SciPy 1.9 中移除(请改用 'hamming')。

请注意,对于 ‘cityblock’、‘cosine’ 和 ‘euclidean’(它们是有效的 scipy.spatial.distance 度量),将使用 scikit-learn 的实现,该实现更快且支持稀疏矩阵(‘cityblock’ 除外)。有关 scikit-learn 度量的详细描述,请参阅 sklearn.metrics.pairwise.distance_metrics 函数。

用户指南 中阅读更多内容。

参数:
X{类数组, 稀疏矩阵} 形状为 (n_samples_X, n_samples_X) 或 (n_samples_X, n_features)

样本之间的成对距离数组或特征数组。如果 metric == “precomputed”,数组形状应为 (n_samples_X, n_samples_X);否则应为 (n_samples_X, n_features)。

Y{array-like, sparse matrix} of shape (n_samples_Y, n_features), default=None

可选的第二个特征数组。仅在 metric != “precomputed” 时允许使用。

metricstr or callable, default=’euclidean’

在计算特征数组中实例之间的距离时使用的度量。如果 metric 是字符串,它必须是 scipy.spatial.distance.pdist 的 metric 参数所允许的选项之一,或者是列在 pairwise.PAIRWISE_DISTANCE_FUNCTIONS 中的度量。如果 metric 为 “precomputed”,则假定 X 是一个距离矩阵。另外,如果 metric 是一个可调用函数,它会被用于每一对实例(行)并记录结果值。该可调用对象应以来自 X 的两个数组作为输入,并返回表示它们之间距离的值。

n_jobsint, default=None

用于计算的作业数。其工作原理是将成对矩阵分解为 n_jobs 个等分,并利用多线程进行计算。

None 表示 1,除非在 joblib.parallel_backend 上下文中。 -1 表示使用所有处理器。有关更多详细信息,请参阅词汇表

“euclidean” 和 “cosine” 度量严重依赖于已经多线程化的 BLAS。因此,增加 n_jobs 很可能会导致资源过度订阅并迅速降低性能。

ensure_all_finitebool 或 ‘allow-nan’,默认为 True

是否对数组中的 np.inf、np.nan、pd.NA 引发错误。对于列在 pairwise.PAIRWISE_DISTANCE_FUNCTIONS 中的度量,此参数会被忽略。可能的值包括:

  • True:强制数组中的所有值均为有限值。

  • False:接受数组中的 np.inf、np.nan、pd.NA。

  • ‘allow-nan’:仅接受数组中的 np.nan 和 pd.NA 值,不能包含无穷大值。

版本 1.6 中新增: force_all_finite 已重命名为 ensure_all_finite

**kwdsoptional keyword parameters

任何其他参数都将直接传递给距离函数。如果使用 scipy.spatial.distance 度量,参数仍取决于具体度量。请参阅 scipy 文档以获取用法示例。

返回:
D形状为 (n_samples_X, n_samples_X) 或 (n_samples_X, n_samples_Y) 的 ndarray

距离矩阵 D。如果 Y 为 None,则 D_{i, j} 为给定矩阵 X 中第 i 个向量和第 j 个向量之间的距离。如果 Y 不为 None,则 D_{i, j} 为 X 中的第 i 个数组和 Y 中的第 j 个数组之间的距离。

另请参阅

pairwise_distances_chunked

执行与此函数相同的计算,但返回距离矩阵块的生成器,以限制内存使用。

sklearn.metrics.pairwise.paired_distances

计算两个数组对应元素之间的距离。

注意事项

如果 metric 是一个可调用对象,则对 XY 的维度没有限制。

示例

>>> from sklearn.metrics.pairwise import pairwise_distances
>>> X = [[0, 0, 0], [1, 1, 1]]
>>> Y = [[1, 0, 0], [1, 1, 0]]
>>> pairwise_distances(X, Y, metric='sqeuclidean')
array([[1., 2.],
       [2., 1.]])