load_breast_cancer#

sklearn.datasets.load_breast_cancer(*, return_X_y=False, as_frame=False)[source]#

加载并返回乳腺癌威斯康星数据集(分类)。

乳腺癌数据集是一个经典的、非常简单的二分类数据集。

类别数

2

每类的样本数

212例(恶性),357例(良性)

样本总数

569

维度

30

特征值范围

real, positive

UCI ML 乳腺癌威斯康星(诊断)数据集的副本下载自: https://archive.ics.uci.edu/dataset/17/breast+cancer+wisconsin+diagnostic

阅读更多内容请参阅 用户指南

参数:
return_X_ybool, default=False

如果为 True,则返回 (data, target) 而不是 Bunch 对象。有关 datatarget 对象的更多信息,请参阅下文。

版本 0.18 新增。

as_framebool, default=False

如果为 True,则数据是包含具有相应 dtypes(数字)的列的 pandas DataFrame。目标是 pandas DataFrame 或 Series,具体取决于目标列数。如果 return_X_y 为 True,则 (data, target) 将是如下所述的 pandas DataFrames 或 Series。

0.23 版本新增。

返回:
dataBunch

Dictionary-like object, with the following attributes.

data{ndarray, dataframe},形状为 (569, 30)

数据矩阵。如果 as_frame=Truedata 将是一个 pandas DataFrame。

target{ndarray, Series},形状为 (569,)

分类目标。如果 as_frame=Truetarget 将是一个 pandas Series。

feature_namesndarray,形状为 (30,)

数据集列的名称。

target_namesndarray,形状为 (2,)

The names of target classes.

frameDataFrame,形状为 (569, 31)

仅当 as_frame=True 时存在。包含 datatarget 的 DataFrame。

0.23 版本新增。

DESCRstr

The full description of the dataset.

filenamestr

The path to the location of the data.

0.20 版本新增。

(data, target)tuple if return_X_y is True

包含两个 ndarray 的元组。第一个是形状为 (569, 30) 的二维 ndarray,每一行代表一个样本,列代表特征。第二个是形状为 (569,) 的 ndarray,包含目标样本。如果 as_frame=True,则两个数组均为 pandas 对象,即 X 为 DataFrame,y 为 Series。

版本 0.18 新增。

示例

假设您对索引为 10、50 和 85 的样本感兴趣,并想知道它们的类别名称。

>>> from sklearn.datasets import load_breast_cancer
>>> data = load_breast_cancer()
>>> data.target[[10, 50, 85]]
array([0, 1, 0])
>>> list(data.target_names)
[np.str_('malignant'), np.str_('benign')]