load_diabetes#
- sklearn.datasets.load_diabetes(*, return_X_y=False, as_frame=False, scaled=True)[source]#
加载并返回糖尿病数据集(回归)。
样本总数
442
维度
10
特征值范围
实数,-.2 < x < .2
目标值
整数 25 - 346
注意
由于原始数据集的文档并不明确,每个特征(即
feature_names)的含义可能不清楚(特别是对于ltg)。我们提供了关于该研究领域科学文献中被认为是正确的信息。请在 用户指南 中阅读更多内容。
- 参数:
- return_X_ybool, default=False
如果为 True,则返回
(data, target)而不是 Bunch 对象。有关data和target对象的更多信息,请参阅下文。版本 0.18 新增。
- as_framebool, default=False
如果为 True,则数据是包含具有相应 dtypes(数字)的列的 pandas DataFrame。目标是 pandas DataFrame 或 Series,具体取决于目标列数。如果
return_X_y为 True,则 (data,target) 将是如下所述的 pandas DataFrames 或 Series。0.23 版本新增。
- scaledbool, 默认=True
如果为 True,则对特征变量进行均值中心化,并除以标准差乘以
n_samples的平方根来进行缩放。如果为 False,则返回特征变量的原始数据。版本 1.1 中新增。
- 返回:
- data
Bunch Dictionary-like object, with the following attributes.
- data{ndarray, dataframe},形状为 (442, 10)
数据矩阵。如果
as_frame=True,data将是一个 pandas DataFrame。- target: {ndarray, Series},形状为 (442,)
回归目标值。如果
as_frame=True,target将是一个 pandas Series。- feature_names: list
数据集列的名称。
- frame: DataFrame,形状为 (442, 11)
仅当
as_frame=True时存在。包含data和target的 DataFrame。0.23 版本新增。
- DESCR: str
The full description of the dataset.
- data_filename: str
The path to the location of the data.
- target_filename: str
目标数据所在位置的路径。
- (data, target)tuple if
return_X_yis True 一个包含两个 ndarray 的元组。第一个是形状为 (442, 10) 的 2D ndarray,每一行代表一个样本,列代表特征。第二个是形状为 (442,) 的 ndarray,包含目标样本。如果
as_frame=True,两个数组都将是 pandas 对象,即X是一个 dataframe,y是一个 series。版本 0.18 新增。
- data
示例
>>> from sklearn.datasets import load_diabetes >>> diabetes = load_diabetes() >>> diabetes.target[:3] array([151., 75., 141.]) >>> diabetes.data.shape (442, 10)