dask_ml.datasets.make_regression

dask_ml.datasets.make_regression

dask_ml.datasets.make_regression(n_samples=100, n_features=100, n_informative=10, n_targets=1, bias=0.0, effective_rank=None, tail_strength=0.5, noise=0.0, shuffle=True, coef=False, random_state=None, chunks=None)[源代码]

生成一个随机的回归问题。

输入集可以是条件良好(默认)或具有低秩-肥尾奇异特征。更多详情请参见 sklearn.datasets.make_low_rank_matrix()

这可以用于在机器集群上生成非常大的 Dask 数组。在使用分布式模式的 Dask 时,客户端机器只需分配一个块的数据。

参数
n_samplesint, 可选 (默认=100)

样本的数量。

n_featuresint, 可选 (默认=100)

功能数量。

n_informativeint, 可选 (默认=10)

信息特征的数量,即用于构建生成输出的线性模型的特征数量。

n_targetsint, 可选 (默认=1)

回归目标的数量,即与样本相关联的 y 输出向量的维度。默认情况下,输出是一个标量。

偏见float, 可选 (默认值=0.0)

底层线性模型中的偏置项。

有效秩int 或 None, 可选 (默认=None)
如果非空:

解释大部分输入数据所需的奇异向量的近似数量,通过线性组合。在输入中使用这种奇异谱,使得生成器能够再现实践中经常观察到的相关性。

如果为空:

输入集条件良好,居中且为单位方差的高斯分布。

尾力浮点数在 0.0 和 1.0 之间,可选(默认=0.5)

如果 effective_rank 不是 None,奇异值分布的脂肪噪声尾部的相对重要性。

噪音float, 可选 (默认值=0.0)

应用于输出的高斯噪声的标准差。

洗牌布尔值,可选(默认=True)

打乱样本和特征。

系数布尔值,可选(默认=False)

如果为真,则返回基础线性模型的系数。

random_stateint, RandomState 实例或 None (默认)

确定数据集创建的随机数生成。传递一个整数以在多次函数调用中获得可重现的输出。参见 术语表

int, 元组

如何对数组进行分块。必须是以下形式之一:- 一个块大小,如1000。- 一个块形状,如(1000, 1000)。- 所有维度上所有块的显式大小,如

((1000, 1000, 500), (400, 400)).

返回
X形状为 [n_samples, n_features] 的 Dask 数组

输入样本。

yDask 数组的形状为 [n_samples] 或 [n_samples, n_targets]

输出值。

系数形状为 [n_features] 或 [n_features, n_targets] 的数组,可选

底层线性模型的系数。仅当 coef 为 True 时返回。