dask_ml.datasets.make_regression
dask_ml.datasets.make_regression¶
- dask_ml.datasets.make_regression(n_samples=100, n_features=100, n_informative=10, n_targets=1, bias=0.0, effective_rank=None, tail_strength=0.5, noise=0.0, shuffle=True, coef=False, random_state=None, chunks=None)[源代码]¶
生成一个随机的回归问题。
输入集可以是条件良好(默认)或具有低秩-肥尾奇异特征。更多详情请参见
sklearn.datasets.make_low_rank_matrix()。这可以用于在机器集群上生成非常大的 Dask 数组。在使用分布式模式的 Dask 时,客户端机器只需分配一个块的数据。
- 参数
- n_samplesint, 可选 (默认=100)
样本的数量。
- n_featuresint, 可选 (默认=100)
功能数量。
- n_informativeint, 可选 (默认=10)
信息特征的数量,即用于构建生成输出的线性模型的特征数量。
- n_targetsint, 可选 (默认=1)
回归目标的数量,即与样本相关联的 y 输出向量的维度。默认情况下,输出是一个标量。
- 偏见float, 可选 (默认值=0.0)
底层线性模型中的偏置项。
- 有效秩int 或 None, 可选 (默认=None)
- 如果非空:
解释大部分输入数据所需的奇异向量的近似数量,通过线性组合。在输入中使用这种奇异谱,使得生成器能够再现实践中经常观察到的相关性。
- 如果为空:
输入集条件良好,居中且为单位方差的高斯分布。
- 尾力浮点数在 0.0 和 1.0 之间,可选(默认=0.5)
如果 effective_rank 不是 None,奇异值分布的脂肪噪声尾部的相对重要性。
- 噪音float, 可选 (默认值=0.0)
应用于输出的高斯噪声的标准差。
- 洗牌布尔值,可选(默认=True)
打乱样本和特征。
- 系数布尔值,可选(默认=False)
如果为真,则返回基础线性模型的系数。
- random_stateint, RandomState 实例或 None (默认)
确定数据集创建的随机数生成。传递一个整数以在多次函数调用中获得可重现的输出。参见 术语表。
- 块int, 元组
如何对数组进行分块。必须是以下形式之一:- 一个块大小,如1000。- 一个块形状,如(1000, 1000)。- 所有维度上所有块的显式大小,如
((1000, 1000, 500), (400, 400)).
- 返回
- X形状为 [n_samples, n_features] 的 Dask 数组
输入样本。
- yDask 数组的形状为 [n_samples] 或 [n_samples, n_targets]
输出值。
- 系数形状为 [n_features] 或 [n_features, n_targets] 的数组,可选
底层线性模型的系数。仅当 coef 为 True 时返回。