dask_ml.datasets.make_classification_df

dask_ml.datasets.make_classification_df

dask_ml.datasets.make_classification_df(n_samples=10000, response_rate=0.5, predictability=0.1, random_state=None, chunks=None, dates=None, **kwargs)[源代码]

使用 make_classification 函数创建一个用于测试的 dask 数据帧。

参数
n_samplesint, 默认值为 10000

要生成的观测数量

response_rate浮点数在 0.0 和 0.5 之间,默认值为 0.5

样本中响应记录的最大百分比为0.5

可预测性浮点数在 0.0 和 1.0 之间,默认值为 0.1

响应的预测难度有多大(1.0 为最简单)

random_stateint, 默认是 None

用于可重复性目的的种子

整数

如何对数组进行分块。必须是以下形式之一:- 一个块大小,例如 1000。

日期tuple, 可选, 默认是 None

用于生成日期列中随机日期的开始和结束日期对象的元组

**kwargs

传递给 sklearn.datasets.make_classification 的其他关键字参数

返回
XDask DataFrame 形状为 [n_samples, n_features] 或

[n_samples, n_features + 1] 当指定日期时,输入样本。

yDask 系列形状为 [n_samples] 或 [n_samples, n_targets]

输出值。