dask_ml.datasets.make_classification_df
dask_ml.datasets.make_classification_df¶
- dask_ml.datasets.make_classification_df(n_samples=10000, response_rate=0.5, predictability=0.1, random_state=None, chunks=None, dates=None, **kwargs)[源代码]¶
使用 make_classification 函数创建一个用于测试的 dask 数据帧。
- 参数
- n_samplesint, 默认值为 10000
要生成的观测数量
- response_rate浮点数在 0.0 和 0.5 之间,默认值为 0.5
样本中响应记录的最大百分比为0.5
- 可预测性浮点数在 0.0 和 1.0 之间,默认值为 0.1
响应的预测难度有多大(1.0 为最简单)
- random_stateint, 默认是 None
用于可重复性目的的种子
- 块整数
如何对数组进行分块。必须是以下形式之一:- 一个块大小,例如 1000。
- 日期tuple, 可选, 默认是 None
用于生成日期列中随机日期的开始和结束日期对象的元组
- **kwargs
传递给 sklearn.datasets.make_classification 的其他关键字参数
- 返回
- XDask DataFrame 形状为 [n_samples, n_features] 或
[n_samples, n_features + 1] 当指定日期时,输入样本。
- yDask 系列形状为 [n_samples] 或 [n_samples, n_targets]
输出值。