class lance.LanceDataset(pyarrow._dataset.Dataset)

Lance数据集采用Lance格式,数据存储在给定的uri位置。

公共成员

LanceDataset(uri: str | Path, 版本: int | str | None = None, ...)

初始化自身。如需准确的签名信息,请参阅 help(type(self))。

__reduce__()

Dataset.__reduce_cython__(self)

property uri : str

数据的位置

property 标签 : 标签

数据集标签管理。

list_indices() list[索引]
index_statistics(index_name: str) dict[str, Any]
property has_index
scanner(...) LanceScanner

返回一个支持各种下推操作的Scanner。

property schema : 模式/架构

该数据集的pyarrow模式

property lance_schema : LanceSchema

该数据集的LanceSchema

property data_storage_version : str

该数据集所使用的数据存储格式版本

property max_field_id : int

清单中的max_field_id

to_table(...) 表格

将数据作为pyarrow.Table读入内存

property partition_expression

未实现(仅覆盖pyarrow数据集以防止段错误)

replace_schema(schema: 模式/架构)

未实现(仅覆盖pyarrow数据集以防止段错误)

replace_schema_metadata(new_metadata: dict[str, str])

替换数据集的结构元数据

replace_field_metadata(field_name: str, new_metadata)

替换模式中某个字段的元数据

get_fragments(...) list[LanceFragment]

从数据集中获取所有片段。

get_fragment(fragment_id: int) LanceFragment | None

获取指定片段ID的片段。

to_batches(...) Iterator[RecordBatch]

将数据集读取为物化的记录批次。

sample(num_rows: int, ...) 表格

随机选取数据样本

获取(索引: list[int] | 数组, ...) 表格

按索引选择数据行。

take_blobs(blob_column: str, ...) list[BlobFile]

按行ID选择二进制大对象。

head(num_rows, **kwargs)

加载数据集的前N行。

count_rows(filter: str | 表达式 | None = None, **kwargs) int

统计符合扫描器筛选条件的行数。

join(right_dataset, keys, right_keys=None, ...)

未实现(仅覆盖pyarrow数据集以防止段错误)

alter_columns(*修改: Iterable[AlterColumn])

修改列名、数据类型和可空性。

merge(data_obj: ReaderLike, left_on: str, ...)

将另一个数据集合并到当前数据集中。

add_columns(转换, ...)

使用定义的值添加新列。

drop_columns(columns: list[str])

从数据集中删除一列或多列

delete(predicate: str | 表达式)

从数据集中删除行。

insert(数据: ReaderLike, *, mode='append', **kwargs)

将数据插入数据集。

merge_insert(开启: str | Iterable[str]) MergeInsertBuilder

返回一个构建器,可用于创建“合并插入”操作

update(更新: dict[str, str], ...) UpdateResult

更新符合where条件的行的列值。

版本()

返回此数据集中的所有版本。

property 版本 : int

返回当前检出的数据集版本

property latest_version : int

返回数据集的最新版本。

checkout_version(版本: int | str) LanceDataset

加载指定版本的数据集。

恢复()

将当前检出的版本恢复为数据集的最新版本。

cleanup_old_versions(...) CleanupStats

清理数据集的旧版本。

create_scalar_index(: str, index_type, ...)

在列上创建标量索引。

create_index(: str | list[str], ...) LanceDataset

在列上创建索引。

drop_index(name: str)

从数据集中删除索引

prewarm_index(name: str)

预热索引

会话() _Session

返回数据集会话,该会话保存了数据集的状态。

static 提交(base_uri, ...) LanceDataset

创建数据集的新版本

static commit_batch(dest, ...) BulkCommitResult

使用多个事务创建数据集的新版本。

validate()

验证数据集。

migrate_manifest_paths_v2()

将清单路径迁移到新格式。

property optimize : DatasetOptimizer
property 统计 : LanceStats

实验性API

static drop(base_uri: str | Path, ...) None
classmethod LanceDataset(*args, **kwargs)

创建并返回一个新对象。有关准确的签名,请参阅help(type)。

filter(expression)

对数据集应用行过滤器。

sort_by(排序, **kwargs)

按一个或多个列对数据集进行排序。

join_asof(right_dataset, 开启, , tolerance, right_on=None, ...)

在当前数据集与另一个数据集之间执行异步连接(asof join)。