-
lance.dataset(uri: str | Path, 版本: int | str | None =
None, asof: ts_types | None =None, block_size: int | None =None, commit_lock: CommitLock | None =None, index_cache_size: int | None =None, storage_options: dict[str, str] | None =None, default_scan_options: dict[str, str] | None =None) LanceDataset 从指定地址打开Lance数据集。
- Parameters:
- uri : str¶
Lance数据集的地址。可以是本地文件路径/tmp/data.lance,也可以是云对象存储URI,例如s3://bucket/data.lance。
- version : optional, int | str¶
如果指定,则加载Lance数据集的特定版本。否则,加载最新版本。可以提供一个版本号(int)或标签(str)。
- asof : optional, datetime or str¶
如果指定此参数,则查找在给定参数值当天或之前创建的最新版本。如果已指定版本号,则忽略此参数。
- block_size : optional, int¶
块大小(以字节为单位)。为最小I/O请求的大小提供提示。
- commit_lock : optional, lance.commit.CommitLock¶
自定义提交锁。仅当您的对象存储不支持原子提交时才需要。详情请参阅用户指南。
- index_cache_size : optional, int¶
索引缓存大小。索引缓存是一个带有TTL的LRU缓存。该数值指定了 在主机内存中缓存的索引页面数量,例如IVF分区数。默认值为
256。粗略来说,对于一个包含
n行的IVF_PQ分区,每个索引页面的大小等于 pq编码(nd.array([n,pq], dtype=uint8)))和行ID(nd.array([n], dtype=uint64))的组合。 近似计算为n = 总行数 / IVF分区数量。pq = PQ子向量数量。- storage_options : optional, dict¶
针对特定存储连接的额外选项。这用于存储连接参数,如凭证、端点等。
- default_scan_options : optional, dict¶
扫描数据集时使用的默认扫描选项。这接受与
lance.LanceDataset.scanner()中描述的相同参数。这些参数将应用于任何扫描操作。这对于为常见参数(如
batch_size)提供默认值非常有用。它还可用于创建包含元字段(如
_rowid或_rowaddr)的数据集视图。如果提供了default_scan_options,那么当设置了适当的扫描选项时,lance.LanceDataset.schema()返回的模式将包含这些字段。