PDF标记器
PDF标记阅读器 #
基类:EventBaseReader
PDF标记阅读器。将PDF读取为Markdown格式及带布局的表格。
workflows/handler.py 中的源代码llama_index/readers/pdf_marker/base.py
10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 | |
load_data #
load_data(file: Path, max_pages: int = None, langs: List[str] = None, batch_multiplier: int = 2, start_page: int = None, extra_info: Optional[Dict] = None) -> List[文档]
从PDF加载数据 参数: file (Path): PDF文件的路径。 max_pages (int): 要处理的最大页数。省略此参数将转换整个文档。 langs (List[str]): 用于OCR的语言列表。查看支持的语言:https://github.com/VikParuchuri/surya/blob/master/surya/languages.py batch_multiplier (int): 如果您有额外的显存,这是默认批处理大小的倍增系数。数值越高将占用更多显存,但处理速度更快。默认设置为2。默认批处理大小将占用约3GB显存。 start_page (int): 转换的起始页码。
返回:
| 类型 | 描述 |
|---|---|
List[文档]
|
List[Document]: 文档列表。 |
workflows/handler.py 中的源代码llama_index/readers/pdf_marker/base.py
18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 | |
选项: 成员:- PDFMarkerReader