跳转到内容

选择要解析的内容

默认情况下,LlamaParse 将提取文档每一页的所有可见内容



您可以通过在 target_pages 参数中以逗号分隔列表的形式传递特定页码来指定要解析的页面。页面编号从 0 开始。

parser = LlamaParse(
target_pages="0,1,2,22,33"
)

范围语法同样受支持 target_pages=0-2,6-22,33



您可以指定文档中想要解析的区域。这有助于移除页眉和页脚。

为此,您需要在 bbox_leftbbox_rightbbox_topbbox_bottom 中提供以相对于页面尺寸的比率(介于0到1之间)表示的边界框边距。

示例:

  • 不解析文档的前10%:bbox_top=0.1
  • 不解析文档的前10%和后20%:bbbox_top=0.1bbox_bottom=0.2,
parser = LlamaParse(
bbox_left=0.2
)


我们支持一种已弃用的方式,即可以在 bounding_box 参数中以逗号分隔的字符串按顺时针方向从上到下提供边界框边距。边距表示为相对于页面尺寸的比例,范围在0到1之间。

示例:

  • 不解析文档的前10%:bounding_box="0.1,0,0,0"
  • 不解析文档的前10%和后20%:bounding_box="0.1,0,0.2,0"
parser = LlamaParse(
bounding_box="0.1,0.4,0.2,0.3"
)


如果你想限制解析的最大页数,可以使用参数 max_pages。LlamaParse 将在达到指定页数后停止解析文档。

parser = LlamaParse(
max_pages=25
)