选择要解析的内容
默认情况下,LlamaParse 将提取文档每一页的所有可见内容
您可以通过在 target_pages 参数中以逗号分隔列表的形式传递特定页码来指定要解析的页面。页面编号从 0 开始。
parser = LlamaParse( target_pages="0,1,2,22,33")curl -X 'POST' \ 'https://api.cloud.llamaindex.ai/api/v1/parsing/upload' \ -H 'accept: application/json' \ -H 'Content-Type: multipart/form-data' \ -H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \ --form 'target_pages="0,1,2,22,33"' \ -F 'file=@/path/to/your/file.pdf;type=application/pdf'范围语法同样受支持 target_pages=0-2,6-22,33。
您可以指定文档中想要解析的区域。这有助于移除页眉和页脚。
为此,您需要在 bbox_left、bbox_right、bbox_top 和 bbox_bottom 中提供以相对于页面尺寸的比率(介于0到1之间)表示的边界框边距。
示例:
- 不解析文档的前10%:
bbox_top=0.1 - 不解析文档的前10%和后20%:
bbbox_top=0.1和bbox_bottom=0.2,
parser = LlamaParse( bbox_left=0.2)curl -X 'POST' \ 'https://api.cloud.llamaindex.ai/api/v1/parsing/upload' \ -H 'accept: application/json' \ -H 'Content-Type: multipart/form-data' \ -H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \ --form 'bbox_left=0.2' \ -F 'file=@/path/to/your/file.pdf;type=application/pdf'我们支持一种已弃用的方式,即可以在 bounding_box 参数中以逗号分隔的字符串按顺时针方向从上到下提供边界框边距。边距表示为相对于页面尺寸的比例,范围在0到1之间。
示例:
- 不解析文档的前10%:
bounding_box="0.1,0,0,0" - 不解析文档的前10%和后20%:
bounding_box="0.1,0,0.2,0"
parser = LlamaParse( bounding_box="0.1,0.4,0.2,0.3")curl -X 'POST' \ 'https://api.cloud.llamaindex.ai/api/v1/parsing/upload' \ -H 'accept: application/json' \ -H 'Content-Type: multipart/form-data' \ -H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \ --form 'bounding_box="0.1,0.4,0.2,0.3"' \ -F 'file=@/path/to/your/file.pdf;type=application/pdf'如果你想限制解析的最大页数,可以使用参数 max_pages。LlamaParse 将在达到指定页数后停止解析文档。
parser = LlamaParse( max_pages=25)curl -X 'POST' \ 'https://api.cloud.llamaindex.ai/api/v1/parsing/upload' \ -H 'accept: application/json' \ -H 'Content-Type: multipart/form-data' \ -H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \ --form 'max_pages=25' \ -F 'file=@/path/to/your/file.pdf;type=application/pdf'