元数据
在JSON模式下,LlamaParse将返回表示已解析对象的数据结构。这对于进一步处理或分析非常有用。
要使用此模式,请将结果类型设置为“json”。
curl -X 'POST' \ 'https://api.cloud.llamaindex.ai/api/v1/parsing/job/<job_id>/result/json' \ -H 'accept: application/json' \ -H 'Content-Type: multipart/form-data' \ -H "Authorization: Bearer $LLAMA_CLOUD_API_KEY"{ "pages": [ ..page objects.. ], "job_metadata": { "job_pages": int, "job_is_cache_hit": boolean }}在页面对象中,根据您的文档,可能存在以下键。
pagepage: 文档的页码。texttext: 从页面中提取的文本。mdmd: 提取文本的Markdown版本。imagesimages: 从页面中提取的所有图像。items: 一个包含heading、text和table对象的数组,按它们在页面上出现的顺序排列。
图像以图像对象数组的形式返回,格式如下:
{ "name": "img_p2_5.png", "height": 718, "width": 251}你可以直接使用 name 的值来获取提取的图像,如下所示:
curl -X 'POST' \ 'https://api.cloud.llamaindex.ai/api/v1/parsing/job/<job_id>/result/image/<name>' \ -H 'accept: application/json' \ -H 'Content-Type: multipart/form-data' \ -H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \ --output "file.png"注意额外的 --output 参数用于 curl 命令,以便将二进制文件保存到文件中。
对于某些演示格式,如果幻灯片包含演讲者备注,这些备注将被提取并返回到页面的 slideSpeakerNotes 条目中:
[ { "page": 1, "text": "Hello\nSlide with notes", "slideSpeakerNotes": "This is a speaker note", ... },...当前支持的幻灯片演讲者备注提取格式:
.pptx(PowerPoint 2007+)
对于这些格式,除了 parse_page_with_lvm 之外的所有解析模式都支持幻灯片演讲者备注提取。