跳转到内容

元数据

在JSON模式下,LlamaParse将返回表示已解析对象的数据结构。这对于进一步处理或分析非常有用。

要使用此模式,请将结果类型设置为“json”。

Terminal window
curl -X 'POST' \
'https://api.cloud.llamaindex.ai/api/v1/parsing/job/<job_id>/result/json' \
-H 'accept: application/json' \
-H 'Content-Type: multipart/form-data' \
-H "Authorization: Bearer $LLAMA_CLOUD_API_KEY"


{
"pages": [
..page objects..
],
"job_metadata": {
"job_pages": int,
"job_is_cache_hit": boolean
}
}


在页面对象中,根据您的文档,可能存在以下键。

  • pagepage: 文档的页码。
  • texttext: 从页面中提取的文本。
  • mdmd: 提取文本的Markdown版本。
  • imagesimages: 从页面中提取的所有图像。
  • items: 一个包含 headingtexttable 对象的数组,按它们在页面上出现的顺序排列。


图像以图像对象数组的形式返回,格式如下:

{
"name": "img_p2_5.png",
"height": 718,
"width": 251
}

你可以直接使用 name 的值来获取提取的图像,如下所示:

Terminal window
curl -X 'POST' \
'https://api.cloud.llamaindex.ai/api/v1/parsing/job/<job_id>/result/image/<name>' \
-H 'accept: application/json' \
-H 'Content-Type: multipart/form-data' \
-H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \
--output "file.png"

注意额外的 --output 参数用于 curl 命令,以便将二进制文件保存到文件中。



对于某些演示格式,如果幻灯片包含演讲者备注,这些备注将被提取并返回到页面的 slideSpeakerNotes 条目中:

[
{
"page": 1,
"text": "Hello\nSlide with notes",
"slideSpeakerNotes": "This is a speaker note",
...
},
...

当前支持的幻灯片演讲者备注提取格式:

  • .pptx (PowerPoint 2007+)

对于这些格式,除了 parse_page_with_lvm 之外的所有解析模式都支持幻灯片演讲者备注提取。