配置选项
在创建新的提取智能体时,模式是最重要的部分。 然而,还有其他几个选项会显著影响提取过程。
这些选项决定了您的模式如何应用于文档:
-
提取目标: 确定提取的范围和粒度。可用选项:
PER_DOC(默认值): 模式应用于整个文档,返回单个JSON对象PER_PAGE: 模式独立应用于每个页面,返回一个JSON对象数组(每个页面一个)PER_TABLE_ROW: 模式应用于有序列表中的每个实体(表格行、项目符号列表等),返回一个JSON对象数组(每个实体对应一个)
请参阅核心概念页面获取关于何时使用每种模式的详细指导。
-
提取模式:使用的提取模式。可以是
FAST、BALANCED、MULTIMODAL或PREMIUM。默认为MULTIMODAL。FAST模式适用于具有OCR但无需基于AI解析的简单文档——这是最快的模式。BALANCED模式在大多数文档的速度和准确性之间提供了良好平衡。MULTIMODAL模式(默认)适用于包含文本、简单表格和图像的视觉丰富文档。PREMIUM模式应用于从复杂表格和信息密集文档中提取数据——通过高级OCR、复杂表格/标题和布局检测提供最高准确性。 -
解析模型: 用于文档解析的模型。如果未提供,则使用提取模式的默认模型。解析模型仅在
MULTIMODAL和PREMIUM模式下可配置。各模式可用模型请参阅下表。 -
提取模型: 用于数据提取的模型。如果未提供,则使用提取模式的默认模型。提取模型仅在
PREMIUM模式下可配置。可用模型请参阅下表。
| 提取模式 | 模型类型 | 可用模型 | 额外积分 | 描述 | 默认 |
|---|---|---|---|---|---|
| 快速 | - | 不可配置 | |||
| 平衡 | - | 不可配置 | |||
| 多模态 | 解析模型 | gemini-2.0-flash |
无 | 中等复杂度文档的快速处理 | ✓ |
gemini-2.5-flash-lite |
无 | 快速且小巧的模型,类似于Gemini 2.0 Flash | |||
gemini-2.5-flash |
+15 积分 / 页 | Gemini 2.0 Flash 的继任者,性能得到提升 | |||
openai-gpt-4-1 |
+25 积分 | - | |||
gemini-2.5-pro |
+55 积分 | 适用于视觉复杂的文档 | |||
| 提取模型 | 不可配置 | ||||
| 高级版 | 解析模型 | gemini-2.5-pro |
无 | 适用于视觉复杂的文档 | ✓ |
openai-gpt-4-1 |
无 | - | |||
anthropic-sonnet-4.5 |
+45 积分 / 页 | 高性能解析复杂布局 | |||
| 提取模型 | openai-gpt-4-1 |
无 | - | ✓ | |
openai-gpt-5-mini |
无 | 更长的上下文保留与推理能力 | |||
openai-gpt-5 |
+30 积分 | 更长的上下文保留与推理能力 (++) | |||
- 系统提示: 为提取智能体提供的任何额外系统级指令。请注意,您应使用模式描述来传递字段级指令、少样本示例、格式说明等。
-
页面范围:通过提供逗号分隔的页码或范围(基于1的索引)来指定从哪些页面提取内容。例如,使用
1,3,5-7,9来提取第1页、第3页、第5至7页以及第9页。您也可以使用类似1-3,8-10的范围来提取前三页和第8至10页。页码采用基于1的计数方式,即第一页为页面1。当您只需要从大型文档的特定部分提取数据时,此选项非常有用。 -
上下文窗口: 作为长文档提取上下文传递的页面数量。当从大型文档中提取内容且需要参考相邻页面上下文时,此功能非常有用。使用SDK中的
ExtractConfig.num_pages_context参数来配置此选项。较大的值能保持更多周边文档内容的完整性,这在需要一次性查看多页表格或发票时很有帮助。较小的值会更快地遍历文件,在需要详尽覆盖密集列表时效果更佳。
如需获取提供增强元数据和洞察的额外提取功能,请参阅元数据扩展页面,其中涵盖:
- 引用溯源: 为提取字段提供来源追踪
- 推理: 提取决策的解释
- 置信度分数: 定量置信度测量
这些扩展会在 extraction_metadata 字段中返回额外的元数据,但可能会影响处理时间。
这些功能目前在用户界面中的 Advanced Settings 下可用。
-
分块模式:控制在处理超出上下文限制的大型文档时,文档如何分割进行处理。可选择以下方式:
PAGE: 每个页面成为单独的处理块(默认)SECTION: 文档根据内容结构(如标题和自然边界)被分割成语义段落 使用 SDK 中的ExtractConfig.chunk_mode参数来配置此选项。
-
高分辨率模式:启用高分辨率处理,提升小文本和精细细节的识别精度。此选项可优化OCR质量,并为文档页面采用更高分辨率。通过SDK中的
ExtractConfig.high_resolution_mode参数启用此功能。警告:此操作可能延长提取处理时间,请仅在必要时使用。 -
清除缓存: 清除缓存结果并重新运行完整提取。默认情况下,LlamaExtract会将解析结果缓存48小时。启用此选项可绕过缓存并确保全新处理,这将产生新的计费费用。使用SDK中的
ExtractConfig.invalidate_cache参数来启用缓存清除功能。
您可以在使用REST API或Python SDK创建提取智能体时配置这些选项。
Python SDK
Section titled “Python SDK”首先,安装 Python SDK:
pip install llama-cloud-services以下是设置各种配置选项的方法:
from llama_cloud_services import LlamaExtractfrom llama_cloud import ExtractConfig, ExtractMode, ChunkMode, ExtractTarget
# Initialize the clientextract = LlamaExtract(api_key="YOUR_API_KEY")
# Define your schemaschema = { "type": "object", "properties": { "company_name": {"type": "string", "description": "Name of the company"}, "revenue": {"type": "number", "description": "Annual revenue in USD"} }}
# Create extraction configurationconfig = ExtractConfig( # Schema alignment extraction_target=ExtractTarget.PER_DOC, # PER_DOC, PER_PAGE
# Model settings extraction_mode=ExtractMode.MULTIMODAL, # FAST, BALANCED, MULTIMODAL, PREMIUM parse_model=None, # Optional: override parse model extract_model=None, # Optional: override extract model
# System prompt system_prompt="Focus on the most recent financial data",
# Page range and context page_range="1-5,10-15", # Extract from specific pages num_pages_context=3, # Number of context pages for long docs
# Metadata extensions (see Metadata Extensions page for details) cite_sources=True, # Enable citations use_reasoning=True, # Enable reasoning (not available in FAST mode) confidence_scores=True, # Enable confidence scores (MULTIMODAL/PREMIUM only)
# Advanced options chunk_mode=ChunkMode.PAGE, # PAGE, SECTION high_resolution_mode=True, # Enable for better OCR invalidate_cache=False, # Set to True to bypass cache)
# Create extraction agent with configurationagent = extract.create_agent( name="Financial Data Extractor", data_schema=schema, config=config)
# Extract from a documentresult = agent.extract("your-document.pdf")print(result.data)REST API
Section titled “REST API”您也可以在创建提取智能体时使用 REST API 配置这些选项:
curl -X 'POST' \ 'https://api.cloud.llamaindex.ai/api/v1/extraction/extraction-agents' \ -H 'accept: application/json' \ -H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \ -H 'Content-Type: application/json' \ -d '{ "name": "Financial Data Extractor", "data_schema": { "type": "object", "properties": { "company_name": {"type": "string", "description": "Name of the company"}, "revenue": {"type": "number", "description": "Annual revenue in USD"} } }, "config": { "extraction_target": "PER_DOC", "extraction_mode": "MULTIMODAL", "parse_model": null, "extract_model": null, "system_prompt": "Focus on the most recent financial data", "page_range": "1-5,10-15", "num_pages_context": 3, "cite_sources": true, "use_reasoning": true, "confidence_scores": true, "chunk_mode": "PAGE", "high_resolution_mode": true, "invalidate_cache": false } }'| 选项 | 类型 | 默认 | 描述 |
|---|---|---|---|
| 模式对齐 | |||
extraction_target |
字符串 | "PER_DOC" |
提取范围:PER_DOC、PER_PAGE、PER_TABLE_ROW |
| 模型设置 | |||
extraction_mode |
字符串 | "MULTIMODAL" |
处理模式:FAST、BALANCED、MULTIMODAL(默认)、PREMIUM |
parse_model |
字符串 | null |
解析模型覆盖(可选) |
extract_model |
字符串 | null |
提取模型覆盖(可选) |
| 系统提示 | |||
system_prompt |
字符串 | null |
附加系统级指令 |
| 页面范围与上下文 | |||
page_range |
字符串 | null |
要提取的页码/范围(从1开始计数,例如"1,3,5-7") |
num_pages_context |
整数 | null |
作为长文档上下文传递的页面数量 |
| 元数据扩展 | |||
cite_sources |
布尔值 | false |
启用来源引用 |
use_reasoning |
布尔值 | false |
启用提取推理(在快速模式下不可用) |
confidence_scores |
布尔值 | false |
启用置信度分数(仅限MULTIMODAL/PREMIUM版本) |
| 高级选项 | |||
chunk_mode |
字符串 | "PAGE" |
文档分块策略:PAGE,SECTION |
high_resolution_mode |
布尔值 | false |
启用高分辨率处理 |
invalidate_cache |
布尔值 | false |
绕过缓存结果 |
注意:某些选项如 confidence_scores 仅在特定提取模式下可用。详情请参阅上方各选项的单独说明。