跳转到内容

配置选项

在创建新的提取智能体时,模式是最重要的部分。 然而,还有其他几个选项会显著影响提取过程。

这些选项决定了您的模式如何应用于文档:

  • 提取目标: 确定提取的范围和粒度。可用选项:

    • PER_DOC (默认值): 模式应用于整个文档,返回单个JSON对象
    • PER_PAGE: 模式独立应用于每个页面,返回一个JSON对象数组(每个页面一个)
    • PER_TABLE_ROW: 模式应用于有序列表中的每个实体(表格行、项目符号列表等),返回一个JSON对象数组(每个实体对应一个)

    请参阅核心概念页面获取关于何时使用每种模式的详细指导。

  • 提取模式:使用的提取模式。可以是 FASTBALANCEDMULTIMODALPREMIUM。默认为 MULTIMODALFAST 模式适用于具有OCR但无需基于AI解析的简单文档——这是最快的模式。BALANCED 模式在大多数文档的速度和准确性之间提供了良好平衡。MULTIMODAL 模式(默认)适用于包含文本、简单表格和图像的视觉丰富文档。PREMIUM 模式应用于从复杂表格和信息密集文档中提取数据——通过高级OCR、复杂表格/标题和布局检测提供最高准确性。

  • 解析模型: 用于文档解析的模型。如果未提供,则使用提取模式的默认模型。解析模型仅在 MULTIMODALPREMIUM 模式下可配置。各模式可用模型请参阅下表。

  • 提取模型: 用于数据提取的模型。如果未提供,则使用提取模式的默认模型。提取模型仅在 PREMIUM 模式下可配置。可用模型请参阅下表。

提取模式 模型类型 可用模型 额外积分 描述 默认
快速 - 不可配置
平衡 - 不可配置
多模态 解析模型 gemini-2.0-flash 中等复杂度文档的快速处理
gemini-2.5-flash-lite 快速且小巧的模型,类似于Gemini 2.0 Flash
gemini-2.5-flash +15 积分 / 页 Gemini 2.0 Flash 的继任者,性能得到提升
openai-gpt-4-1 +25 积分 -
gemini-2.5-pro +55 积分 适用于视觉复杂的文档
提取模型 不可配置
高级版 解析模型 gemini-2.5-pro 适用于视觉复杂的文档
openai-gpt-4-1 -
anthropic-sonnet-4.5 +45 积分 / 页 高性能解析复杂布局
提取模型 openai-gpt-4-1 -
openai-gpt-5-mini 更长的上下文保留与推理能力
openai-gpt-5 +30 积分 更长的上下文保留与推理能力 (++)
  • 系统提示: 为提取智能体提供的任何额外系统级指令。请注意,您应使用模式描述来传递字段级指令、少样本示例、格式说明等。
  • 页面范围:通过提供逗号分隔的页码或范围(基于1的索引)来指定从哪些页面提取内容。例如,使用1,3,5-7,9来提取第1页、第3页、第5至7页以及第9页。您也可以使用类似1-3,8-10的范围来提取前三页和第8至10页。页码采用基于1的计数方式,即第一页为页面1。当您只需要从大型文档的特定部分提取数据时,此选项非常有用。

  • 上下文窗口: 作为长文档提取上下文传递的页面数量。当从大型文档中提取内容且需要参考相邻页面上下文时,此功能非常有用。使用SDK中的ExtractConfig.num_pages_context参数来配置此选项。较大的值能保持更多周边文档内容的完整性,这在需要一次性查看多页表格或发票时很有帮助。较小的值会更快地遍历文件,在需要详尽覆盖密集列表时效果更佳。

如需获取提供增强元数据和洞察的额外提取功能,请参阅元数据扩展页面,其中涵盖:

  • 引用溯源: 为提取字段提供来源追踪
  • 推理: 提取决策的解释
  • 置信度分数: 定量置信度测量

这些扩展会在 extraction_metadata 字段中返回额外的元数据,但可能会影响处理时间。

这些功能目前在用户界面中的 Advanced Settings 下可用。

  • 分块模式:控制在处理超出上下文限制的大型文档时,文档如何分割进行处理。可选择以下方式:

    • PAGE: 每个页面成为单独的处理块(默认)
    • SECTION: 文档根据内容结构(如标题和自然边界)被分割成语义段落 使用 SDK 中的 ExtractConfig.chunk_mode 参数来配置此选项。
  • 高分辨率模式:启用高分辨率处理,提升小文本和精细细节的识别精度。此选项可优化OCR质量,并为文档页面采用更高分辨率。通过SDK中的ExtractConfig.high_resolution_mode参数启用此功能。警告:此操作可能延长提取处理时间,请仅在必要时使用。

  • 清除缓存: 清除缓存结果并重新运行完整提取。默认情况下,LlamaExtract会将解析结果缓存48小时。启用此选项可绕过缓存并确保全新处理,这将产生新的计费费用。使用SDK中的ExtractConfig.invalidate_cache参数来启用缓存清除功能。

您可以在使用REST API或Python SDK创建提取智能体时配置这些选项。

首先,安装 Python SDK:

Terminal window
pip install llama-cloud-services

以下是设置各种配置选项的方法:

from llama_cloud_services import LlamaExtract
from llama_cloud import ExtractConfig, ExtractMode, ChunkMode, ExtractTarget
# Initialize the client
extract = LlamaExtract(api_key="YOUR_API_KEY")
# Define your schema
schema = {
"type": "object",
"properties": {
"company_name": {"type": "string", "description": "Name of the company"},
"revenue": {"type": "number", "description": "Annual revenue in USD"}
}
}
# Create extraction configuration
config = ExtractConfig(
# Schema alignment
extraction_target=ExtractTarget.PER_DOC, # PER_DOC, PER_PAGE
# Model settings
extraction_mode=ExtractMode.MULTIMODAL, # FAST, BALANCED, MULTIMODAL, PREMIUM
parse_model=None, # Optional: override parse model
extract_model=None, # Optional: override extract model
# System prompt
system_prompt="Focus on the most recent financial data",
# Page range and context
page_range="1-5,10-15", # Extract from specific pages
num_pages_context=3, # Number of context pages for long docs
# Metadata extensions (see Metadata Extensions page for details)
cite_sources=True, # Enable citations
use_reasoning=True, # Enable reasoning (not available in FAST mode)
confidence_scores=True, # Enable confidence scores (MULTIMODAL/PREMIUM only)
# Advanced options
chunk_mode=ChunkMode.PAGE, # PAGE, SECTION
high_resolution_mode=True, # Enable for better OCR
invalidate_cache=False, # Set to True to bypass cache
)
# Create extraction agent with configuration
agent = extract.create_agent(
name="Financial Data Extractor",
data_schema=schema,
config=config
)
# Extract from a document
result = agent.extract("your-document.pdf")
print(result.data)

您也可以在创建提取智能体时使用 REST API 配置这些选项:

Terminal window
curl -X 'POST' \
'https://api.cloud.llamaindex.ai/api/v1/extraction/extraction-agents' \
-H 'accept: application/json' \
-H "Authorization: Bearer $LLAMA_CLOUD_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"name": "Financial Data Extractor",
"data_schema": {
"type": "object",
"properties": {
"company_name": {"type": "string", "description": "Name of the company"},
"revenue": {"type": "number", "description": "Annual revenue in USD"}
}
},
"config": {
"extraction_target": "PER_DOC",
"extraction_mode": "MULTIMODAL",
"parse_model": null,
"extract_model": null,
"system_prompt": "Focus on the most recent financial data",
"page_range": "1-5,10-15",
"num_pages_context": 3,
"cite_sources": true,
"use_reasoning": true,
"confidence_scores": true,
"chunk_mode": "PAGE",
"high_resolution_mode": true,
"invalidate_cache": false
}
}'
选项 类型 默认 描述
模式对齐
extraction_target 字符串 "PER_DOC" 提取范围:PER_DOCPER_PAGEPER_TABLE_ROW
模型设置
extraction_mode 字符串 "MULTIMODAL" 处理模式:FASTBALANCEDMULTIMODAL(默认)、PREMIUM
parse_model 字符串 null 解析模型覆盖(可选)
extract_model 字符串 null 提取模型覆盖(可选)
系统提示
system_prompt 字符串 null 附加系统级指令
页面范围与上下文
page_range 字符串 null 要提取的页码/范围(从1开始计数,例如"1,3,5-7")
num_pages_context 整数 null 作为长文档上下文传递的页面数量
元数据扩展
cite_sources 布尔值 false 启用来源引用
use_reasoning 布尔值 false 启用提取推理(在快速模式下不可用)
confidence_scores 布尔值 false 启用置信度分数(仅限MULTIMODAL/PREMIUM版本)
高级选项
chunk_mode 字符串 "PAGE" 文档分块策略:PAGESECTION
high_resolution_mode 布尔值 false 启用高分辨率处理
invalidate_cache 布尔值 false 绕过缓存结果

注意:某些选项如 confidence_scores 仅在特定提取模式下可用。详情请参阅上方各选项的单独说明。