跳转到内容

多模态

LlamaIndex 不仅提供构建基于语言的应用的能力,还能构建多模态应用——将语言与图像相结合。

这个领域目前正在积极探索中,但一些引人入胜的应用场景正在不断涌现。

所有核心RAG概念:索引、检索和合成,都可以扩展到图像场景中。

  • 输入可以是文本或图像。
  • 存储的知识库可以包含文本或图像。
  • 生成响应的输入可以是文本或图像。
  • 最终响应可以是文本或图像。

查看以下指南:

您可以通过LlamaIndex使用新的OpenAI GPT4V生成structured输出。用户只需指定一个Pydantic对象来定义输出的结构。

查看以下指南:

通常理解图像需要从知识库中查找信息。这里的流程是检索增强图像描述——首先使用多模态模型为图像生成描述,然后通过从文本语料库中检索来优化该描述。

查看以下指南:

以下是一些展示 GPT-4V 智能体能力的初步工作。

这些部分展示了不同多模态模型在各种使用场景下的对比。

LLaVa-13、Fuyu-8B 和 MiniGPT-4 多模态大语言模型在图像推理方面的对比

Section titled “LLaVa-13, Fuyu-8B, and MiniGPT-4 Multi-Modal LLM Models Comparison for Image Reasoning”

这些笔记本展示了如何使用不同的多模态大语言模型进行图像理解/推理。各种模型推理由 Replicate 或 OpenAI GPT4-V API 提供支持。我们比较了几种流行的多模态大语言模型:

  • GPT4-V (OpenAI API)
  • LLava-13B (Replicate)
  • Fuyu-8B (Replicate)
  • MiniGPT-4 (Replicate)
  • CogVLM (Replicate)

查看以下指南:

在本笔记本指南中,我们将演示如何评估多模态RAG系统。与纯文本场景类似,我们将分别考虑检索器和生成器的评估。正如我们在关于评估多模态RAG的博客中所提及的,我们这里的方法涉及应用适用于纯文本场景的常规评估技术的适配版本。这些适配版本是llama-index库(即评估模块)的一部分,本笔记本将引导您了解如何将它们应用于您的评估用例。

以下是展示如何与不同多模态模型提供商交互的笔记本指南。