跳转到主内容

与文档的聊天

信息处理的下一步

与其依赖公开数据集和一般知识,“与文档聊天”基于你信任的内部来源,生成情境特定的答案和分析。上传你的文档并使用这些文档作为聊天中回答问题的基础!

解决数据限制

如果你向语言模型提问,你将依赖模型所训练的数据集。通常这些信息来自互联网。非公开来源很可能不在该数据集中。通过将你的文档用作聊天的来源,你可以确保模型具备回答你问题所需的信息。

使用你的文档的能力

你可以就你的文档提问,例如列出文档的要点或对文档进行摘要。你还可以让语言模型利用你自己的数据集执行特定分析。

文档驱动聊天的缺点

上传文档并处理它们需要额外步骤,这些步骤在你不需要特定信息上下文就能得到良好回答时就不必进行。此外,由于必须先从文档中提取所需信息再将请求发送给语言模型,生成回答的时间也更长。

文档聊天背后的处理过程

你上传的文档中的文本会被提取并分割成若干片段。每段文本有固定的字符数(1024 字符),并且设置了重叠(128 字符)以便于检索。每段文本都会以向量形式存储在向量数据库中。每次提问时,将基于与所提问问题的相似性从这些数据中筛选出相关内容。

文档片段的选择过程

片段文本已被转换为向量。向量具有多维度,表示与其他文本的“相似度”。向量数据库使我们能够根据问题对文本片段进行排序和筛选。我们从中最多选择 100 段文本(每段 1024 字符)与问题一起发送。

适合文档驱动聊天的模型

我们选择了具有较大上下文窗口的模型,以实现文档聊天的可能性。我们希望最多能随同 100 段 1024 字符的文本。总共约超过 100,000 字符。请优先使用来自中央模型目录的高质量语言模型。

适合的模型

适合的模型是具有足够上下文空间和良好文档分析能力的模型,例如 OpenAI、Claude、Google 的高质量模型,以及欧洲 AI 的模型。

选择一个或多个文档

你可以通过在问题输入框右侧点击回形针来开启文件模式。你可以最多选择 10 个文件来进行聊天。

适合的语言模型

当你开始与文档聊天时,会检查语言模型是否适合进行文档聊天。如果不合适,系统会自动从当前目录中选择一个合适的模型。

在开启文件模式时,你即可与这些文档聊天。

按文件处理

除了与文档聊天外,AI-Public 还提供在每个文档上单独应用提示并获取独立答案的功能。此功能称为 逐文件处理(Per bestand verwerken)

逐文件处理

此功能可与“与文件聊天”组合使用。

可能的场景

一个使用 “逐文件处理” 的实际示例:

  1. 你上传参考文档并在“与文件聊天”中启用
  2. 你上传需要分析的多个文档并在“逐文件处理”中启用
  3. 你提出一个提示,该提示逐个应用于所有文件

通过这种方式,你可以让所有文档基于参考文档自动进行分析。

最大文件数量

“逐文件处理”功能的最大文件数为 30。

支持的文件类型

AI-Public 支持多种用于文档聊天的文件类型:

  • .pdf 的 PDF 文件
  • .docx 的 Word 文件
  • .csv 的 CSV 文件
  • .json 的 JSON 文件
  • .txt 的文本文件
  • 带扩展名的音频和视频文件:mp3、mp4、mpeg、mpga、m4a、wav、webm

与音频或视频文件聊天

AI-School 会先用设置好的转录提供商把音频和视频文件转为文本。对于对话,结果可能包含时间块和说话人标签。之后可以用合适的文本模型修正标点、拼写、说话人标签和专业术语。由于提供商和模型限制,长文件的处理方式可能不同于短文件。

WhatsApp