RAG Series No.04

多模态 RAG 与高级解析工程

Layout-Aware (布局感知) 物理切片 · Late Chunking (延迟切片) · 跨模态向量联合召回与推理

ENGINE: ACTIVE
表格逻辑恢复率
100%vs 35% (传统文本流)

Layout Bounding Box 网格对齐还原,完美恢复合并单元格中的隐藏逻辑。

长语境关联留存
+180%Late Chunking 词嵌入

不截断注意力矩阵,让切片携带完整文档层级语义,告别碎片数据孤岛。

跨模态对齐精度
98.4%联合向量映射

将 image_02.png 的走势图坐标与表格文本重合映射,双向提取,双重校验。

I. 混合源文档物理快照

CONFIDENTIAL A4
VIEW MODE:
CONFIDENTIAL INTERNAL USE ONLYDoc ID: GR-2025-09

2025年度企业财务中期汇报与资产走势

我们对华东和华南两个大区进行了全面的审计。以下是数据详情表格。本期重点观察下半年度,由于合并结算导致的账面资产调整。请参考本报告附带的折线图走势。

[Box_01: Grid Table Extractor]
季度华东利润华南利润环比(华东)
Q1¥120,000¥150,000基期
Q2¥140,000¥160,000+16.7%
Q3 (合并项)¥185,000¥175,000+32.1%
Q4¥210,000¥190,000+13.5%

从下半年折线走势可以看出,华东区自Q3开始斜率显著陡峭,并最终在Q4实现了整体收益的反超与拉升。

[Box_02: Vision OCR Caption]
华东/华南区利润走势图 (image_02.png)单位: 万元
Q1
Q2
Q3
Q4
PAGE 1 OF 1AUDITED BY BAKER METRICS CO.

切片技术图解 (Chunking Engineering)

❌ 早期物理切片 (Early Chunking)Context Fragmented

长文档直接截断为固定 500 Token 碎片。编码时每个碎片各自独立。检索“Q3环比”时,对应切片由于丢失了首段的“2025年企业财务”年份主语,最终无法与提问对齐召回。

🚀 延迟注意力切片 (Late Chunking)Global Attention

一整篇文档送入 Encoder 生成关联矩阵,保留全局 Token 注意力交互。在此之上按照物理段落进行边界切片,使得每个 Chunk 在检索时天然自带上下文元语义,大幅提升匹配率。

II. 评测沙箱与策略对比

EVALUATION SANDBOX v2.0
解析策略切换控制台
对比传统解析器(PDFMiner等纯文本流)与集成多模态大模型的最新 Late Chunking 检索流在数据对齐上的差异。
Vision-OCR-TableLate ChunkingDynamic Multi-Modal MappingGemini 2.5 Fusion
RAG 问答模拟评测区
选择下方内置的标准企业审计预置问题,或者输入自定义问句。
标准评估预设问句 (Standard Evaluator Presets):
检索置信度得分 (Confidence):
98%HIGH CONFIDENCE
双向跨模态对齐状态:
校验通过 - 结构无损
LLM 生成回复 (Model Response)
ADVANCED STREAM
2025年Q3中,华东区的净利润为 **¥185,000**,其环比增长率为 **+32.1%**(从 Q2 的 ¥140,000 增长至 Q3 的 ¥185,000)。此项数据已通过多模态混合解析流成功从排版复杂的财务报表及图表 `image_02.png` 中提取,并与 Late Chunking 全局特征对齐完成双重校验。
召回的物理对齐分块 (Retrieved Source Chunks)
[CHUNK_01]
TEXTLate Chunking (携带全局注意力语义)
2025年企业财务汇报。我们对华东和华南两个大区进行了全面的审计。以下是数据详情表格...
[CHUNK_02]
TABLEOCR-Table 视觉网格物理结构还原
| 季度 | 华东区净利润 | 华南区净利润 | 环比增长 (华东) |
|---|---|---|---|
| Q1 | ¥120,000 | ¥150,000 | 基期 |
| Q2 | ¥140,000 | ¥160,000 | +16.7% |
| Q3 | ¥185,000 | ¥175,000 | +32.1% |
| Q4 | ¥210,000 | ¥190,000 | +13.5% |
[CHUNK_03]
VISION联合多模态语义对齐
[Vision Caption]: 成功定位 image_02.png 并解析折线图:华东区折线在Q3的斜率明显变陡,标注数值为 +32.1%,对应的 Y 轴绝对值为 18.5万,与表格Q3数据完美对齐。

III. 技术架构与工程白皮书 (Technical Architecture)

解读混合多模态检索底层技术链:布局边界识别、整幅文档注意力关联、混合高维向量空间。

1. Vision Bounding Box (布局提取)

利用物理坐标反投影技术,Layout-Aware 会在前置阶段对 PDF 的 A4 画布运行骨架和表格线框识别,获得精确的位置矩阵,从而将原本容易错乱混淆的复杂合并单元格完美保留为 Markdown 结构。

2. Late Chunking (延迟全局词嵌入)

常规切割无法应对数据和年份关联被无情砍断的情况。Late Chunking 使用整篇输入在自注意力(Self-Attention)生成完整的相关性系数后再物理切断,赋予每个分块全文档级的长文本语境视野。

3. Cross-Modal Fusion (跨模态对齐)

在统一映射的高维多模态向量库内,当检索提问指向趋势时,不仅直接召回带有结构性数据的 Markdown 切片,还能双向匹配到视觉模型描述的折线图,交由大模型完成终极大一统推理。

关联 · 提示工程技术全景查看完整技术地图

本节点承载《提示工程技术全景》中 #16 多模态思维链(思想说明 + 示例)。

已覆盖技术承载(强覆盖)

已覆盖
#16

多模态思维链 (Multimodal CoT)

把思维链从纯文本扩展到图文联合:先基于图像 + 文本生成「推理步骤」,再据此产出答案——让视觉证据进入推理链路。

强覆盖 · 本节点已配专门承载
图: 一堆水果 + 文本: 共几个? Step1: 图中苹果 3、橘子 2… Step2: 3+2=5 → 答案 5
优势
  • 视觉证据参与推理
  • 复杂图文任务更稳
局限
  • 需多模态模型支撑
  • 图文对齐易出错