实用指南:RAG分块策略——完整工程指南
《实用笔记:RAG分块策略——完整工程指南》的操作流程说明:为采用该模式的团队提供的合同、检查清单以及可直接插入的代码模板。
以下笔记为《RAG分块策略:完整工程指南》提供了一条实用的学习路径。重点在于各种契约、校验机制以及可直接插入的代码占位符,而非激励性表述。 在完成概览阶段时,首先列出相关契约:所需输入、成功标志以及部分失败时的处理方式。这样的检查清单能确保后续的代码修改保持一致性。 将这一阶段视为输入与经过验证的输出之间的契约。为相关成果命名,明确成功校验标准,并杜绝默许的部分完成情况。
核心权衡:上下文与精确度
“核心权衡情境”阶段若被视为可度量的对象,效果会最佳。在扩大范围之前,先记录一份理想的处理结果、一个失败案例以及回滚说明。在功能结果旁同时记录处理时间以及令牌或查询成本。提前了解这些成本,就能避免在系统从演示环境过渡到共享环境时出现意外费用。应将分块策略与检索策略分开处理,当质量指标发生变化时,调整其中一个不应强制要求重新编写另一个。
[ TOO SMALL CHUNKS ] [ TOO LARGE CHUNKS ]
Loss of Context / Meaning "Lost in the Middle" Effect
(e.g., "IF request is made...") (Dense with irrelevant fluff)
│ │
└───────────────► 🎯 ◄─────────────────┘
THE GOLDILOCKS ZONE
(High Precision + Context)
策略1:固定大小与递归分割(基准方案)
策略1中的固定大小递归阶段在被视为可度量的对象时效果最佳。在扩大范围之前,先收集一份理想的转录样本、一个失败案例以及回滚说明。 将配置置于应用程序代码之外。环境文件、密钥存储和功能标志应集中存放于一个位置,以便操作人员无需查看整个结构即可进行审计。 将分块策略与检索策略分开。当质量指标发生变化时,修改其中一项不应迫使重新编写另一项。
固定大小分块(朴素方法)
固定大小分块——在将其视为可度量的对象时,“朴素阶段”的效果最佳。在扩大范围之前,需记录一份理想的处理结果、一个失败案例以及回滚说明。同时文档化正常流程与恢复流程。重试机制、人工审核环节以及错误处理都属于产品功能的一部分,而非后续需要补充的内容。应将分块策略与检索策略分开,当质量指标发生变化时,修改其中一项不应强制要求重新编写另一项。固定大小分块——在将其视为可度量的对象时,“朴素阶段”的效果最佳。在扩大范围之前,需记录一份理想的处理结果、一个失败案例以及回滚说明。应将此阶段视为输入与经过验证的输出之间的契约,为相关成果命名,明确成功标准,杜绝无声的半完成状态。
递归字符分块(生产环境基准)
在递归字符分块阶段,应在修改代码之前明确输入内容、该步骤的负责人以及终止标准。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。除了功能结果外,还需记录执行时间以及令牌或查询成本。提前了解成本情况,可避免在从演示环境过渡到共享环境时出现意外费用。必须注明实际作为答案依据的段落;若没有引用,操作人员就无法区分幻觉内容与索引缺失问题。
# Example: LangChain Recursive Character Splitter
from langchain.text_splitter import RecursiveCharacterTextSplitter
splitter = RecursiveCharacterTextSplitter(
chunk_size=512,
chunk_overlap=50,
separators=["\n\n", "\n", ". ", " ", ""]
)
策略2:基于结构的语义分块
在“策略2:结构感知语义处理”阶段,应在修改代码之前明确输入内容、该步骤的负责人以及终止标准。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 配置信息应置于应用程序代码之外。环境文件、密钥存储以及功能标志应集中存放于一个位置,以便操作人员无需查看整个系统结构即可进行审核。 需引用实际作为答案依据的段落。如果没有引用,操作人员就无法区分是幻觉内容还是索引缺失导致的错误。
结构感知(文档原生)分块
在结构感知型文档原生分块阶段,修改代码之前需明确输入内容、该步骤的负责人以及终止标准。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 需同时记录正常流程与异常恢复路径。重试机制、人工审核环节以及错误处理都属于产品功能的一部分,而非后续的优化工作。 必须引用实际作为答案依据的段落。没有引用的话,操作人员就无法区分幻觉内容与索引缺失问题。 在结构感知型文档原生分块阶段,修改代码之前需明确输入内容、该步骤的负责人以及终止标准。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 应将此阶段视为输入与经过验证的输出之间的契约。为相关输出物命名,明确成功判定标准,并拒绝默许部分处理的结果。
完成。语义分块(基于意义的边界划分)
在处理语义分块与基于意义的边界划分阶段时,首先列出相关要求:所需输入、成功信号以及部分失败时的处理方式。这样的清单能确保后续的代码修改保持一致性。 在功能结果旁记录执行时间以及令牌或查询成本。提前了解成本情况,可避免从演示环境过渡到共享环境时出现意外费用。 在调整提示词之前,先使用固定的问题集测试召回率。仅仅更换提示词往往无法改善较差的检索效果。
Sentence A ──► Embed ──┐
Sentence B ──► Embed ──┴── Similarity: 0.89 (Keep together)
Sentence C ──► Embed ──── Similarity: 0.32 (Drop below threshold -> CUT HERE)
策略3:高级上下文保留架构
在处理“策略3:高级上下文保留”阶段时,首先写下相关规范:所需输入、成功标志以及部分失败时的处理方式。这样的检查清单能确保后续的代码修改保持一致性。 将配置信息置于应用程序代码之外。环境文件、密钥存储以及功能开关应集中存放,以便操作人员无需查看整个系统结构即可进行审计。 在调整提示词之前,先使用固定的问题集来测试召回率。仅仅更换提示词很难解决检索效果不佳的问题。
1. 从小到大(父子)分块
在完成“从小到大拆分父子数据块”的第一阶段时,首先要写下相关契约:所需的输入参数、成功标志以及部分失败时的处理方式。这样的清单能确保后续的代码修改保持一致性。 同时记录正常流程和异常恢复流程。重试机制、人工审核环节以及错误消息处理都是产品功能的一部分,而非后续需要补充的内容。 在调整提示词之前,先使用固定的问题集来测试召回率。仅仅更换提示词很难解决检索效果不佳的问题。 在完成“从小到大拆分父子数据块”的第一阶段时,首先要写下相关契约:所需的输入参数、成功标志以及部分失败时的处理方式。这样的清单能确保后续的代码修改保持一致性。 将这一阶段视为输入与经过验证的输出之间的契约。为相关产物命名,明确成功判定标准,绝不允许出现无声无息的部分完成情况。
2. 后期拆分
将“后期分块”阶段视为可测量的界面来处理效果最佳。在扩大范围之前,先记录一份理想的转录结果、一个失败案例以及回滚说明。在功能结果旁同时记录处理时间以及令牌或查询成本。提前了解成本情况,可避免在系统从演示环境过渡到共享环境时出现意外费用。应将分块策略与检索策略分开,当质量指标发生变化时,修改其中一项不应迫使重新编写另一项。
生产环境决策矩阵
将“生产决策矩阵”阶段视为可度量的模型来使用效果最佳。在扩大范围之前,先记录一份最优案例、一个失败案例以及回滚说明。 将配置与应用程序代码分开。环境文件、密钥存储和功能开关应集中存放于一处,以便操作人员无需查看整个系统结构即可进行审计。 将分块策略与检索策略分开。当质量指标发生变化时,修改其中一项不应迫使重新编写另一项。
确保成功的工程规则总结
将阶段工作的总结工程规则视为可度量的对象来处理效果最佳。在扩大范围之前,需记录一份理想案例、一个故障实例以及回滚说明。 同时记录正常流程与恢复流程。重试机制、人工审核环节以及错误处理方式都是产品本身的一部分,而非后续需要补充的内容。 应将分块策略与检索策略分开。当质量指标发生变化时,修改其中一项不应强制要求重新编写另一项。 将阶段工作的总结工程规则视为可度量的对象来处理效果最佳。在扩大范围之前,需记录一份理想案例、一个故障实例以及回滚说明。 应将此阶段视为输入与经过验证的输出之间的契约。为相关成果命名,明确成功标准,绝不允许出现无声的半完成状态。
是时候动手实践了……
在修改代码之前,需先确定该步骤的输入参数、负责人以及结束标准,以便为后续执行做好准备。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测其中的隐藏状态。除了功能结果外,还需记录执行时间以及令牌或查询成本。提前了解这些成本信息,可避免在从演示环境过渡到共享环境时出现意外费用。必须注明支撑答案的具体内容,否则操作人员就无法区分是虚假信息还是索引缺失导致的错误。
前提条件
在准备阶段,应在修改代码之前明确输入内容、该步骤的负责人以及结束标准。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 配置信息应置于应用程序代码之外。环境文件、密钥存储以及功能标志应集中存放于一个位置,以便操作人员无需查看整个系统结构即可进行审核。 需引用实际作为答案依据的段落。如果没有引用,操作人员就无法区分是幻觉内容还是索引缺失导致的错误。
pip install langchain langchain-community langchain-experimental llama-index llama-index-embeddings-openai openai chromadb
export OPENAI_API_KEY="your-openai-api-key"
1. 递归字符分块(LangChain)
在第一个递归字符分块阶段,修改代码之前需明确输入参数、该步骤的负责人以及终止条件。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 需同时记录正常流程与异常恢复路径。重试机制、人工审核环节以及错误处理都是产品功能的一部分,而非后续需要补充的内容。 必须引用实际作为答案依据的段落。没有引用的话,操作人员就无法区分是幻觉内容还是索引缺失导致的错误。 在第一个递归字符分块阶段,修改代码之前需明确输入参数、该步骤的负责人以及终止条件。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 应将此阶段视为输入与验证后输出之间的契约。为相关产出命名,明确成功标准,绝不允许出现无声的、不完整的处理结果。
from langchain_text_splitters import RecursiveCharacterTextSplitter
# Sample document
sample_text = """
# RAG System Design
Retrieval-Augmented Generation (RAG) decouples knowledge storage from reasoning capability.
Instead of forcing the AI to answer strictly from memory, RAG searches an external database first.
## The Ingestion Pipeline
1. Document Extraction: PDFs and web pages are converted into clean text.
2. Chunking: Documents are chopped into smaller, manageable text blocks.
3. Vectorization: Each block is converted into a numeric representation.
"""
# Initialize Recursive Splitter
text_splitter = RecursiveCharacterTextSplitter(
chunk_size=200, # Target chunk size in characters/tokens
chunk_overlap=30, # Overlap to prevent mid-sentence context loss
separators=["\n\n", "\n", ". ", " ", ""] # Try double line breaks first
)
chunks = text_splitter.create_documents([sample_text])
print(f"Total chunks created: {len(chunks)}\n")
for i, chunk in enumerate(chunks):
print(f"--- Chunk {i+1} ---")
print(chunk.page_content)
2. 父子结构/从小到大分块(LangChain + Chroma)
在处理父子结构从小到大分块的阶段时,首先明确相关规范:所需输入、成功标志以及部分失败时的处理方式。这样的清单能确保后续的代码修改保持一致性。 在功能结果旁记录执行时间以及token或查询成本。提前了解成本情况,可避免从演示环境过渡到共享环境时出现意外费用。 在调整提示词之前,先使用固定的问题集测试召回率。仅仅更换提示词往往无法改善较差的检索效果。
from langchain_text_splitters import RecursiveCharacterTextSplitter
from langchain.retrievers import ParentDocumentRetriever
from langchain_community.vectorstores import Chroma
from langchain_community.storage import InMemoryStore
from langchain_openai import OpenAIEmbeddings
from langchain_core.documents import Document
# 1. Initialize Vector Store (for small child embeddings) and DocStore (for large parent text)
embeddings = OpenAIEmbeddings()
vectorstore = Chroma(collection_name="parent_child_rag", embedding_function=embeddings)
docstore = InMemoryStore()
# 2. Define Parent (Big) and Child (Small) Splitters
parent_splitter = RecursiveCharacterTextSplitter(chunk_size=600, chunk_overlap=50)
child_splitter = RecursiveCharacterTextSplitter(chunk_size=120, chunk_overlap=20)
# 3. Create the ParentDocumentRetriever
retriever = ParentDocumentRetriever(
vectorstore=vectorstore,
docstore=docstore,
child_splitter=child_splitter,
parent_splitter=parent_splitter,
)
# 4. Ingest Documents
docs = [
Document(
page_content="""
System Architecture: The Two Pipelines.
A production RAG framework runs on two main pipelines: Ingestion and Inference.
The Ingestion pipeline extracts text, creates chunks, embeds them, and stores them in a vector DB.
The Inference pipeline encodes user queries, performs vector similarity search, injects context into prompts, and generates LLM answers.
Hybrid search combines keyword and vector retrieval to handle exact SKU IDs alongside general concepts.
"""
)
]
retriever.add_documents(docs)
# 5. Query the Retriever
query = "What happens during inference in RAG?"
retrieved_parents = retriever.invoke(query)
print(f"Retrieved Parent Context (Full Block):\n")
print(retrieved_parents[0].page_content)
3. 语义分块(LlamaIndex)
在处理 LlamaIndex 的三个语义分块阶段时,首先需明确相关约定:所需输入、成功标志以及部分失败时的处理方式。这样的检查清单能确保后续的代码修改保持一致性。 将配置信息置于应用程序代码之外。环境文件、密钥存储以及功能开关应集中存放,以便操作人员无需查看整个系统结构即可进行审计。 在调整提示词之前,先使用固定的问题集来衡量召回率。仅仅更换提示词很难改善较差的检索效果。
from llama_index.core.node_parser import SemanticSplitterNodeParser
from llama_index.embeddings.openai import OpenAIEmbedding
from llama_index.core.schema import Document
# 1. Initialize the Embedding Model used for detecting topic shifts
embed_model = OpenAIEmbedding(model="text-embedding-3-small")
# 2. Configure the Semantic Splitter
semantic_parser = SemanticSplitterNodeParser(
buffer_size=1, # Number of surrounding sentences to evaluate together
breakpoint_percentile_threshold=90, # Split threshold percentile (higher = fewer, larger chunks)
embed_model=embed_model
)
# 3. Sample document with distinct thematic shifts
raw_text = """
Quantum computing leverages qubits that can exist in superposition states, unlike classical bits.
Superposition allows algorithms to process vast potential outcomes simultaneously.
Entanglement further connects qubit states instantaneously across physical space.
On a totally different topic, baking sourdough bread requires maintaining a wild yeast starter.
You feed the starter equal parts flour and water every 24 hours to encourage fermentation.
Proper gluten development requires folding the dough during the bulk fermentation stage.
"""
doc = Document(text=raw_text)
# 4. Generate Nodes (Chunks)
nodes = semantic_parser.get_nodes_from_documents([doc])
print(f"Total Semantically Coherent Chunks: {len(nodes)}\n")
for i, node in enumerate(nodes):
print(f"--- Chunk {i+1} ---")
print(node.get_content().strip())
print("\n")
实现总结
在处理实现总结阶段时,首先需写明接口规范:所需的输入参数、成功信号以及部分失败时的处理方式。这样的清单能确保后续的代码修改保持一致性。 同时记录正常流程与异常恢复路径。重试机制、人工审核环节以及错误消息处理都是产品本身的组成部分,而非后续需要补充的功能。 在调整提示词之前,先使用固定的问题集来测试召回率。仅仅更换提示词很难解决检索效果不佳的问题。 在处理实现总结阶段时,首先需写明接口规范:所需的输入参数、成功信号以及部分失败时的处理方式。这样的清单能确保后续的代码修改保持一致性。 应将此阶段视为输入与经过验证的输出之间的契约。为相关成果命名,明确成功判定标准,杜绝默许部分完成的情况。
结论:分块处理是工程问题,而非人工智能问题
“结论分块”这一阶段作为可度量的工作面来处理时效果最佳。在扩大范围之前,先记录一份优秀的测试案例、一个失败案例以及回滚说明。在功能结果旁同时记录执行时间以及令牌或查询成本。提前了解成本情况,可避免在从演示环境过渡到共享环境时出现意外费用。应将分块策略与检索策略分开,当质量指标发生变化时,修改其中一项不应强制要求重新编写另一项。
操作检查清单
在“操作检查清单”阶段,修改代码之前需明确输入内容、该步骤的负责人以及完成标准。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。