全部版块 我的主页
› 论坛 › 数据科学与人工智能 › 人工智能
223 0
2026-08-11

所有RAG系统,都依托单次大模型调用,堆叠三大核心工程层级搭建而成。

提示工程:定义大模型调用本身,包含系统指令、任务规则、约束输出格式的结构化范式。

上下文工程:填充模型上下文窗口的全部内容,涵盖检索、内容压缩、无效信息过滤等核心操作。

循环工程:大模型调用的外围控制逻辑,包含二次调用触发条件、循环终止规则、校验失败后的系统自愈机制。

绝大多数RAG相关争议与困惑,本质都是混淆了问题所属的工程层级。只要明确问题归属,绝大多数技术疑点都会迎刃而解。本文将完整拆解三大层级的权责边界、与本系列技术体系的对应关系,并纠正一个普遍误区:行业流传的「逐层迭代替代」演进逻辑,仅有一半属实。

本文是《企业文档智能》系列的核心纲领性文章。该系列基于四大核心模块搭建企业级RAG系统,而本文将结合2026年行业主流的三层架构体系,解答核心问题:三层架构的迭代并非简单的顺序更替,而是对早已存在的技术模式的事后归纳与命名。

📓 本系列配套开源笔记已上传GitHub:doc-intel/notebooks-vol1。所有笔记均可基于真实PDF文档,端到端复现四大模块能力,直观展示三层工程的运行逻辑:规范输出形态的提示层、由问题解析与检索内容组装而成的上下文层、校验失败后自动重试的循环层。

一、三层架构核心框架

单次大模型调用之上,堆叠三大独立工程体系,各自掌控不同的技术抓手,共同支撑生产级RAG系统脱离入门Demo,实现稳定落地。

提示工程是开发者接触的首个层级。通过系统指令定义模型身份与约束、用户指令承载具体问题与上下文、可选的结构化范式固定输出格式。精准完善的提示设计,能让模型严格遵循规则执行任务,而非自由发挥、随机输出。

该技术体系在2022–2023年随GPT-3.5、ChatGPT普及成型,「提示工程」一词也同步成为行业通用概念。

上下文工程是提示工程无法解决复杂问题后的进阶体系。大模型的上下文窗口容量有限,开发者需要自主决策窗口内的留存内容:通过检索筛选有效文档、通过压缩剔除冗余噪声、通过隔离避免子任务输出干扰主任务窗口。

LangChain 提出的四大核心策略(写入、筛选、压缩、隔离),精准归纳了自RAG论文问世以来,行业默认遵循的上下文处理逻辑。2025年该概念正式普及:Karpathy、Tobi Lütke 公开提及该术语,Anthropic 发布行业标杆文章《AI智能体高效上下文工程》,正式确立其行业地位。

循环工程是单次大模型调用无法满足生产需求后的高阶体系。模型输出看似合理但不符合格式规范、检索结果完整但模型自主判定答案残缺、接口请求超时、智能体调用工具出错……面对这类问题,开发者需要掌控四大核心控制维度:二次调用触发条件、循环终止时机、调用失败自愈方案、结果交付前的跨智能体核验机制。

2026年5月,Boris Cherny 提出经典观点「我不再手动给Claude写提示词,而是通过循环调度自动调用Claude」,十天后 Anthropic 推出动态工作流能力,标志着「循环工程」正式成为行业标准术语。

行业普遍认知的演进逻辑:提示工程 → 上下文工程 → 循环工程,即上一层技术瓶颈饱和后,才会迭代出新层级。这套叙事简洁流畅,但并不完全准确。

二、客观真相:技术模式早于概念命名

三大层级对应的技术模式,在专属术语诞生前就已长期存在。

2022年10月普林斯顿大学与谷歌联合推出的 ReAct 框架,是推理+行动循环的经典范式,比「循环工程」术语早三年以上;2023年3月 AutoGPT 实现公开的自主目标驱动循环;2023年 NeurIPS 会议的反射机制(Reflexion)实现模型自我校验;2025年7月 Geoffrey Huntley 提出的 Ralph 循环实现持久化目标存储。直至2026年5月循环工程定名时,相关技术模式已在生产环境落地三年以上。

上下文工程同理。2020年Lewis等人发表的初代RAG论文,远早于提示工程的诞生;2022年,所有成熟大模型应用都已具备完整的上下文管理能力(分块、检索、去重、截断),只是彼时尚未被定义为「上下文工程」。LangChain 的四大策略体系,只是对过去四年生产级RAG系统隐性实践的系统化总结。

客观事实是:大模型时代初期,三大层级的技术逻辑就已并存。四年行业迭代的核心变化,是生产环境的核心瓶颈持续转移。

当提示词质量是核心瓶颈时,无人关注循环逻辑;当上下文管理缺陷成为主要问题时,LangChain 上下文策略体系正式成型;当多轮对话的智能体稳定性成为最大痛点时,Anthropic 动态工作流体系应运而生。

「技术逐层演进」只是美观的汇报叙事,「瓶颈持续迁移」才是行业真实的迭代逻辑。

三、瓶颈迁移的三大核心驱动力

三大核心力量,推动RAG工程的核心瓶颈逐层上移。

1. 大模型能力持续迭代

新一代模型对人工提示工程的依赖持续降低:GPT-4 可精准执行 GPT-3 忽略的指令,Claude 3.5 可直接输出合规JSON格式,无需人工修饰。提示工程并未消失,只是不再是性能瓶颈。未来模型更长的有效上下文、更低的上下文衰减、原生多文档推理能力,将大幅弱化现有上下文工程的工作量,让行业瓶颈进一步上移。

2. 上下文窗口容量爆发式增长

2023年初主流模型仅4K上下文窗口,同年 Claude 2 实现100K窗口,2024年 Gemini 1.5 突破百万Token窗口,2026年百万级窗口已成为标配。

超大窗口并非万能,模型存在严重的「上下文衰减」问题,实际有效检索范围远小于标称容量。这彻底改变了上下文工程的核心目标:从「如何塞满窗口、容纳更多内容」转变为「如何筛选优质内容、剔除无效信息,保证模型精准检索关键信息」,瓶颈从「内容压缩」转向「内容精选」,恰好对应上下文工程的筛选、隔离策略。

3. 任务运行链路持续变长

2022年的RAG场景多为单次问答、即时结束;2026年的生产级智能体可连续运行40轮、持续6小时,支持多子智能体分布式执行、结果聚合合成。

短单次任务无需循环调度逻辑,自然不存在循环工程需求;而超长链路、多轮迭代的复杂任务,完全依赖循环工程保障稳定性。瓶颈迁移的核心,不是技术变了,而是业务场景复杂度迭代升级。

三大力量协同作用:模型能力升级弱化底层层级压力、超大窗口重构上下文工程核心目标、长链路任务催生全新的循环工程层级。行业术语的迭代更替,本质是生产环境核心痛点的迁移,而非技术体系的简单升级。

四、三大层级的核心权责边界

三层架构的核心价值,是明确各层级的权责边界,每一层仅解决一类核心问题。

第一层:提示工程|单次模型调用的输入管控

覆盖单次调用的全部输入内容:系统指令、用户提问、输出范式、工具定义、本轮对话历史。核心解决三大问题:如何定义模型身份、如何设置约束保障答案可靠、如何规范输出结构。该层级技术成熟、边界清晰,是所有RAG的基础。

第二层:上下文工程|调用之间的窗口内容管控

负责管控模型上下文窗口的内容进出,LangChain 四大策略完整定义其能力边界:

写入:固定不变的缓存前缀内容(系统提示、工具定义等,多轮对话保持不变);

筛选:检索与记忆召回,从海量数据中筛选本轮任务的有效信息;

压缩:内容摘要、紧凑处理、工具级截断,避免内容溢出窗口;

隔离:子智能体独立窗口运行、外部工具持久化存储状态、中间结果不侵入主上下文。

四大策略可自由组合,完整覆盖生产环境上下文工程的全部落地场景。

第三层:循环工程|多轮调用的全流程调度管控

核心负责二次调用触发、循环终止、故障自愈、结果核验交付四大维度:触发规则(满足何种条件启动下一轮调用)、终止规则(完成即终止/达到资源上限终止/无有效信息终止)、自愈方案(退避重试、升级大模型、人工介入、跳过异常数据继续执行)、对抗核验(通过独立智能体反向校验答案真伪)。

明确层级边界的核心意义:各层级的故障形态、排查方式完全不同。

提示层故障:显性报错,模型输出明显偏离预期、逻辑混乱;

上下文层故障:隐性故障,答案流畅通顺,但因上下文失真导致结果错误;

循环层故障:高成本故障,无效循环重复执行、消耗大量Token资源、最终超时失败。

三类故障需要完全不同的排查方案,若笼统将RAG视为黑盒,所有问题都无法高效解决。

关于调度工程的补充说明:部分开发者会拆分出第四层「调度工程」,指代上下文与循环之间的执行环境,包含工具调用、安全围栏、结果核验、跨会话记忆。在三层架构体系中,这些能力并非缺失,而是被拆分融入对应层级:工具与记忆能力归属上下文工程的隔离策略,核验与自愈能力归属循环工程。本系列M6文章将单独详解调度工程,将四大核心模块定义为独立调度单元。三层、四层架构仅为拆解视角不同,而非技术理念冲突。

五、七大循环模式与核心黄金法则

2026年循环工程体系已定型:七大基础范式 + 一条核心准则。其中六大范式来自2026年5月Anthropic动态工作流更新,退避重试范式为通用经典能力;核心准则为行业通用落地经验,早于所有范式命名。

七大范式并非固定执行流程,而是标准化技术词汇。生产级循环通常会组合2–3种范式实现复杂能力:多子智能体并行分发任务、通过对抗校验核验共识答案、基于完成度判断终止循环、瞬时故障自动退避重试。范式组合应用,是循环工程的核心落地逻辑;范式命名,是团队高效协作沟通的统一语言。

贯穿所有循环的核心黄金法则:每一次重试迭代,必须带来有效改变。

同一故障、同一参数的重复重试,不会产生任何学习效果,只会造成无效空转。有效改变分为三类:调整输入载荷(扩大检索范围)、升级模型规格(小模型失败后切换大模型重试)、更换执行策略(关键词检索失效后,改用向量稠密检索)。无任何变更的重试,是循环工程最典型的资源浪费场景。

生产级循环的核心,不在于堆砌范式,而在于根据场景精准组合2–3种适配范式,并严格遵循「每次迭代必有优化」的核心准则。

六、下一个行业瓶颈的演进方向

三层架构体系本身预示了自身的迭代终点:当下层工程体系逐步成熟、瓶颈消除后,行业焦点必然继续上移,诞生全新的第四层工程体系。

目前第四层级已出现非正式概念,尚未形成行业统一标准:

技能工程(Skill Engineering):源自Anthropic 2025年末智能体技能体系,聚焦智能体运行时的能力调度;

记忆工程(Memory Engineering):聚焦跨会话持久化状态存储,包含项目规范、历史决策、用户偏好等长效信息;

目标工程(Goal Engineering):聚焦长周期任务目标维持,对应Anthropic目标指令、OpenAI Codex CLI同类能力;

工具目录工程:聚焦元调度能力,让智能体自主匹配、启用本轮任务所需的工具集。

目前无法确定哪一个概念会成为统一的第四层标准,但结合前三层的演进规律,率先成为生产环境核心瓶颈的方向,将成为下一代行业通用工程体系。前文提到的三大迭代驱动力,将继续推动行业技术升级。

2026年开发者的最优落地思路:不必执着于概念名词,重点精准识别当前系统的核心瓶颈。

模型输出明显错乱 → 瓶颈:提示工程;

答案流畅但结果错误 → 瓶颈:上下文工程;

循环重复空转、资源浪费 → 瓶颈:循环工程;

智能体遗忘跨会话核心信息 → 瓶颈:已超越循环工程,进入下一代未知层级。

七、基于三层架构的全系列技术体系梳理

以下为《企业文档智能》全系列文章完整图谱,按阅读顺序排列,并标注每篇文章对应的核心工程层级。完整覆盖全系列技术规划,无需额外文档即可掌握全貌。

注:实际开发中,三层层级并非严格顺序执行(第二部分模块会先完成上下文处理,再通过提示工程实现生成输出),三层架构是技术复盘与问题定位的分析视角,而非开发时序。

第一部分:基础框架(无单一核心层级,搭建整体认知)

1. 极简RAG入门:百行代码实现PDF输入、高亮答案输出,无向量库、无第三方框架,微型复刻四大模块完整循环逻辑

2. 嵌入向量并非万能:解析向量检索的固有故障,说明主题相似度不等于问答关联度

2bis. 重排序模型并非万能:阐明交叉编码器重排序的适用场景与冗余场景

3. RAG不属于机器学习:解释机器学习工具为何不适用于检索+生成的RAG系统核心问题

4. 技术适配场景指南:从正则匹配到视觉大模型,梳理各类RAG技术的精准适配场景

4bis. 十大常见RAG误区:总结本系列重点解决的生产环境高频故障

第二部分:四大核心模块(上下文工程为主,收尾衔接提示、循环工程)

文档解析模块(上下文工程)

5A. PDF双层结构逻辑:文本层与结构层,解析默认文本提取丢失的RAG核心质量信息

5B. 关系型数据模型:PDF结构化转换方案,替代传统扁平化文本输出

5bis. Azure布局解析:PyMuPDF解析失效时,通过Azure服务精准解析复杂表格

5ter. Docling本地解析:本地离线解析富文本表格,无需云端上传

5quater. 视觉大模型解析:通过视觉能力识别文本解析器无法读取的图表、示意图

5quinquies. EasyOCR扫描件解析:扫描版PDF的OCR处理,区分纯文字提取与结构化文档解析

5sexies. 图片可检索优化:实现PDF图片内容可检索,无需全量解析

5septies. 目录重构:修复PDF缺失的目录结构,实现按章节精准检索

5octies. 目录循环解析:将目录重构升级为自上而下的迭代循环逻辑(循环工程)

5nonies. 智能体自适应解析:流水线根据页面类型,自主选择最优解析器(循环工程)

问题解析模块(上下文工程)

6A. 优先问题解析:补齐绝大多数RAG流水线缺失的前置步骤,检索前结构化梳理用户问题

6B. 问题五维提取法:拆解关键词、检索范围、输出形态、问题拆解、模糊澄清五大核心字段

6C. 解析问题调度:基于结构化问题,制定分块策略、模型规格、片段筛选、审计规则四大调度方案

6bis. 模糊问题智能澄清:单次澄清疑问,沉淀默认规则,避免重复提问

6ter. 问题解析隐性核心要点:行业教程普遍忽略的关键落地细节

6quater. 问题解析上下文工程:结构化问题字段,精准指导检索与生成逻辑

6quinquies. 问题解析前置循环:检索启动前的小型校验迭代循环(循环工程)

检索模块(上下文工程为主,部分循环工程)

7A. 检索的本质是过滤:重构认知,检索是缩小范围而非宽泛匹配索引

7B. 锚点检测:关键词、向量、目录多信号并行匹配,大模型最终仲裁

7C. 大模型仲裁机制:模型自主筛选最优页面并输出决策依据

7bis. 上下文工程核心:定义答案生成依赖的四大结构化输入

7ter. 检索隐性核心要点:纠正余弦相似度的过度神化误区

7quater. 层级化检索:基于文档目录的长文本迭代检索(循环工程)

7quinquies. 检索杜绝幻觉:通过精准检索,从源头限制模型虚构空间

7sexies. 表格行级检索:精准匹配宽幅表格中的目标数据行

生成模块(提示工程为主,收尾循环工程)

8A. 结构化答案契约:通过范式约束,杜绝自由文本输出,从根源防幻觉

8B. 提示词组装:基于基础模板+问题专属规则,动态拼接最优生成提示词

8C. 答案校验:输出前校验文本片段与引用来源,通过反馈循环优化结果

8bis. 单次/多次生成策略:区分单次生成足够场景与多轮迭代优化场景(循环工程)

8ter. 结构化生成范式:适配契约约束的标准化生成模式

8quater. 模型级联调度:低成本本地模型优先、复杂任务升级旗舰模型(循环工程)

第三部分:显性化循环工程体系

9A. 生产级完整流水线:整合四大升级模块,实现结构化解析→目录检索→结构化答案全链路

9B. 多文档适配验证:同一流水线适配四类差异极大的真实文档

9bis. 检索错误自愈:检索匹配错误后,拦截故障并自动修复,避免错误流入生成环节

9ter. 模型成本调度:简单问题适配低成本模型,控制资源消耗

10A. 级联升级解析:自适应解析策略,简单页面轻量解析、复杂页面启用高阶解析器

10B. 级联升级落地案例:扁平化表格升级Azure解析、示意图升级视觉模型解析的完整流程

11. 交叉引用解析:自动定位文档引用章节,而非仅返回引用标识

12. 批量列表问答:匹配全部有效片段,而非仅返回最优结果

13. 工作流调度器:智能判断循环启动与终止时机

13bis. 流水线循环工程:显性定义复合调度流水线的循环控制逻辑

第四部分:语料库级工程(上下文为主,拓展循环能力)

14. 语料库核心问题:解析简易RAG在海量归档文档中的失效原因(上下文工程)

15. 语料库预处理:文件夹PDF批量转化为可检索结构化语料库(上下文工程)

16. 语料库本体构建:企业RAG所需的标签体系与关联关系,替代传统知识图谱(上下文工程)

17. 语料库查询逻辑:SQL过滤优先、检索为辅的多文档批量查询(上下文工程)

17bis. 语料库级问题澄清循环:将单文档澄清逻辑升级适配海量语料(循环工程)

17ter. 语料库上下文工程:多文档场景下的上下文管理体系升级(上下文工程)

17quater. 语料库循环工程:海量文档场景下的迭代调度体系升级(循环工程)

第五部分:生产落地运维(跨三层通用能力)

18. 代码架构:模块化拆解四大模块的工程代码结构

19. 存储方案:长文本结构化存储、可回放工程资产,含范式迁移、存储图谱配套方案

20. 评估体系:按故障类型拆分评估维度,替代单一综合得分

21. 成本与延迟优化:流水线迭代过程中的资源与耗时管控

22. 安全体系:语料库的权限管控与数据安全防护

附加专题

B01. 拼写纠错:预处理清理OCR与人工输入错别字噪声

B02. FAQ适配RAG:将现有FAQ库转化为检索语料

B03. 可控拒答机制:带证据支撑的合规「未知答案」输出

B04. PDF表格深度解析:复杂表格解析专项技术拆解

B05. 模型选型指南:各模块场景的最优模型匹配方案

B06. 调度架构详解:完整的智能体调度范式落地

B07. 仿真测试:基于真实调用特征的模拟测试方案

B08. 简历解析基准测试:基于真实简历的解析器性能测评

B10-B12. 本地部署方案:Ollama本地大模型、本地向量嵌入、本地模型性能基准测试

系列纲领性文章

M1. 专家赋能理念:系列核心思想,AI放大专家能力而非替代专家

M3. 逐篇隐性核心要点:汇总系列所有创新技术观点

M4. 十大行业突破点:本系列区别于主流RAG教程的核心创新

M5. 记忆与计算优势:AI不超越专家推理,仅超越人类记忆与计算上限

M6. RAG调度工程:全新视角解读系统,将四大模块定义为独立调度单元,模型为调度框架内的单次调用能力

统一技术词汇的核心价值是提升团队沟通效率,而非机械套用清单。精准说出「此处需要对抗核验」,远优于「答案偶尔不准」。概念是工具,不是教条。机械堆砌所有循环范式的项目,往往落地效果最差;优秀团队会按需适配场景,精准选用2–3种最优范式。

八、总结

提示、上下文、循环三层架构,是贯穿本系列所有技术内容的核心分析框架。全文完整梳理了三层架构对应的所有系列文章,精准定位每一项优化的核心归属层级,帮助开发者快速定位问题、精准迭代。

行业逐层迭代的叙事存在误导性:三大层级的技术模式自大模型时代初期就已并存,术语的顺序诞生,仅代表各层级依次成为生产核心瓶颈。模型能力升级弱化了提示工程难度、超大窗口重构了上下文工程逻辑、长链路任务催生了全新的循环工程体系。

三层架构既是稳定的RAG工程落地方法论,也是2026年行业技术瓶颈的真实快照。未来新的工程层级,也将在新的瓶颈出现后被正式定义。

生产落地最优思路:将三层架构作为问题分诊工具。输出错乱查提示、流畅错误查上下文、空转超时查循环、跨会话遗忘等待下一代技术体系。不必拘泥于概念名词,精准识别当下系统的核心瓶颈,才是最高效的迭代方式。

推荐学习书籍 《CDA一级教材》适合CDA一级考生备考,也适合业务及数据分析岗位的从业者提升自我。完整电子版已上线CDA网校,累计已有10万+在读~ !

免费加入阅读:https://edu.cda.cn/goods/show/3151?targetId=5147&preview=0

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

相关推荐
栏目导航
热门文章
推荐文章

说点什么

分享

扫码加好友,拉您进群
各岗位、行业、专业交流群