先说一个最近常见的画面:投行的人用智能体跑可比公司分析,信贷经理用它做尽调材料汇编,保险团队长用它盯续保率,合规岗用它自动生成报送报告。工具和场景之间正在快速配对,但配对错了的情况比想象中多 ——买了能跑全流程的智能体,却只用来查数据;或者拿一个查数型工具去扛核心业务,最后卡在合规那一关。
这背后是同一个问题:金融业的活儿种类太多,智能体的形态也太多,两者怎么配才对 。把公开材料、厂商案例和监管要求放在一起核对了一遍,整理出一个场景和智能体的配对框架,以及一套能直接用的评估清单。
一、先看金融业哪些活儿正在被接手
智能体在金融业落地,不是均匀铺开的,而是集中在"高频、规则相对明确、错误代价可控"的活儿上。按业务线拆,大致是六类场景:
投行与投研 ——查公告、比公司、做可比分析、更新模型、生成初稿。这类活儿的特点是材料多、口径杂、时间紧,一个项目动辄要看几十份 PDF。智能体在这里的价值主要是"把材料拉齐 + 标注异常点",判断部分仍然靠人。
实际用起来,时间分布大致是:找数据占 20%、核口径占 15%、做模型占 25%、画图做表占 10%,剩下 30% 才是真正的分析判断。前 70% 每件都不难,但把注意力切得很碎 ——智能体接手的正是这部分。
信贷与风控 ——对公尽调要查企业、看财报、核工商、翻公告、找风险;零售信贷要核收入、查征信、比对黑名单。这类场景的共同点是步骤多、系统多、单笔金额差异大 ,从几万到几千万不等,所以智能体能走多深,取决于单笔错了的代价有多大。
一笔对公贷款从立项到放款,平均要接触 8—12 个系统(工商、税务、征信、财报、合同、押品、风控、审批、放款),每个系统都要查、要录、要核。流程一长,注意力就从"这笔贷款该不该放"变成"别漏了某一步" ——智能体最该接的就是这种流程性消耗。
保险理赔 ——查保单、核责任、算赔付、做欺诈筛查。这是目前跑得最顺的场景之一,因为小额理赔天然符合"高频、规则明确、错误代价可控"三个条件。
理赔场景还有个特点值得单说:它可以按金额分档设定自动化程度 。500 澳元以下全自动、500—5000 澳元智能体初审加人工抽检、5000 澳元以上全流程人工——这种分档设计让机构能在"效率"和"风险"之间找到平衡点,而不必在全自动和全人工之间二选一。这也是为什么理赔能成为少数几个真正跑到决策辅助档的场景。
财富与客服 ——答产品问题、调行情、做资产配置说明、生成客户沟通材料。这类场景直面客户,出错会直接引发投诉,所以对输出准确性和留痕的要求最高 。
合规与报送 ——自动生成合规报告、监测交易异常、整理监管报送材料。这类活儿规则最明确但更新最频繁,智能体的价值在于"把规则变化快速同步到执行层"。
内部运营 ——会议纪要、材料摘要、代码辅助、知识库问答。这类场景风险最低,也是大部分机构智能体落地的第一站。
六类场景的风险等级、错误代价、监管强度完全不同,这决定了它们该配的智能体形态也不一样。
二、智能体的三种形态,能力边界差在哪
市面上的金融智能体,按能力边界可以分成三种形态。这个分类比按厂商分更有用,因为同一家厂商的产品往往横跨两种形态,而不同形态的适配场景完全不同 。
查数型 ——接数据源,回答"是什么"。典型能力是调行情、查财报、比公司、筛 ETF、做财务对比。使用者一句话就能拿到结构化答案。这类智能体的优点是上手快、反馈短,缺点是只解决单点查询,跑不了完整流程。
国内这条线上主要是百度和字节:百度的"库库 AI" 依托百度文库、学术、网盘里的内容和文件,内置上市公司、行情、财报、研报;字节的扣子 则把券商能力拆成技能,接入华泰、广发、国信证券,其中广发一家就上了 8 项——财务对比、龙虎榜、ETF 筛选、基金定投,使用者一句话就能调行情、比公司、筛 ETF。海外对应的做法是把通用助手接上 FactSet、S&P Capital IQ、MSCI 这类专业数据源。
流程型 ——接业务系统,完成"做一遍"。典型能力是材料收集、字段抽取、交叉核对、生成初稿、跑完一整套尽调或理赔流程。这类智能体要连接多个内部系统,涉及数据出域、权限管控、执行隔离等问题,所以能不能进生产环境,取决于它的合规能力而不是它的聪明程度 。
这条线上最具代表性的是腾讯 WorkBuddy 金融版 ——9 月 3 日上线,面向银行、券商、保险推出 80 多个金融专家,主打四道防线:数据不出域、权限管控、执行隔离、全程审计。它已落地中金公司、国投证券、平安银行、中国太平等 100 多家金融机构,覆盖公司金融、零售金融、投研投顾、个客经营四大工作台。四道防线这个设计很能说明问题:它卖的不是"能力更强",是"合规审查能过" 。
决策辅助型 ——接模型与规则,回答"该不该"。典型能力是给出授信建议、风险评级、赔付结论。这类是监管关注的重中之重,因为它直接触及"决策权归谁"这个核心问题 。目前监管对信贷审批、核保理赔这类核心场景的定位是"稳妥探索",不是全面自动化替代人工。
能做到这一档的玩家最少,走的多是全栈金融级 路线:阿里云点金 把可信数据、行业技能、沙箱隔离、权限管控、审计追溯集成在一个平台,底层是"芯云模智"一整套——平头哥真武 AI 芯片在金融行业部署超 10 万卡、服务超 150 家客户,千问大模型从"理解"走向"行动",点金在其上承载岗位逻辑、合规审计和长程任务执行,盈米基金已率先用上它的长期记忆和沙箱能力;蚂蚁数科 Agentar 拿到信通院可信 AI 智能体最高等级评级,服务数百家金融机构——有银行用它做信贷审批辅助,有券商让它自动生成合规报告。
三种形态不是替代关系,是叠加关系。一个成熟的金融智能体部署,往往是从查数型起步,验证价值后再往流程型延伸,决策辅助型则始终保留人工确认环节。
把三种形态的能力边界说细一点,差别主要在三个地方:接的是什么系统 (数据源 / 业务系统 / 模型与规则)、输出的是什么 (答案 / 半成品 / 建议)、出错后的影响范围 (单点错误 / 流程传导 / 直接影响客户权益)。第三个差别最关键,它决定了这个形态需要多强的合规配套。
三、场景 × 智能体:怎么配才对
把六类场景和三种形态交叉,配对关系大致是这样:
场景
主配形态
边界在哪
典型错误代价
投行 / 投研
查数型 + 流程型
结论与建议由人出
中(影响判断质量)
对公信贷
流程型为主
授信建议必须人工确认
高(单笔金额大)
零售信贷
流程型 + 决策辅助
否决需人工复核
中高(涉及消费者权益)
保险理赔
流程型 + 决策辅助
小额可自动,大额人工
低—中(分档)
财富 / 客服
查数型为主
涉及产品推荐需留痕
高(直面客户)
合规 / 报送
流程型
规则更新需人工同步
高(监管责任)
内部运营
查数型
几乎无边界
低
这张表能解释几个常见现象:
为什么理赔跑得最快 ——因为小额理赔同时满足"高频、规则明确、错误代价可控",是唯一一个可以大范围跑到决策辅助档的场景。安联保险在澳大利亚的 Project Nemo 是个典型:自然灾害后的小额理赔(500 澳元以下)从几天压缩到一天甚至几小时,七个专门智能体协同完成覆盖检查、天气核验、欺诈筛查、赔付测算、审计总结,人只做最后的赔付决策 。
为什么信贷推进最慢 ——因为单笔金额大、监管强度高、追责链条长。同样是流程型智能体,用在理赔可以快速铺开,用在信贷则要过风险管理委员会批准。
为什么很多机构"买了用不起来" ——多数是配错了。用查数型去扛信贷全流程(能力不够),或者用流程型只做查数(浪费且操作繁琐),都会得出"智能体不好用"的错误结论。
四、结合使用的关键:人机分工那一刀切在哪
场景和形态配对之后,剩下最关键的一步是划人机边界。这一刀切在哪,决定了项目能不能过合规、能不能长期跑。
监管的思路已经很明确。今年 6 月,国家金融监督管理总局首次在正式文件中提出"金融智能体"概念,四大原则的第一条是"谁使用谁负责" 。这句话可以拆成三层理解:
机构主体责任不转移 :谁把智能体部署进业务流程,谁就是第一责任人,不能用"这是 AI 做的"当合规挡箭牌流程设计责任不消失 :智能体执行到哪一步、哪里需要人工介入,这套边界是机构自己设计的,设计有漏洞责任在设计方具体岗位责任不模糊 :审核人员是认真复核还是直接点通过,这个选择是人做的,不能用"AI 建议的"模糊自己的失职
落到操作层面,上线前要划清四道边界:
权限边界 ——能调用哪些系统、访问什么数据、执行到哪一步,上线前白纸黑字定死,不能等出事再讨论"它怎么有这个权限"。人工接口 ——涉及资金、合规、客户重大权益的操作,必须留能否决、能修改、能回退的确认环节,这个确认不是走形式。异常升级 ——遇到不确定情况走什么路径、谁来接手、多久响应。责任划分 ——出错后沿着"谁部署、谁授权、谁确认"这条链回溯,链条不能断。
配套的组织保障是"三道防线":业务和技术部门是第一道(日常运营与基础风控),风险合规和独立模型验证是第二道(盯模型有没有跑偏),内部审计和董事会是第三道(定期复盘、兜底问责)。
这里有个容易被忽略的判断标准:智能体的"一致性"不等于"正确性" 。它连续一百次判断都可能符合历史规律,但第一百零一次遇到黑天鹅,照样会按惯性出牌。所以边界不是"等它错了再划",是"上线前就必须划"。
五、落地实测:五步场景评估清单
框架说完,落到可用层面。要给某个具体场景配智能体,可以照下面五步走。
第一步,给场景定风险档。 先回答两个问题:单笔错了代价多大?会不会直接影响客户权益?两个都是"低"的(如内部运营、小额理赔)可以大胆试;有一个是"高"的(如对公信贷、财富客服)必须先划边界再上。
第二步,选形态不选品牌。 按需查询选查数型,按跑流程选流程型,需要建议选决策辅助型。先把形态定下来,再去比较同形态的产品 ,比反过来选省事得多。
第三步,问四项合规能力。 数据能不能不出域、权限粒度到什么程度、过程能不能留痕、审计日志能不能被监管直接调取。这四项是产品自带还是要集成商补,直接决定了隐性成本——后者往往比 License 本身贵。
问的时候要注意话术陷阱:"支持私有化部署"和"默认私有化部署"是两回事,"提供审计日志"和"审计日志可被监管直接调取"也是两回事 。前者是能力,后者是默认配置,采购时差出来的工程量可能比软件费还高。
第四步,划人机分工那一刀。 按前面四道边界逐项写清楚,尤其是"哪些操作必须人工确认"和"异常走什么升级路径"。这一步写不出来的,先别上线。
写的时候有个实用技巧:把边界写成一份"能做 / 需确认 / 禁止"三栏清单 ,而不是一段文字描述。三栏清单的好处是可以直接嵌进系统权限配置,也能直接拿给合规岗看——文字描述过得了自己这关,过不了合规那关。
第五步,小场景实测两周。 挑该场景里"高频、小额、规则明确"的一小段跑,比如理赔初审、公告摘要、财务字段抽取。跑通了再往核心业务推,不要一上来全量铺开。
实测阶段要盯三个指标:准确率 (错了多少条)、拦截率 (人工拦下了多少条本该自动通过的)、异常升级率 (多少条走到人工接管)。第一个指标看能力,后两个看边界划得对不对——如果拦截率过高,说明智能体的自主范围设得太大;如果异常升级率过高,说明它遇到的不确定情况超出了设计预期,需要回去调场景范围。
五步走完,任何场景配智能体都能有一个相对靠谱的判断。这套清单不复杂,但能避开大部分"演示很惊艳、上线就翻车"的坑。
六、哪些场景会先跑通:三点判断
最后是关于推进顺序的判断,供参考。
第一,理赔和内部运营会最先跑通。 前者天然符合高频小额规则明确,后者风险最低。这两块是验证价值、积累经验的安全区。
第二,投研和合规会稳步推进但不会自动化到底。 这两块的活儿碎、材料多,智能体价值明显;但结论涉及判断和监管责任,最终会稳定在"智能体做前段、人做判断"这个分工上。
第三,信贷和财富会最慢,且长期保留人工环节。 因为单笔金额大、直接影响客户权益、追责链条长。这不是技术问题,是责任主体不能转移这个原则决定的 ——只要 AI 不能当被告,最终决策权就必须在人手里。
把三条合起来看,其实是一条主线:自动化程度的上限,由"出错后谁兜底"决定,而不是由"模型有多聪明"决定 。理赔能自动是因为小额错了机构赔得起;信贷不能自动是因为大额错了没人赔得起。理解这一点,就能理解为什么有些场景推得动、有些推不动,也能避免把预算花在注定推不动的地方。
海外也在给这条主线定价。金融 AI 公司 Rogo 的估值一年之内从 3.5 亿美元涨到约 20 亿美元,服务的金融专业人士超过 4 万人——它卖的不是模型,是"把模型接进金融工作流"的那一层 。同样是"结合使用",谁把场景吃得更透、把责任链条理得更顺,谁就先拿到溢价。
对金融从业者来说,真正要关心的不是哪家产品更聪明,而是自己这个场景该配哪种形态、人机那一刀切在哪、四条边界能不能给出确定答案 。把这三件事想清楚,比追着发布会跑有用得多。
关于 AIFA(AI金融分析师)认证
想把"识别场景需求、选对 AI 工具形态、设计人机分工、验证输出可信度"这套能力系统练一遍,可以看 AIFA(AI金融分析师)认证 。这套认证把多源数据核对、AI 输出的人工复核、金融场景下的可信度评估拆成可考核的能力点,适合金融从业者把"用 AI 干活"从凭感觉推到有章法。
欢迎前往 AIFA 金融分析讨论区 学习了解。