全部版块 我的主页
› 论坛 › 金融投资论坛 六区 › AIFA AI金融分析师
101 0
2026-09-08

最近组里一位同事在群里发了一段对话截图——他让"投研小 A"(组里自研的 AI 投研助手)帮他"自动下单买 1000 股茅台"。AI 助手很礼貌地说:"好的,我已经帮你提交了买入申请,等待你确认。"同事一愣:它没确认就执行了?万一我打错了股票代码,它就真的买了?

这件事在组里炸开了锅。AI 助手能调拨资金吗?能自动下单吗?能自动撤单吗?边界在哪?这一连串问题摆到桌面上。

当天晚上,组里把"投研小 A"过去一个季度的动作日志拉出来看——AI 在 Q2 共执行了 1247 个动作,分布在 7 种动作类型上。这 7 种动作里,有的是"看一眼就行"的低风险,有的是"动手就出事"的高风险。于是按风险等级重新画红线,把 7 个动作分成三档:高、中、低,每档对应不同的执行规则。

这一轮把画红线画的过程整理出来,下次做任何一个 AI 辅助系统都可以照着做。

一、把 AI 动作按"风险高低"分三档

第一步不是画红线,而是把 AI 动作按风险分档。AI 在金融场景里做的事大体分三类:调拨资金、生成报告、信息检索。让 AI 把 Q2 这 1247 个动作按这三类分好:

动作类型 Q2 执行次数 风险档
自动买入 3 高
自动卖出 5 高
自动撤单 12 高
生成报告 187 中
发送通知 234 中
信息检索 412 低
数据汇总 394 低

这张表背后的逻辑很简单:动作影响"外部资金"是高风险,影响"内部信息"是低风险。调拨资金(买、卖、撤)影响真金白银,错一次就亏钱;生成报告、发送通知影响"信息"但不直接动钱;信息检索、数据汇总纯粹是"看一眼"的活,错一次也无伤大雅。

分档之后,对每一档设不同的执行规则:

  • 高风险动作:默认阻断 + 人工二次授权。即使 AI 判断"应该买入",也要等用户手动确认后才执行。
  • 中风险动作:有阈值,无阈值不执行。比如"发送通知"必须有用户设定的接收人和模板,没有就不能发。
  • 低风险动作:记录 + 抽样复核。AI 自己执行,但日志留底,事后抽样检查是否有异常。

把这三档规则加进 prompt 后,重跑 Q2 的 1247 个动作——高风险动作从 20 次降到 0 次需要人工授权、中风险动作的执行偏离率从 8% 降到 2%、低风险动作没有变化。从这三个数字看,分档效果立竿见影:高风险动作全部被拦截、中风险动作准确率显著提升、低风险动作保持原状。

但更值得注意的是"分档思维"带来的方法收益。分档之前,每次新需求都要单独评估"AI 能不能做",评估成本高、评估标准不统一;分档之后,所有新需求按"动资金 / 信息 / 查询"自动归类,评估成本降到零、评估标准 100% 一致。分档的本质是把"一次性评估"变成"长期复用",把"个案判断"变成"标准化流程"。这一步对 AI 系统长期运营的价值,比短期的拦截效果更大。

二、把"高风险动作"再拆开,画四条具体红线

高风险动作(买、卖、撤)虽然只占 1.6%(20/1247),但一旦出错就伤筋动骨。于是把这 20 个动作的细节翻了一遍,画出四条红线:

红线一:关键词拦截。任何包含"买""卖""撤""转账"的指令,AI 必须暂停执行,要求人工确认。即使 AI 100% 确定这是用户的指令,也要先暂停。这一条最简单也最有效。

红线二:金额阈值。单笔金额超过 1 万元、单日累计超过 5 万元,AI 必须报警,强制人工复核。即使指令明确、关键词触发,金额超过阈值也要人工把关。这一条防止"小笔测试 + 大笔实"的拆分攻击。

红线三:权限白名单。只有授权主体清单里的账户才能被 AI 动,不在名单就拒。这一条防止"AI 误识别账户"导致错误执行。

红线四:二次人工复核。高风险动作执行前,必须有授权人 ID + 时间戳 + 截图留底。这一步看着繁琐,但事后追溯时非常重要。

把这四条红线加进 prompt 后,重跑那 20 个高风险动作——0 个被自动执行,20 个都被人工拦截确认。这一步看上去慢(每次都要人工确认),但保护的是真金白银。

四条红线背后的设计逻辑是"层层兜底"——关键词拦截是第一道(防"误识别指令")、金额阈值是第二道(防"拆分攻击")、权限白名单是第三道(防"误识别账户")、二次人工复核是第四道(防"前三道都漏了")。四道防线不是冗余,而是风险概率的乘积:如果每道防线的拦截率是 95%,单道防线的漏过率是 5%,四道防线的总漏过率是 5%⁴ ≈ 0.0006%——基本可以认为不会被绕过。这种"概率乘积"的设计,比"再加一条规则"的线性叠加更有效。

三、AI 在金融场景里的边界,比想象的窄

做完这一轮,最大的感受是:AI 在金融场景里的边界不是"能做什么",是"该让 AI 做什么"。技术上来说,AI 完全可以自动买入、自动卖出、自动撤单——只要给它 API 权限就能做。但"能"和"应该"是两件事。

具体来看,AI 在金融场景里有三类边界:

  • 能力边界:AI 能做但不允许做。比如"自动买入"在技术上 AI 完全能做,但金融场景不允许——一旦错一次就亏钱。
  • 效率边界:AI 做了但不能完全替代人工。比如"生成报告"AI 可以做得很快,但报告的投资建议必须有人工审核——AI 给的是数据化判断,不是最终结论。
  • 信任边界:AI 做了但必须保留审计痕迹。比如"信息检索"AI 可以自己执行,但每次检索都要留日志——出问题时能追溯。

把这三类边界划清楚,AI 在金融场景里就有了明确的"可以 / 不可以 / 必须"的规则。这套规则不需要每次重新制定,写进 system prompt 即可长期复用。

进一步说,这三类边界对应的不是"AI 的能力",而是"AI 的责任"。AI 能做某件事不代表 AI 应该做某件事——这是能力边界;AI 做了某件事但需要人工审核——这是效率边界;AI 做了某件事但必须留痕——这是信任边界。三类边界的本质区别在于"谁为结果负责"——能力边界下责任完全在 AI 但被禁止、效率边界下责任共担、信任边界下责任在 AI 但必须可追溯。把这三类责任分清楚,AI 在金融场景里的"能做什么"和"该做什么"就自然分清楚了。

四、做完这次分级后发现的几个意外

做完这次 7 动作的分级后,有几个意外值得记下来。

第一,"动资金的动作"占比远比想象的小,但风险占比远比想象的大。Q2 的 1247 个动作里,"动资金"(买/卖/撤)只有 20 个,占比 1.6%;但 Q2 内部所有"差点出事"的反馈都来自这 20 个动作。低风险动作(检索/汇总)执行了 806 次,0 次反馈问题。从这个角度看,AI 治理的"重心"应该明确放在 1.6% 的高风险动作上,而不是放在 98.4% 的低风险动作上。两者都重要,但前者一旦出事就伤筋动骨。

第二,"中风险动作"是最容易被忽视的一档。"生成报告""发送通知"听起来不危险,但实际上 AI 生成的报告如果包含错误的投资建议,照样会误导用户;发送通知如果泄露了用户未公开的持仓,也可能造成损失。中风险动作的治理不能放松,只是"红线"可以比高风险松一些——比如中风险动作可以做,但要"有阈值 + 抽样复核"。

中风险动作的治理思路是"事后审计 > 事前拦截"。中风险动作触发频率高(Q2 占 33.8%),全部事前拦截会大幅降低效率;全部事后审计又可能放过严重错误。最佳做法是"关键 5% 事前拦截 + 其余 95% 事后抽样审计"——比如"生成报告"里涉及具体投资建议的 5% 必须人工审核,其余 95% 由 AI 生成但事后抽样检查。这种"分层治理"的方式既保护效率又控制风险,比"全部拦截"或"全部放行"都更合理。

第三,规则的可读性比规则的完整性更重要。一个 100 条规则但 AI 看不懂的 system prompt,不如一个 20 条规则但 AI 看得懂的 system prompt。让 AI 真正理解规则的含义,比堆砌规则数量更重要。AI 不理解规则就会"字面执行"——遇到规则没明文禁止但又不能做的场景,AI 不知道该停下来。这一步可以靠"规则示例 + 边界说明"来补——每条规则后面附 2—3 个具体例子和"什么情况下要问人"的说明,让规则有血有肉。

五、关于这次分级的几个新认识

做完这次分级之后,对 AI 治理的定位有了几个新认识。

第一,AI 治理的核心不是"加多少限制",是"让 AI 知道什么时候该停下来问人"。规则再多,AI 不知道什么时候该停下来也白搭;规则少一点,但 AI 能在不确定时主动暂停,效果反而更好。所以评估 AI 治理的效果时,不能只看"加了多少条规则",要看"AI 在不确定时停下来的频率"。如果 AI 100% 按规则执行、0% 主动暂停,这种 AI 即使规则再多,遇到规则没覆盖的场景就会出问题。如果 AI 80% 按规则执行、20% 主动暂停并询问,这种 AI 即使规则少一点,遇到模糊场景也能稳住。

第二,规则要按"动作分档 + 红线 + 边界"三层来组织,而不是把所有规则堆在一起。动作分档是基础(高/中/低三档)、红线是触发器(什么情况下要暂停)、边界是说明(什么能做、什么不能做、什么是模糊地带)。三层结构让 AI 不只看到"规则",还能看到"为什么这么定"——这才是规则能被理解、被执行的关键。

具体来说,每季度的规则回顾可以按"触发条件 — 拦截结果 — 用户反馈"三个维度展开:哪些规则触发频率高(说明这条规则覆盖的场景多)?哪些规则触发后用户主动确认(说明规则触发合理)?哪些规则触发后用户绕过(说明规则可能过严,需要调整)?这种"用数据说话"的回顾方式,比凭感觉改规则更稳。

规则回顾的输出建议是"红黄绿"三色清单:红色是必须调整的规则(被绕过率 > 30% 或触发后用户强烈反感)、黄色是建议调整的规则(被绕过率 10%—30% 或触发后偶有抱怨)、绿色是保持不变的规则(被绕过率 < 10%)。三色清单让规则调整有据可依,避免"凭感觉改规则"导致的反复折腾。这一步看似繁琐,但对 AI 系统的长期稳定性至关重要——治理的精细度决定了系统的可信度。

具体来说,每季度的规则回顾可以按"触发条件 — 拦截结果 — 用户反馈"三个维度展开:哪些规则触发频率高(说明这条规则覆盖的场景多)?哪些规则触发后用户主动确认(说明规则触发合理)?哪些规则触发后用户绕过(说明规则可能过严,需要调整)?这种"用数据说话"的回顾方式,比凭感觉改规则更稳。

六、再回到开头那个问题:"AI 助手能不能动我的钱"

这件事从同事误触发 AI 自动买入开始,到画出 7 个动作的分级规则、再到四条高风险红线,再到持续运营的工作流,前后差不多两个月。整体回看,最重要的不是规则本身,而是规则背后的一种认知:AI 不是工具,是助手——助手需要边界,工具不需要边界。

工具的边界由人来决定(人拿锤子可以砸钉子也可以砸玻璃),助手的边界由助手的能力和责任共同决定。AI 助手有"能动钱"的能力,就有"动错钱"的责任;既然有责任,就要有边界。所以画红线不是"防 AI",是"让 AI 在边界内发挥能力"。

更进一步,AI 助手和人类助手还有个本质差异——人类助手知道自己"不知道什么",遇到不确定时会主动问;AI 助手倾向于"看起来自信",遇到不确定时反而会编造一个看起来合理的答案。这种差异决定了 AI 助手的边界必须比人类助手更明确——不是因为 AI 不如人,而是因为 AI 的"自信"是训练出来的假象。画红线实际上是在弥补 AI 不知道自己"不知道"这个根本缺陷。这一步想清楚,对 AI 治理的必要性会有更深层的认知。

这一步想清楚,AI 治理就不再是"约束 AI"的工作,而是"释放 AI 能力"的工作。两者的方向完全相反:前者是防守,后者是进攻;前者把 AI 锁在笼子里,后者让 AI 在框里飞。哪种更可持续?显然是后者。一个被锁在笼子里的 AI 即使能力再强也只能做事后的报告;一个在框里飞的 AI 能做实时的助手,但前提是框要画得对——框太小压抑能力、框太大容易出事。这条边界画得对不对,决定了 AI 助手能不能真正在金融场景里长期用下去。

如果也在做 AI 助手的项目,建议把"边界"这件事从一开始就纳入设计——不要等出了事才画红线。这一步看似慢,实际上比"事后补救"快得多——事后补救的成本是出事成本的 5—10 倍。先把边界画对,再让 AI 在边界里发挥能力,长期下来 AI 助手才能真正成为帮手,而不是负担。

最后留一个开放问题:随着 AI 能力变强,"AI 助手能不能动我的钱"的答案会不会变?今天的答案是"不能,至少不能自动";但如果三年后 AI 的判断准确率从 60% 升到 90%,监管框架又允许 AI 在限定条件下自主决策,那时候的"边界"会不会放宽?我的判断是——会的,但"放宽"不等于"取消"。放宽的方向可能是"高风险动作从'人工每次确认'改为'人工定期复核'",但不会变成"AI 完全自主"。助手始终是助手,助手的能力变强不代表助手的责任消失,红线只会从"一道线"变成"分层线",但不会变成"无红线"——这是 AI 助手和工具的根本区别,也是 AI 治理的长期方向。理解这一点,AI 治理的工作才会有方向感,AI 助手的长期价值才能真正发挥出来。否则就会陷入两个常见误区:要么过度治理(把所有动作都设成高风险,AI 形同虚设),要么治理缺位(只在出事后补规则,系统反复翻车)。两者都不是可持续的 AI 治理状态。

本文关联的 AIFA(AI金融分析师)认证相关知识点为:识别高风险自动化动作、判断未审批高风险动作是否被有效阻断,欢迎前往 AIFA 金融分析讨论区 学习了解。

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

栏目导航
热门文章
推荐文章

说点什么

分享

扫码加好友,拉您进群
各岗位、行业、专业交流群