演示与生产之间隔着什么
在演示环境里表现完美的智能体,一进生产环境就状况百出——这是智能体落地的常态。演示用的是精选数据、理想输入、宽容的观众;生产面对的是脏数据、刁钻输入和零容忍的业务。
上线前的五道关,一道都不能省。
第一关:效果基线
用真实的、有代表性的测试集(至少 100 条覆盖主要场景与边界情况)建立效果基线。准确率、拒答率、幻觉率都要有明确阈值,低于阈值不上线。
第二关:数据就绪
知识库是否覆盖真实问题?数据更新频率是否跟得上业务变化?来源数据的权责是否清晰?数据就绪度不达标,智能体只是空中楼阁。
第三关:权限边界
智能体能看什么数据、能执行什么操作,必须有最小权限边界。尤其是涉及写操作的智能体,权限设计要过安全评审。
第四关:异常兜底
答不上来时怎么办?答错了谁兜底?必须设计清晰的降级路径:转人工、拒答话术、错误上报机制。没有兜底设计的智能体,一次事故就足以摧毁业务方的信任。
第五关:运营机制
上线不是结束。谁负责每周看日志?谁负责更新知识库?效果如何度量与迭代?没有运营机制的智能体,三个月后就会沦为一个无人维护的摆设。
结语
这五道关看起来慢,实际上是最快的路。绕过关卡仓促上线的智能体,最终都会以更难看的方式补课。