不要只用“感觉挺智能”作为标准

智能体的回答具有一定灵活性,如果项目开始前没有约定验收方式,交付时很容易出现双方理解不同。企业认为系统应该什么都能做,服务方则认为功能已经完成,最终难以判断项目是否达到目标。

验收应围绕已确认的业务场景和交付范围,而不是追求所有问题都能回答。

使用真实任务建立测试清单

从历史咨询、日常工作和真实资料中整理一组代表性任务,包括常见问题、边界问题、异常输入和必须转人工的情况。每个任务应说明期望结果,以及允许怎样的表达差异。

检查答案是否有可靠依据

对于知识问答场景,不只看答案是否流畅,还要检查引用的资料是否正确、是否使用了最新版本,以及资料不足时会不会明确说明不知道。不能让智能体为了完成回答而自行编造业务事实。

验证人工接管和异常处理

投诉、报价、合同、隐私和系统错误等情况,应验证能否按照约定停止自动处理、提示用户并通知负责人。系统连接失败时,也要有清楚的错误提示和补救方式。

检查权限和数据范围

使用不同角色测试可访问内容,确认外部用户、普通员工和授权人员看到的信息符合要求。还要检查日志中是否记录了关键操作,以及敏感字段是否按照方案处理。

确认部署、培训和维护材料

验收不仅包括功能页面,还应确认部署状态、账号权限、操作说明、使用培训、问题反馈渠道和后期维护范围。企业内部需要知道由谁更新资料、如何查看记录、出现问题后联系谁。

分阶段验收更容易控制风险

复杂项目可以把验收分为原型验证、核心功能测试、试运行和正式交付。每个阶段使用真实任务检查,通过后再扩大范围,比最后一次性验收更容易发现问题。

鉴维网络会根据客户需求确认验收范围。简单项目和复杂项目的测试数量、系统连接和交付材料会有所不同,最终应以双方确认的方案为准。