答案应该是暂停自动回复,把问题交给一名有姓名、负责任、能跟进的农业推广人员。采购季临近不会让未经审核的建议变得更可靠,模型也不应替人决定农户是否可以喷药、何时可以重新进田或采收。
1983年9月26日,苏联军官斯坦尼斯拉夫·彼得罗夫在莫斯科附近的谢尔普霍夫-15指挥中心值班。预警系统显示,美国发射了一枚洲际弹道导弹,随后又显示有四枚。按照警报呈现的含义,上级面对的可能是一次核攻击。
彼得罗夫没有把屏幕上的结论直接当成事实。他注意到警报规模与全面攻击的逻辑不符,也没有得到地面雷达的确认。他将其判断为误报。后来查明,卫星把高空云层反射的阳光误识别成了导弹发射。BBC后来在对彼得罗夫的报道中记录了这次事件。
这不是一则关于“人永远比机器聪明”的故事。它说明了更具体的一件事:当系统给出的信号可能造成严重后果,而证据又不完整时,必须由一个有责任边界的人判断下一步。
采购季前出现的那条问题
设想一名由真实工作场景拼合而成的农业推广人员,我们称他为夸梅。距离可可采购季开启还有三天,他收到一条由Asante Twi语音转写而来的农户问题。
农户提到一种化学品,又问现在喷洒后是否还能按计划进田采收。系统能够识别部分话语,也能找到相关的可可种植内容,但现有审核材料没有完整覆盖这个具体情形。产品用量、重新进入田间的间隔以及采收前间隔,至少有一项无法从已批准内容中确认。
此时,购买商即将收货,农户感受到的是时间压力。对话系统感受到的只是相似词、候选内容块和置信度。两者都不能补上缺失的农艺证据。
AgriVoice在这种情况下应当停止选择答案,并把原问题、转写结果和未能确认的项目交给夸梅。夸梅可以核对农户所说的产品,查看经农业专家批准的材料,并在必要时继续向合格的农艺人员确认。系统负责把问题送到正确的人手里,最终决定仍由具名的人作出。
一个流畅回答可能带来的代价
最危险的回复往往听起来并不危险。它可以使用自然的Twi语音,句子完整,语气平稳,却把错误的产品、剂量或等待间隔说得像已核实事实。
Neuralis已经发现,机器翻译曾把表示可可的“kokoo”处理成“chicken”。这类错误在普通聊天中或许只是荒唐,在农药指导里却可能改变整条建议。现有三个化学品内容块仍因剂量、重新进入田间的时间和采收前间隔未获确认而被暂停,这是正确的安全状态。
采购季越近,猜测的诱惑越大。农户可能担心错过出售窗口,推广人员可能面对更多催问,系统运营者也可能希望提高“成功回答率”。安全指标必须抵抗这种压力。一个问题被正确升级给人工处理,应计为成功,而不是失败。
如果系统为了减少等待而拼出一个答案,风险会进入田间。帮工可能过早返回,果实可能在未经确认的间隔内采收,事后也很难追查究竟是谁批准了这条指导。关于这些字段为什么必须保持暂停,可参见[三个被暂停的化学品内容块,以及它们可能带进可可园的风险](/blog/zh-CN/三个被暂停的化学品内容块-以及它们可能带进可可园的风险-73a408b9/)。
把“转人工”设计成一条可执行路径
人工升级不能只是播放一句“请咨询专家”。每次升级都需要一名明确的负责人。对AgriVoice试点而言,合作机构必须指定接收升级问题的推广人员,并明确响应责任。
系统也要保存足够的判断依据:农户原始问题、语音转写、候选主题、没有回答的原因,以及涉及化学品时缺失的安全字段。推广人员才能快速区分三种情况:批准内容已经覆盖,可以回复;问题需要农业专家补充;现有信息不足,应继续暂停相关操作。
回复本身也应来自经过审核的内容。语言模型可以从批准的内容块中选择答案,却不能自行编写农艺指导。任何缺失、含糊、超出范围或存在安全疑问的问题,都应进入人工队列。
这样的设计会减少一项好看的数字:自动回答比例。但它保护了更重要的试点指标,包括零条不安全农药建议、正确回答或正确升级的比例,以及每次升级是否有人负责处理。[农业语音系统安全升级:阿明的农药问题为何需要负责人和处理时限](/blog/zh-CN/农业语音系统安全升级-阿明的农药问题为何需要负责人和处理时限-1099698a/)进一步说明了这条责任链为何必须在农户开始使用前建立。
三天的压力不能改写安全边界
采购季前三天,夸梅需要的不是一个替他作决定的模型。他需要系统准确承认自己缺少什么,把问题完整送达,并让农户知道正在由谁核实。
彼得罗夫面对的后果与可可种植当然不在同一量级,两件事共享的机制却很清楚:机器发出了需要行动的信号,现场证据不足,而立即照做可能造成无法挽回的后果。安全来自一个具名的人对不确定性负责,也来自系统允许这个人按下暂停键。
对农业语音产品而言,最可信的回答有时是一条清楚的升级通知:这个问题尚未获得批准,负责人正在核实,在确认剂量、重新进入田间的间隔和采收前间隔之前,请不要把自动生成的语言当作操作指导。
评论
暂无评论。