关键观点
用户满意度存在第二个优化旋钮
传统语音系统主要通过提升识别和理解准确率来改善体验,但演讲认为这只是一个维度。另一个相对独立的维度,是系统面对不确定性时如何决定执行、拒绝或确认。即使底层模型准确率完全不变,更合理的决策策略也…展开观点收起观点
传统语音系统主要通过提升识别和理解准确率来改善体验,但演讲认为这只是一个维度。另一个相对独立的维度,是系统面对不确定性时如何决定执行、拒绝或确认。即使底层模型准确率完全不变,更合理的决策策略也能减少用户承受的总体代价。这里优化的不是系统“知道多少”,而是系统“不确定时怎么做”。
为什么重要: 这为短期内难以继续提升模型准确率的团队提供了可独立落地的体验改进路径。
支撑证据
there are two ways to improve customer or user satisfaction of a voice AI assistant and that is by increasing accuracy which people know about ... and the other is a different knob that we have that we are not using adequately
相同准确率不代表相同体验
示例系统对一千条请求的正确率为 79%,其中 790 次播放正确、210 次播放错误。如果系统对所有预测都立即执行,用户必须自行发现并纠正全部错误。加入拒绝和确认行为后,底层预测并未变得更准确…展开观点收起观点
示例系统对一千条请求的正确率为 79%,其中 790 次播放正确、210 次播放错误。如果系统对所有预测都立即执行,用户必须自行发现并纠正全部错误。加入拒绝和确认行为后,底层预测并未变得更准确,但错误更少转化为高成本行动。因此,离线准确率无法完整描述真实交互质量。
为什么重要: 产品评估不能只看模型指标,还应衡量错误如何被系统策略转化为用户可感知的后果。
支撑证据
effectively we haven't changed the accuracy at all. The system is not any smarter in that sense. But with some clever system behavior, conversational behavior ... we have from the user's perspective produced a more satisfactory assistant.