网友称坐副驾看短剧,语音助手听到短剧说去祁王府就开始导航目的地,反映出什么问题?从车企层面该怎样解决?
这件事看起来无解,其实并不是没有办法!
短剧里的人说去祁王府,它识别得非常准确,真正尴尬的是它没有搞明白这句话是谁说的,是不是说给它听的就已经开始干活了。

现在很多车企宣传智能座舱,最喜欢讲几个词:自然语言、免唤醒、连续对话、可见即可说。
这些功能确实方便,以前你得喊一句“小X同学”,等它回应,再说“导航去某某地方”;现在你随口说一句“有点热”“去公司”,车机马上就能执行。
但这里有一个很容易被忽略的问题,当唤醒词这道门被拆掉以后,车机就必须有能力判断:驾驶员讲话、副驾讲话、后排孩子讲话、乘客刷短视频的声音,甚至车载音响正在播放的电视剧,这些声音到底哪些是指令。

语音助手至少要过四关:
- 第一关,听清楚说了什么。
- 第二关,判断是谁说的、声音来自哪个座位。
- 第三关,判断这句话是不是在跟车机说话。
- 第四关,判断这项操作能不能直接执行。
如果短剧本身就是通过车载音响播放的,其实相对好处理,因为车机知道自己此刻正在播放什么声音。现在的车载语音方案已经可以过滤 infotainment 播放信号和背景噪声;通过麦克风阵列,也可以判断声音来自驾驶位还是副驾驶位。Cerence 的车载语音方已经把这类语音增强和多区域交互作为明确能力。

如果短剧是副驾驶拿手机外放,情况会复杂一点,但依然可以结合声源定位座位分区、唤醒状态以及说话人识别去判断。
比如同样是打开座椅加热,驾驶员说和副驾驶说,对应的本来就应该是不同座椅。现在的座舱语音技术已经能定位说话者所在座位;进一步还可以通过声纹识别确定是谁在讲话。Cerence 的 Voice Biometrics甚至已经把“识别说话者+敏感操作二次验证”作为使用场景。

所以我觉得车企真正应该做的,是给语音助手加一套“执行权限”:查个天气问个问题误唤醒一次问题不大,调空调开座椅加热这类可逆操作可以适当放宽,导航如果系统无法确认声音来源,最好问一句:“是否导航到祁王府?”
以前的车机是听不懂,用户嫌它笨。
现在的大模型越来越会理解上下文,也越来越容易把一句模糊的话猜成一个合理意图,不能只测语音识别准确率99%,一句话能控制多少个功能还应该专门测一个指标:错误执行率。
车企完全可以在测试阶段大量播放短剧、电视剧、播客、导航播报,让几个人同时聊天,让副驾驶刷视频,让后排孩子乱喊,把这些场景塞进回归测试里,看看1000小时真实座舱环境中,到底有多少句与车机无关的话最终触发了操作。
它把一句根本不是说给它听的话听懂了,还真的执行了,这才是智能座舱必须防住的情况。
车里的智能除了越来越会听人话,还得知道什么时候这句话不该听,这条边界守住了,免唤醒连续对话这些体验才真的有意义。