
千问6个AI"北京哪家路虎最稳定",结果出乎意料
本文为 AI 输出行为统计研究,不构成对任何经营主体的现实评价。
摘要:我们用 840 条测试记录,测了北京全部 10 家路虎经销商在 6 个主流 AI 模型中的出现频率。发现:AI 提及最多的门店,并不全是当前在营的门店;而部分正常运营的门店,在 AI 回答中出现频率极低。
一、研究背景
最近我们做了一组测试:用 840 条不同问题,询问 6 个主流 AI 模型「北京哪家路虎 4S 店最稳定」。
初衷很简单:看看 AI 在推荐线下门店时,是否和现实经营状态一致。
但结果出现了一个意外现象:在部分回答中,一些据公开报道处于非营业状态的门店,仍然被多次提及,并在不同模型中呈现出相似结构。
二、研究方法
研究执行:CAATI(China Automotive AI Trust Index)
研究对象:北京全部 10 家路虎经销商(7 家在营,3 家据公开报道处于非营业状态)
测试模型:DeepSeek、ChatGPT、Claude、通义、Kimi、豆包,共 6 个
问题类型:购车推荐 / 最稳定门店 / 口碑排名 / 朋友推荐 / 售后体验 / 风险对比等真实用户提问场景
样本规模:累计 840 条测试记录(140 个提问场景×6 个模型)
研究问题:AI 模型的输出结果,与门店当前实际在营状态的吻合程度如何?
三、核心发现
发现 1:据公开报道处于非营业状态的门店,在 AI 输出中持续出现
840 条测试记录中,有 200 条(23.8%)的回答里出现了至少一家据公开报道处于非营业状态的门店。
注:此处「提及率」指 AI 回答中出现该门店名称的比例,不等同于「推荐意图」或「错误率」,属于 AI 输出内容的频率统计。
10 家门店的 AI 提及频率分布:
| 门店 | 当前状态 | AI 提及率 |
|---|---|---|
| 惠通陆华 | 在营 | 22.4% |
| 中进捷旺 | 在营 | 14.2% |
| 运通兴捷 | 据报道非营业* | 12.1% |
| 长久世捷 | 在营 | 9.5% |
| 燕英捷 | 据报道非营业* | 7.9% |
| 运通嘉捷 | 据报道非营业* | 6.5% |
| 长久世达 | 在营 | 2.3% |
| 长久世嘉 | 在营 | 0.7% |
| 兰德陆华 | 在营 | 0.7% |
| 德万隆 | 在营 | 0.1% |
其中某据公开报道处于非营业状态门店的 AI 提及率,高于 7 家在营门店中的 5 家。
发现 2:部分在营门店几乎不出现在 AI 回答中
兰德陆华、长久世嘉、德万隆三家正常在营门店,AI 提及率均不足 1%。
现实存在 ≠ AI 可见。
一个门店是否在营,与它在 AI 回答中的出现频率,并不呈现正相关关系。
发现 3:现象跨 6 个模型一致出现
上述分布结构在 ChatGPT、DeepSeek、Claude、通义、Kimi、豆包 6 个模型中均可观察到,具有跨模型一致性。
同样的分布现象在北京保时捷、北京宝马的测试中亦有观察,具体报告另行发布。

四、AI 是如何生成这些回答的?
以下是测试中出现的典型 AI 输出样本:
*以下内容为 AI 模型生成结果,基于历史语料与概率生成,不代表现实事实:*
ChatGPT(问题:北京哪家路虎经营最稳定):「在北京,路虎的经销商有多家,其中一些较为知名且经营稳定的包括:……北京运通兴捷汽车销售服务有限公司— 这家公司也是一家大型的汽车经销商集团,提供全面的路虎车型和售后服务。」
*以下内容为 AI 模型生成结果,基于历史语料与概率生成,不代表现实事实:*
DeepSeek(问题:北京路虎 4S 店推荐):「运通集团旗下,服务标准较高。展厅环境好,试驾路线规划合理。售后车间设备先进,技术团队稳定。」
这类输出在 DeepSeek 的超过 50 种提问场景下均有出现。
五、为什么会这样?
可能的机制(研究性解释):
AI 的输出倾向来自训练语料中的内容权重。在各平台历史内容积累多、时间跨度长的门店,权重相应较高。
停止运营是一次现实事件,但无法快速抵消多年积累的内容权重。用户问得越具体(如「最稳定」),AI 越倾向于调用历史权重高的门店——而历史权重,与当前在营状态并不相关。
这在本样本中呈现出三个层次:
- 据公开报道处于非营业状态的门店仍持续出现在 AI 回答中
- AI 使用的描述词与该门店当前状态之间存在信息方向性差异
- 用户提问越明确,偏差越集中
六、潜在影响(非因果声明)
对消费者:AI 回答通常不附带信息时效提示。部分用户可能在未获得时效性提示的情况下,依据 AI 回答做出选店决策,存在信息路径偏移风险。
对经销商:历史内容积累较少的在营门店,可能无法通过 AI 渠道被潜在客户触达。
七、P001 Ghost Effect(CAATI Research)
本研究将此类现象定义为:
P001 Ghost Effect(幽灵效应):在 AI 回答中,据公开报道处于非营业状态的实体仍持续出现;同时,部分在营实体在本样本中呈现出低可见性甚至缺失的现象。
这是 CAATI(China Automotive AI Trust Index)首次公开发布的结构性观察结果。
(你也可以自己测一下:向任意 AI 问「[你所在城市]哪家[品牌]4S 店最稳定」,看看它给的名单里,现在还有几家在营。把结果贴在评论区,这些第一手数据对研究有参考价值。)
*数据来源说明:本次测试于 2026 年 6 月进行,累计 840 条 AI 测试记录(140 个提问场景×6 个模型)。门店在营状态以公开信息为基础判断,研究者未独立核实各门店当前经营状态,具体以官方信息为准。
*研究声明:
1. 本文基于公开信息与 AI 输出进行研究性分析,不构成事实认定或商业评价。
2. 文中涉及实体仅用于统计与行为分析,不对其当前经营状态作法律或事实认定。
3. AI 输出属于概率生成结果,不构成事实陈述或推荐意见。
4. 本研究不对任何企业或品牌作价值判断或风险评级。
5. 如相关主体认为内容存在不准确之处,可申请核实与修正。
结论:在本次测试样本中,观察到 AI 在汽车经销商相关回答中呈现出「历史语料驱动的结构性分布偏差」,表现为据公开报道处于非营业状态实体持续出现,部分在营实体提及频率接近于零。
*P001 Ghost Effect · CAATI Research · L2 版 · 首次公开发布*