为什么说千问能硬刚 ChatGPT?
关注者
485被浏览
601,138登录后你可以
不限量看优质回答私信答主深度交流精彩内容一键收藏
看了看这个问题,又看了看投资大佬朱啸虎的朋友圈观点,我想起来一件事儿:
在过去两年里我经历了大大小小上百次地震,让我对地震释放出的能量产生了好奇,于是用不同的 AI 帮我计算了一遍又一遍,然后我发现它们的计算结果是不一致的,基本上各有各的答案,但是引用的计算公式都是同一个,显然 AI 们对数学的精确计算方面表现一塌糊涂。
这件事情促使我开发了一款 Apple 快捷指令,用来计算正确的「地震 TNT 当量」[1],然后再用它来考验 AI 对这种涉及精确结果的计算能力。目前这个快捷指令早已被我校对得非常准确,计算出来的答案可以被视为标准答案。

有了标准答案以后再来考验一波千问,看它能否准确计算出这个结果,或者说计算误差有多大:
要求:计算里氏 8.5 级地震释放能量的 TNT 当量
结果:8480 万吨!我预先计算好的标准答案是 8480.24 万吨,千问给出来的计算结果是 8480 万吨,0.24 万吨四舍五入可以不计,千问的数学计算能力由此可见一斑,比我之前接触过的任何 AI 都强,包括 ChatGPT。

从这一个数学计算的细节上来看,千问的确有硬刚 ChatGPT 的实力,但这尚不足以说明题主疑惑的为什么,于是我想到了前段时间回答过的另一个问题:
在这个问题里面我就列举过千问最新版 Qwen3 的实力:
- Qwen3-Max:这一款是字面意思上的「大」模型,总参数量突破万亿,而且在这个规模上保持住了 Scalling Law(规模化法则),性能较上一代旗舰模型暴涨,目前已经达到 ChatGPT-5 的顶尖水准;
- Qwen3-Omni:也叫全模态预训练大模型,可以处理文本、图像、音频等多种形式的信息输入,然后再通过流式相应输出文本或语音形式的自然语言,最显著的特点就是说话像真人一样自然。
在计算地震当量的这里显然是 Qwen3-Max 的 Thinking 版出手了,这个版本主打深度思考任务,根据已知表现,AIME 数学竞赛题直接秒出标准答案,复杂编程需求一步到位,这两项成绩均能达到国际顶尖水准。

现在回答题主的问题,为什么说千问能硬刚 ChatGPT?因为实力允许啊!


