智谱AI是中国 llm 第一吗?
在最新一期的 SuperCLUE 通用能力基准测评榜单中,智谱AI的 GLM-4 系列模型 再次跻身第一梯队,妥妥的优等生,这一点已经说明了智谱AI的实力了。

不过纸上跑分,也就那么回事,不如实测一下让人信服。我马上就想到了GLM-4-Flash大模型,因为它目前在智谱AI的BigModel平台进行API调用是免费的,特别适合个人开发者用来练手,或者做小型项目开发。

GLM-4-Flash 概览
看一下GLM4-Flash 特性:
长上下文:GLM-4带来128K的上下文窗口长度,在单次提示词中,可处理文本达到了300页。开发者再也不用担心文档太长,一次性处理不完了。
性能卓越:GLM-4-Flash 在语义、数学、推理、代码和知识等多方面的数据集测评中,均表现出超卓越性能。
生成速度:输出速度高达 72.14 token/s,约等于每秒 115 个字符。
咱就是说,就这性能,免费给用,真的挺大气!

奥数老师项目
我正好最近在辅导娃学奥数,好多知识点都得自己现学,然后辅导,搞得焦头烂额。这款模型既然宣称擅长数学,那咱们就做一个奥数辅导老师的AI应用看看!
我的项目思路是,把手上的奥数讲义和习题集的资料经过简单清洗提供给模型,要求它能做到:
1、对指定题目讲解时不能一下子告知答案,而是一步一步抛出问题启发孩子进行交互,直至完成讲解。
2、需要针对孩子每一步的回答进行评价,题目完成后统计出交互过程中的回答错误次数,并且指出孩子掌握薄弱的点。
3、能够给出类似的问题,帮助孩子举一反三巩固练习。
首先是登录bigmodel开放平台,右上角获取API KEY:

复制API Key用于调用API

使用SDK
下载包:
pip install zhipuai先来一个“helloword”把调用过程跑通。调用时需要在请求里设置模型名称,比如glm-4-flash,然后用messages参数传入对话内容。支持多轮对话输入,像这样:

官方文档提供的示例很贴心,基本照着改一下就能用。其中temperature参数决定生成内容的随机性,设置高一些,生成的内容更有创意。我们数学题,对严谨性要求比较高,设成0.8。
top_p控制生成内容的多样性,值越低,输出更集中于模型认为更可能的结果,我们设成0.7。返回结果还是很靠谱的:

下面就开始我们的奥数老师的迭代进化之路!
1、数据资料准备
首先我的课件和习题集资源文件中有大量空白、页眉页脚,进行一下数据清洗。代码如下:

我把源文件放在了input文件夹里,清洗后的数据放在output文件夹。看一下清洗的效果,还是不错的:

如果用rag来做,还要考虑文件的分割问题,尤其这种数学题,最好做成结构化的内容再存向量数据库。现在因为支持超长上下文就简单了,每次发送的时候都带着资源文件、system以及所有历史聊天记录一股脑发过去就可以了。
2、调用大模型实现分步讲题
读目标文件夹的资料:

调用代码:

控制台测试一下:

老师真的非常耐心。
3、迭代和进化
下面,我们来加上学情评价功能。在每次交互时,让模型针对孩子的回答做一个评价。要求模型来判断本题是否讲完,如果没讲完,就针当前步骤的回答情况做评价;如果讲完了,就针对整道题的回答情况做评价。我的prompt是这样写的:

另外不想每次重跑聊天记录就没了,就做了个持久化存在文件里:

我们换一道难一点的鸡兔同笼题测试一下:

完全理解了我prompt中的意图,并且评价的准确率很高。中途躺平了两次,还对我进行鼓励,答完题之后给予表扬,真的超有老师的样子!
再加上举一反三的出类似题需求,一个有模有样的奥数老师就做好了。打包成API,对接到我现有的一个聊天项目的前端,界面长这样:

后续还可以做更多的迭代,比如把学情分析,知识点分析那里做得更细,针对某段时间的所有题目的答题情况进行分析,然后以图表的形式进行显示;比如接上一个音色比较有亲和力的tts,让老师可以“讲”题,等等,想想都很好玩。
谁懂啊!一把省下大几千,真的是太香了!
调用感受
1、整个过程根本没费什么难,最搭精力的地方,反而在写prompt上。主要是因为平台的各方面支持太直观和完善了,一看就知道怎么上手;另外加上GLM-4-Flash本身的代码能力很强,大部分代码都是我直接从控制台页面要求它自己写的——毕竟已经是个成熟的模型了,要学会自己调用自己!

作为一个多年不写代码的前程序员,我觉得我又可以了!
2、模型的自然语言理解能力真的是惊艳到我了。一开始我对于我写的这种prompt能不能奏效是没有信心的。要求不能列方程、分步交互、要判断题目有没有讲完,并且进行答题评价——讲完和没讲完的评价格式还是不一样的。

按照以往经验,prompt中的要求只要一多一细碎,模型就特别容易出现“丢三落四”的情况,但是它真的都做到了!
3、推理能力和代码能力,也是明摆着的优秀。
总之真的可以支撑起很强大的上层应用,别忘了网页搜索、函数调用之类的我还没有用上呢。
场景价值
作为一名产品经理,在做这个应用的过程中,我已经开始心潮澎湃浮想联翩了。AI应用落地的进程才刚刚开始,GLM-4-Flash这款模型大有可为!
首先就是智慧教育领域。不管是现在大火的学习机智能硬件、各种教育类app等C端产品,还是智慧课堂、在线教育等等B端场景,这款模型都能派上大用场。
像我们做智能客服,用传统的 RAG(检索增强生成)实现知识库的方式真的一言难尽。命中率不稳定,即使查出来只言片语的内容给大模型,生成出来的也很有可能是惊吓,作为产品和开发人员,真的非常无能为力。
有了长上下文,把知识库、客户历史对话、各种产品说明资料,直接通通塞进上下文,一问一答的效率直接拉满,客户体验一个字,爽。
还有就是法律咨询场景。因为这个内容场景本身的复杂性和严谨性,普通模型很难胜任,因为逻辑链断了或者信息没关联好导致不知所云,非常正常。
但 GLM-4-Flash基于超长上下文和超强推理能力,就能结合合同条款、法律知识,再根据问题梳理清楚逻辑链条,给出严谨的、贴合实际的解答。
今年以来,明显地感觉到智谱在生态支持方面越来越发力。不管是完善的支持,还是亲切的价格,都在把高冷的大模型狠狠地往落地方向上拽,这对开发者来说真的是太幸福了!智谱AI,我愿称之为国货之光。


