mac mini M4(16GB+256GB) 本地跑一个 7b 模型,辅助一些日常任务可行吗?
4.12更新 实测可行,也不可行。
4.12是星期天,我的智谱coding plan周额度只剩最后5%。有评论区的兄弟让我试试mlx,这不就折腾上了。下了gemma4 26b a4b,qwen3.5 27b的模型,还没放开跑,就重启了,走不了一点。
换jackrong qwen3.5 9b 那个opus蒸馏的小模型,刚好给Hermes agent当后端,跑一个收集每日热点的工作流。数据源就三个,量子位啥的。能跑完,内存负载也还行,70%左右,GPU刚好跑满。这个工作流老是被智谱给限制,所以才想出这个本地跑法,但估计数据源多了也不太行。
然后,重点来了。我继续用这个小模型做后端,让Hermes看看某个路径下的文件夹是什么内容,能否删除。
看着内存负载往90%甚至100%去了,hermes也卡了很久,5分钟往上吧,我就默默关上了终端。
这本地部署多少还是有些寂寞了。
这问题我在行。我是24+512,还真想过跑7b小模型,ollama list 的模型如下:

实测30b的模型已经到极限了,而且会发热。(ollama里面可以用 qwen3.5 27b但比较卡,跑是不能跑的)所以最后换了oss:20b,能用但基本用得不多。经过测试,9b还是适合真正的跑任务。
然后我用这些模型干嘛了呢?
- 尝试给claude code用──不支持
- 给open claw 用,效果一般。
- 本地工作流。
这个本地工作流我试过两个,一个是三段式翻译。就是下面这种:
最佳 AI 翻译工作流:全世界最信达雅的翻译初翻──反思──再译的形式,翻一本300多页的书,当然不是一次性翻译,而是chunck成很多章节,小段,大概2000字左右一段,具体忘记了,反正用的是qwen2.5:7b,先出初稿。然后精彩的来了:Mac直接干上天了,下面是istatistica pro的截图



为啥呢,每一段都要跑三次翻译流程,这样就变成了3^N的指数级增长。嗯,三生万物是吧。放弃了。
第二个是提取本地制度。我在Win上使用Open Claw 调用Mac 的7b小模型对一些制度进行语义处理,然后Open Claw 根据语义提取的结果归纳制度的要点,主要内容什么的。效果还可以。也没发热。当然这次不敢大力出奇迹了,也就用一个制度尝试了一下,,如果有几十个,我估计也够呛。
哦我用7b小模型干的最后一件事,是在ollama里玩角色扮演,让小模型扮成一个女性角色和我“养成”──其实是为了做读书搭子,测试一下效果。反正语气很呆板,简短,没过多测试就觉得太无聊了。
至于自动发文章,收集新闻和部署一些应用脚本的任务,我猜测应该还可以,试试不就知道了。但你要是爬虫,或者RSS几百个源的话,感觉够呛。
谁能帮我决定一下,这OLLAMA还有必要留着吗?