如何选择合适的苹果Mac以最佳运行大型模型?

8月26日那天,我正在享受泡茶的闲暇时光,突然看到一系列关于“M6”“M5 Ultra”“1.2TB/s”的新闻跳了出来——这不是显卡发布会,而是苹果为Mac mini和Mac Studio推出了全新产品线。没有提到Vision Pro,也没有关于iOS 18的新图标,演示文稿的每一页都在强调这一点:这代芯片,是专门为AI推理而设计的。如果你想把像Qwen2-70B或Phi-3-vision这样的模型装进你桌面上的小盒子,光看它是否能装下远远不够,更重要的是它能否高效运作。Mac Studio的M5 Ultra型号配备了512GB的统一内存,预计要到十月下旬才会发货,但朋友圈里已经有朋友下单了起售价为96GB的版本,并搭配了1TB的固态硬盘,价格高达46999元。付款的时候虽然没有犹豫,但收到发票时看到“M5 Ultra(双芯quad-die)”的字样,忍不住盯了三分钟——它的带宽高达1.2TB/s,几乎是M6 Mac mini 16GB版的八倍,但这真能让你每天多生成200条稳定的回复吗?还是只能让你在成功跑通第一个235B模型时拍张照发个朋友圈?上个月,我用M6 Mac mini 24GB试过CodeLlama-32B-Q4_K_M,运行VS Code、Ollama和本地的向量库,再加载一个PDF解析服务时,系统直接开始强制关闭后台进程。这不是卡顿,而是温柔的内存提醒:你还有1.8GB的可用内存。而我的朋友使用M5 Max Studio的64GB内存来运行相同的模型时,上下文从4K提升到32K,生成token的速度明显提高,从“等它处理完”变为“它刚说完我就能想好下一句”。差异在哪里?带宽从170GB/s跃升至614GB/s,虽然重量保持不变,但数据的传输速度却快得多——就像将乡村的水泥路换成沪宁高速,车辆依旧是那辆车。

Mac mini的M5 Pro起价12999元,定制到48GB内存时总价将近22000元,而此时再看Mac Studio的M5 Max,起售价为19999元,配备36GB内存,情况就变得有点微妙了。Mac Studio多出的不仅仅是GPU核心数量和带宽,还有雷雳5接口、双万兆网络接口,甚至支持连接两台Pro Display XDR显示器——你是为内存买单?还是为了未来三年无需更换主机的信心?

6999元的M6 Mac mini 16GB+256GB,现在依然可以在直播间抢到。它确实能够跑Phi-3、Gemma-2B和TinyLlama,用于聊天、写周报、为孩子编写童话等需求都没问题。但是如果真把它当作AI工作站来使用……你明白的吧?一打开Chrome就占用了2.3GB,再启动Docker Desktop又要1.1GB,当你拖动model.gguf进命令行,按下回车的瞬间,风扇声就开始宣告它的存在。

有人问我:“70B的模型能在128GB内存的Mac Studio上正常使用吗?”我尝试了Qwen2-70B-Q4_K_M,在8K上下文中,同时打开浏览器查资料、IDE编写代码和模型实时补全,机器运行时温度适中,风扇转速也没超过3200rpm。但当你切换到128K上下文,或者同时开启两个RAG pipeline时,内存瞬间占用达到93%,系统开始悄然压缩页面。这个时候你就明白了:参数不仅仅是数字,它们代表着物理世界中的重量、热量和时间。

苹果没有欺骗消费者。M6适合尝试新鲜事物,M5 Pro更适合认真工作,而M5 Max则是为中型模型提供充裕空间的办公室选择,至于M5 Ultra……很可能是你未来三年都无需再开封第二台Mac的理由。然而,当你在Apple官网选择“512GB统一内存”的那一刻,你是在购买计算能力,还是某种对AI时代的信心呢?

发表评论

订阅我们的邮箱