最近后台被问爆了一个问题:想在家跑本地大模型,到底该买啥硬件?
毕竟现在大模型订阅费年年涨,往对话框里传个私人文件还总担心数据泄露,谁不想整个“AI自由”的本地机子,断网也能用,不用看厂商脸色。
我翻了不下十篇测评,发现绝大多数人都还抱着老思路:跑AI嘛,买最贵的N卡就对了。直到上周看到一组实测数据,我才发现之前的认知全错了——你花3万买的RTX 5090,可能真不如2万块的巴掌大迷你主机好用。
算力差7倍,5090为啥会“输”?
单看纸面算力,5090真的是碾压级的存在。
FP32单精度算力104.8 TFLOPS,现在风头正盛的AMD Strix Halo(就是搭载Ryzen AI Max+ 395芯片的迷你主机),同精度算力才14.8 TFLOPS,差了整整7倍。要是跑FP16、FP4这种AI常用的低精度计算,差距还能拉得更大。
但问题是,算力再高,模型加载不进去,啥用都没有。
5090的显存是32G,听着不小对吧?算个最实在的账:70B参数的大模型,就算用最省空间的4位量化,光加载模型权重就要32.6G——刚好多出0.6G,直接爆显存,连启动都做不到。你算力再强,也是拳头打在棉花上,使不上劲。
反倒是那款2万块的迷你主机,板载128G统一内存——就是CPU和显卡共用内存的架构,苹果M系列已经玩了好多年,现在AMD、Intel、高通甚至英伟达自己的专业计算卡都在跟进。想给AI分多少内存就分多少,别说70B模型,就算塞个更大的,只要总内存够就能跑,价格还比5090便宜一万块,怎么看都划算。
别着急下单,统一内存有个致命短板
看到这你是不是已经准备搜迷你主机链接了?等会,内存这东西从来不是只看大小的。
如果把内存比作装模型的仓库,容量就是仓库能放多少货,带宽就是仓库大门的宽度——你货存得再多,门窄到每次只能搬一个箱子,运输效率能高才怪。
这恰恰是统一内存的硬伤:5090的显存带宽有1792GB/s,而那款AMD迷你主机的内存带宽只有256GB/s,差了7倍都不止。
给不跑模型的朋友解释下:大模型每生成一个字(行业里叫Token),都需要把整个模型从内存里读出来算一遍。按256GB/s的带宽算,跑40G大小的模型,一秒钟最多读6次,也就是一秒钟只能蹦6个字——比我们平时手机打字还慢,长回复等得你能睡着。
就算是目前统一内存带宽顶格的苹果M3 Ultra,819GB/s的带宽一秒也就生成20个Token,跟5090的速度比差了一大截。这也是为啥现在高带宽HBM内存价格涨得离谱,全行业都在卡这个脖子。
当然也不是没有解法:现在的混合专家模型(MoE)就特别适配统一内存架构——这种模型不用每次读取全部参数,每次生成只需要激活一小部分“专家”模块。比如Qwen3-30B-A3B,看着是30B参数的模型,每次只激活3B参数,算下来每个字只需要读2G数据,在AMD迷你主机上一秒能生成100多个Token,速度跟云端模型差不多,完全能用。
但迷你主机的另一个坑躲不开:算力弱,处理长提示词特别慢。实测跑70B模型的时候,每秒只能处理95个提示词Token,你要是传个4000字的文档进去,得等40秒才能蹦出第一个字,要是塞个几万字的长上下文,等几十分钟都不奇怪。
这周两个戳中我的小细节
聊完硬核的硬件,说两个这周看到的有意思的内容。
一个是解决程序员千古难题的:布尔变量怎么起名?之前我写代码的时候,给布尔值起名能纠结五分钟,直到看到一个简单到离谱的规则:用四个前缀就够了——is形容状态(比如isActive),has形容包含关系(比如hasAccess),can形容能力权限(比如canEdit),should形容逻辑判断(比如shouldRetry)。
还有个铁则:别用否定词,别搞什么isDisabled、isNotError,绕两次判断就能把自己绕晕,亲测有效。
另一个是这周的科技圈小瓜:OpenAI出了个230美元的AI专用键盘,乔纳森主导设计的,一排快捷键管AI审批、语音输入,还有RGB灯带显示AI状态——我看完第一反应是,这东西值1600块?我99块的键盘设几个宏不能干?本来大家都盼着乔纳森能搞出下一个iPhone级的AI硬件,结果先掏出来个换壳快捷键键盘,实在是有点失望。
哦对还有两个浪漫又提气的事:天问二号飞了400天,终于追到了2016HO3小行星,那个小行星才20米长,半个篮球场大,探测器的翼展都有15米,相当于开着一辆大货车去捡一个小石子,还不能把石子碰飞,难度真的拉满了;还有个荷兰设计师做了台阳台风力编织机,靠风吹就能自动织织物,浪漫归浪漫,就是不知道刮台风的时候会不会直接织出个麻袋。
最后说句实在话,现在别信什么“几千块实现本地大模型自由”的鬼话。
不管是贵的独立显卡,还是性价比高的统一内存迷你主机,本质上都是在容量和速度之间做权衡:选显卡速度快但装不下大模型,选迷你主机装得下但速度慢。现阶段也就跑跑中等规模的MoE模型,真要舒舒服服用本地大模型,还得等内存技术再迭代个两三年——毕竟现在的硬件,离大家想要的“自由”,还差得远呢。(全文约1460字)





