本地 AI 工作负载
用 Mac mini 跑本地大模型:怎么判断配置够不够?
不要从单一 AI 分数开始。模型文件、量化、上下文、并发、运行工具和工作流决定是否装得下、是否好用。
简短结论
先算容量:模型权重与上下文必须留在统一内存内;装得下以后,再看带宽、GPU、存储和持续运行。小模型不需要 Mac Studio,大模型也不能只靠更快芯片解决。
容量是硬门槛
统一内存需要同时容纳模型权重、KV Cache、系统与其他应用。只看参数量不够,还要看实际模型文件和量化。
速度来自不同环节
模型装下后,内存带宽主要影响逐 token 生成;GPU 计算更影响提示词预填、视觉与部分并行任务;持续负载还要看散热与功耗。
Agent 与 RAG 会增加余量需求
长上下文、工具调用、索引、多个会话、IDE 与浏览器并行会共同占用内存,不能按裸模型权重买到刚好。
本地与云端分开判断
隐私、离线、延迟或长期成本要求本地时,硬件更重要;主要使用云 API 时,本地峰值性能未必改变实际体验。
按模型与工作流计算
填写模型、量化、上下文、运行工具和并发,查看最低安全配置。