本地跑大模型,2026年真的夠用了嗎?MS01 + MLX 實測報告
2026年了,本地跑大模型到底夠不夠用? 這個問題我自己問了很多次。答案是:看你用來幹什麼。 SFD 實驗室在今年初把一台 Apple M4 Max 配置的 Mac mini(MS01)專門留出來跑本地模型——mlx_lm 伺服器一直在跑,供各個 Agent 呼叫。三個月下來,哪些場景本地夠用、哪些必須走雲端 A…

2026年了,本地跑大模型到底夠不夠用?
這個問題我自己問了很多次。答案是:看你用來幹什麼。
SFD 實驗室在今年初把一台 Apple M4 Max 配置的 Mac mini(MS01)專門留出來跑本地模型——mlx_lm 伺服器一直在跑,供各個 Agent 呼叫。三個月下來,哪些場景本地夠用、哪些必須走雲端 API,我們積累了一批很實際的資料。
我們的本地推理設定
機器:Mac mini (M4 Max, 128GB統一記憶體)
推理框架:mlx_lm (Apple MLX)
服務:mlx_lm.server 監聽 8080 端口,對內網暴露 OpenAI 相容 API
當前載入模型:mlx-community/Qwen3-30B-A3B (MoE架構, 8bit量化)
備用模型:mlx-community/Llama-3.3-70B-Instruct-8bit
128GB 統一記憶體的關鍵優勢:LLM 跑模型是記憶體帶寬密集型任務,蘋果的統一記憶體讓 GPU 直接讀主記憶體,不像 PC 顯卡需要從 RAM 複製到 VRAM,這讓 M4 Max 的實際推理速度比理論參數看起來要快得多。
實測推理速度(2026年3月資料)
- Qwen3-30B MoE(8bit):約 45-60 tokens/s(日常對話任務)
- Llama-3.3-70B(8bit):約 18-25 tokens/s(較慢,但夠用於長文摘要)
- Qwen2.5-7B(4bit):約 120+ tokens/s(飛快,適合分類/短回答)
對比一下:GPT-4o 的回應延遲通常在 1-3 秒(含網路),生成速度約 60-80 tokens/s。也就是說,Qwen3-30B 在區域網路內的體驗已經接近 GPT-4o,延遲更低(沒有網路往返)。
哪些任務本地夠用
✅ 完全夠用(我們已經切換到本地):
- 文章摘要和總結(每天處理 30+ 篇,Qwen3-30B 品質穩定)
- 程式碼審查(Llama-3.3-70B 對 Python/JS 審查建議品質不輸 GPT-4 Turbo)
- 內部文件問答(RAG 場景,速度快隱私好)
- 日常短文寫作輔助(1000字以內)
- 資料分類和打標籤(批量任務,70B 準確率約 88-92%)
❌ 還是用雲端(差距明顯):
- 需要聯網即時資訊的任務
- 複雜程式碼生成(>200行,邏輯複雜)— Claude/GPT-4.1 明顯更好
- 多模態(截圖分析、圖文結合)— 本地視覺模型還差很多
- 需要 128K+ 超長上下文的任務
成本帳:本地 vs 雲端
我們每月通過雲端 API 的 token 消耗大約是 8,000 萬 tokens(14個 Agent 加起來)。如果全部走 Claude Sonnet 4,大概是 $400/月。
把能本地處理的任務切掉約 35%,每月 API 費用降到了約 $260。MS01 的電費算下來約 $15/月(M4 Max 功耗極低)。主要收益是延遲更低、隱私更好、不受 API 限流影響。
SFD編者注
如果你在考慮要不要買台 Mac mini 做本地推理伺服器:64GB 記憶體是起步門檻(能跑 34B 8bit),128GB 是舒適區(隨意切模型)。M4 Max 比 M3 Ultra 性價比高很多。唯一的坑:mlx_lm 不支援圖像生成(那是另一套 API),買之前想清楚你的主要用途。