先說正常情況。Gemma 4 26B 是 Google 的 260 億參數模型。以 16-bit 精度儲存,光是權重就要 50GB 記憶體。即使量化到 4-bit,也需要約 14–18GB RAM 才能載入,再加上 KV Cache 跟 overhead,8GB MacBook Air 根本沒有機會。
然後 turbo-fieldfare 出現了。
2026 年 7 月 17 日,GitHub 用戶 drumih 推出這個從頭寫起的推理引擎,描述只有一句話:「Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook.」 7 月 29 日的 HN Show 帖子拿到 893 點、328 則留言,登上首頁。Better Stack 的 YouTube 教學影片在一個月內累積超過 16 萬次觀看。
它不是 llama.cpp 的 patch,也不是 MLX 的 wrapper——是 Swift 6.2 + Metal 4 完全重寫,專為 Apple Silicon 的統一記憶體架構設計。
要理解為什麼 2GB 可行,需要先了解 Gemma 4 的架構特性。
Gemma 4 26B 採用 MoE 架構:雖然總參數有 260 億,但每次生成一個 token 時,模型只會「路由」到約 3.88B 活躍參數(Active Parameters)。其餘的「專家(experts)」在那個 token 的計算中完全不需要。
這是 turbo-fieldfare 的切入點:既然一次只用一部分專家,就把用不到的專家放在 SSD,需要時才串流進來。
這個設計在傳統 PC 上行不通,原因有三:
.gturbo 格式,GPU 可直接讀取 SSD 資料,跳過 CPU 中轉# 確認 macOS 版本(需要 26.0 以上)
sw_vers
# 確認 Xcode Command Line Tools
xcode-select --version
# 確認 Swift 版本(需要 6.2 以上)
swift --version
若 Xcode 版本不足,前往 App Store 更新至 Xcode 26。
# Clone repo
git clone https://github.com/drumih/turbo-fieldfare.git
cd turbo-fieldfare
# 建置 Release 版本(約 2–5 分鐘)
swift build -c release
# 確認建置成功
ls .build/release/turbo-fieldfare
第一次建置會下載 Swift Package 依賴,需要網路連線。建置完成後執行檔約 12 MB。
# 使用內建安裝指令下載並轉換模型
.build/release/turbo-fieldfare install gemma4-26b-it
# 安裝進度會顯示百分比
# 預設安裝至 ~/.turbo-fieldfare/models/
# 視網速,約需 15–40 分鐘
模型以自訂 .gturbo 格式儲存,這是針對 Metal GPU 直讀優化的格式,比標準 GGUF 在 Apple Silicon 上快約 20%。
# 啟動互動式對話
.build/release/turbo-fieldfare chat gemma4-26b-it
# 輸出範例:
# Loading model... (2.1 GB resident)
# Model ready. Type your message:
# > 用繁體中文解釋 Mixture of Experts 架構
首次啟動需要約 10–15 秒載入 Shared Expert 到記憶體。後續對話啟動只需 2–3 秒。
# 啟動 OpenAI 相容 API 伺服器(預設 port 8080)
.build/release/turbo-fieldfare serve gemma4-26b-it --port 8080
# 測試 API
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4-26b-it",
"messages": [{"role": "user", "content": "Hello"}],
"max_tokens": 100
}'
API 伺服器完全相容 OpenAI Chat Completions 格式,可直接替換任何使用 openai SDK 的專案。
以下數據來自 turbo-fieldfare 官方 repo 與社群實測(2026 年 7–8 月):
| 硬體 | RAM | Decode 速度 | 記憶體佔用 | 適合程度 |
|---|---|---|---|---|
| M2 MacBook Air 8GB | 8GB | 5.1–6.3 tok/s | ~2.1 GB | ✅ 完全可用 |
| M2 MacBook Air 16GB | 16GB | 6.5–8 tok/s | ~2.1 GB | ✅ 推薦 |
| M3 MacBook Pro 16GB | 16GB | 10–14 tok/s | ~2.1 GB | ✅ 推薦 |
| M3 Max MacBook Pro | 36GB+ | 23 tok/s | ~2.1 GB | 🔥 極佳 |
| M4 MacBook Air 16GB | 16GB | 14–18 tok/s(預估) | ~2.1 GB | ✅ 推薦 |
| Intel Mac | 任意 | 不支援 | — | ❌ 不支援 |
| 工具 | 最小 RAM | 速度(8GB M2) | 支援模型 | 安裝難度 | 開源授權 |
|---|---|---|---|---|---|
| turbo-fieldfare | 8GB(RAM 佔用 ~2GB) | 5–6 tok/s | Gemma 4 26B 專用 | 中(需 Xcode 26) | Apache 2.0 |
| Ollama | 8GB(7B 模型)/ 32GB(26B 模型) | 7B: 15–25 tok/s | 400+ 模型 | 低(一行安裝) | MIT |
| LM Studio | 8GB(7B 模型) | 7B: 12–20 tok/s | GGUF 模型廣泛 | 低(GUI) | 免費閉源 |
| omlx | 8GB(7B)/ 16GB(13B) | 更快(continuous batching) | 多模型支援 | 中 | Apache 2.0 |
| MLX(Apple 官方) | 16GB(26B 模型) | 26B: 10–15 tok/s | 廣泛支援 | 中(Python) | MIT |
結論: turbo-fieldfare 的定位非常明確——「在 8GB 機器上跑 26B 模型」這件事,它是唯一選項。如果你有 32GB+ RAM,直接用 Ollama 或 MLX 體驗更好、速度更快、模型選擇更多。
公司合約、個人稅務文件、醫療資料——這些東西你不想傳到雲端。turbo-fieldfare 讓 8GB M2 Air 就能在本機完成文件摘要、翻譯、敏感資訊識別,全程離線,資料不出本地。
# 本機處理文件範例
curl http://localhost:8080/v1/chat/completions \
-d '{
"messages": [{
"role": "user",
"content": "以下是一份合約,請用繁體中文摘要主要條款:\n\n[合約內容貼上]"
}]
}'
出差、飛機上、咖啡廳 WiFi 不穩——只要模型載好,turbo-fieldfare 完全離線運作。對於需要 AI 輔助但網路不穩定的場景,這是最可靠的備選方案。
大學實驗室、AI 課程教學、研究機構——不需要 GPU 伺服器,每個學生的 MacBook Air 都能跑 26B 模型進行實驗。大幅降低 AI 研究的硬體門檻。
初稿、分類、格式化等低複雜度任務 → 路由至本機 turbo-fieldfare(零成本)
複雜推理、代碼生成、長文撰寫 → 路由至 Claude Sonnet 5 API($2/MTok)
# 簡單路由邏輯範例(Python)
def route_request(prompt: str, complexity: str):
if complexity == "low":
# 本機 turbo-fieldfare,零 token 費用
return call_local_api("http://localhost:8080", prompt)
else:
# Claude Sonnet 5,$2/$10 per MTok
return call_claude_api(prompt)
turbo-fieldfare 的 API 伺服器完全相容 OpenAI 格式,可以在 Claude Code 的 CLAUDE.md 中設定 custom model endpoint,讓低複雜度任務走本機推理節省 token 費用:
# CLAUDE.md 設定範例
## 本機模型路由設定
- 簡單摘要、格式化任務 → local_gemma4(localhost:8080)
- 代碼生成、複雜推理 → claude-sonnet-5(預設)
## 連接本機模型
export OPENAI_API_BASE="http://localhost:8080/v1"
export OPENAI_API_KEY="local-no-auth-needed"
# 建立 macOS launchd plist 讓服務開機自啟
cat > ~/Library/LaunchAgents/com.turbo-fieldfare.plist << 'EOF'
<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE plist PUBLIC "-//Apple//DTD PLIST 1.0//EN"
"http://www.apple.com/DTDs/PropertyList-1.0.dtd">
<plist version="1.0">
<dict>
<key>Label</key>
<string>com.turbo-fieldfare</string>
<key>ProgramArguments</key>
<array>
<string>/path/to/turbo-fieldfare/serve</string>
<string>gemma4-26b-it</string>
</array>
<key>RunAtLoad</key>
<true/>
</dict>
</plist>
EOF
launchctl load ~/Library/LaunchAgents/com.turbo-fieldfare.plist
8GB M2 Air 跑 turbo-fieldfare 雖然可行,但速度有限。如果你的工作流程需要更高吞吐量,DigitalOcean GPU Droplet 提供 A100 / H100 按小時計費,不用買硬體就能跑 26B 全精度模型。
🚀 DigitalOcean 免費試用 $200 點數Ollama 是通用型 LLM 管理工具,支援數百個模型,採用 llama.cpp 後端,需要足夠 RAM 載入完整模型。turbo-fieldfare 是針對 Gemma 4 MoE 架構從頭設計的單一目的引擎,利用 MoE 的稀疏性把 97% 的模型放在 SSD,這是 Ollama 沒有做到的事。代價是只支援 Gemma 4 26B 這一個模型。
取決於用途。對話場景(人類閱讀速度)完全夠用,每秒大約 1 個字。但用來生成長篇代碼或文章,需要等待 1–2 分鐘。若你的主要需求是高吞吐量批次處理,這個速度不理想,建議用雲端 API 或 omlx(如果是 Apple Silicon LLM 伺服器需求)。
macOS 26(預計 2026 年秋季正式發佈)的 Metal 4 是必要條件,turbo-fieldfare 使用了 Metal 4 的 GPU 直接 SSD 讀取功能,在更舊的 macOS 上無法啟用。目前若要試用,需要安裝 macOS 26 Beta。穩定版本發布後建議升級再安裝。
根據 researcher R176 的資料,Gemma 4 26B 的 benchmark 成績大約相當於 2025 年底–2026 年初的中端模型(比 Claude Sonnet 4.6 稍弱,比 GPT-4o mini 強)。2026 年 8 月的「舊 SOTA」水準,但對本機離線使用已非常充足。中文能力:turbo-fieldfare 的 tokenizer 對中文膨脹幾乎為 0,對中文使用者友善。
完全可以。模型一旦安裝到 ~/.turbo-fieldfare/models/,之後所有推理都是純本機運算,不需要任何網路連線。這是 turbo-fieldfare 相對雲端 API 最大的優勢之一。
有,但需要額外安裝 Image Pack(+1.1 GB)。安裝指令:turbo-fieldfare install gemma4-26b-it --with-image。安裝後可以傳入圖片 URL 或 base64 資料進行視覺理解任務。
DataCamp 有完整的 LLM 基礎課程,涵蓋 Transformer 架構、量化技術(4-bit / 8-bit GGUF)、MoE 原理,讓你真正理解 turbo-fieldfare 背後的技術原理。
📖 DataCamp 免費試用 7 天 查看 AI/ML 課程目錄結合 turbo-fieldfare 本機推理 + Claude Code 的完整 AI 開發工作流程。10 個技能模組 + 30 個 Starter Prompts,直接整合進你的 Claude Code 設定。
🛍️ 在 Gumroad 查看