📌 本文重點
- Unsloth Desktop 把筆電變成本地多模態 AI 伺服器
- 支援多 GPU / CPU,並提供 OpenAI 兼容 API
- 適合本地聊天助理、RAG、Agent 與多模態 Side Project
- 幾乎不改程式即可把既有 OpenAI workflow 搬到本機
用一句話定位:Unsloth Desktop 就是把你的筆電變成「小型 AI 伺服器 + 實驗室」的開源桌面工具,讓聊天、程式助理、RAG、影像與語音模型都能在本機跑起來。
工具來源:
– Reddit 介紹文:https://www.reddit.com/r/LocalLLaMA/comments/1vlj87v/introducing_unsloth_desktop_app/
– Product Hunt:https://www.producthunt.com/products/unsloth
核心功能:把「本地模型」變成可用的服務
下面三個功能,是你真的會用到、立刻能起手的重點。
1. 支援多種模型格式:MLX / diffusion / 語音 / GGUF
Unsloth Desktop 的定位不是「只跑 LLM」,而是一個多模態模型的統一入口:
- 語言模型:支援 GGUF(
llama.cpp系列)、MLX(Apple Silicon 上的高效框架) - 影像 / 視覺:支援 diffusion 影像 / 影片模型
- 語音:支援音訊模型(語音辨識、TTS 等)
你可以這樣開始行動:
- 安裝好 Unsloth 後,打開模型面板
- 選擇一個預設 GGUF LLM(例如
MiniMax-H3、Muse Glimmer) - 選一個簡單的 diffusion 模型(如 Stable Diffusion 系列)
- 在同一個介面裡,分別測試文字聊天和影像生成
這種「同一套操作邏輯管理多模態模型」的好處,是你不用在不同 CLI 工具之間切來切去,對 AI 新手非常友善。
2. 多 GPU & CPU 加速,本地推理真的跑得動
很多人「幻想」在筆電上跑模型,卡在效能與顯示記憶體。Unsloth Desktop 的重點是盡量把你手上的硬體吃乾抹淨:
- 支援多種 GPU:NVIDIA、AMD、Intel、Mac(含 Apple Silicon)
- 支援 CPU 推理:沒有獨顯也可以跑,只是速度會慢一些
- 對訓練 / 微調:標榜約 2 倍訓練速度、70% VRAM 節省(來源:官方 Reddit 介紹)
💡 關鍵: 大約 2 倍訓練速度與 70% VRAM 節省,代表同樣硬體上能跑更大模型或更多實驗。
你可以立刻做的事:
- 在設定頁面確認硬體偵測到的 GPU / CPU
- 選一個中型模型(例如
7B gguf),先跑一次聊天測試 - 觀察系統資源使用(macOS 的活動監視器、Windows 的工作管理員),確認真的有用到 GPU
如果你是 Mac 使用者,可以搭配像這篇關於 Apple Silicon + llama.cpp 的效能優化思路:https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md,來理解「為什麼在 M 系列晶片上跑本地 LLM 是可行的」。
3. OpenAI 兼容 API + 自我修復工具呼叫
Unsloth Desktop 最關鍵的功能,是把本地模型包成一個 OpenAI 兼容的 API:
- 提供 OpenAI-compatible endpoint(Unsloth Native)
- 可以同時串本地模型和雲端模型(例如 OpenAI、Anthropic 等),在同一個 API 層切換
- 內建「自我修復」的工具呼叫與沙盒化代碼執行:模型在呼叫外部工具或執行程式碼出錯時,可以自動重試 / 修正,同時把程式碼限制在安全環境裡
💡 關鍵: OpenAI 兼容 API 讓你幾乎不改程式碼,就能把原本的雲端 workflow 直接換成本地模型。
這讓你可以做幾件事:
- 把本地 LLM 當成 ChatGPT-compatible 的後端,接在現成客戶端(如
Chatbox、Continue、Open WebUI等) - 在 VS Code 旁邊跑自己的模型,搭配 Claude Code / Codex 類工具一起用
- 建立簡單 Agent:模型收到任務 → 呼叫系統工具或小腳本 → 在沙盒裡執行 → 回傳結果
適合誰用:三種典型場景
1. 本地聊天與程式助理:在 VS Code 旁跑自己的模型
如果你平常習慣用 Claude Code、Cursor 或 GitHub Copilot,想要多一個「完全不出機房」的備用助理,可以這樣玩:
- 把 Unsloth Desktop 裝在開發機上,啟動一個 GGUF LLM
- 用 VS Code 外掛或本地聊天客戶端,改成連至 Unsloth 的 OpenAI 兼容 API
- 寫程式時,用雲端模型做主力、遇到敏感專案(公司內網、客戶程式碼)就切到本地模型
具體行動建議:
- 選一套 ChatGPT-compatible 客戶端(例如
Continue或Chatbox) - 在其設定裡,把
api_base改成 Unsloth 提供的 endpoint(例如http://localhost:port/v1) - 選定模型名稱,例如
local-llm-7b,直接開始對話與程式補全
2. 私有資料實驗與原型:本機 RAG / Agent,不經雲端
很多團隊不敢把內部文件丟上雲端 RAG,Unsloth 提供了一條完全本地的實驗路線:
- 把公司或個人 PDF / Markdown / internal wiki 先處理成向量資料庫(自行寫腳本或用現成 RAG 套件)
- 模型端用 Unsloth 提供的本地 LLM API
- 在本機 web app 或小工具裡,做檢索 + 回答組合
可以這樣起手:
- 在你的後端(Node.js / Python)中,接 Unsloth 的 API 當成
chat/completions或responses來源 - 用如
n8n/LangChain/LlamaIndex這類工具,把「取文件片段 → 呼叫本地 LLM」串起來 - 先做一個只服務自己筆電的小型內部 FAQ Bot,再考慮用 Cloudflare Tunnels 把 Unsloth API 安全地開到公司內網(Unsloth 原文有提到 Cloudflare 保護連線)
3. 多模態 Side Project:影像生成、語音模型、簡單 Agent 工作流
如果你平常喜歡做 Side Project,Unsloth 可以當成你所有 AI 功能的統一後端:
- 用 diffusion 模型接一個「本地 Stable Diffusion 影像生成頁面」
- 用語音模型做「錄音 → 轉文字 → LLM 摘要 → TTS 回覆」的工作流
- 用 Agent 功能做一個「會自己跑
bash/Python腳本」的小助手,幫你整理檔案或抓網頁資料
具體行動:
- 在 Unsloth Desktop 裡啟動影像 + 語言 + 語音模型
- 在本地 web app(React / Vue / Svelte 任意)裡,統一呼叫同一個 API endpoint
- 利用工具呼叫與沙盒功能,設計幾個具體指令,例如「幫我整理
Downloads資料夾」或「抓這個網站最新 10 篇文章做摘要」
怎麼開始:從安裝到接上現有 workflow
1. 安裝:Mac / Windows / Linux 都有
Unsloth Desktop 是開源工具,支援三大桌面平台:
- Mac:適合 Apple Silicon,用 MLX 模型可以發揮硬體優勢
- Windows:多數開發者主力,適合接 NVIDIA / AMD GPU
- Linux:伺服器與進階用戶首選
行動步驟:
- 前往官網或 GitHub 下載最新版(可從 Product Hunt 連過去:https://www.producthunt.com/products/unsloth)
- 安裝並啟動,確認介面可以看到模型列表
- 在設定裡檢查硬體偵測與 API 設定(本地端口、是否啟用 OpenAI 兼容模式)
2. 跑起第一個 GGUF / MLX 模型
上手建議流程:
- 在介面中選擇一個輕量模型(例如
3B–7B GGUF),避免一開始就把 VRAM 撐爆 - 點選「啟動 / RUN」讓模型載入;等待載入完成
- 使用內建聊天介面,輸入一段問題(例如「幫我寫一個 Python 把 CSV 轉成 JSON 的程式」)
- 確認回答品質與速度,調整溫度、
max tokens等基本參數
若你是 Mac M 系列:
- 優先選 MLX 模型,在偏好設定裡確認使用 Apple GPU
- 對照前面的 Apple Silicon +
llama.cpp文章,思考是否要調整batch size等設定
3. 啟用 OpenAI 兼容 API:用 curl 測試
確認 API 真的跑起來,是往後串接 n8n / Zapier 的基礎。
假設 Unsloth 在本機開一個 http://localhost:8000/v1 的 API,可以這樣測:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_LOCAL_KEY" \
-d '{
"model": "local-llm-7b",
"messages": [
{"role": "user", "content": "幫我用 Python 寫一個排序函式"}
]
}'
你應該會拿到一個結構與 OpenAI 非常接近的 JSON 回應。確認:
model名稱是否正確- 是否需要 API key(有些版本可設定為無認證,只限本機)
💡 關鍵: 成功用
curl打通http://localhost:8000/v1/chat/completions,就代表之後的任何 OpenAI 客戶端幾乎都能直接改 endpoint 來使用本地模型。
4. 在 n8n / Zapier / 本地 web app 裡改掉 endpoint
最後一步,把你原本的 workflow 直接「搬家」到自己筆電上的 Unsloth。
以 n8n 為例:
- 找到原本呼叫 OpenAI 的 HTTP Request 節點
- 把 URL 從
https://api.openai.com/v1/chat/completions改成http://localhost:8000/v1/chat/completions - 把
Authorizationheader 改成對應的本地 key(或移除認證視你設定而定) - 保留原本的
messages結構,只把model改成 Unsloth 內的本地模型名稱
Zapier 類似做法:
- 若使用 Webhooks by Zapier,改成打本地 URL
- 若原本用的是 OpenAI 官方 integration,則改為自訂 webhook
對於自己寫的 web app:
- 在環境變數裡新增
OPENAI_BASE_URL=http://localhost:8000/v1 - 程式碼中使用
OPENAI_BASE_URL來組合 API URL,而不是寫死api.openai.com
這樣,你所有原本設計給 OpenAI / Claude 的 workflow,可以在幾乎不改程式的情況下,直接切到自己機器上的 Unsloth。本地 + 雲端混用時,只要切換 base URL 或 model 名稱,就能控制資料是否出機房。
簡短比較:Unsloth 與常見本地 LLM 工具差異
若你已經在用 Ollama、
llama.cpp,也可以把 Unsloth 當成「更偏向多模態與訓練、又有桌面介面」的補充工具。
| 名稱 | 核心功能 | 免費方案 | 適合誰 |
|---|---|---|---|
| Unsloth Desktop | 多模態模型管理 + 本地訓練 + OpenAI 兼容 API | 開源免費 | 想在筆電做本地 Agent、多模態實驗的開發者 |
| Ollama | 本地 LLM 管理與推理(重文字) | 開源免費 | 想快速跑文字模型、不需要訓練與多模態的人 |
llama.cpp |
低階 C++ 推理引擎(GGUF、效能優化) | 開源免費 | 有工程背景、願意自己包 API 的技術使用者 |
如果你想要一個「按裝置效能極限推到滿、又不必寫太多底層程式」的本地 AI 實驗室,Unsloth Desktop 是一個很實用的選擇:先讓它跑起一個本地 LLM,接上 OpenAI 兼容 API,然後把你現有的工作流一個一個搬過來,你就真正擁有了屬於自己的多模態 Agent 伺服器。
🚀 你現在可以做的事
- 前往 Product Hunt 或 GitHub 下載並安裝 Unsloth Desktop,啟動一個
7B gguf或 MLX 模型- 用
curl或你常用的 ChatGPT-compatible 客戶端,將api_base改成http://localhost:8000/v1測試本地 API- 挑一個現有用 OpenAI 的 workflow(如
n8n流程或小型 web app),只改 endpoint 與model名稱,把它搬到本機 Unsloth 上跑


發佈留言