📌 本文重點
- 用舊 PC 搭建「迷你雲端 + 本地 AI」
- 利用 Self-Hosting Guide 系統化部署 LLM 與自動化
- 透過 WireGuard 打通安全的遠端存取通道
一句話定位:這是一份幫你在家搭一個「迷你雲端 + AI 環境」的說明書,從本地 LLM、家用自動化到安全遠端存取,一套打包。
主角是 GitHub 上超熱門的自架指南專案 mikeroyal/Self-Hosting-Guide,它像是一本持續更新的「自建 IT 生態系手冊」,你可以照著它,把一台舊 PC 變成自己的 AI 內網與家庭雲。
下面會聚焦三件跟你最有關的事:
- 怎麼選、怎麼跑本地 LLM(含硬體需求)
- 怎麼把模型接進自動化管線(Home Assistant、開發工具、自架 Git)
- 怎麼用 WireGuard 之類方案,讓整套系統能安全地從外面連回家
最後會給一條「懶人起手路線」,照做就能在一個週末搭起初版 AI 內網。
核心功能 1:幫你選與部署本地 LLM
Self-Hosting Guide 做的事:把本地部署 LLM 的選項、硬體需求、工具鏈整理好,讓你不用從 Reddit、HN 一篇篇啃。
1.1 怎麼挑模型?
日常自用、寫程式或辦公,其實不必直接上 70B 巨獸。你可以用這份指南搭配社群經驗,先鎖定幾種典型選項:
| 名稱 | 核心功能 | 免費方案 | 適合誰 |
|---|---|---|---|
| Qwen / LLaMA 系列 Q4 量化 | 通用聊天、程式輔助 | 開源模型免費 | 想把 GPT/Claude 部分換成本地的人 |
| 中小型 7B-14B 模型 | 簡單對話、個人筆記、RAG | 多數開源 | 硬體普通的家用機 |
| 27B–32B 模型(如 Qwen3.6-27B) | 強一點的程式與長文理解 | 模型免費,但吃資源 | 有 RTX 3090 級 GPU 的進階玩家 |
在 Reddit 的 Qwen3.6-27B 優化案例 中,有人用 RTX 3090 + kvflash 把:
- token 生成速度提升到約 38.6 tok/s
- KV cache VRAM 從 ~21GB 降到 ~17.5GB
💡 關鍵: 單張 RTX 3090 透過 kvflash 等優化就能流暢跑 27B 級模型,讓「高階單卡跑大模型」變成實務選項。
這代表:
- 高階單卡也能跑 27B 模型
- 只要配置得當,日常 coding/聊天其實很順
你可以馬上做的事:
- 先確認自己 GPU:
- 無 GPU / Intel NUC / 家用舊機 → 目標 7B 量化模型
- RTX 3060-3070 → 13B 或 14B 模型
- RTX 3090 / 4090 → 可以嘗試 27B 以上(搭配量化 + KV 優化)
- 打開 Self-Hosting Guide 的 LLM 章節,挑一套部署方案:
- 想圖形化、簡單管理 → 找「Docker + Web UI」路線
- 想自己玩細節 → 找
vLLM/text-generation-inference等關鍵字
1.2 必備工具:Ollama / LM Studio / vLLM
本地 LLM 生態裡,以下幾種工具是常見組合(指南裡也有提到相關堆疊):
| 名稱 | 核心功能 | 免費方案 | 適合誰 |
|---|---|---|---|
Ollama |
一行指令拉模型、啟動本地 API | 完全免費 | 想快速起一個 ChatGPT 替代的人 |
LM Studio |
有 UI 的模型下載與啟動器 | 免費客戶端 | 不熟 CLI 的使用者 |
vLLM |
高效推理框架,支援長上下文、KV 優化 | 開源 | 想追求高吞吐、寫服務端的工程師 |
你可以馬上做的事(以 Ollama 為例):
- 在你的 Linux / macOS / Windows 安裝 Docker(或直接安裝
Ollama):
bash
curl -fsSL https://ollama.com/install.sh | sh - 拉一個通用聊天模型(例如
qwen:7b):
bash
ollama pull qwen:7b
ollama run qwen:7b - 開啟瀏覽器,接一個簡單 Web UI(比如
Open WebUI或指南中的前端項目),就有本地 Chat。
核心功能 2:把模型接進自動化管線
只在終端機裡跟模型聊天很快會膩,Self-Hosting Guide 的價值是教你:怎麼讓模型變成你家裡與工作流的一部分。
2.1 家用場景:結合 Home Assistant
指南中有完整一章介紹 Home Assistant,你可以這樣用:
- 讓 LLM 幫你:
- 轉換你說出的自然語言成自動化指令(例如:「我出門了」→ 關燈 + 關冷氣 + 啟動警報)
- 設計複雜條件自動化(比如天氣 + 家人是否在家 + 時間條件)
你可以馬上做的事:
- 在家裡一台常開機器(NUC/舊 PC)裝好 Docker。
- 依照指南,跑起
Home AssistantDocker 容器。 - 把本地 LLM 提供的 API(例如
Ollama預設在http://localhost:11434)接進Home Assistant: - 透過
Home Assistant的 REST / Webhook 自定義整合 - 或查指南中列出的 LLM 插件項目,選現成方案
這樣就能做到:「家裡的自動化規則,全部走本地,不往外傳」。
💡 關鍵: 把 Home Assistant 與本地 LLM 串起來,就能在完全離線的情況下,用自然語言控制整個智慧家居。
2.2 工作場景:自架開發工具 + Git 服務
Hacker News 上有不少人分享,已經用本地模型取代部分 GPT/Claude 的日常 coding(參考:Ask HN: Has anyone replaced Claude/GPT with a local model for daily coding?)。Self-Hosting Guide 把這些需求拆成幾件事:
- 自架 Git 服務(例如
Gitea) - 自架 Code Review / CI 工具
- 本地 LLM 提供程式輔助、摘要、Code Review
你可以馬上做的事:
- 按指南起一個
Gitea/GitLab Self-Hosted: - 管理自己專案
- 把程式碼全部留在家裡伺服器
- 啟動一個專門幫你寫程式的本地模型(例如 13B 量化模型):
- 用
VS Code/Neovim插件,把 LLM API 指到你的本地網址 - 讓「Copilot 類功能」完全在你自家網路裡運行
核心功能 3:用 WireGuard 打通「安全外網」
你在家裡搭了一堆服務(LLM、Home Assistant、Git),下一步就是:如何在外面(公司、咖啡店)也能安全用到?
Self-Hosting Guide 花了不少篇幅介紹 WireGuard,重點是:
- 比傳統 VPN 設定簡單
- 效能好、延遲低
- 適合「家裡一台主機 + 多台手機/筆電」的拓撲
你可以馬上做的事:
- 按指南在家用伺服器上安裝
WireGuard:
bash
sudo apt install wireguard - 建立一個基本設定(指南裡有範本):
- 伺服器端設定 IP 範圍(例如
10.0.0.1/24) - 每台裝置一組 key
- 在手機、筆電裝
WireGuardApp,把設定檔匯入。 - 測試從外網連回家裡的 Home Assistant / LLM Web UI:
- 確認只透過 VPN 通道能接入
- 不把服務直接暴露在公網
這樣做完,你就可以在外面用自己的「家用 GPT」,而不怕資料跑到第三方。
💡 關鍵: 用 WireGuard 把家裡變成「只給自己與信任設備開放」的私人雲端,比直接開公網埠安全太多。
適合誰用?幾個具體情境
1. 家裡有一台舊電腦,想做點有趣但不想再裝一堆雲服務的人
- 把它變成:NAS + LLM + Home Assistant 的整合機
- 儲存相片、影音,順便當你的「家庭 ChatGPT」
2. 想降低雲端 LLM 成本的開發者 / 早期團隊
- 常用功能(例如程式補全、文件摘要)搬回本地
- 只在需要強模型時才連外部 API
3. 對隱私敏感的自由工作者 / 企業
- 客戶文件、程式碼不想上雲端
- 自己管理整個資料與模型環境
4. 喜歡折騰硬體與自動化的玩家
- 把 Home Assistant + LLM 玩到極致
- 用 WireGuard 把家當作自己的「個人雲端」。
怎麼開始:一週末搞定的懶人路線
最後總結一條 「起手路線」,照著走就能搭出你的第一版 AI 內網。
Step 0:準備一台舊機 + Docker
- CPU:近 5 年內的桌機或筆電
- RAM:至少 16GB
- GPU:沒有也行(先跑 7B 小模型),有
RTX 3060以上更好 - OS:建議
Ubuntu Server/Debian - 安裝 Docker +
docker-compose
Step 1:部署 1 個聊天模型(Ollama)
- 安裝
Ollama(或依照 Self-Hosting Guide 中的建議):
bash
curl -fsSL https://ollama.com/install.sh | sh - 拉一個通用模型(例如
llama3:8b或qwen:7b):
bash
ollama pull llama3:8b - 啟動並確認能在瀏覽器/CLI 聊天。
Step 2:部署 1 個文件 / RAG 服務
- 選一個簡單 RAG 專案(例如指南裡推薦的開源 RAG Web UI):
- 用 Docker 起一個 Web 服務
- 把本地 PDF / Markdown 丟進去建立索引
- 把 RAG 的 LLM 後端指向
Ollama的 API: - 在設定頁填入
http://host.docker.internal:11434或你的本地 IP - 測試:輸入「幫我整理公司 A 專案會議紀錄」,看回答是否依據你的文件。
Step 3:逐步擴展成「個人 AI 內網」
每成功一小步,就再加一個服務:
- 接 Home Assistant:
- 先只用它做幾條簡單自動化(睡前關燈、出門關冷氣)
- 再讓 LLM 參與規則設計與自然語言控制
- 接開發工具:
- 在
VS Code裝支援自定義 LSP / LLM 的插件 - 把 endpoint 指向你本地 LLM
- 最後再加上
WireGuard: - 把整套「迷你雲端」安全地帶出門用
整個過程不用一次到位,只要跟著 Self-Hosting Guide 的章節,一個一個勾:
- LLM → Automation → Home Assistant → WireGuard → 其他服務
做完,你就會有一個完全掌控、可隨時擴充的「自架 AI 全家桶」。
如果你一直想把 GPT 類工作能力留在自己家裡,這份 Self-Hosting Guide 值得直接 Star 收藏,照著它,一台舊機 + 一個週末,就能搭出你的第一個「個人 AI 內網」。
🚀 你現在可以做的事
- 打開 Self-Hosting Guide,先 Star 並閱讀 LLM 相關章節
- 在一台舊電腦上安裝 Docker + Ollama,實際跑起一個 7B 模型試用
- 依照指南部署 Home Assistant 與 WireGuard,把本地 LLM 串進家庭自動化與遠端存取


發佈留言