自架 AI 全家桶實戰筆記

自架 AI 全家桶實戰筆記

📌 本文重點

  • 用舊 PC 搭建「迷你雲端 + 本地 AI」
  • 利用 Self-Hosting Guide 系統化部署 LLM 與自動化
  • 透過 WireGuard 打通安全的遠端存取通道

一句話定位:這是一份幫你在家搭一個「迷你雲端 + AI 環境」的說明書,從本地 LLM、家用自動化到安全遠端存取,一套打包。

主角是 GitHub 上超熱門的自架指南專案 mikeroyal/Self-Hosting-Guide,它像是一本持續更新的「自建 IT 生態系手冊」,你可以照著它,把一台舊 PC 變成自己的 AI 內網與家庭雲。

下面會聚焦三件跟你最有關的事:

  • 怎麼選、怎麼跑本地 LLM(含硬體需求)
  • 怎麼把模型接進自動化管線(Home Assistant、開發工具、自架 Git)
  • 怎麼用 WireGuard 之類方案,讓整套系統能安全地從外面連回家

最後會給一條「懶人起手路線」,照做就能在一個週末搭起初版 AI 內網。


核心功能 1:幫你選與部署本地 LLM

Self-Hosting Guide 做的事:把本地部署 LLM 的選項、硬體需求、工具鏈整理好,讓你不用從 Reddit、HN 一篇篇啃。

1.1 怎麼挑模型?

日常自用、寫程式或辦公,其實不必直接上 70B 巨獸。你可以用這份指南搭配社群經驗,先鎖定幾種典型選項:

名稱 核心功能 免費方案 適合誰
Qwen / LLaMA 系列 Q4 量化 通用聊天、程式輔助 開源模型免費 想把 GPT/Claude 部分換成本地的人
中小型 7B-14B 模型 簡單對話、個人筆記、RAG 多數開源 硬體普通的家用機
27B–32B 模型(如 Qwen3.6-27B) 強一點的程式與長文理解 模型免費,但吃資源 有 RTX 3090 級 GPU 的進階玩家

在 Reddit 的 Qwen3.6-27B 優化案例 中,有人用 RTX 3090 + kvflash 把:

  • token 生成速度提升到約 38.6 tok/s
  • KV cache VRAM 從 ~21GB 降到 ~17.5GB

💡 關鍵: 單張 RTX 3090 透過 kvflash 等優化就能流暢跑 27B 級模型,讓「高階單卡跑大模型」變成實務選項。

這代表:

  • 高階單卡也能跑 27B 模型
  • 只要配置得當,日常 coding/聊天其實很順

你可以馬上做的事:

  1. 先確認自己 GPU:
  2. 無 GPU / Intel NUC / 家用舊機 → 目標 7B 量化模型
  3. RTX 3060-3070 → 13B 或 14B 模型
  4. RTX 3090 / 4090 → 可以嘗試 27B 以上(搭配量化 + KV 優化)
  5. 打開 Self-Hosting Guide 的 LLM 章節,挑一套部署方案:
  6. 想圖形化、簡單管理 → 找「Docker + Web UI」路線
  7. 想自己玩細節 → 找 vLLM / text-generation-inference 等關鍵字

1.2 必備工具:Ollama / LM Studio / vLLM

本地 LLM 生態裡,以下幾種工具是常見組合(指南裡也有提到相關堆疊):

名稱 核心功能 免費方案 適合誰
Ollama 一行指令拉模型、啟動本地 API 完全免費 想快速起一個 ChatGPT 替代的人
LM Studio 有 UI 的模型下載與啟動器 免費客戶端 不熟 CLI 的使用者
vLLM 高效推理框架,支援長上下文、KV 優化 開源 想追求高吞吐、寫服務端的工程師

你可以馬上做的事(以 Ollama 為例):

  1. 在你的 Linux / macOS / Windows 安裝 Docker(或直接安裝 Ollama):
    bash
    curl -fsSL https://ollama.com/install.sh | sh
  2. 拉一個通用聊天模型(例如 qwen:7b):
    bash
    ollama pull qwen:7b
    ollama run qwen:7b
  3. 開啟瀏覽器,接一個簡單 Web UI(比如 Open WebUI 或指南中的前端項目),就有本地 Chat。

核心功能 2:把模型接進自動化管線

只在終端機裡跟模型聊天很快會膩,Self-Hosting Guide 的價值是教你:怎麼讓模型變成你家裡與工作流的一部分

2.1 家用場景:結合 Home Assistant

指南中有完整一章介紹 Home Assistant,你可以這樣用:

  • 讓 LLM 幫你:
  • 轉換你說出的自然語言成自動化指令(例如:「我出門了」→ 關燈 + 關冷氣 + 啟動警報)
  • 設計複雜條件自動化(比如天氣 + 家人是否在家 + 時間條件)

你可以馬上做的事:

  1. 在家裡一台常開機器(NUC/舊 PC)裝好 Docker。
  2. 依照指南,跑起 Home Assistant Docker 容器。
  3. 把本地 LLM 提供的 API(例如 Ollama 預設在 http://localhost:11434)接進 Home Assistant
  4. 透過 Home Assistant 的 REST / Webhook 自定義整合
  5. 或查指南中列出的 LLM 插件項目,選現成方案

這樣就能做到:「家裡的自動化規則,全部走本地,不往外傳」。

💡 關鍵: 把 Home Assistant 與本地 LLM 串起來,就能在完全離線的情況下,用自然語言控制整個智慧家居。

2.2 工作場景:自架開發工具 + Git 服務

Hacker News 上有不少人分享,已經用本地模型取代部分 GPT/Claude 的日常 coding(參考:Ask HN: Has anyone replaced Claude/GPT with a local model for daily coding?)。Self-Hosting Guide 把這些需求拆成幾件事:

  • 自架 Git 服務(例如 Gitea
  • 自架 Code Review / CI 工具
  • 本地 LLM 提供程式輔助、摘要、Code Review

你可以馬上做的事:

  1. 按指南起一個 Gitea / GitLab Self-Hosted
  2. 管理自己專案
  3. 把程式碼全部留在家裡伺服器
  4. 啟動一個專門幫你寫程式的本地模型(例如 13B 量化模型):
  5. VS Code / Neovim 插件,把 LLM API 指到你的本地網址
  6. 讓「Copilot 類功能」完全在你自家網路裡運行

核心功能 3:用 WireGuard 打通「安全外網」

你在家裡搭了一堆服務(LLM、Home Assistant、Git),下一步就是:如何在外面(公司、咖啡店)也能安全用到?

Self-Hosting Guide 花了不少篇幅介紹 WireGuard,重點是:

  • 比傳統 VPN 設定簡單
  • 效能好、延遲低
  • 適合「家裡一台主機 + 多台手機/筆電」的拓撲

你可以馬上做的事:

  1. 按指南在家用伺服器上安裝 WireGuard
    bash
    sudo apt install wireguard
  2. 建立一個基本設定(指南裡有範本):
  3. 伺服器端設定 IP 範圍(例如 10.0.0.1/24
  4. 每台裝置一組 key
  5. 在手機、筆電裝 WireGuard App,把設定檔匯入。
  6. 測試從外網連回家裡的 Home Assistant / LLM Web UI:
  7. 確認只透過 VPN 通道能接入
  8. 不把服務直接暴露在公網

這樣做完,你就可以在外面用自己的「家用 GPT」,而不怕資料跑到第三方。

💡 關鍵: 用 WireGuard 把家裡變成「只給自己與信任設備開放」的私人雲端,比直接開公網埠安全太多。


適合誰用?幾個具體情境

1. 家裡有一台舊電腦,想做點有趣但不想再裝一堆雲服務的人

  • 把它變成:NAS + LLM + Home Assistant 的整合機
  • 儲存相片、影音,順便當你的「家庭 ChatGPT」

2. 想降低雲端 LLM 成本的開發者 / 早期團隊

  • 常用功能(例如程式補全、文件摘要)搬回本地
  • 只在需要強模型時才連外部 API

3. 對隱私敏感的自由工作者 / 企業

  • 客戶文件、程式碼不想上雲端
  • 自己管理整個資料與模型環境

4. 喜歡折騰硬體與自動化的玩家

  • 把 Home Assistant + LLM 玩到極致
  • 用 WireGuard 把家當作自己的「個人雲端」。

怎麼開始:一週末搞定的懶人路線

最後總結一條 「起手路線」,照著走就能搭出你的第一版 AI 內網。

Step 0:準備一台舊機 + Docker

  • CPU:近 5 年內的桌機或筆電
  • RAM:至少 16GB
  • GPU:沒有也行(先跑 7B 小模型),有 RTX 3060 以上更好
  • OS:建議 Ubuntu Server / Debian
  • 安裝 Docker + docker-compose

Step 1:部署 1 個聊天模型(Ollama)

  1. 安裝 Ollama(或依照 Self-Hosting Guide 中的建議):
    bash
    curl -fsSL https://ollama.com/install.sh | sh
  2. 拉一個通用模型(例如 llama3:8bqwen:7b):
    bash
    ollama pull llama3:8b
  3. 啟動並確認能在瀏覽器/CLI 聊天。

Step 2:部署 1 個文件 / RAG 服務

  1. 選一個簡單 RAG 專案(例如指南裡推薦的開源 RAG Web UI):
  2. 用 Docker 起一個 Web 服務
  3. 把本地 PDF / Markdown 丟進去建立索引
  4. 把 RAG 的 LLM 後端指向 Ollama 的 API:
  5. 在設定頁填入 http://host.docker.internal:11434 或你的本地 IP
  6. 測試:輸入「幫我整理公司 A 專案會議紀錄」,看回答是否依據你的文件。

Step 3:逐步擴展成「個人 AI 內網」

每成功一小步,就再加一個服務:

  1. 接 Home Assistant:
  2. 先只用它做幾條簡單自動化(睡前關燈、出門關冷氣)
  3. 再讓 LLM 參與規則設計與自然語言控制
  4. 接開發工具:
  5. VS Code 裝支援自定義 LSP / LLM 的插件
  6. 把 endpoint 指向你本地 LLM
  7. 最後再加上 WireGuard
  8. 把整套「迷你雲端」安全地帶出門用

整個過程不用一次到位,只要跟著 Self-Hosting Guide 的章節,一個一個勾:

  • LLM → Automation → Home Assistant → WireGuard → 其他服務

做完,你就會有一個完全掌控、可隨時擴充的「自架 AI 全家桶」。


如果你一直想把 GPT 類工作能力留在自己家裡,這份 Self-Hosting Guide 值得直接 Star 收藏,照著它,一台舊機 + 一個週末,就能搭出你的第一個「個人 AI 內網」。

🚀 你現在可以做的事

  • 打開 Self-Hosting Guide,先 Star 並閱讀 LLM 相關章節
  • 在一台舊電腦上安裝 Docker + Ollama,實際跑起一個 7B 模型試用
  • 依照指南部署 Home Assistant 與 WireGuard,把本地 LLM 串進家庭自動化與遠端存取

留言

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *