標籤: 本地 LLM 教學

  • 自架 AI 全家桶實戰筆記

    自架 AI 全家桶實戰筆記

    📌 本文重點

    • 用舊 PC 搭建「迷你雲端 + 本地 AI」
    • 利用 Self-Hosting Guide 系統化部署 LLM 與自動化
    • 透過 WireGuard 打通安全的遠端存取通道

    一句話定位:這是一份幫你在家搭一個「迷你雲端 + AI 環境」的說明書,從本地 LLM、家用自動化到安全遠端存取,一套打包。

    主角是 GitHub 上超熱門的自架指南專案 mikeroyal/Self-Hosting-Guide,它像是一本持續更新的「自建 IT 生態系手冊」,你可以照著它,把一台舊 PC 變成自己的 AI 內網與家庭雲。

    下面會聚焦三件跟你最有關的事:

    • 怎麼選、怎麼跑本地 LLM(含硬體需求)
    • 怎麼把模型接進自動化管線(Home Assistant、開發工具、自架 Git)
    • 怎麼用 WireGuard 之類方案,讓整套系統能安全地從外面連回家

    最後會給一條「懶人起手路線」,照做就能在一個週末搭起初版 AI 內網。


    核心功能 1:幫你選與部署本地 LLM

    Self-Hosting Guide 做的事:把本地部署 LLM 的選項、硬體需求、工具鏈整理好,讓你不用從 Reddit、HN 一篇篇啃。

    1.1 怎麼挑模型?

    日常自用、寫程式或辦公,其實不必直接上 70B 巨獸。你可以用這份指南搭配社群經驗,先鎖定幾種典型選項:

    名稱 核心功能 免費方案 適合誰
    Qwen / LLaMA 系列 Q4 量化 通用聊天、程式輔助 開源模型免費 想把 GPT/Claude 部分換成本地的人
    中小型 7B-14B 模型 簡單對話、個人筆記、RAG 多數開源 硬體普通的家用機
    27B–32B 模型(如 Qwen3.6-27B) 強一點的程式與長文理解 模型免費,但吃資源 有 RTX 3090 級 GPU 的進階玩家

    在 Reddit 的 Qwen3.6-27B 優化案例 中,有人用 RTX 3090 + kvflash 把:

    • token 生成速度提升到約 38.6 tok/s
    • KV cache VRAM 從 ~21GB 降到 ~17.5GB

    💡 關鍵: 單張 RTX 3090 透過 kvflash 等優化就能流暢跑 27B 級模型,讓「高階單卡跑大模型」變成實務選項。

    這代表:

    • 高階單卡也能跑 27B 模型
    • 只要配置得當,日常 coding/聊天其實很順

    你可以馬上做的事:

    1. 先確認自己 GPU:
    2. 無 GPU / Intel NUC / 家用舊機 → 目標 7B 量化模型
    3. RTX 3060-3070 → 13B 或 14B 模型
    4. RTX 3090 / 4090 → 可以嘗試 27B 以上(搭配量化 + KV 優化)
    5. 打開 Self-Hosting Guide 的 LLM 章節,挑一套部署方案:
    6. 想圖形化、簡單管理 → 找「Docker + Web UI」路線
    7. 想自己玩細節 → 找 vLLM / text-generation-inference 等關鍵字

    1.2 必備工具:Ollama / LM Studio / vLLM

    本地 LLM 生態裡,以下幾種工具是常見組合(指南裡也有提到相關堆疊):

    名稱 核心功能 免費方案 適合誰
    Ollama 一行指令拉模型、啟動本地 API 完全免費 想快速起一個 ChatGPT 替代的人
    LM Studio 有 UI 的模型下載與啟動器 免費客戶端 不熟 CLI 的使用者
    vLLM 高效推理框架,支援長上下文、KV 優化 開源 想追求高吞吐、寫服務端的工程師

    你可以馬上做的事(以 Ollama 為例):

    1. 在你的 Linux / macOS / Windows 安裝 Docker(或直接安裝 Ollama):
      bash
      curl -fsSL https://ollama.com/install.sh | sh
    2. 拉一個通用聊天模型(例如 qwen:7b):
      bash
      ollama pull qwen:7b
      ollama run qwen:7b
    3. 開啟瀏覽器,接一個簡單 Web UI(比如 Open WebUI 或指南中的前端項目),就有本地 Chat。

    核心功能 2:把模型接進自動化管線

    只在終端機裡跟模型聊天很快會膩,Self-Hosting Guide 的價值是教你:怎麼讓模型變成你家裡與工作流的一部分

    2.1 家用場景:結合 Home Assistant

    指南中有完整一章介紹 Home Assistant,你可以這樣用:

    • 讓 LLM 幫你:
    • 轉換你說出的自然語言成自動化指令(例如:「我出門了」→ 關燈 + 關冷氣 + 啟動警報)
    • 設計複雜條件自動化(比如天氣 + 家人是否在家 + 時間條件)

    你可以馬上做的事:

    1. 在家裡一台常開機器(NUC/舊 PC)裝好 Docker。
    2. 依照指南,跑起 Home Assistant Docker 容器。
    3. 把本地 LLM 提供的 API(例如 Ollama 預設在 http://localhost:11434)接進 Home Assistant
    4. 透過 Home Assistant 的 REST / Webhook 自定義整合
    5. 或查指南中列出的 LLM 插件項目,選現成方案

    這樣就能做到:「家裡的自動化規則,全部走本地,不往外傳」。

    💡 關鍵: 把 Home Assistant 與本地 LLM 串起來,就能在完全離線的情況下,用自然語言控制整個智慧家居。

    2.2 工作場景:自架開發工具 + Git 服務

    Hacker News 上有不少人分享,已經用本地模型取代部分 GPT/Claude 的日常 coding(參考:Ask HN: Has anyone replaced Claude/GPT with a local model for daily coding?)。Self-Hosting Guide 把這些需求拆成幾件事:

    • 自架 Git 服務(例如 Gitea
    • 自架 Code Review / CI 工具
    • 本地 LLM 提供程式輔助、摘要、Code Review

    你可以馬上做的事:

    1. 按指南起一個 Gitea / GitLab Self-Hosted
    2. 管理自己專案
    3. 把程式碼全部留在家裡伺服器
    4. 啟動一個專門幫你寫程式的本地模型(例如 13B 量化模型):
    5. VS Code / Neovim 插件,把 LLM API 指到你的本地網址
    6. 讓「Copilot 類功能」完全在你自家網路裡運行

    核心功能 3:用 WireGuard 打通「安全外網」

    你在家裡搭了一堆服務(LLM、Home Assistant、Git),下一步就是:如何在外面(公司、咖啡店)也能安全用到?

    Self-Hosting Guide 花了不少篇幅介紹 WireGuard,重點是:

    • 比傳統 VPN 設定簡單
    • 效能好、延遲低
    • 適合「家裡一台主機 + 多台手機/筆電」的拓撲

    你可以馬上做的事:

    1. 按指南在家用伺服器上安裝 WireGuard
      bash
      sudo apt install wireguard
    2. 建立一個基本設定(指南裡有範本):
    3. 伺服器端設定 IP 範圍(例如 10.0.0.1/24
    4. 每台裝置一組 key
    5. 在手機、筆電裝 WireGuard App,把設定檔匯入。
    6. 測試從外網連回家裡的 Home Assistant / LLM Web UI:
    7. 確認只透過 VPN 通道能接入
    8. 不把服務直接暴露在公網

    這樣做完,你就可以在外面用自己的「家用 GPT」,而不怕資料跑到第三方。

    💡 關鍵: 用 WireGuard 把家裡變成「只給自己與信任設備開放」的私人雲端,比直接開公網埠安全太多。


    適合誰用?幾個具體情境

    1. 家裡有一台舊電腦,想做點有趣但不想再裝一堆雲服務的人

    • 把它變成:NAS + LLM + Home Assistant 的整合機
    • 儲存相片、影音,順便當你的「家庭 ChatGPT」

    2. 想降低雲端 LLM 成本的開發者 / 早期團隊

    • 常用功能(例如程式補全、文件摘要)搬回本地
    • 只在需要強模型時才連外部 API

    3. 對隱私敏感的自由工作者 / 企業

    • 客戶文件、程式碼不想上雲端
    • 自己管理整個資料與模型環境

    4. 喜歡折騰硬體與自動化的玩家

    • 把 Home Assistant + LLM 玩到極致
    • 用 WireGuard 把家當作自己的「個人雲端」。

    怎麼開始:一週末搞定的懶人路線

    最後總結一條 「起手路線」,照著走就能搭出你的第一版 AI 內網。

    Step 0:準備一台舊機 + Docker

    • CPU:近 5 年內的桌機或筆電
    • RAM:至少 16GB
    • GPU:沒有也行(先跑 7B 小模型),有 RTX 3060 以上更好
    • OS:建議 Ubuntu Server / Debian
    • 安裝 Docker + docker-compose

    Step 1:部署 1 個聊天模型(Ollama)

    1. 安裝 Ollama(或依照 Self-Hosting Guide 中的建議):
      bash
      curl -fsSL https://ollama.com/install.sh | sh
    2. 拉一個通用模型(例如 llama3:8bqwen:7b):
      bash
      ollama pull llama3:8b
    3. 啟動並確認能在瀏覽器/CLI 聊天。

    Step 2:部署 1 個文件 / RAG 服務

    1. 選一個簡單 RAG 專案(例如指南裡推薦的開源 RAG Web UI):
    2. 用 Docker 起一個 Web 服務
    3. 把本地 PDF / Markdown 丟進去建立索引
    4. 把 RAG 的 LLM 後端指向 Ollama 的 API:
    5. 在設定頁填入 http://host.docker.internal:11434 或你的本地 IP
    6. 測試:輸入「幫我整理公司 A 專案會議紀錄」,看回答是否依據你的文件。

    Step 3:逐步擴展成「個人 AI 內網」

    每成功一小步,就再加一個服務:

    1. 接 Home Assistant:
    2. 先只用它做幾條簡單自動化(睡前關燈、出門關冷氣)
    3. 再讓 LLM 參與規則設計與自然語言控制
    4. 接開發工具:
    5. VS Code 裝支援自定義 LSP / LLM 的插件
    6. 把 endpoint 指向你本地 LLM
    7. 最後再加上 WireGuard
    8. 把整套「迷你雲端」安全地帶出門用

    整個過程不用一次到位,只要跟著 Self-Hosting Guide 的章節,一個一個勾:

    • LLM → Automation → Home Assistant → WireGuard → 其他服務

    做完,你就會有一個完全掌控、可隨時擴充的「自架 AI 全家桶」。


    如果你一直想把 GPT 類工作能力留在自己家裡,這份 Self-Hosting Guide 值得直接 Star 收藏,照著它,一台舊機 + 一個週末,就能搭出你的第一個「個人 AI 內網」。

    🚀 你現在可以做的事

    • 打開 Self-Hosting Guide,先 Star 並閱讀 LLM 相關章節
    • 在一台舊電腦上安裝 Docker + Ollama,實際跑起一個 7B 模型試用
    • 依照指南部署 Home Assistant 與 WireGuard,把本地 LLM 串進家庭自動化與遠端存取