用本地開源 AI 控制你的 Mac

用本地開源 AI 控制你的 Mac

📌 本文重點

  • 本地視覺模型可當 macOS 半自動操作助理
  • 優先選支援 GGUF 的 4B–7B 模型在 Mac 上運行
  • 先讓模型說步驟,再逐步接上自動點擊工作流

只要把「看得懂畫面」的開源 AI 模型裝在 Mac 上,你就能讓它幫你看截圖、找按鈕、決定滑鼠要點哪裡,變成半自動的 macOS 操作助理。


核心功能:這類模型到底能做什麼?

以下說的「模型」,指的是可以本地跑、支援視覺輸入的開源模型,本文主要參考 Towards AI 的實測:用 136 張真實 macOS 截圖,看每個模型會「點哪裡」。原文連結在此:https://pub.towardsai.net/5-best-local-open-source-models-that-can-control-your-mac-in-2026-61b4a1e4600c

💡 關鍵: 用 136 張真實 macOS 截圖實測,代表這些模型真的能理解日常桌面操作場景

這類模型的三個關鍵能力:

  1. 看截圖、理解介面元素
  2. 看一張 macOS 螢幕截圖,辨識「按鈕、選單、側邊欄、分頁」等。
  3. 實際用法:每次你截圖目前畫面,把圖丟給模型,問它「我要開 Wi-Fi 設定,下一步要點哪裡?」。

  4. 用文字描述操作步驟

  5. 模型會用文字回答:「先點右上角 Apple 圖示,再選『系統設定』,然後在側邊欄點『Wi-Fi』」。
  6. 你可以把這些回答,接到自動化工具(AppleScript、Keyboard Maestro、Shortcuts)變成真正的點擊。

  7. 預測滑鼠點擊位置

  8. 在 Towards AI 實測中,每個模型都要對截圖輸出一個「要點的座標」。
  9. 你可以用這個座標,讓腳本自動移動滑鼠並點擊,完成半自動操作。

表現最好的 5 款本地開源模型

以下是從原文與目前本地部署生態綜合整理出的 5 款代表模型,重點是:都能在 Mac 本地跑、支援視覺輸入,適合做「螢幕助手」。

提醒:各模型的具體版本與分數以原文與官方 repo 為準,這裡重點放在「怎麼選」與「怎麼用」。

名稱 核心功能 免費方案 適合誰
LLaVA / LLaVA-NeXT 經典開源視覺語言模型,理解 UI 元素佳,社群資源多 完全開源,可下載 GGUF 量化版 想要穩定、教學資源多的入門使用者
Qwen-VL (含量化版) 多語系、對中文 UI 說明友善,與 Hugging Face / llama.cpp 整合度高 開源,可用 GGUF 量化在 Mac 上跑 需要中文介面說明、希望在 M 系列 Mac 上效能更好的人
InternVL / MiniCPM-V 更偏「感知」類任務,對複雜畫面理解細節不錯 開源,多種大小模型可選 做進階 UI 分析、需要在自家產品整合的人
Phi-3-Vision 類小模型 參數較小、資源占用低,適合輕度自動化 開源,有多種量化方案 只有 8GB–16GB RAM 的 Mac,想跑得動就好
Gemma Vision / 類似視覺版小模型 Google 系列、偏向乾淨 UI 理解與指令跟隨 開源,有社群提供 GGUF 想接未來更多 Google 生態,做客製化工作流的使用者

💡 關鍵: 這 5 類模型的共通點是都能在 Mac 本地跑、支援視覺輸入,非常適合做桌面「螢幕助手」


模型差異:隱私、本地運行、資源占用

  1. 隱私
  2. 上述模型若以 GGUF / llama.cpp 在本地跑,截圖不會上雲端,非常適合有敏感資料的公司與工作機。
  3. 行動:如果你在意隱私,優先選「完全在本地推理」的方案,不要接雲端 API。

  4. 本地運行便利度

  5. LLaVA、Qwen-VL 等都有 Hugging Face Hub 上的 GGUF 模型,可以搭配 transformers 或 llama.cpp。
  6. Hugging Face 官方已支援 GGUF 原生載入(參考:https://huggingface.co/blog/transformers-llama-cpp-quants、Reddit 討論:https://www.reddit.com/r/LocalLLaMA/comments/1wnxm0r/ggufs_in_transformers_natively/)。
  7. 行動:選一個有 GGUF 的模型,優先跟 Hugging Face / llama.cpp 生態走,安裝流程最簡單。

  8. 資源占用

  9. 4B–7B 參數的量化模型,一般 M1 / M2 MacBook(16GB RAM)就能跑。
  10. 超過 13B 會明顯變慢,占用也大,不建議拿來做即時操作助理。
  11. 行動:先從 4B–7B 規模的 Qwen-VL 或 LLaVA GGUF 開始測試,確認速度再升級。

💡 關鍵: 4B–7B 量化模型是在一般 16GB Mac 上兼顧可用速度與效果的甜蜜點


適合誰用:3 個具體場景

  1. 懶得自己點、但不想寫複雜腳本的人
  2. 需求:常整理檔案、開特定設定、做重複的 GUI 操作,但不熟 AppleScript。
  3. 做法:用模型看截圖,讓它用自然語言說「下一步要點哪裡」,再把這些指令手動轉成 Shortcuts 或 Keyboard Maestro 流程。

  4. 需要半自動「教學 + 操作」的 IT / 內部支援

  5. 需求:公司裡常有人問「怎麼開 VPN、怎麼設定印表機」,而且每台 Mac 介面略有不同。
  6. 做法:讓模型看使用者截圖,輸出文字步驟與點擊位置,再用腳本執行或回覆說明。

  7. 想做自己的「桌面代理人」的開發者 / Maker

  8. 需求:做一個類似「螢幕助手」的小工具,幫你點按、排程例行操作。
  9. 做法:把視覺模型接到一個簡單 Python / Swift 程式,讓它每 X 秒讀取截圖,決定下一個點擊座標,交給自動化腳本執行。

怎麼開始:在普通 Mac 上裝一個模型 + 建第一個 workflow

下面用 Qwen-VL GGUF + llama.cpp 當例子,示範最短上手路徑。你可以換成 LLaVA 或其他支援 GGUF 的視覺模型,流程類似。


步驟 1:安裝基本環境

  1. 安裝 Homebrew(若已安裝可跳過)
    打開 Terminal:
    bash
    /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

  2. 安裝必備工具
    bash
    brew install cmake git python


步驟 2:下載並編譯 llama.cpp

  1. 取得原始碼
    bash
    git clone https://github.com/ggerganov/llama.cpp.git
    cd llama.cpp

  2. 編譯(針對 Apple Silicon 優化)
    bash
    mkdir build && cd build
    cmake .. -DLLAMA_METAL=ON
    cmake --build . --config Release

行動:這段只需要跑一次,之後都重用同一份 llama.cpp。


步驟 3:從 Hugging Face 抓一個 GGUF 視覺模型

  1. 選模型
    打開 Hugging Face,搜尋類似:
  2. Qwen-VL-GGUF
  3. 或 llava-v1.5-7b-GGUF 等具備視覺能力、標明 GGUF 格式的模型。

  4. 使用 huggingface-cli 下載
    安裝與登入:
    bash
    pip install -U "huggingface_hub[cli]"
    huggingface-cli login

下載模型檔(以示意 ID 代替,請換成實際模型):
bash
huggingface-cli download myorg/Qwen-VL-4B-GGUF \
Qwen-VL-4B-Q4_K_M.gguf \
--local-dir ./models/qwen-vl-4b

行動:確保你選的是 Q4 / Q5 之類量化版本,體積較小,適合一般 Mac。


步驟 4:寫一個最簡單的「看截圖 → 建議下一步」腳本

下面用 Python 示意:

import subprocess
import os
from datetime import datetime

LLAMA_BIN = "./build/bin/llama-cli"  # 依照你編譯出的檔名調整
MODEL_PATH = "./models/qwen-vl-4b/Qwen-VL-4B-Q4_K_M.gguf"

SCREENSHOT_DIR = "./screenshots"
os.makedirs(SCREENSHOT_DIR, exist_ok=True)

# 1. 截圖目前螢幕
filename = datetime.now().strftime("%Y%m%d-%H%M%S.png")
filepath = os.path.join(SCREENSHOT_DIR, filename)
subprocess.run(["screencapture", "-x", filepath])

# 2. 準備提示詞(prompt)
prompt = (
    "你現在看到的是一張 macOS 截圖。\n"
    "目標:幫我打開『系統設定』裡的『Wi-Fi』頁面。\n"
    "請回答:\n"
    "1)下一步滑鼠應該點哪個按鈕或選單?\n"
    "2)用簡短步驟列出接下來 3 步操作。\n"
)

# 3. 呼叫模型(llama.cpp 需支援 image + text 模式,參考各模型說明)
result = subprocess.run([
    LLAMA_BIN,
    "-m", MODEL_PATH,
    "--image", filepath,
    "-p", prompt,
    "-n", "256"  # 最多生成 256 token
], capture_output=True, text=True)

print("模型回答:")
print(result.stdout)

這個腳本會:

  • 自動抓一張當前螢幕截圖。
  • 把截圖 + 指令丟給模型,請它說明下一步要點哪裡。
  • 在 Terminal 印出回答,你可以照做,或下一步再把回答解析成座標、接上自動點擊腳本。

行動:先讓模型說對步驟,確認理解 UI 沒問題,再往「自動點擊」邁進。


步驟 5:接上「自動幫你點」的小 workflow

等你確認模型給的步驟足夠穩定,可再疊以下工具:

  1. 用 AppleScript / Swift 控制滑鼠
  2. 例如用 Swift / Objective-C 的 CGEvent API,或第三方 CLI 工具移動滑鼠到指定座標並點擊。

  3. 用 Keyboard Maestro / Shortcuts 固定流程

  4. 把「截圖 → 丟給模型 → 執行步驟」包成一條快捷鍵,變成半自動助手。

  5. 安全性設定

  6. 建議只在自己的機器上跑,而且限制模型只能在特定 App(設定、Finder)執行點擊,避免誤操作重要軟體。

最後整理:怎麼選、怎麼跑

  • 如果你完全新手:從 LLaVA 或 Qwen-VL 的 GGUF 小模型開始,照本文步驟裝 llama.cpp,先讓它「說步驟」。
  • 如果你是開發者:善用 Hugging Face 對 GGUF 的原生支援,在 transformers 中直接載入量化模型,接自己熟悉的 Python 工具鏈。
  • 如果你只有一般 MacBook:優先選 4B–7B 量化模型,避免模型過大導致卡頓;確認隱私需求後,再考慮是否要加上雲端模型輔助。

只要先搭出第一個「幫我打開系統設定 → Wi-Fi」的小 workflow,你就有了自己的雛形桌面代理人,之後就能一步步擴充,讓 Mac 越來越懂得自己操作自己。

🚀 你現在可以做的事

  • 到 Hugging Face 搜尋並下載一個 Qwen-VL 或 LLaVA 的 GGUF 量化模型
  • 依照文中步驟安裝 llama.cpp,跑通第一個「看截圖 → 說步驟」的 Python 腳本
  • 選擇 Keyboard Maestro 或 Shortcuts,把這個腳本包成快捷鍵,開始實驗你的第一個螢幕助手 workflow

留言

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *