📌 本文重點
- 本地視覺模型可當 macOS 半自動操作助理
- 優先選支援 GGUF 的 4B–7B 模型在 Mac 上運行
- 先讓模型說步驟,再逐步接上自動點擊工作流
只要把「看得懂畫面」的開源 AI 模型裝在 Mac 上,你就能讓它幫你看截圖、找按鈕、決定滑鼠要點哪裡,變成半自動的 macOS 操作助理。
核心功能:這類模型到底能做什麼?
以下說的「模型」,指的是可以本地跑、支援視覺輸入的開源模型,本文主要參考 Towards AI 的實測:用 136 張真實 macOS 截圖,看每個模型會「點哪裡」。原文連結在此:https://pub.towardsai.net/5-best-local-open-source-models-that-can-control-your-mac-in-2026-61b4a1e4600c
💡 關鍵: 用 136 張真實 macOS 截圖實測,代表這些模型真的能理解日常桌面操作場景
這類模型的三個關鍵能力:
- 看截圖、理解介面元素
- 看一張 macOS 螢幕截圖,辨識「按鈕、選單、側邊欄、分頁」等。
-
實際用法:每次你截圖目前畫面,把圖丟給模型,問它「我要開 Wi-Fi 設定,下一步要點哪裡?」。
-
用文字描述操作步驟
- 模型會用文字回答:「先點右上角 Apple 圖示,再選『系統設定』,然後在側邊欄點『Wi-Fi』」。
-
你可以把這些回答,接到自動化工具(
AppleScript、Keyboard Maestro、Shortcuts)變成真正的點擊。 -
預測滑鼠點擊位置
- 在 Towards AI 實測中,每個模型都要對截圖輸出一個「要點的座標」。
- 你可以用這個座標,讓腳本自動移動滑鼠並點擊,完成半自動操作。
表現最好的 5 款本地開源模型
以下是從原文與目前本地部署生態綜合整理出的 5 款代表模型,重點是:都能在 Mac 本地跑、支援視覺輸入,適合做「螢幕助手」。
提醒:各模型的具體版本與分數以原文與官方 repo 為準,這裡重點放在「怎麼選」與「怎麼用」。
| 名稱 | 核心功能 | 免費方案 | 適合誰 |
|---|---|---|---|
| LLaVA / LLaVA-NeXT | 經典開源視覺語言模型,理解 UI 元素佳,社群資源多 | 完全開源,可下載 GGUF 量化版 | 想要穩定、教學資源多的入門使用者 |
| Qwen-VL (含量化版) | 多語系、對中文 UI 說明友善,與 Hugging Face / llama.cpp 整合度高 | 開源,可用 GGUF 量化在 Mac 上跑 | 需要中文介面說明、希望在 M 系列 Mac 上效能更好的人 |
| InternVL / MiniCPM-V | 更偏「感知」類任務,對複雜畫面理解細節不錯 | 開源,多種大小模型可選 | 做進階 UI 分析、需要在自家產品整合的人 |
| Phi-3-Vision 類小模型 | 參數較小、資源占用低,適合輕度自動化 | 開源,有多種量化方案 | 只有 8GB–16GB RAM 的 Mac,想跑得動就好 |
| Gemma Vision / 類似視覺版小模型 | Google 系列、偏向乾淨 UI 理解與指令跟隨 | 開源,有社群提供 GGUF | 想接未來更多 Google 生態,做客製化工作流的使用者 |
💡 關鍵: 這 5 類模型的共通點是都能在 Mac 本地跑、支援視覺輸入,非常適合做桌面「螢幕助手」
模型差異:隱私、本地運行、資源占用
- 隱私
- 上述模型若以
GGUF/llama.cpp在本地跑,截圖不會上雲端,非常適合有敏感資料的公司與工作機。 -
行動:如果你在意隱私,優先選「完全在本地推理」的方案,不要接雲端
API。 -
本地運行便利度
LLaVA、Qwen-VL等都有 Hugging Face Hub 上的GGUF模型,可以搭配transformers或llama.cpp。- Hugging Face 官方已支援 GGUF 原生載入(參考:https://huggingface.co/blog/transformers-llama-cpp-quants、Reddit 討論:https://www.reddit.com/r/LocalLLaMA/comments/1wnxm0r/ggufs_in_transformers_natively/)。
-
行動:選一個有
GGUF的模型,優先跟 Hugging Face /llama.cpp生態走,安裝流程最簡單。 -
資源占用
4B–7B參數的量化模型,一般M1/M2 MacBook(16GB RAM)就能跑。- 超過
13B會明顯變慢,占用也大,不建議拿來做即時操作助理。 - 行動:先從
4B–7B規模的Qwen-VL或LLaVA GGUF開始測試,確認速度再升級。
💡 關鍵: 4B–7B 量化模型是在一般 16GB Mac 上兼顧可用速度與效果的甜蜜點
適合誰用:3 個具體場景
- 懶得自己點、但不想寫複雜腳本的人
- 需求:常整理檔案、開特定設定、做重複的 GUI 操作,但不熟
AppleScript。 -
做法:用模型看截圖,讓它用自然語言說「下一步要點哪裡」,再把這些指令手動轉成
Shortcuts或Keyboard Maestro流程。 -
需要半自動「教學 + 操作」的 IT / 內部支援
- 需求:公司裡常有人問「怎麼開 VPN、怎麼設定印表機」,而且每台 Mac 介面略有不同。
-
做法:讓模型看使用者截圖,輸出文字步驟與點擊位置,再用腳本執行或回覆說明。
-
想做自己的「桌面代理人」的開發者 / Maker
- 需求:做一個類似「螢幕助手」的小工具,幫你點按、排程例行操作。
- 做法:把視覺模型接到一個簡單
Python/Swift程式,讓它每X秒讀取截圖,決定下一個點擊座標,交給自動化腳本執行。
怎麼開始:在普通 Mac 上裝一個模型 + 建第一個 workflow
下面用 Qwen-VL GGUF + llama.cpp 當例子,示範最短上手路徑。你可以換成 LLaVA 或其他支援 GGUF 的視覺模型,流程類似。
步驟 1:安裝基本環境
-
安裝 Homebrew(若已安裝可跳過)
打開Terminal:
bash
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)" -
安裝必備工具
bash
brew install cmake git python
步驟 2:下載並編譯 llama.cpp
-
取得原始碼
bash
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp -
編譯(針對 Apple Silicon 優化)
bash
mkdir build && cd build
cmake .. -DLLAMA_METAL=ON
cmake --build . --config Release
行動:這段只需要跑一次,之後都重用同一份 llama.cpp。
步驟 3:從 Hugging Face 抓一個 GGUF 視覺模型
- 選模型
打開 Hugging Face,搜尋類似: Qwen-VL-GGUF-
或
llava-v1.5-7b-GGUF等具備視覺能力、標明GGUF格式的模型。 -
使用
huggingface-cli下載
安裝與登入:
bash
pip install -U "huggingface_hub[cli]"
huggingface-cli login
下載模型檔(以示意 ID 代替,請換成實際模型):
bash
huggingface-cli download myorg/Qwen-VL-4B-GGUF \
Qwen-VL-4B-Q4_K_M.gguf \
--local-dir ./models/qwen-vl-4b
行動:確保你選的是 Q4 / Q5 之類量化版本,體積較小,適合一般 Mac。
步驟 4:寫一個最簡單的「看截圖 → 建議下一步」腳本
下面用 Python 示意:
import subprocess
import os
from datetime import datetime
LLAMA_BIN = "./build/bin/llama-cli" # 依照你編譯出的檔名調整
MODEL_PATH = "./models/qwen-vl-4b/Qwen-VL-4B-Q4_K_M.gguf"
SCREENSHOT_DIR = "./screenshots"
os.makedirs(SCREENSHOT_DIR, exist_ok=True)
# 1. 截圖目前螢幕
filename = datetime.now().strftime("%Y%m%d-%H%M%S.png")
filepath = os.path.join(SCREENSHOT_DIR, filename)
subprocess.run(["screencapture", "-x", filepath])
# 2. 準備提示詞(prompt)
prompt = (
"你現在看到的是一張 macOS 截圖。\n"
"目標:幫我打開『系統設定』裡的『Wi-Fi』頁面。\n"
"請回答:\n"
"1)下一步滑鼠應該點哪個按鈕或選單?\n"
"2)用簡短步驟列出接下來 3 步操作。\n"
)
# 3. 呼叫模型(llama.cpp 需支援 image + text 模式,參考各模型說明)
result = subprocess.run([
LLAMA_BIN,
"-m", MODEL_PATH,
"--image", filepath,
"-p", prompt,
"-n", "256" # 最多生成 256 token
], capture_output=True, text=True)
print("模型回答:")
print(result.stdout)
這個腳本會:
- 自動抓一張當前螢幕截圖。
- 把截圖 + 指令丟給模型,請它說明下一步要點哪裡。
- 在
Terminal印出回答,你可以照做,或下一步再把回答解析成座標、接上自動點擊腳本。
行動:先讓模型說對步驟,確認理解 UI 沒問題,再往「自動點擊」邁進。
步驟 5:接上「自動幫你點」的小 workflow
等你確認模型給的步驟足夠穩定,可再疊以下工具:
- 用 AppleScript / Swift 控制滑鼠
-
例如用
Swift/Objective-C的CGEvent API,或第三方CLI工具移動滑鼠到指定座標並點擊。 -
用 Keyboard Maestro / Shortcuts 固定流程
-
把「截圖 → 丟給模型 → 執行步驟」包成一條快捷鍵,變成半自動助手。
-
安全性設定
- 建議只在自己的機器上跑,而且限制模型只能在特定 App(設定、Finder)執行點擊,避免誤操作重要軟體。
最後整理:怎麼選、怎麼跑
- 如果你完全新手:從
LLaVA或Qwen-VL的GGUF小模型開始,照本文步驟裝llama.cpp,先讓它「說步驟」。 - 如果你是開發者:善用 Hugging Face 對
GGUF的原生支援,在transformers中直接載入量化模型,接自己熟悉的Python工具鏈。 - 如果你只有一般 MacBook:優先選
4B–7B量化模型,避免模型過大導致卡頓;確認隱私需求後,再考慮是否要加上雲端模型輔助。
只要先搭出第一個「幫我打開系統設定 → Wi-Fi」的小 workflow,你就有了自己的雛形桌面代理人,之後就能一步步擴充,讓 Mac 越來越懂得自己操作自己。
🚀 你現在可以做的事
- 到 Hugging Face 搜尋並下載一個
Qwen-VL或LLaVA的GGUF量化模型- 依照文中步驟安裝
llama.cpp,跑通第一個「看截圖 → 說步驟」的Python腳本- 選擇
Keyboard Maestro或Shortcuts,把這個腳本包成快捷鍵,開始實驗你的第一個螢幕助手 workflow










