讓電腦自己看螢幕幹活的小工具

讓電腦自己看螢幕幹活的小工具

📌 本文重點

  • 開源工具可把螢幕變成「可程式化」工作桌
  • 支援本機 LLM 與瀏覽器 LLM,兼顧隱私與便利
  • 透過 GUI 預設規則,非工程師也能自動化桌面任務
  • 可搭配 Webhook、雲端 LLM 打造微型 agent 工作流

只要先把規則設好,這個開源小工具就能在背景「看著」你的螢幕,等畫面出現特定文字或按鈕,就自動幫你通知、截圖、點擊甚至重啟程式。

工具原帖(作者自述):r/LocalLLaMA 原文連結


核心功能:把螢幕變成一張「可程式化」的工作桌

1. Observer MCP:一個控制台管理多個觀察任務

這個工具的核心是一個叫 Observer MCP 的控制器,可以同時管理多個「觀察任務」(micro-agents)。

你可以做的事:

  • 任務 A:監看模擬器視窗,畫面出現「Not Responding」就自動
  • 截圖
  • 關閉程式
  • 重新啟動模擬器
  • 任務 B:盯住下載器介面,偵測到「Download complete」就
  • 彈桌面通知
  • 或發一個 Webhook 給你自己的 Telegram/Slack bot
  • 任務 C:每天早上 9 點打開 BI 報表,如果畫面中出現「error」「failed」字樣
  • 立即截圖
  • 寄信給負責人

操作邏輯很像「IFTTT 版的螢幕監控」:

  • IF 螢幕上出現某段文字 / 某個按鈕
  • THEN 執行通知、按鍵、滑鼠、呼叫 API、丟給其他 CLI 工具

你可以在工具內的 GUI 列出多個任務,分別開關,不需要改程式碼,只要改設定。


2. 本機 LLM + 瀏覽器 LLM:llama.cpp + transformers.js

這個工具內建兩種推理引擎,讓你可以選擇 AI 要跑在哪裡。

  • llama.cpp 模式:
  • 在你的電腦本機跑 LLM
  • 適合已經有 GPU 或願意下載模型的人
  • 好處:完全離線、資料不出機器,適合隱私敏感場景

💡 關鍵: 使用 llama.cpp 本機模式時,所有資料都留在自己的電腦裡,特別適合處理敏感畫面與內部數據。

  • transformers.js + WebGPU 模式(跑在瀏覽器):
  • 利用瀏覽器的 WebGPU,在前端執行模型
  • 不需要架後端,也不必裝一堆依賴
  • 搭配 Hugging Face 開源的高速 WebGPU kernels,可以在 Chrome/Edge 之類的瀏覽器上流暢運作

你可以這樣配置:

  • 輕量任務(純文字判斷、簡單判讀畫面):用瀏覽器版 LLM,完全零部署
  • 重度任務(複雜畫面理解、長報表分析):切換成本機 llama.cpp 模式

實際操作動作:

  1. 在設定頁選擇 Local LLM 或 Browser LLM
  2. 如果選 Local LLM,指定你的 GGUF 模型路徑(例如從 Hugging Face 下好的模型)
  3. 如果選 Browser LLM,只要開對應的 Web UI,直接在瀏覽器跑

3. 預設規則 + 簡單 GUI:不會寫程式也能配置

作者在 v3.0.0 的重點,就是讓「他媽媽也會用」。

工具提供:

  • 預設規則模板(例如「偵測錯誤字樣」「下載完成通知」「程式崩潰自動重啟」)
  • 圖形介面 GUI:
  • 下拉選單選「要看哪個視窗」
  • 文本欄位填「要找的關鍵字」
  • 再選「觸發後要做什麼動作」

你可以這樣設定第一個規則:

  1. 打開工具 > 新增任務
  2. 選擇「觀察區域」:整個螢幕,或某個應用程式視窗
  3. 在「條件」輸入關鍵字,例如 error 或 download complete
  4. 在「動作」選擇:彈出桌面通知 + 播放提示音
  5. 儲存後按「啟動」

從這一刻開始,電腦就會在背景幫你盯畫面,只要滿足條件,就幫你處理重複的提醒工作。


適合誰用:三種典型場景

1. 辦公桌面自動化:BI 報表 / 下載器 / 排程任務

如果你工作中常遇到:

  • 要盯 BI 報表更新,一有錯誤就要截圖回報
  • 等大型檔案下載完成才能進下一步
  • 排程報表生成,有時悄悄失敗沒人發現

你可以這樣做:

  • 建一個任務專門看 BI 報表頁面
  • 條件:畫面包含 Error / Failed / Timeout
  • 動作:截圖 + 寄 Email 給團隊
  • 再建一個任務盯住下載器視窗
  • 條件:出現 100% 或 Download complete
  • 動作:桌面通知 + 呼叫你的 CLI 腳本開始後續處理

💡 關鍵: 透過關鍵字條件搭配自動通知與截圖,可以避免「排程失敗卻沒人發現」的情況默默發生。

2. 遊戲 / 模擬實驗監控

對玩家或研究員:

  • 模擬器長時間跑實驗,一掛掉就浪費幾個小時
  • 練功、排隊、排程任務,需要特定事件時才回來動手

可設定:

  • 任務:觀察模擬器畫面
  • 條件:出現 Not responding 或畫面變黑
  • 動作:
    • 截圖留證
    • 關閉程式
    • 再重新啟動模擬器
    • 發 Telegram / Slack 通知你

3. 重視隱私,又不想把畫面丟雲端的人

如果你在處理:

  • 內部財務報表
  • 客戶名單
  • 研究實驗數據

又希望 AI 幫忙看畫面,但不想傳到雲端:

  • 開啟 Local LLM(llama.cpp) 模式
  • 所有畫面截圖、文字解析都在你的電腦裡完成
  • 即使你用 WebGUI 管理,也只是本機 Web 介面,資料不會被上傳

怎麼開始:最快上手路線

注意:原始專案為開源,實際專案名稱 / 下載方式請以作者 GitHub 為準。以下是一條通用、接地氣的上手流程。

步驟 1:從 GitHub 下載與安裝

  1. 打開作者提供的 GitHub 連結(可從 Reddit 原文找到):
  2. r/LocalLLaMA 貼文
  3. 在 GitHub 右側 Release 區塊,下載
  4. Windows:*.exe 或 *.msi
  5. macOS:*.dmg
  6. 安裝後啟動程式

首次啟動時通常會:

  • 要求螢幕錄影權限(macOS)或類似權限(Windows)
  • 這是為了截圖與讀取畫面內容

步驟 2:只用瀏覽器版的「零部署」玩法

如果你不想先搞本地模型,建議先用 瀏覽器版 LLM。

  1. 在工具設定裡選擇 Browser / Web LLM 模式
  2. 工具會指示你打開一個本機 Web UI(例如 http://localhost:xxxx)
  3. 確保你的瀏覽器支援 WebGPU(最新版 Chrome / Edge 通常可以)

這種玩法的好處:

  • 不用裝 CUDA、不用拉模型
  • 先體驗「螢幕被 AI 盯著」的感覺
  • 確認需求後,再決定要不要搬到本地 LLM

步驟 3:建立你的第一個觀察規則(關鍵字通知)

目標:只要畫面出現某關鍵字,立刻彈出通知。

操作示範:

  1. 在工具主畫面點 New Task 或「新增任務」
  2. 名稱:BI 報表錯誤偵測
  3. 觀察來源:選擇
  4. 目標應用程式視窗(例如 Chrome 中某個 tab)
  5. 或整個螢幕
  6. 條件設定:
  7. 模式:關鍵字比對
  8. 關鍵字:Error, Fail, Timeout(可多個)
  9. 動作設定:
  10. 桌面通知+提示音
  11. 按「儲存」並「啟動」任務

接著打開你的 BI 報表頁,試著手動製造一個錯誤(或用假資料),確認工具會彈通知。


步驟 4:接 Slack / Email Webhook,變成小工作流

當你熟悉基本規則後,可以往「微型工作流」走。

  1. 在工具中新增一個動作類型:
  2. HTTP Webhook
  3. 填入你的 Slack Incoming Webhook URL 或自架的 Webhook endpoint
  4. 設定內容:
  5. 傳送 JSON 包含:任務名稱、觸發時間、螢幕截圖連結(如存到本機再由你自己的服務處理)

範例工作流:

  • BI 報表錯誤 → 工具截圖 + 呼叫 Slack Webhook → 團隊頻道收到「報表錯誤 + 圖片」
  • 模擬器當機 → 工具重啟程式 + 呼叫 Email 發送服務 → 你手機立刻收通知

如果你熟 CLI 工具,可以再加一層:

  • 工具觸發時執行某個 shell script
  • Script 裡再呼叫 curl、ffmpeg、python 等,組成一條完整 pipeline

💡 關鍵: 透過 Webhook 或 shell script,這個螢幕監控工具可以無縫接到你原本的自動化腳本與團隊通知渠道。


和雲端 LLM 混搭:把它當成練習用的「微型 agent」場

雖然這個工具主打本地與瀏覽器 LLM,但你也可以:

  • 在設定裡新增 OpenAI / Claude API key
  • 把「畫面描述」或 OCR 結果,丟給雲端 LLM 做更複雜判斷

例如:

  • 本地 LLM 負責:
  • 每幾秒截圖 + 基本文字偵測
  • 雲端 LLM 負責:
  • 分析整份畫面內容(例如圖表、表格)
  • 決定要不要通知你,或要不要執行下一步

這樣的搭配好處:

  • 你可以在一個「單機環境」裡,練習設計 agent workflow
  • 之後要搬到更大規模的多 agent 系統(如企業自動化平台),概念是相通的

建議學習路線:

  1. 先用預設 GUI + 本地 LLM 完成 2–3 個任務
  2. 再加上 Webhook,試一次和 Slack / Email 整合
  3. 最後才接 OpenAI / Claude,看整條流程能否穩定跑通

這樣,你就多了一個很實際的「AI 工作桌」,幫你把螢幕上的重複瑣事自動化。


🚀 你現在可以做的事

  • 前往 r/LocalLLaMA 原文 找到作者 GitHub 連結並下載專案
  • 安裝後建立一個簡單任務,例如監控 BI 報表錯誤並彈出桌面通知
  • 設定一個 HTTP Webhook,把觸發事件發到你的 Slack 或 Email,實際跑通一條小型工作流

留言

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *