標籤: 圖文理解工作助理

  • 用 DeepSeek Harness 做你的多模態工作助理

    用 DeepSeek Harness 做你的多模態工作助理

    📌 本文重點

    • DeepSeek Harness 提供免費開源多模態 Agent
    • 用 /goal + /plan 讓 Agent 自動拆任務與執行
    • 結合 @引用與 MCP/ACP,管理圖文與文件上下文
    • 適合搭建團隊內部的多種工作助理流程

    用 DeepSeek Harness,你可以在一個免費開源的 Agent 裡,同時處理文字、圖片與文件,還能把任務拆成計畫持續執行,變成真正可用的工作助理。

    官網與程式碼:https://github.com/deepseek-ai/deepseek-harness

    v0.1.1 版本公告(含多模態更新):https://www.reddit.com/r/LocalLLaMA/comments/1vugyfe/deepseek_harness_v011_released/


    核心功能:先搞懂這幾個就能開始用

    這節的目標:看完就知道 DeepSeek Harness 能做什麼,並決定要拿它來解哪一種工作。

    1. 多模態 Agent:文字+圖片同一條工作流

    DeepSeek Harness v0.1.1 把 DeepSeek-V4-Flash-Vision-Exp 視覺模型接進來,讓 Agent 能直接理解圖片與文字的混合輸入。

    💡 關鍵: DeepSeek-V4-Flash-Vision-Exp 讓同一個 Agent 對話同時理解截圖與文字,大幅減少人工整理資料的時間。

    具體能做什麼:

    • 同一個對話裡:丟截圖+補充文字說明,讓 Agent 一次看懂
    • 圖片可以來自:本地檔案、貼上的螢幕截圖、工具回傳的圖片
    • 模型可以辨識:表格、報表、UI 介面、流程圖等常見工作截圖

    你可以立刻試的操作:

    1. 準備一張產品後台的報表截圖(營收、轉換率等)。
    2. 啟動 DeepSeek Harness 的介面(後面會教安裝)。
    3. 新建一個工作空間,把截圖拖進對話框,輸入:
    4. 「看這張圖幫我總結 3 個關鍵指標,列點回答。」
    5. 確認 Agent 是否正確抓到數字與欄位名稱,再往下問細節。

    2. /goal + /plan:讓 Agent 自己拆任務與追進度

    v0.1.1 在指令上最重要的更新,是 /goal 和 /plan 支援文字+圖片輸入,讓 Agent 不只回答,而是「接案」做事。

    • /goal:定義整個任務的目標
    • /plan:請 Agent 把目標拆成步驟並執行

    這兩個指令搭配多模態輸入,就是一個簡單版的「工作流程自動化」。

    💡 關鍵: 用 /goal 定義目標、用 /plan 拆步驟,等於在本地擁有一個能持續追任務進度的工作助理。

    實作示範:用報表截圖做完整 /goal /plan 流程

    假設你有一張過去 6 個月的營收報表截圖,要讓 Agent 幫你找問題並列出下一步行動:

    1. 在對話中貼上報表截圖。
    2. 輸入 /goal 指令,例如:

    text
    /goal
    目標:根據這張營收報表,找出過去 6 個月的主要變化,並提出 3 個可執行的優化建議。
    條件:
    - 優先關注營收跌幅較大的月份
    - 建議要具體到可以交給營運同事執行

    1. 接著輸入 /plan,讓 Agent 自己拆步驟並開始做:

    text
    /plan
    請你:
    1. 把圖表資料轉成文字總結(列月份與數字)
    2. 找出營收明顯下降的兩個區間、分析可能原因
    3. 寫出 3 個具體可執行的優化方案,列為待辦事項

    1. 觀察 Agent 的輸出是否有:
    2. 明確的步驟
    3. 對每一步有完成狀態或說明

    做到這裡,你就完成了第一個多模態 /goal /plan 工作流,可以直接複製到其他任務。

    3. @引用+MCP/ACP 附件:把「舊對話+文件+圖片」都變成上下文

    DeepSeek Harness 有一個 @選單,可以在對話裡引用:

    • 先前的對話(舊任務、舊討論)
    • 上傳過的文檔(規格書、工單、需求單)
    • 圖像附件(透過 MCP/ACP 持久化保存)

    MCP/ACP 的重點是:圖片附件不是用完就消失,而是可以被 Agent 在後續任務重複引用。

    💡 關鍵: 透過 @引用與 MCP/ACP,把一次上傳的文件與截圖變成「可重複調用的知識庫」,避免每次任務都重貼同樣資料。

    你實際可以這樣用:

    1. 建一個「產品知識助理」工作空間。
    2. 上傳:
    3. PRD 文件(PDF 或 Markdown)
    4. 過去的 UI 設計稿截圖
    5. 內部 FAQ 文檔
    6. 用 @選單把「當前任務相關的文檔+截圖」拉進上下文:
    7. 比如在對話裡輸入「@PRD_v2 @首頁_UI_2024Q3」,再描述你的問題:
    8. 「請根據這兩份資料,列出目前首頁設計還沒對齊 PRD 的地方。」

    這樣你就不用重複貼同一份文檔或截圖,Agent 會把被 @引用的內容當作背景知識來分析。


    適合誰用:幫你對號入座的 4 種場景

    這節的目標:找到一個你現在就能在團隊裡試跑的具體用例。

    1. 內部知識助理:丟截圖+需求文檔,快速對齊產品理解

    場景:產品經理/設計師/工程師討論新功能,常常出現「UI 截圖+PRD+ Slack 對話」混在一起。

    你可以這樣做:

    • 把 PRD、設計稿截圖、過去討論記錄丟進同一個 DeepSeek Harness 工作空間
    • 用 @引用相關文件,再丟目前版本的 UI 截圖
    • 下指令:
    • 「幫我列出目前 UI 和 PRD 不一致的地方,按照頁面區塊分組。」

    好處:比人力逐段比對更快,當成第一輪檢查,再由人做最後確認。

    2. 簡易 UI/UX 互評工具

    場景:設計團隊想快速收集對某個頁面或流程的評價。

    你可以這樣做:

    • 為每個頁面開一條對話,貼上 UI 截圖
    • 使用 /goal 定義評估目標:
    • 「目標:根據這個頁面,從資訊架構、可用性、視覺一致性三個方向提出具體改善建議。」
    • 用 /plan 要 Agent:
    • 步驟 1:描述目前設計
    • 步驟 2:列出問題
    • 步驟 3:提出修改方案

    輸出可以直接整理成設計回饋文件,給團隊參考。

    3. 客服工單理解與歸類

    場景:客服每天收到大量截圖+文字描述的問題,要先分門別類再交給工程或產品。

    你可以這樣做:

    • 把客服工單內容(文字)+使用者提供的錯誤截圖丟進同一個任務
    • 用 @引用產品 FAQ 或已知問題列表
    • 下指令:
    • 「幫我判斷這個工單屬於哪一個模組/錯誤類型,給出分類標籤與可能原因。」

    這可以當作客服內部的輔助工具,加速初步分類與指派。

    4. 報表截圖分析與週報草稿

    場景:營運、行銷同事每週要寫報告,但常常只有報表截圖(如 GA、後台報表)。

    你可以這樣做:

    • 把這週的關鍵報表截圖整理好,丟進一條對話
    • /goal:設定這週報告的目標(例如:找出異常、解釋波動)
    • /plan:請 Agent 依序:
    • step 1:總結數據
    • step 2:指出異常點
    • step 3:產出週報草稿

    最後再由人類修稿,就能快速產出可用的報告初稿。


    怎麼開始:從 GitHub 到第一個多模態任務

    這節的目標:照著做,30–60 分鐘內跑起第一個多模態 Agent。

    1. 安裝與基本啟動

    前置:

    • 準備一台可以連外網的開發環境(macOS / Linux / WSL 皆可)
    • 安裝好:
    • Python 3.10+ 或 Docker
    • Git

    步驟一:抓專案

    git clone https://github.com/deepseek-ai/deepseek-harness.git
    cd deepseek-harness
    

    步驟二:安裝依賴(以 Python 為例)

    pip install -r requirements.txt
    

    (實際依賴與啟動腳本以官方 README 為準:https://github.com/deepseek-ai/deepseek-harness)

    步驟三:啟動介面或 CLI

    專案提供 Web UI / CLI 等不同啟動方式,通常是:

    python -m deepseek_harness.server
    

    啟動後,開啟瀏覽器訪問本地 URL(例如 http://localhost:8000,以官方文件為準)。

    2. 跑官方範例:確認 Agent 正常運作

    在介面中:

    1. 新建一個 Agent 或工作空間,選擇 DeepSeek 相關模型(包含 vision 的版本,例如 DeepSeek-V4-Flash-Vision-Exp)。
    2. 跑官方示範任務:通常會有預設指令或範例對話,可以先用純文字確認:
    3. 能正常回應
    4. 能接受簡單的 /goal 或 /plan 指令

    如果你偏好程式方式,也可以參考 Towards AI 上的介紹,了解這個框架如何搭配 Claude Code 或 Codex 等開發工具使用:

    3. 實作:做一個自己的「圖文理解工作助理」

    現在,把前面提到的多模態能力,結合你現有的 RAG / 工具調用。

    步驟一:接上你的 RAG 或工具

    • 如果你已有向量資料庫(如:Chroma、Weaviate、Elastic):
    • 將檢索 API 包成一個工具(function / MCP provider)
    • 在 DeepSeek Harness 的工具設定中註冊這個檢索工具
    • 將「查文件」完全交給工具,「理解文件+圖片+任務規劃」交給 Agent。

    可以對照 Agentic RAG 的設計思路:讓 Agent 主動決定何時檢索、檢索幾次:

    步驟二:設計一個固定流程的工作助理

    例如「產品需求評估助理」,定義一個模板:

    1. 使用者輸入:
    2. 需求文檔(文字或 PDF)
    3. 現有 UI 截圖
    4. Agent 流程:
    5. /goal:永遠是「評估新需求與現有產品是否一致」
    6. /plan:
      1. 用工具檢索相關歷史需求與決策記錄
      2. 比對現有 UI 截圖與新需求
      3. 輸出評估報告與待辦事項

    你可以把這整套流程固化在一個「預設對話開場白」裡,讓團隊每次只要丟資料,就能跑同樣的流程。

    步驟三:逐步優化指令模板

    實際跑幾次之後:

    • 把效果好的 /goal 與 /plan 指令存成模板
    • 整理常用的 @引用組合(例如:@最新PRD @設計截圖)
    • 在團隊裡分享一份「怎麼跟助理說話」指南

    DeepSeek Harness 與其他開發者工具的簡易比較

    如果你已在用其他 AI 助手(像是 Claude Code、Codex),可以用下表定位:

    名稱 核心功能 免費方案 適合誰
    DeepSeek Harness 多模態 Agent、/goal /plan、工具整合 開源免費,自架 想打造自家工作流的工程師/產品團隊
    Claude Code 雲端程式助理、自然語言改碼 有免費額度 需要雲端 IDE 型助理的開發者
    Codex(API 生態) 程式碼生成與補全 API 依供應商而定 想在 SaaS 產品中嵌入程式助理的團隊

    對開發者而言,DeepSeek Harness 的定位比較像「你自己可控的骨幹」:多模態理解+任務規劃+工具調用都在你掌控的環境裡,適合拿來搭建團隊內部的工作助理。


    最後建議:從一個小任務開始,把 Agent 變成「同事」

    如果你第一次接觸多模態 Agent,建議從下面的順序開始:

    1. 先選一個單一任務:例如「每週報表截圖分析」。
    2. 用 DeepSeek Harness 跑完整的 /goal + /plan 流程,確認能穩定產出你要的結果。
    3. 再慢慢加上:文件 @引用、RAG 檢索、更多工具。

    一旦你有第一個能被同事穩定使用的「圖文理解工作助理」,後面要擴展到客服、產品、設計等場景,只是複製流程與調整指令而已。

    🚀 你現在可以做的事

    • 去 GitHub 下載並安裝 deepseek-harness,跑一遍官方範例
    • 在團隊中挑一個具體任務(如週報表分析),設計對應的 /goal 和 /plan 模板
    • 整理一批常用文件與截圖,建立首個「產品知識助理」工作空間並實際試用