📌 本文重點
- DeepSeek Harness 提供免費開源多模態 Agent
- 用
/goal+/plan讓 Agent 自動拆任務與執行- 結合 @引用與 MCP/ACP,管理圖文與文件上下文
- 適合搭建團隊內部的多種工作助理流程
用 DeepSeek Harness,你可以在一個免費開源的 Agent 裡,同時處理文字、圖片與文件,還能把任務拆成計畫持續執行,變成真正可用的工作助理。
官網與程式碼:https://github.com/deepseek-ai/deepseek-harness
v0.1.1 版本公告(含多模態更新):https://www.reddit.com/r/LocalLLaMA/comments/1vugyfe/deepseek_harness_v011_released/
核心功能:先搞懂這幾個就能開始用
這節的目標:看完就知道 DeepSeek Harness 能做什麼,並決定要拿它來解哪一種工作。
1. 多模態 Agent:文字+圖片同一條工作流
DeepSeek Harness v0.1.1 把 DeepSeek-V4-Flash-Vision-Exp 視覺模型接進來,讓 Agent 能直接理解圖片與文字的混合輸入。
💡 關鍵:
DeepSeek-V4-Flash-Vision-Exp讓同一個 Agent 對話同時理解截圖與文字,大幅減少人工整理資料的時間。
具體能做什麼:
- 同一個對話裡:丟截圖+補充文字說明,讓 Agent 一次看懂
- 圖片可以來自:本地檔案、貼上的螢幕截圖、工具回傳的圖片
- 模型可以辨識:表格、報表、UI 介面、流程圖等常見工作截圖
你可以立刻試的操作:
- 準備一張產品後台的報表截圖(營收、轉換率等)。
- 啟動 DeepSeek Harness 的介面(後面會教安裝)。
- 新建一個工作空間,把截圖拖進對話框,輸入:
- 「看這張圖幫我總結 3 個關鍵指標,列點回答。」
- 確認 Agent 是否正確抓到數字與欄位名稱,再往下問細節。
2. /goal + /plan:讓 Agent 自己拆任務與追進度
v0.1.1 在指令上最重要的更新,是 /goal 和 /plan 支援文字+圖片輸入,讓 Agent 不只回答,而是「接案」做事。
/goal:定義整個任務的目標/plan:請 Agent 把目標拆成步驟並執行
這兩個指令搭配多模態輸入,就是一個簡單版的「工作流程自動化」。
💡 關鍵: 用
/goal定義目標、用/plan拆步驟,等於在本地擁有一個能持續追任務進度的工作助理。
實作示範:用報表截圖做完整 /goal /plan 流程
假設你有一張過去 6 個月的營收報表截圖,要讓 Agent 幫你找問題並列出下一步行動:
- 在對話中貼上報表截圖。
- 輸入
/goal指令,例如:
text
/goal
目標:根據這張營收報表,找出過去 6 個月的主要變化,並提出 3 個可執行的優化建議。
條件:
- 優先關注營收跌幅較大的月份
- 建議要具體到可以交給營運同事執行
- 接著輸入
/plan,讓 Agent 自己拆步驟並開始做:
text
/plan
請你:
1. 把圖表資料轉成文字總結(列月份與數字)
2. 找出營收明顯下降的兩個區間、分析可能原因
3. 寫出 3 個具體可執行的優化方案,列為待辦事項
- 觀察 Agent 的輸出是否有:
- 明確的步驟
- 對每一步有完成狀態或說明
做到這裡,你就完成了第一個多模態 /goal /plan 工作流,可以直接複製到其他任務。
3. @引用+MCP/ACP 附件:把「舊對話+文件+圖片」都變成上下文
DeepSeek Harness 有一個 @選單,可以在對話裡引用:
- 先前的對話(舊任務、舊討論)
- 上傳過的文檔(規格書、工單、需求單)
- 圖像附件(透過 MCP/ACP 持久化保存)
MCP/ACP 的重點是:圖片附件不是用完就消失,而是可以被 Agent 在後續任務重複引用。
💡 關鍵: 透過
@引用與 MCP/ACP,把一次上傳的文件與截圖變成「可重複調用的知識庫」,避免每次任務都重貼同樣資料。
你實際可以這樣用:
- 建一個「產品知識助理」工作空間。
- 上傳:
- PRD 文件(PDF 或 Markdown)
- 過去的 UI 設計稿截圖
- 內部 FAQ 文檔
- 用
@選單把「當前任務相關的文檔+截圖」拉進上下文: - 比如在對話裡輸入「
@PRD_v2@首頁_UI_2024Q3」,再描述你的問題: - 「請根據這兩份資料,列出目前首頁設計還沒對齊 PRD 的地方。」
這樣你就不用重複貼同一份文檔或截圖,Agent 會把被 @引用的內容當作背景知識來分析。
適合誰用:幫你對號入座的 4 種場景
這節的目標:找到一個你現在就能在團隊裡試跑的具體用例。
1. 內部知識助理:丟截圖+需求文檔,快速對齊產品理解
場景:產品經理/設計師/工程師討論新功能,常常出現「UI 截圖+PRD+ Slack 對話」混在一起。
你可以這樣做:
- 把 PRD、設計稿截圖、過去討論記錄丟進同一個 DeepSeek Harness 工作空間
- 用
@引用相關文件,再丟目前版本的 UI 截圖 - 下指令:
- 「幫我列出目前 UI 和 PRD 不一致的地方,按照頁面區塊分組。」
好處:比人力逐段比對更快,當成第一輪檢查,再由人做最後確認。
2. 簡易 UI/UX 互評工具
場景:設計團隊想快速收集對某個頁面或流程的評價。
你可以這樣做:
- 為每個頁面開一條對話,貼上 UI 截圖
- 使用
/goal定義評估目標: - 「目標:根據這個頁面,從資訊架構、可用性、視覺一致性三個方向提出具體改善建議。」
- 用
/plan要 Agent: - 步驟 1:描述目前設計
- 步驟 2:列出問題
- 步驟 3:提出修改方案
輸出可以直接整理成設計回饋文件,給團隊參考。
3. 客服工單理解與歸類
場景:客服每天收到大量截圖+文字描述的問題,要先分門別類再交給工程或產品。
你可以這樣做:
- 把客服工單內容(文字)+使用者提供的錯誤截圖丟進同一個任務
- 用
@引用產品 FAQ 或已知問題列表 - 下指令:
- 「幫我判斷這個工單屬於哪一個模組/錯誤類型,給出分類標籤與可能原因。」
這可以當作客服內部的輔助工具,加速初步分類與指派。
4. 報表截圖分析與週報草稿
場景:營運、行銷同事每週要寫報告,但常常只有報表截圖(如 GA、後台報表)。
你可以這樣做:
- 把這週的關鍵報表截圖整理好,丟進一條對話
/goal:設定這週報告的目標(例如:找出異常、解釋波動)/plan:請 Agent 依序:- step 1:總結數據
- step 2:指出異常點
- step 3:產出週報草稿
最後再由人類修稿,就能快速產出可用的報告初稿。
怎麼開始:從 GitHub 到第一個多模態任務
這節的目標:照著做,30–60 分鐘內跑起第一個多模態 Agent。
1. 安裝與基本啟動
前置:
- 準備一台可以連外網的開發環境(macOS / Linux / WSL 皆可)
- 安裝好:
- Python 3.10+ 或 Docker
- Git
步驟一:抓專案
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
步驟二:安裝依賴(以 Python 為例)
pip install -r requirements.txt
(實際依賴與啟動腳本以官方 README 為準:https://github.com/deepseek-ai/deepseek-harness)
步驟三:啟動介面或 CLI
專案提供 Web UI / CLI 等不同啟動方式,通常是:
python -m deepseek_harness.server
啟動後,開啟瀏覽器訪問本地 URL(例如 http://localhost:8000,以官方文件為準)。
2. 跑官方範例:確認 Agent 正常運作
在介面中:
- 新建一個 Agent 或工作空間,選擇 DeepSeek 相關模型(包含 vision 的版本,例如
DeepSeek-V4-Flash-Vision-Exp)。 - 跑官方示範任務:通常會有預設指令或範例對話,可以先用純文字確認:
- 能正常回應
- 能接受簡單的
/goal或/plan指令
如果你偏好程式方式,也可以參考 Towards AI 上的介紹,了解這個框架如何搭配 Claude Code 或 Codex 等開發工具使用:
3. 實作:做一個自己的「圖文理解工作助理」
現在,把前面提到的多模態能力,結合你現有的 RAG / 工具調用。
步驟一:接上你的 RAG 或工具
- 如果你已有向量資料庫(如:Chroma、Weaviate、Elastic):
- 將檢索 API 包成一個工具(function / MCP provider)
- 在 DeepSeek Harness 的工具設定中註冊這個檢索工具
- 將「查文件」完全交給工具,「理解文件+圖片+任務規劃」交給 Agent。
可以對照 Agentic RAG 的設計思路:讓 Agent 主動決定何時檢索、檢索幾次:
步驟二:設計一個固定流程的工作助理
例如「產品需求評估助理」,定義一個模板:
- 使用者輸入:
- 需求文檔(文字或 PDF)
- 現有 UI 截圖
- Agent 流程:
/goal:永遠是「評估新需求與現有產品是否一致」/plan:- 用工具檢索相關歷史需求與決策記錄
- 比對現有 UI 截圖與新需求
- 輸出評估報告與待辦事項
你可以把這整套流程固化在一個「預設對話開場白」裡,讓團隊每次只要丟資料,就能跑同樣的流程。
步驟三:逐步優化指令模板
實際跑幾次之後:
- 把效果好的
/goal與/plan指令存成模板 - 整理常用的
@引用組合(例如:@最新PRD@設計截圖) - 在團隊裡分享一份「怎麼跟助理說話」指南
DeepSeek Harness 與其他開發者工具的簡易比較
如果你已在用其他 AI 助手(像是 Claude Code、Codex),可以用下表定位:
| 名稱 | 核心功能 | 免費方案 | 適合誰 |
|---|---|---|---|
| DeepSeek Harness | 多模態 Agent、/goal /plan、工具整合 |
開源免費,自架 | 想打造自家工作流的工程師/產品團隊 |
| Claude Code | 雲端程式助理、自然語言改碼 | 有免費額度 | 需要雲端 IDE 型助理的開發者 |
| Codex(API 生態) | 程式碼生成與補全 API | 依供應商而定 | 想在 SaaS 產品中嵌入程式助理的團隊 |
對開發者而言,DeepSeek Harness 的定位比較像「你自己可控的骨幹」:多模態理解+任務規劃+工具調用都在你掌控的環境裡,適合拿來搭建團隊內部的工作助理。
最後建議:從一個小任務開始,把 Agent 變成「同事」
如果你第一次接觸多模態 Agent,建議從下面的順序開始:
- 先選一個單一任務:例如「每週報表截圖分析」。
- 用 DeepSeek Harness 跑完整的
/goal+/plan流程,確認能穩定產出你要的結果。 - 再慢慢加上:文件
@引用、RAG 檢索、更多工具。
一旦你有第一個能被同事穩定使用的「圖文理解工作助理」,後面要擴展到客服、產品、設計等場景,只是複製流程與調整指令而已。
🚀 你現在可以做的事
- 去 GitHub 下載並安裝
deepseek-harness,跑一遍官方範例- 在團隊中挑一個具體任務(如週報表分析),設計對應的
/goal和/plan模板- 整理一批常用文件與截圖,建立首個「產品知識助理」工作空間並實際試用

