標籤: AI 工具

  • 用 DeepSeek Harness 做你的多模態工作助理

    用 DeepSeek Harness 做你的多模態工作助理

    📌 本文重點

    • DeepSeek Harness 提供免費開源多模態 Agent
    • 用 /goal + /plan 讓 Agent 自動拆任務與執行
    • 結合 @引用與 MCP/ACP,管理圖文與文件上下文
    • 適合搭建團隊內部的多種工作助理流程

    用 DeepSeek Harness,你可以在一個免費開源的 Agent 裡,同時處理文字、圖片與文件,還能把任務拆成計畫持續執行,變成真正可用的工作助理。

    官網與程式碼:https://github.com/deepseek-ai/deepseek-harness

    v0.1.1 版本公告(含多模態更新):https://www.reddit.com/r/LocalLLaMA/comments/1vugyfe/deepseek_harness_v011_released/


    核心功能:先搞懂這幾個就能開始用

    這節的目標:看完就知道 DeepSeek Harness 能做什麼,並決定要拿它來解哪一種工作。

    1. 多模態 Agent:文字+圖片同一條工作流

    DeepSeek Harness v0.1.1 把 DeepSeek-V4-Flash-Vision-Exp 視覺模型接進來,讓 Agent 能直接理解圖片與文字的混合輸入。

    💡 關鍵: DeepSeek-V4-Flash-Vision-Exp 讓同一個 Agent 對話同時理解截圖與文字,大幅減少人工整理資料的時間。

    具體能做什麼:

    • 同一個對話裡:丟截圖+補充文字說明,讓 Agent 一次看懂
    • 圖片可以來自:本地檔案、貼上的螢幕截圖、工具回傳的圖片
    • 模型可以辨識:表格、報表、UI 介面、流程圖等常見工作截圖

    你可以立刻試的操作:

    1. 準備一張產品後台的報表截圖(營收、轉換率等)。
    2. 啟動 DeepSeek Harness 的介面(後面會教安裝)。
    3. 新建一個工作空間,把截圖拖進對話框,輸入:
    4. 「看這張圖幫我總結 3 個關鍵指標,列點回答。」
    5. 確認 Agent 是否正確抓到數字與欄位名稱,再往下問細節。

    2. /goal + /plan:讓 Agent 自己拆任務與追進度

    v0.1.1 在指令上最重要的更新,是 /goal 和 /plan 支援文字+圖片輸入,讓 Agent 不只回答,而是「接案」做事。

    • /goal:定義整個任務的目標
    • /plan:請 Agent 把目標拆成步驟並執行

    這兩個指令搭配多模態輸入,就是一個簡單版的「工作流程自動化」。

    💡 關鍵: 用 /goal 定義目標、用 /plan 拆步驟,等於在本地擁有一個能持續追任務進度的工作助理。

    實作示範:用報表截圖做完整 /goal /plan 流程

    假設你有一張過去 6 個月的營收報表截圖,要讓 Agent 幫你找問題並列出下一步行動:

    1. 在對話中貼上報表截圖。
    2. 輸入 /goal 指令,例如:

    text
    /goal
    目標:根據這張營收報表,找出過去 6 個月的主要變化,並提出 3 個可執行的優化建議。
    條件:
    - 優先關注營收跌幅較大的月份
    - 建議要具體到可以交給營運同事執行

    1. 接著輸入 /plan,讓 Agent 自己拆步驟並開始做:

    text
    /plan
    請你:
    1. 把圖表資料轉成文字總結(列月份與數字)
    2. 找出營收明顯下降的兩個區間、分析可能原因
    3. 寫出 3 個具體可執行的優化方案,列為待辦事項

    1. 觀察 Agent 的輸出是否有:
    2. 明確的步驟
    3. 對每一步有完成狀態或說明

    做到這裡,你就完成了第一個多模態 /goal /plan 工作流,可以直接複製到其他任務。

    3. @引用+MCP/ACP 附件:把「舊對話+文件+圖片」都變成上下文

    DeepSeek Harness 有一個 @選單,可以在對話裡引用:

    • 先前的對話(舊任務、舊討論)
    • 上傳過的文檔(規格書、工單、需求單)
    • 圖像附件(透過 MCP/ACP 持久化保存)

    MCP/ACP 的重點是:圖片附件不是用完就消失,而是可以被 Agent 在後續任務重複引用。

    💡 關鍵: 透過 @引用與 MCP/ACP,把一次上傳的文件與截圖變成「可重複調用的知識庫」,避免每次任務都重貼同樣資料。

    你實際可以這樣用:

    1. 建一個「產品知識助理」工作空間。
    2. 上傳:
    3. PRD 文件(PDF 或 Markdown)
    4. 過去的 UI 設計稿截圖
    5. 內部 FAQ 文檔
    6. 用 @選單把「當前任務相關的文檔+截圖」拉進上下文:
    7. 比如在對話裡輸入「@PRD_v2 @首頁_UI_2024Q3」,再描述你的問題:
    8. 「請根據這兩份資料,列出目前首頁設計還沒對齊 PRD 的地方。」

    這樣你就不用重複貼同一份文檔或截圖,Agent 會把被 @引用的內容當作背景知識來分析。


    適合誰用:幫你對號入座的 4 種場景

    這節的目標:找到一個你現在就能在團隊裡試跑的具體用例。

    1. 內部知識助理:丟截圖+需求文檔,快速對齊產品理解

    場景:產品經理/設計師/工程師討論新功能,常常出現「UI 截圖+PRD+ Slack 對話」混在一起。

    你可以這樣做:

    • 把 PRD、設計稿截圖、過去討論記錄丟進同一個 DeepSeek Harness 工作空間
    • 用 @引用相關文件,再丟目前版本的 UI 截圖
    • 下指令:
    • 「幫我列出目前 UI 和 PRD 不一致的地方,按照頁面區塊分組。」

    好處:比人力逐段比對更快,當成第一輪檢查,再由人做最後確認。

    2. 簡易 UI/UX 互評工具

    場景:設計團隊想快速收集對某個頁面或流程的評價。

    你可以這樣做:

    • 為每個頁面開一條對話,貼上 UI 截圖
    • 使用 /goal 定義評估目標:
    • 「目標:根據這個頁面,從資訊架構、可用性、視覺一致性三個方向提出具體改善建議。」
    • 用 /plan 要 Agent:
    • 步驟 1:描述目前設計
    • 步驟 2:列出問題
    • 步驟 3:提出修改方案

    輸出可以直接整理成設計回饋文件,給團隊參考。

    3. 客服工單理解與歸類

    場景:客服每天收到大量截圖+文字描述的問題,要先分門別類再交給工程或產品。

    你可以這樣做:

    • 把客服工單內容(文字)+使用者提供的錯誤截圖丟進同一個任務
    • 用 @引用產品 FAQ 或已知問題列表
    • 下指令:
    • 「幫我判斷這個工單屬於哪一個模組/錯誤類型,給出分類標籤與可能原因。」

    這可以當作客服內部的輔助工具,加速初步分類與指派。

    4. 報表截圖分析與週報草稿

    場景:營運、行銷同事每週要寫報告,但常常只有報表截圖(如 GA、後台報表)。

    你可以這樣做:

    • 把這週的關鍵報表截圖整理好,丟進一條對話
    • /goal:設定這週報告的目標(例如:找出異常、解釋波動)
    • /plan:請 Agent 依序:
    • step 1:總結數據
    • step 2:指出異常點
    • step 3:產出週報草稿

    最後再由人類修稿,就能快速產出可用的報告初稿。


    怎麼開始:從 GitHub 到第一個多模態任務

    這節的目標:照著做,30–60 分鐘內跑起第一個多模態 Agent。

    1. 安裝與基本啟動

    前置:

    • 準備一台可以連外網的開發環境(macOS / Linux / WSL 皆可)
    • 安裝好:
    • Python 3.10+ 或 Docker
    • Git

    步驟一:抓專案

    git clone https://github.com/deepseek-ai/deepseek-harness.git
    cd deepseek-harness
    

    步驟二:安裝依賴(以 Python 為例)

    pip install -r requirements.txt
    

    (實際依賴與啟動腳本以官方 README 為準:https://github.com/deepseek-ai/deepseek-harness)

    步驟三:啟動介面或 CLI

    專案提供 Web UI / CLI 等不同啟動方式,通常是:

    python -m deepseek_harness.server
    

    啟動後,開啟瀏覽器訪問本地 URL(例如 http://localhost:8000,以官方文件為準)。

    2. 跑官方範例:確認 Agent 正常運作

    在介面中:

    1. 新建一個 Agent 或工作空間,選擇 DeepSeek 相關模型(包含 vision 的版本,例如 DeepSeek-V4-Flash-Vision-Exp)。
    2. 跑官方示範任務:通常會有預設指令或範例對話,可以先用純文字確認:
    3. 能正常回應
    4. 能接受簡單的 /goal 或 /plan 指令

    如果你偏好程式方式,也可以參考 Towards AI 上的介紹,了解這個框架如何搭配 Claude Code 或 Codex 等開發工具使用:

    3. 實作:做一個自己的「圖文理解工作助理」

    現在,把前面提到的多模態能力,結合你現有的 RAG / 工具調用。

    步驟一:接上你的 RAG 或工具

    • 如果你已有向量資料庫(如:Chroma、Weaviate、Elastic):
    • 將檢索 API 包成一個工具(function / MCP provider)
    • 在 DeepSeek Harness 的工具設定中註冊這個檢索工具
    • 將「查文件」完全交給工具,「理解文件+圖片+任務規劃」交給 Agent。

    可以對照 Agentic RAG 的設計思路:讓 Agent 主動決定何時檢索、檢索幾次:

    步驟二:設計一個固定流程的工作助理

    例如「產品需求評估助理」,定義一個模板:

    1. 使用者輸入:
    2. 需求文檔(文字或 PDF)
    3. 現有 UI 截圖
    4. Agent 流程:
    5. /goal:永遠是「評估新需求與現有產品是否一致」
    6. /plan:
      1. 用工具檢索相關歷史需求與決策記錄
      2. 比對現有 UI 截圖與新需求
      3. 輸出評估報告與待辦事項

    你可以把這整套流程固化在一個「預設對話開場白」裡,讓團隊每次只要丟資料,就能跑同樣的流程。

    步驟三:逐步優化指令模板

    實際跑幾次之後:

    • 把效果好的 /goal 與 /plan 指令存成模板
    • 整理常用的 @引用組合(例如:@最新PRD @設計截圖)
    • 在團隊裡分享一份「怎麼跟助理說話」指南

    DeepSeek Harness 與其他開發者工具的簡易比較

    如果你已在用其他 AI 助手(像是 Claude Code、Codex),可以用下表定位:

    名稱 核心功能 免費方案 適合誰
    DeepSeek Harness 多模態 Agent、/goal /plan、工具整合 開源免費,自架 想打造自家工作流的工程師/產品團隊
    Claude Code 雲端程式助理、自然語言改碼 有免費額度 需要雲端 IDE 型助理的開發者
    Codex(API 生態) 程式碼生成與補全 API 依供應商而定 想在 SaaS 產品中嵌入程式助理的團隊

    對開發者而言,DeepSeek Harness 的定位比較像「你自己可控的骨幹」:多模態理解+任務規劃+工具調用都在你掌控的環境裡,適合拿來搭建團隊內部的工作助理。


    最後建議:從一個小任務開始,把 Agent 變成「同事」

    如果你第一次接觸多模態 Agent,建議從下面的順序開始:

    1. 先選一個單一任務:例如「每週報表截圖分析」。
    2. 用 DeepSeek Harness 跑完整的 /goal + /plan 流程,確認能穩定產出你要的結果。
    3. 再慢慢加上:文件 @引用、RAG 檢索、更多工具。

    一旦你有第一個能被同事穩定使用的「圖文理解工作助理」,後面要擴展到客服、產品、設計等場景,只是複製流程與調整指令而已。

    🚀 你現在可以做的事

    • 去 GitHub 下載並安裝 deepseek-harness,跑一遍官方範例
    • 在團隊中挑一個具體任務(如週報表分析),設計對應的 /goal 和 /plan 模板
    • 整理一批常用文件與截圖,建立首個「產品知識助理」工作空間並實際試用
  • Adobe Firefly 免費變身多媒體 AI 音效工作室

    Adobe Firefly 免費變身多媒體 AI 音效工作室

    📌 本文重點

    • Firefly 免費頁面即可一站生成配樂、旁白與音效
    • 三大音訊工具搭配 Gemini 可完成腳本與分鏡
    • 生成內容為免版稅,適合影片與多媒體專案
    • 對 YouTube、課程、Podcast、Side Project 都實用

    用一句話說完:現在只要開一個免費 Adobe Firefly 頁面,就能一站搞定影片配樂、AI 旁白、人聲與音效,外加 Gemini Omni Flash 幫你生腳本和畫面。

    Firefly AI 音訊工具介紹來源:The Decoder 報導

    Firefly 入口(需 Adobe 帳號):https://firefly.adobe.com


    核心功能:一站式多媒體 AI 工作室

    Firefly 現在的音訊功能可以分成 3 塊:背景音樂、語音、人聲與音效,再加上 Gemini Omni Flash 做腳本與畫面規劃。

    💡 關鍵: Firefly 把「腳本 → 旁白 → 配樂 → 音效」整合到同一介面,實際剪輯前就能一次把聲音資源準備好。

    1. Generate Music:幫你做可用的 BGM

    能做什麼

    • 依照文字描述生成背景音樂,例如:lofi hip-hop, calm, 2 minutes、cinematic, inspiring, 60 seconds
    • 產出免版稅(royalty-free)的音樂,適合拿去剪影片、Podcast、簡報 BGM

    怎麼用(快速路線)

    1. 開啟:進 https://firefly.adobe.com → 登入 Adobe 帳號 → 選 Generate Music。
    2. 設定風格:在提示框輸入風格與情緒,例如:
    3. Lofi hip hop, chill, study, 2 minutes
    4. Corporate, upbeat, presentation, 30 seconds
    5. 選長度:右側通常可選 15 秒、30 秒、60 秒、120 秒等長度,先從 30 秒 測試。
    6. 產生與重試:點 Generate → 不滿意就改幾個關鍵字再生一次。
    7. 匯出:選 Download → 建議選 WAV(後製空間大)或 MP3(檔案小)再丟進剪輯軟體。

    2. Generate Speech:AI 旁白、人聲一次搞定

    能做什麼

    • 把你準備好的腳本變成 AI 旁白,支援多語言、多種聲線
    • 音色可選「溫暖敘事」「專業解說」「活潑廣播」等不同角色

    怎麼用

    1. 開啟:在 Firefly 首頁選 Generate Speech。
    2. 貼上腳本:把 YouTube 影片解說詞、課程講稿、Podcast 開場白貼進文字框。
    3. 選語言與聲線:
    4. 語言:選 Chinese / Mandarin 或你要的語言
    5. 聲線:選性別與風格,先聽試播(Preview)
    6. 微調語速和情緒:
    7. 教學影片:語速中偏慢、語氣中立
    8. 廣告 / Jingle:語氣活潑、情緒偏高
    9. 匯出音檔:下載成 WAV / MP3,在剪輯軟體對齊畫面使用。

    3. Generate Sound Effects:快速補齊效果音

    能做什麼

    • 依文字描述生成特定音效:按鈕點擊聲、轉場「呼」一聲、城市環境音等
    • 對 YouTube Vlog、遊戲實況、簡報動畫很有幫助

    怎麼用

    1. 開啟:選 Generate Sound Effects。
    2. 文字提示:輸入具體用途,例如:
    3. mouse click, soft, UI
    4. whoosh, fast, transition
    5. office ambience, light, background
    6. 選長度:
    7. 0.5~2 秒:按鈕聲、轉場聲
    8. 5~20 秒:環境氛圍音(咖啡廳、雨聲)
    9. 預聽與調整:生成後多聽幾個版本,把最符合節奏的那個下載。

    4. Gemini Omni Flash:腳本、分鏡、視覺素材助手

    Firefly 也整合了 Google Gemini Omni Flash,等於內建一個文本/多模態模型,幫你在音訊前一站就把內容想好。

    可以這樣用

    1. 生腳本:輸入需求,像:
    2. 幫我寫一支 3 分鐘的理財新手教學 YouTube 影片腳本,口吻輕鬆、使用範例多。
    3. 分鏡建議:請它把腳本拆成鏡頭,大綱包含「畫面內容 + 旁白」。
    4. 搭配 Firefly 影像工具:分鏡確定後,用 Firefly 的圖片 / 影片生成功能做縮圖或背景畫面。

    工具比較與適用族群

    名稱 核心功能 免費方案 適合誰
    Generate Music 依文字生成免版稅背景音樂,可選風格與長度 需 Adobe 帳號,可在 Firefly 網站免費使用(有配額與解析度限制) YouTuber、線上課程講師、公司簡報製作、Podcast BGM
    Generate Speech 將文字腳本轉成多語言 AI 旁白,支援不同聲線 同上,免費帳號即可測試多種語音 不方便錄音的創作者、公司內訓影片、個人 Side Project 說明影片
    Generate Sound Effects 生成按鍵聲、轉場聲、環境音等效果音 同上,適合大量產出短音效 Vlog 剪輯、遊戲實況剪輯、Podcast 音效設計、簡報動畫音效
    Gemini Omni Flash(整合於 Firefly) 生成腳本、分鏡與文字構想,可輔助影像與音訊創作 透過 Firefly 介面使用,有使用配額 需要快速發想腳本、提案內容、影片大綱的創作者與團隊

    💡 關鍵: 只要有免費 Adobe 帳號,就能在 Firefly 網站內試玩完整音訊工具組,非常適合個人創作者與小團隊先行導入。


    適合誰用?幾個具體場景

    1. YouTube 影片製作

    可以這樣串起來:

    • 用 Gemini Omni Flash 寫腳本 → Generate Speech 做旁白 → Generate Music 做 BGM → Generate Sound Effects 補轉場與按鈕音效。

    實際行動:下一支影片開始前,先把腳本丟給 Gemini 優化,再一次把三軌音(旁白 / 配樂 / 效果音)生好再進剪輯軟體。

    2. 線上課程與公司簡報影片

    • 沒空錄音:用 Generate Speech 把課綱變成穩定的 AI 旁白,風格統一、不用擔心 NG。
    • 背景音樂:用 Generate Music 生「低存在感」的 corporate / ambient BGM,音量在 -20dB 左右鋪底即可。

    實際行動:先準備好投影片腳本 → 丟給 Generate Speech → 旁白完成後,再按章節生成對應 BGM。

    3. Podcast 或 Jingle 快速產出

    • 開場 Jingle:用 Generate Music 做 10~15 秒的品牌旋律,再搭配 Generate Speech 做一句 Slogan。
    • 短訪談:沒錄到補錄的橋段,可暫時用 AI 旁白補洞。

    實際行動:先寫你節目那句「固定開場白」,用幾個不同聲線試聽,選一個做節目固定音檔。

    4. 個人 Side Project

    • 個人產品 Demo、App 介紹頁影片
    • 小遊戲、互動網站的背景音與按鈕聲

    實際行動:先列出你專案需要的「聲音清單」(例如:背景音 1 條、按鍵聲 3 種、通知聲 2 種),逐項用 Generate Music / Sound Effects 生出來存進專案資料夾。


    怎麼開始:從註冊到匯出音軌

    步驟一:用免費 Adobe 帳號登入 Firefly

    1. 到 https://firefly.adobe.com
    2. 使用 Google / Apple / Email 註冊 Adobe ID
    3. 登入後,在首頁可以看到 Audio(或 Music / Speech / SFX)相關入口

    小提醒:免費帳號會有「生成次數 / 解析度」等限制,若是偶爾創作,通常足夠使用。

    步驟二:在介面選風格與長度

    以 Generate Music 為例,其餘工具操作類似:

    1. 在左側或上方輸入提示文字(Prompt),盡量包含:
    2. 樂風:lofi / pop / rock / cinematic / corporate
    3. 情緒:chill / energetic / inspiring / sad
    4. 用途與長度:for YouTube vlog, 60 seconds
    5. 在右側選長度、節奏(BPM)、有無節奏鼓點等(若介面有提供)。
    6. 點 Generate 生成,聽完不喜歡就修改提示或直接再生成一次。

    Generate Speech / Sound Effects 的操作也一樣:

    • Speech:貼文字 → 選語言 & 聲線 → 試聽 → 調整語速 / 情緒 → 匯出。
    • SFX:文字描述 + 長度 → 生成 → 挑版本 → 匯出。

    步驟三:匯出到剪輯軟體(Premiere、Audition、CapCut…)

    建議輸出格式

    • WAV:品質好、無壓縮,適合正式作品與後製
    • MP3:檔案小,適合快速 Demo、雲端分享

    匯入常用剪輯軟體的方式

    • Premiere Pro:
    • 在專案面板右鍵 → Import → 選擇下載的音檔
    • 或直接拖拉音檔到時間軸(Timeline)

    • Adobe Audition:

    • File → Open → 選擇音檔
    • 或拖曳到 Multitrack Session 中做混音、壓縮、EQ

    • CapCut(桌機 / 手機):

    • 點「上傳」或「新增媒體」→ 選擇音檔
    • 拖到音軌,調整與畫面的對齊

    小技巧

    • 旁白(Speech)放在最上層音軌,音量做為基準
    • BGM(Music)通常比旁白低 15~20dB
    • SFX 音量略高於 BGM,但不可蓋過旁白

    💡 關鍵: 把旁白當成音量基準,再用「BGM -15~20dB、SFX 略高於 BGM」這個簡單規則,就能快速混出清晰又有層次的聲音。

    步驟四:版權與使用注意

    根據 The Decoder 報導,Firefly 生成的音樂、語音與音效為 royalty-free(免版稅),適合用於影片與多媒體專案。

    行動建議:

    • 上線商業作品前,再到 Adobe 官方條款頁確認最新授權規則與限制,避免平台政策更新導致使用爭議。
    • 導出設定盡量保留高品質版本(WAV),再另外輸出壓縮版本給平台(YouTube / Podcast)使用。

    如果你常做影片、簡報或 Podcast,需要「快速做出能聽的聲音」,可以先挑一個正在剪的作品,照文中的順序跑一次:腳本 → Speech → Music → SFX → 匯入剪輯軟體,你會很直觀感受到 Firefly 當「一站式多媒體 AI 工作室」帶來的時間差距。

    🚀 你現在可以做的事

    • 立刻到 Firefly 網站 用免費 Adobe 帳號登入,試用 Generate Music、Speech、Sound Effects
    • 把一支現有影片或簡報的腳本丟給 Gemini Omni Flash,生成或優化完整旁白與分鏡
    • 依照文中的音量與音軌配置建議,將生成的三軌音匯入你慣用的剪輯軟體實際跑一次流程
  • 讓桌面自己動的 UI-Mate 實戰筆記

    讓桌面自己動的 UI-Mate 實戰筆記

    📌 本文重點

    • UI-Mate 讓 AI 直接「看畫面、動滑鼠鍵盤」
    • 用自然語言或示範錄製,就能生成桌面操作流程
    • 可與現有 Python 腳本與 RPA 流程整合,減少人工操作

    用一句話說:UI-Mate 就是一個「看得懂螢幕、聽得懂人話、會自己動滑鼠鍵盤」的桌面機器人,幫你把重複性的桌面操作交給 AI 來做。

    模型主頁:https://huggingface.co/tencent/UI-Mate-27B


    核心功能:這三件事搞懂就能用

    1. 視覺理解:給截圖,它看得懂 UI

    UI-Mate-27B 的核心是一個多模態模型:
    – 你提供「螢幕截圖」+
    – 一段自然語言說明(例如:請幫我打開 Chrome 並登入後台)
    – 它輸出一段結構化動作序列:滑鼠移動、點擊、鍵盤輸入等

    💡 關鍵: 只要一張截圖加一句需求,模型就能直接產出可執行的桌面操作步驟。

    實際可以怎麼用:
    1. 先準備好一個測試畫面(例如:公司後台登入頁)。
    2. 截圖保存為 screen.png。
    3. 把截圖和指令丟給 UI-Mate,看它給出怎樣的「下一步操作」。

    你會拿到類似這樣的結構化輸出(示意):

    {
      "actions": [
        {"type": "move", "x": 540, "y": 320},
        {"type": "click", "button": "left"},
        {"type": "keyboard", "text": "your_email@example.com"},
        {"type": "key", "value": "TAB"},
        {"type": "keyboard", "text": "your_password"},
        {"type": "click", "x": 620, "y": 410}
      ]
    }
    

    接下來你只要寫一個小腳本讀這個 JSON,真的去移動滑鼠、輸入文字,桌面就會「自己操作」。

    2. 自然語言指令:講人話就能控制桌面

    UI-Mate 的互動方式很直覺:
    – 你不需要寫流程圖,也不必一開始就拆成「步驟 1、步驟 2」
    – 只要描述結果:
    -「幫我批量把 Excel 檔案匯入這個 ERP 系統」
    -「打開 Outlook,把今天的報表寄給 A 組所有人」

    模型會自己規劃步驟,並在每一步:
    1. 讀取最新截圖
    2. 思考現在畫面狀態(按鈕位置、輸入框、表格等)
    3. 給出下一步滑鼠鍵盤操作

    你可以這樣實作一個最小可用版本:
    – 外層自己寫「迴圈」:
    1. 每步:截圖 → 丟給 UI-Mate → 執行動作
    2. 執行完再截圖下一幀
    – UI-Mate 負責:理解畫面 + 決定下一步

    行動建議:
    – 先選一個你每天重複 10 次以上的操作(例如:下載報表、貼到另一個系統),用自然語言完整描述「你平常怎麼做」,當成指令丟給 UI-Mate,看它的步驟規劃是否合理。

    3. 示範錄製重用:示範一次,變成可重複流程

    UI-Mate 還有一個「示範引導模式」(demo-guided mode):
    – 你親自操作一次完整流程
    – 系統記錄下:每一步的截圖 + 你的操作
    – 模型會從這次成功示範中,歸納出一個「可泛化的流程」

    這跟傳統 RPA 的差別在於:
    – 傳統 RPA:錄的是「座標腳本」,畫面稍微變一下就壞掉
    – UI-Mate:每次執行時都重新「看畫面」,按「字樣、位置關係」來找按鈕,不是死記座標

    💡 關鍵: UI-Mate 不是重播固定座標,而是每次重新看 UI,用文字與位置關係判斷該點哪裡。

    可以這樣玩:
    1. 用你熟悉的桌面錄製工具(或自製簡單 recorder)記錄一步步操作與截圖。
    2. 把「示範過程」餵給 UI-Mate,請它輸出一個「可重複使用的任務描述 + 動作模板」。
    3. 下次只要換資料(不同 Excel、不同客戶),讓 UI-Mate 根據新畫面、自動套同一個流程。

    行動建議:
    – 選一個流程性質很穩定、但資料每天不同的任務(例如:每日匯入銷售數據),試著用「示範一次 → 重用」方式,取代你手動教同事的 SOP。


    適合誰用:四種典型場景

    1. 重複性後台系統操作

    • 例如:
    • 每天登入多個 SaaS 後台,下載報表、貼到內部系統
    • 每週批次更新客戶狀態
    • 你可以:
    • 把這些步驟示範一次
    • 用 UI-Mate 產生可重複的「桌面任務」
    • 未來只改輸入條件(日期、客戶名),交給 AI 操作

    2. 桌面版軟體批量設定

    • 例如:
    • VPN 客戶端批量新增設定檔
    • 本地 ERP/會計軟體批量開立客戶資料
    • 傳統腳本難點在於:UI 複雜、不易找到穩定 API
    • UI-Mate 直接「看畫面」,幫你點選和輸入。

    3. 跨 app 搬資料

    • 例如:
    • 從 Outlook 下載附件 → 存到指定資料夾 → 打開 Excel 做簡單整理 → 貼到公司內部系統
    • 原本要寫一堆整合腳本或 RPA 流程
    • 現在可以:
    • 用自然語言描述「從哪裡拿資料、要丟去哪裡」
    • UI-Mate 在不同程式之間切換畫面、操作滑鼠鍵盤

    4. 給不會寫程式的同事用的「桌面機器人」

    • 對象:
    • 業務、行政、財務等非工程同事
    • 玩法:
    • 工程師先搭好「UI-Mate 服務」和一個簡單的 Web / 桌面介面
    • 同事只要:
      • 輸入指令(或從下拉選任務)
      • 確認螢幕共享權限
    • 剩下交給 UI-Mate 自己在他們的桌面操作

    怎麼開始:Hugging Face + 本地部署實戰

    以下以在本地機器上跑 UI-Mate-27B 為主線,預設你有一台具備較強 GPU 的機器(例如 48GB VRAM 以上),或準備先在雲端機器試用。

    步驟 0:硬體與環境準備

    建議環境:
    – GPU:單張 48GB VRAM(或多卡切分),若用量化(如 4-bit)可略降需求
    – 系統:Ubuntu 20.04 / 22.04 或 Windows + WSL
    – Python:3.10 或以上

    行動:

    conda create -n uimate python=3.10 -y
    conda activate uimate
    pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124
    pip install transformers accelerate safetensors pillow
    

    💡 關鍵: 若使用 4-bit 等量化,可以在較小 VRAM 的 GPU 上嘗試跑 UI-Mate-27B。

    步驟 1:從 Hugging Face 下載權重

    模型頁面:https://huggingface.co/tencent/UI-Mate-27B

    行動:

    huggingface-cli login  # 輸入你的 HF token
    # 下載模型(示例,可改路徑)
    huggingface-cli download tencent/UI-Mate-27B --local-dir ./uimate-27b
    

    如果你不想預先全部拉下來,也可直接用 from_pretrained 動態下載(見下一步)。

    步驟 2:跑一個最小 Demo

    以下是一個「給一張截圖 + 一句指令,讓 UI-Mate 回傳動作計劃」的簡單腳本:

    from transformers import AutoModelForCausalLM, AutoTokenizer
    from PIL import Image
    import torch, json
    
    MODEL_PATH = "tencent/UI-Mate-27B"  # 或改成本地路徑
    
    device = "cuda" if torch.cuda.is_available() else "cpu"
    
    print("Loading model...")
    model = AutoModelForCausalLM.from_pretrained(
        MODEL_PATH,
        torch_dtype=torch.float16,
        device_map="auto"
    )
    
    tokenizer = AutoTokenizer.from_pretrained(MODEL_PATH)
    
    # 1. 準備截圖與指令
    image = Image.open("screen.png")  # 先手動截一張
    user_instruction = "在這個畫面中,幫我輸入帳號和密碼,然後按登入。"  
    
    # 2. 組合多模態輸入(形式視官方範例為準)
    inputs = tokenizer(
        user_instruction,
        return_tensors="pt"
    ).to(device)
    
    # 一般會有圖像編碼器,這裡假設模型內已處理;實作時請對照官方範例
    
    with torch.no_grad():
        outputs = model.generate(
            **inputs,
            max_new_tokens=512
        )
    
    reply = tokenizer.decode(outputs[0], skip_special_tokens=True)
    print("Model output:\n", reply)
    
    # 若模型以 JSON 格式輸出動作,可直接解析
    try:
        actions = json.loads(reply)
        print("Parsed actions:", actions)
    except json.JSONDecodeError:
        print("請依官方格式調整 prompt,確保輸出為 JSON。")
    

    實務上請以 UI-Mate 官方示例程式為準,Hugging Face 頁面的 README 通常會附完整 demo,先照抄跑通,再慢慢改成你的場景。

    步驟 3:用 Python 腳本發指令 + 真實執行

    接下來要做的是把模型輸出的動作「真的」執行在桌面上:

    1. 安裝桌面操作套件(以 Windows 為例):
    pip install pyautogui mss
    
    1. 寫一個簡單「桌面代理 loop」:
    import pyautogui, time, json
    from mss import mss
    
    # 假設這是從 UI-Mate 拿到的 JSON
    plan = {
      "actions": [
        {"type": "move", "x": 500, "y": 300},
        {"type": "click", "button": "left"},
        {"type": "keyboard", "text": "demo_user"}
      ]
    }
    
    for step in plan["actions"]:
        if step["type"] == "move":
            pyautogui.moveTo(step["x"], step["y"], duration=0.2)
        elif step["type"] == "click":
            pyautogui.click(button=step.get("button", "left"))
        elif step["type"] == "keyboard":
            pyautogui.typewrite(step["text"], interval=0.05)
        time.sleep(0.2)
    
    1. 把兩段程式串起來:
    2. 每步:用 mss 截圖 → 丟給 UI-Mate → 解析 JSON → 用 pyautogui 執行
    3. 加上錯誤處理(超時、視窗關閉等),就能形成一個簡單的桌面機器人。

    怎麼接到既有自動化腳本 / RPA 流程

    多數團隊已經有一堆:
    – Python 自動化腳本
    – 現成 RPA 流程(如 UiPath、Power Automate)

    你可以把 UI-Mate 當成「一個新步驟」插進去,而不是全部重寫。

    實戰示例:Python 腳本 + UI-Mate 處理「UI 部分」

    假設你原本有一個腳本:
    – 從資料庫抓訂單 → 輸出 CSV
    – 然後要人手動開某個老舊桌面系統,把這些訂單一筆筆輸入

    改造方式:
    1. 保留原本「資料庫 → CSV」的 Python 程式
    2. 新增一個 fill_orders_with_uimate() 函式:
    – 負責:
    1. 打開舊系統
    2. 逐筆讀取 CSV
    3. 對每一筆訂單:
    – 截圖
    – 呼叫 UI-Mate:請依照示範流程,把這筆訂單填入畫面上對應欄位。
    – 執行模型輸出的滑鼠鍵盤動作

    整體流程變成:

    原本 Python 程式:
      資料庫 → CSV  → (人手動輸入)
    
    改造後:
      資料庫 → CSV → UI-Mate 桌面代理 → 舊系統
    

    與 RPA 工具共存的方式

    如果你公司已經有 RPA 工具(例如 UiPath):
    – 把 UI-Mate 當成「一個 API」:
    1. 在本地或伺服器上跑一個簡單的 Flask/FastAPI 服務,提供 /plan-actions endpoint:
    – Input:截圖 + 任務描述
    – Output:UI-Mate 計劃好的動作 JSON
    2. 在 RPA 流程裡新增一個步驟:
    – 呼叫這個 API 拿動作
    – 用 RPA 自己的「滑鼠/鍵盤活動」元件,執行 JSON 裡的動作

    這樣的好處:
    – 原有 RPA 流程不必大改
    – 跟 IT 合規的整合點很清楚:只是一個額外的內部 API


    小結:建議你的第一個實驗任務

    如果你只想花半天試試 UI-Mate,這樣安排:
    1. 選一個每天都在做、步驟固定的桌面任務(例如:登入兩個系統、下載/上傳一份報表)。
    2. 用 Hugging Face Demo 或本地部署,先跑通:
    – 截圖 + 自然語言指令 → UI-Mate 回傳動作
    3. 寫一個小 Python 腳本,真的在桌面執行那些動作。
    4. 最後,再把這個任務掛到你現有的自動化腳本或 RPA 裡,讓 UI-Mate 僅負責「用眼睛看 UI 的那一段」。

    做到這一步,你就多了一個「會看畫面、會動滑鼠」的 AI 同事,可以逐步把更多枯燥的桌面操作交給它。

    🚀 你現在可以做的事

    • 打開 UI-Mate-27B 模型頁,按 README 示範先跑通官方 demo
    • 在自己的機器上依照文中指令建立 uimate 環境並試跑一次截圖 + 指令的最小腳本
    • 選一個固定桌面任務,設計截圖迴圈 + pyautogui 執行,做出你的第一個 UI-Mate 桌面機器人
  • 用 Replit Free Mode 免費請 GPT-5.6 寫程式

    用 Replit Free Mode 免費請 GPT-5.6 寫程式

    📌 本文重點

    • Replit Free Mode 讓你免 API 金流直接用 GPT-5.6 Luna 寫程式
    • 一句人話就能從想法生成可執行程式並協助除錯、重構
    • 特別適合 side project、MVP、教學練習與小團隊 internal tool

    只想「講一句人話」就拿到能跑的程式?Replit 的 Free Mode 搭載 GPT-5.6 Luna,讓你不用管 API 費用,直接在雲端寫、改、跑程式。

    官方介紹:Replit Free Mode powered by GPT-5.6 Luna — OpenAI Blog | Replit 官網


    核心功能:一句話到可執行程式

    下面這幾個能力,基本涵蓋「從想法到可跑程式」的全流程,你可以逐一試。


    1. 自然語言生成完整程式

    能做什麼:

    • 把需求用白話打給 Luna:例如「幫我做一個輸入網址就抓頁面標題的 Python 小工具」。
    • Luna 會產生:程式碼 + 檔案結構 + 依賴套件(requirements.txt / package.json 等)。
    • 在 Replit 裡可以直接按 Run 驗證程式是否能跑。

    💡 關鍵: 你只要用自然語言描述需求,Luna 就能直接給出「可執行且帶完整檔案結構」的專案,而不是零散片段程式碼。

    可以馬上做的事:

    1. 登入 Replit 後新建一個 Python Repl。
    2. 打開右側 AI 面板(Luna),輸入你的需求。
    3. 要求它「請給完整程式碼並幫我建立必要檔案」。

    2. 自動改 Bug、看錯誤訊息

    能做什麼:

    • 程式跑錯、出現 trace?直接貼給 Luna:「我按 Run 後出現這段錯誤,幫我修」。
    • 它會解釋錯誤原因,提出修正版本,甚至直接在檔案中幫你改動。

    可以馬上做的事:

    1. 故意輸入一個會出錯的程式(例如少裝套件)。
    2. 把整段錯誤訊息貼給 Luna,問:「為什麼?」
    3. 再追問:「幫我改到可以跑,並說明你改了什麼。」

    3. 重構與加註解,變可讀程式

    能做什麼:

    • 把一整支亂成一團的函式貼給 Luna,說:「幫我拆成多個小函式並加中文註解」。
    • 可以指定風格:「註解只寫在關鍵邏輯,不要每行都寫」。

    可以馬上做的事:

    1. 找一段你寫過或在網路上找到的程式碼,貼給 Luna。
    2. 指令示例:
    3. 「幫我重構成更易讀的版本,保持功能相同。」
    4. 「加繁體中文註解,讓初學者也看得懂。」

    適合誰用:4 個高命中場景

    GPT-5.6 Luna 在 Replit Free Mode 裡最適合下面幾種日常開發場景,你可以對號入座。


    1. 個人 side project:快速拼出可以用的雛形

    典型需求:

    • 爬資料、寫小工具、做簡單 Web app。
    • 沒時間細看文件,只想「先有東西能跑」。

    實際操作:

    • 舉例:想做「每日匯率提醒」小工具。
    • 在 Replit 建一個 Python 專案。
    • 告訴 Luna:「抓某銀行匯率 API,每天寄一封 Email 給我。」
    • 要求:
      • 「幫我寫主程式 + 環境變數設定範例。」
      • 「提醒我在哪裡要改成自己的 Email 帳號。」

    2. MVP 試作:先證明可行再談設計

    典型需求:

    • 只需 demo,先有功能再說 UX、架構。

    實際操作:

    • 舉例:做一個「內部表單 → 自動丟到 Notion」服務。
    • 新建 Node.js Repl。
    • 給 Luna 簡短規格:
      • 「做一個簡單網頁表單,送出後呼叫 Notion API 建新頁面。」
    • 要求:
      • 「幫我切前端檔案與後端 server.js。」
      • 「用注解標出我需要填 Notion token 的位置。」

    3. 小團隊 internal tool:自動化繁瑣工作

    典型需求:

    • 把重複操作寫成腳本;例如:整理 log、轉檔、批次產出報表。

    實際操作:

    • 舉例:DevOps 想做 log 分析腳本:
    • 把範例 log 檔上傳到 Replit。
    • 對 Luna 說:「讀這個 log,幫我做一個能統計錯誤率與平均響應時間的工具。」
    • 要求:
      • 「最後輸出成 CSV 檔。」
      • 「寫一個 CLI 介面,可指定檔案路徑。」

    💡 關鍵: 這類 internal tool 用 Luna 代工,可以大幅減少重複人工操作時間,讓團隊專注在核心開發工作。


    4. 教學與練習:邊寫邊問,像有一位助教

    典型需求:

    • 老師:出作業給學生,示範可跑程式。
    • 學生:練習時想知道「這樣寫有沒有更好?」

    實際操作:

    • 舉例:教 if/else 與函式:
    • 要 Luna 生成一個「成績換等級」程式,要求加註解。
    • 再問:「把這份程式改寫成使用字典 mapping 的版本,並解釋差異。」

    實作示範:一步步用 Free Mode 做一個小工具

    以「簡易網址標題抓取工具」為例,一步走完 Free Mode 流程。


    步驟 1:註冊與開啟 Free Mode

    1. 到 https://replit.com 註冊帳號(可用 Google / GitHub 登入)。
    2. 登入後,右上角點 Create Repl。
    3. 選擇語言(例如 Python)。
    4. 確認右側有 AI 助手面板(通常標示為 Luna / AI),這就是 Free Mode 入口。

    Free Mode 的重點:在 Replit 裡用 Luna 時,不需自己準備 OpenAI API key,也不用管 token 計費。


    步驟 2:設定語言與專案結構

    1. 在 Create Repl 選單中:
    2. Language:選 Python。
    3. Template:預設即可。
    4. 建立後,左側檔案區會看到 main.py。你可以先留空,交給 Luna 一次產生。
    5. 在 AI 面板輸入:

    「我要一個命令列工具,輸入網址後抓出頁面 <title> 文字並印出。請給我:
    1. 完整 main.py。
    2. 如果需要套件,幫我建立 requirements.txt。」

    Luna 會:

    • 產出 Python 程式,可能使用 requests + beautifulsoup4。
    • 建立 requirements.txt,列表需要安裝的套件。

    步驟 3:和 AI 一起 debug、改版

    1. 按 Run,如果出現錯誤(例如套件未安裝),把錯誤訊息全選貼給 Luna:

    「這段錯誤是什麼意思?幫我改到可以在 Replit 上直接跑。」

    1. 要求它:
    2. 加上 pip 安裝步驟,或在 Replit 的 Packages 面板幫你選。
    3. 修改程式讓錯誤處理更友善,例如網址無效時印出提示。
    4. 當程式可以穩定跑後,再請 Luna:

    「幫我把這份程式加上繁體中文註解,並簡短說明程式流程。」

    到這一步,你就完成了:

    • 一個可執行的小工具。
    • 有註解、適合自己與同事二次維護。

    和本地 LLM / 其他雲端 IDE 怎麼搭配?

    Replit Free Mode 很適合「雲端原型」,但你可能還會用本地 LLM 或其他 IDE。下面是常見組合:

    名稱 核心功能 免費方案 適合誰
    Replit + GPT-5.6 Luna 雲端一站式寫程式、跑程式、協作;免自己管 API Free Mode 可直接用 Luna,限制較寬鬆 想快速做 side project、MVP、小工具的人
    本地 LLM(如 Ollama + 開源模型) 不連網也能跑模型,在 VS Code / 終端中輔助寫程式 多數模型可免費下載使用,主成本是硬體 重視隱私、在公司內網或沒網路時開發
    雲端 AI IDE(如 Cursor、Claude Code) 深度整合編輯器、多檔案重構、強代碼理解 有免費額度,但通常有使用上限 長期大型專案開發者,希望整合 Git、測試流程

    搭配建議:

    • 原型在 Replit,長期在本機或其他 IDE:
    • 先用 Replit + Luna 做出可跑原型。
    • 成熟後,再把程式碼拉到 Git,接到自己慣用 IDE(VS Code、Cursor 等)。
    • 雲端 + 本地雙軌:
    • 雲端(Replit)負責 demo、分享給 team。
    • 本地 LLM 負責敏感程式碼(公司內部系統、機密邏輯)。

    💡 關鍵: 把 Replit Free Mode 當成「雲端原型場」,再搭配本地或其他雲端 IDE,是目前最靈活、成本最低的開發配置之一。


    小結:你現在可以做的三件事

    1. 開 Replit 帳號,啟用一個 Python / Node.js Repl,打開 Luna 面板。
    2. 用一句話描述你想做的小工具,要求 Luna「給完整專案結構 + 可跑程式」。
    3. 一邊跑程式,一邊把錯誤訊息、重構需求丟給 Luna,當成免費的雲端「結對程式夥伴」。

    善用 Free Mode,你可以在沒有 API 預算的情況下,實際感受 GPT-5.6 Luna 在程式開發上的威力,並把 idea 變成真正能跑的軟體。

    🚀 你現在可以做的事

    • 去 Replit 註冊帳號並建立第一個 Repl,確認右側 Luna 面板可用
    • 按照文中的「網址標題抓取工具」示例,請 Luna 生出完整專案並親手按一次 Run
    • 把你現有的一段「醜但能動」的程式貼給 Luna,要求重構與加註解,體驗它當助教與結對夥伴的效果
  • 把舊遊戲卡變成本地 AI 程式助手

    把舊遊戲卡變成本地 AI 程式助手

    📌 本文重點

    • 16GB 顯卡即可本地跑 Qwen 3.8-27B 程式助手
    • llama.cpp + MTP 把長上下文推理速度壓到可用
    • 少數高階指令即可讓 Agent 自動讀 repo、寫 code、跑測試

    用一張 16GB 顯卡,把 Qwen 3.8-27B 跑在自己機器上,變成一個能讀 repo、寫 code、自己跑測試的本地程式助手。


    核心功能:這套組合能幫你做什麼?

    1. 在 16GB 顯卡上跑 27B 長上下文 Agent

    • Qwen 3.8-27B 是阿里開源的大模型,在 Reddit 實測 裡,表現接近商用雲端模型,特別擅長長上下文推理和實務知識。
    • 社群已針對 16GB VRAM 做過完整配置分享,可在 73k context 下跑 agentic coding,單專案可吃超過百萬 token 歷史。參考設定。
    • 透過 GGUF 量化 + cache 量化,搭配 CPU RAM,把 27B 模型擠進「遊戲卡 + 小主機」這種平價組合。

    💡 關鍵: 只要 16GB 顯卡就能在本地處理 73k 以上長上下文,支援單專案百萬 token 歷史。

    你可以做的:
    – 把原本只能打遊戲的 16GB 顯卡,變成一台完全離線的 AI 程式助手。
    – 不依賴雲端,內網就能讓 AI 幫你寫 CLI 工具、重構專案。


    2. llama.cpp v0.1.0 + FastMTP / adaptive MTP:把延遲壓到能用

    • llama.cpp v0.1.0 是穩定版,支援多平台(Windows / Linux / macOS / Apple Silicon),對 GGUF 模型友善。版本連結
    • HauhauCS 的 FastMTP(多 token 預測)在 Qwen 3.8-27B 上可達 3 倍輸出速度提升:模型頁面。
    • llama.cpp 的 adaptive MTP(PR#27210)會依情境自動調整 MTP 深度:簡單部分快出,多步推理時才放慢,代碼生成速度可提升 10–50%。

    💡 關鍵: 結合 FastMTP 與 adaptive MTP,可以把原本「一秒一 token」的體驗提升到實際可用的程式生成速度。

    你可以做的:
    – 在同一台機器上,從「一秒一 token」變成「可以實際用來寫 code」的速度。
    – 不用糾結 MTP 數字,用 adaptive 模式就能有不錯的平衡。


    3. 真正的「Agent」:少數幾個高階提示就能跑完整專案

    • Qwen 3.8-27B 在所謂 medium reasoning 模式下,對「代理式編碼」特別吃香:實測 benchmark 顯示,比 xhigh 模式更省 token、更少請求,完成度相近。
    • 你只要給它幾個高階指令(例如:讀 repo、規劃任務、按計畫實作),讓它自己呼叫 shell/測試,就能完成一個小專案。

    你可以做的:
    – 把它當成「本地版 Cursor Agent」:讓它自己看專案、拆任務、寫程式、跑測試。


    適合誰用?

    • 個人開發者 / 接案工程師:
    • 想用 Qwen 3.8-27B 協助寫後端 / CLI 工具,但又不想每月付雲端費用。
    • 例:在家用 3060 16GB + N100 補一台小主機,做本地私有助手。

    • 公司內部專案:

    • 需要把專案 code、內部文件給 LLM 看,但有資料不出防火牆的限制。
    • 例:在 CI/CD server 上掛一個 Qwen Agent,協助寫腳本、改 pipeline。

    • AI 工具愛好者 / 自架控:

    • 喜歡試不同量化、推理引擎,把效能擠到極限。
    • 例:對比 medium reasoning + adaptive MTP vs xhigh + 固定 MTP 的速度與品質差異。

    工具與環境:一次給你可複製的配置

    1. 必要硬體與系統建議

    最低建議(接近 Reddit 實測環境):

    • GPU:RTX 4060/5060 Ti 16GB,或同級 16GB 顯卡
    • CPU:Intel N100 以上(有 AVX2 更好)
    • RAM:32GB(推薦 48GB+,上下文拉長時更穩)
    • 系統:Ubuntu 22.04 / Windows 11(本文以 Linux 命令為例)

    行動:檢查自己機器:

    nvidia-smi  # 看 VRAM 容量
    free -h     # 看 RAM
    

    2. 模型與 llama.cpp 安裝

    Step 1:抓 llama.cpp v0.1.0

    git clone https://github.com/ggml-org/llama.cpp.git
    cd llama.cpp
    git checkout v0.1.0
    make -j$(nproc)
    

    Step 2:下載 Qwen 3.8-27B GGUF

    建議用 HauhauCS Aggressive + MTP 版本:

    下載範例(用 hf_hub_download 或直接瀏覽器下載):

    mkdir -p models/qwen-3.8-27b
    # 將下載好的 .gguf 放進這個資料夾
    mv ~/Downloads/Qwen3.8-27B-*-Q5_K_M.gguf models/qwen-3.8-27b/
    

    3. 實測好用的啟動指令(16GB VRAM)

    下面是一個可直接用來跑 Agent 的作者實測配置(參考自 1M+ token 實作):

    ./bin/llama-server \
      -m models/qwen-3.8-27b/Qwen3.8-27B-*-Q5_K_M.gguf \
      --ctx-size 73000 \
      --batch-size 512 \
      --n-gpu-layers 45 \
      --gpu-layers-split auto \
      --cache-type-k q8_0 \
      --cache-type-v q8_0 \
      --no-mmap \
      --temp 0.8 \
      --top_p 0.9 \
      --seed 42 \
      --mtl 4 \
      --mtp-adaptive
    

    關鍵說明:

    • --ctx-size 73000:長上下文,適合讀整個 repo。
    • --cache-type-k/v q8_0:cache 量化,換取更大上下文與速度。
    • --mtp-adaptive:啟用 adaptive MTP,自動調整多 token 推理深度。
    • --mtl 4:多執行緒,視 CPU 調整(8 核可用 6–8)。

    行動:啟動後,瀏覽器開 http://localhost:8080,確認模型可以互動,再往下走 Agent Workflow。


    Workflow 示範:讓本地 Qwen 自己寫一個 CLI 工具

    目標:寫一個「掃描專案中 TODO 註解並輸出報表」的 Python CLI 工具,讓 Agent 自己:

    1. 讀 repo
    2. 規劃任務
    3. 分步撰碼
    4. 呼叫 pytest 或自訂測試

    1. 準備一個 repo + agent shell

    假設你的專案在 ~/projects/todo-cli:

    cd ~/projects/todo-cli
    python -m venv .venv
    source .venv/bin/activate
    pip install pytest
    

    準備一個簡單的「Agent shell」腳本(例如 agent_shell.py),透過 HTTP 調用 llama.cpp,並允許它執行有限制的 shell 指令:

    import subprocess, json, requests, os
    
    API_URL = "http://localhost:8080/completion"
    
    ALLOWED_CMDS = ["pytest", "python", "ls", "cat"]
    
    def call_llm(prompt):
        payload = {
            "prompt": prompt,
            "max_tokens": 512,
            "temperature": 0.7
        }
        r = requests.post(API_URL, json=payload)
        return r.json()["content"]
    
    def run_cmd(cmd):
        if cmd.split()[0] not in ALLOWED_CMDS:
            return "[blocked command]"
        return subprocess.run(cmd, shell=True, capture_output=True, text=True).stdout
    
    if __name__ == "__main__":
        while True:
            user = input("You> ")
            if user.strip() == "exit":
                break
            resp = call_llm(user)
            print("Agent>", resp)
    

    行動:確保你能從命令列下指令,讓 Agent 先以「聊天模式」回答,再逐步加上工具使用(shell 執行)。


    2. 用高階提示引導 Qwen 變成程式助手

    示範系統提示(可貼進 Web UI 或 agent_shell 的第一個請求):

    你是一位本地程式助手,目標是在不依賴外網的情況下,完成整個專案開發流程。
    
    能力與規則:
    1. 你可以要求我執行指令,例如:`RUN: pytest`、`RUN: ls`、`RUN: cat filename`。
    2. 每次回答時,如果需要實際操作,請先說明要做什麼,再給出一行 `RUN:` 指令。
    3. 每個階段先列出簡短計畫,再實作。
    4. 對於程式碼修改,請輸出完整檔案內容,而不是差異片段。
    

    接著,使用者只需幾個高階指令:

    1. 讀 repo + 規劃任務

    text
    請先用 `RUN: ls` 和 `RUN: find . -maxdepth 3` 理解專案結構,之後提出一個開發計畫:
    目標是寫一個 `todo_report` CLI,掃描整個 repo 的 TODO 註解,輸出為 JSON 檔。

    1. 實作 CLI

    text
    依照你的計畫,先實作最小可用版本的 `todo_report`,用 Python 實作,並寫對應的 pytest 測試。

    1. 自動測試與修正

    text
    實作完成後,請要求我執行 `RUN: pytest`,你再根據測試結果修正程式。

    你會看到的典型互動流程:

    • 模型要求 RUN: ls、RUN: cat ... → 你在 shell 中照做,把結果貼回給它。
    • 它產生 todo_report.py 完整檔案內容 → 你存檔。
    • 它產生測試檔 → 你存檔,執行 pytest,貼回錯誤訊息。
    • 迭代 2–3 輪,CLI 工具就完成了。

    重點:整個過程你只下了 3–4 個高階指令,其餘由 Agent 自己規劃與修正。


    進階調校:reasoning 模式、量化與「記憶」

    1. medium vs xhigh reasoning:怎麼選?

    根據 agentic coding benchmark:

    • medium reasoning:
    • 得分較高、請求數幾乎減半,生成 token 也少三分之一。
    • 非常適合「多輪小步」的代理任務(寫 code、修測試)。

    • xhigh reasoning:

    • 單次 prompt 的嚴苛推理題可能略好,但耗時、耗 token。

    💡 關鍵: 實測顯示 medium reasoning 在代理式編碼中比 xhigh 更省時、省 token,完成度相近。

    建議:

    • 本地 Agent 預設用 medium。
    • 偶爾需要「一次回答寫完一篇長文或複雜設計」時,再開 xhigh。

    2. 量化與快取:怎麼不犧牲太多品質?

    實用組合(16GB 卡):

    • 權重:Q4_K_M 起跳,追求品質用 Q5_K_M。
    • KV cache:q8_0 或 q6_K,在長上下文時性價比佳。

    調整原則:

    • 若 VRAM 爆掉 → 降權重量化或減 --n-gpu-layers,讓更多層跑在 CPU。
    • 若輸出過慢 → 開 --mtp-adaptive 或固定 --mtp 3,配合 --batch-size 512 以上。

    3. 延伸玩法:簡單「長期記憶」

    你可以加一層「記憶層」,例如:

    • 使用簡單檔案索引:
    • 把重要檔案(設計文件、規格)摘要成短段落,存 JSON。
    • 開發時先用關鍵字搜尋相關摘要,附在 prompt 開頭,讓 Qwen 有「記憶」。

    • 像 ai-memory 那樣記錄對話:

    • 把每次對話中重要決策(例如:架構選擇、命名約定)存到 memory.md。
    • 每次新任務前,把 memory.md 摘要貼給模型。

    行動:先在專案根目錄加一個 ai_memory/,把設計決策和重要檔案摘要集中存放,讓下一次 Agent 啟動時也能延續上下文。


    怎麼開始:一鍵腳本 + 三個可套用 Prompt

    1. 安裝腳本(Linux 範例)

    # 安裝依賴\sudo apt update && sudo apt install -y build-essential git python3-venv
    
    # 取得 llama.cpp v0.1.0
    git clone https://github.com/ggml-org/llama.cpp.git
    cd llama.cpp
    git checkout v0.1.0
    make -j$(nproc)
    
    # 建立模型資料夾
    mkdir -p models/qwen-3.8-27b
    # 將從 Hugging Face 下載的 Qwen3.8-27B GGUF 放入上述資料夾
    
    echo "完成:請下載 GGUF 模型到 models/qwen-3.8-27b,然後執行啟動命令。"
    

    2. 一行啟動命令(可直接複製)

    ./bin/llama-server \
      -m models/qwen-3.8-27b/Qwen3.8-27B-*-Q5_K_M.gguf \
      --ctx-size 73000 --batch-size 512 --n-gpu-layers 45 \
      --cache-type-k q8_0 --cache-type-v q8_0 \
      --temp 0.8 --top_p 0.9 --mtl 4 --mtp-adaptive
    

    3. 三個可直接用的 Agent prompt 範本

    (1) Repo 讀取與理解

    你是一位本地程式助手,目標是理解這個 repo 的結構與目的。
    請:
    1. 用 `RUN:` 指令要求我列出檔案與重要檔案內容。
    2. 整理出專案用途、主要模組、依賴關係。
    3. 最後輸出一段 <SUMMARY> ... </SUMMARY> 作為後續任務的簡要說明。
    

    (2) 新功能開發(CLI 工具)

    根據目前 repo 的內容,規劃並實作一個新 CLI 工具:
    需求:{在此描述}
    步驟:
    1. 先列出開發計畫(檔案變更列表)。
    2. 依序產出完整檔案內容。
    3. 為新功能撰寫至少一個 pytest 測試。
    每個階段如果需要檔案內容或測試結果,請用 `RUN:` 指令要求我執行。
    

    (3) 重構與程式碼審查

    請針對這個模組進行重構,目標:
    - 提升可讀性
    - 避免重複邏輯
    - 保持對外 API 不變
    流程:
    1. 要求我貼上目前檔案內容。
    2. 提出重構建議清單。
    3. 輸出重構後的完整檔案。
    4. 建議或修改對應的測試。
    

    照著這套流程,你今天就能把舊遊戲卡升級成一個能讀 repo、寫 code、自己跑測試的本地 Qwen 3.8 程式助手。


    🚀 你現在可以做的事

    • 在自己的機器上執行 nvidia-smi 和 free -h,確認硬體是否符合 16GB VRAM + 32GB RAM 的建議配置
    • 按文中步驟安裝 llama.cpp v0.1.0,下載 Qwen 3.8-27B GGUF 到 models/qwen-3.8-27b 並用啟動指令跑起來
    • 在一個現有 repo 中建立 agent_shell.py,貼上提供的系統 prompt,實際讓本地 Qwen 幫你完成一個小型 CLI 工具或重構任務
  • GPT‑5.6 Sol 實測:把圖片變成可對話資料庫

    GPT‑5.6 Sol 實測:把圖片變成可對話資料庫

    📌 本文重點

    • GPT‑5.6 Sol:強大的免費視覺理解模型
    • 可將任何圖片轉成結構化資料與可行動內容
    • 適合 PM、工程師、知識工作者與學生日常使用

    一句話先講清楚:GPT‑5.6 Sol 就是一個「把任何圖片,變成可對話的結構化資訊引擎」的免費視覺模型。你丟 UI 畫面、流程圖、簡報、課本照片,它都能幫你拆成條列、表格、JSON 結構,接著和你一起推理、規劃、改寫。

    延伸閱讀:GPT 5.6 Sol is the best “vision” model OpenAI ever released(Roboflow)


    核心功能:四類圖片,一套思路

    下面這四個能力,是你日常工作幾乎每天都用得到的:

    1. 介面&報表理解:把畫面拆成欄位、操作流程

    Sol 的強項是看畫面就能理解「這是什麼系統、有哪些輸入輸出、使用者會怎麼操作」。

    能做到的事:

    • 螢幕截圖、Figma 畫面 → 條列介面元素、欄位意義
    • 數據儀表板/報表截圖 → 整理成表格+關鍵指標解讀
    • 網頁畫面 → 推測使用者流程、可能的 CTA 與漏斗

    你可以這樣用:

    上傳一張系統畫面,搭配文字:

    這是我們內部訂單管理系統的截圖,請:
    1. 條列畫面上所有欄位與按鈕,說明用途
    2. 推測完整使用者操作流程(從進入頁面到完成訂單)
    3. 匯出成 JSON 結構:{step, action, input_fields, output}


    2. 流程圖與架構圖分析:幫你「用嘴」改系統

    Sol 看懂箭頭、方框、節點彼此關係,適合拿來快速討論系統設計。

    可以做到:

    • 系統架構圖 → 抽出服務清單、依賴關係、可能瓶頸
    • 資料流圖 → 指出安全風險、延遲來源、可快取點
    • 業務流程圖 → 找出人工步驟、可自動化環節

    實際操作:

    貼一張系統拓樸圖,詢問:

    這是目前的系統架構,請:
    1. 用文字重述整體資料流
    2. 找出三個可能的單點失敗風險
    3. 提出兩種改版方案,分別優先提升可靠性/擴充性


    3. 文件掃描:簡報、PDF、紙本變成行動清單

    Sol 讀圖片型文字的能力很好,尤其是:

    • 簡報截圖、講義照片 → 整理成條列、摘要、行動項目
    • 掃描 PDF → 自動找章節重點、重要數字與定義
    • 白板/手寫筆記 → 轉成段落+待辦事項

    範例用法:

    上傳一張簡報頁面,請它:

    把這頁簡報內容:
    1. 濃縮成 5 點摘要
    2. 整理出「接下來一週可以執行的具體行動清單」,用 checklist 格式
    3. 輸出成 Markdown,方便貼到 Notion


    4. 實物/場景理解:從畫面推需求與規格

    除了文件,Sol 也能看懂實體世界的畫面:

    • 實物照片 → 辨識零件、用途、可能問題(例如損壞、錯配)
    • 環境/場景 → 推測流程、設備配置、安全風險
    • 教學器材、課本圖例 → 整理成教學步驟、題庫

    應用範例:

    拍一張教學實驗設備照片:

    根據這張實驗設備照片:
    1. 推測實驗主題與步驟
    2. 列出需要注意的安全事項
    3. 幫我設計 3 題考題(選擇題),附標準答案


    💡 關鍵: GPT‑5.6 Sol 能把原本只能「看」的圖片,轉成可搜尋、可編輯、可推理的結構化資料,是連結視覺與文字工作流程的核心工具。


    適合誰用?四種角色的實際場景

    1. 產品/PM:丟 Figma,請它寫 PRD 和 edge cases

    場景:你只有原型圖,卻要明天開需求評估會議。

    操作步驟:

    1. 在 Figma 內選擇幾個核心畫面,輸出 PNG。
    2. 在 ChatGPT 對話視窗上傳圖片(確保模型選擇 Sol 或系統自動使用最新視覺模型)。
    3. 用這種 prompt:
      “`
      這是新功能的 Figma 畫面,請:
    4. 條列出這個功能的目標與主要使用情境
    5. 以 PRD 形式整理:user story、主要流程、欄位規格
    6. 列出至少 10 個 edge cases 與錯誤訊息設計建議
    7. 用表格輸出,方便我貼到 Confluence
      “`

    你可以迭代:再丟一張畫面,請它「更新前面 PRD 中的流程圖與欄位表」,做到真正的圖片驅動需求寫作。


    2. 工程師:錯誤畫面+拓樸圖,請它推理問題和改動建議

    場景:線上系統偶發錯誤,你截了錯誤頁面和架構圖,想快速釐清可能原因。

    操作步驟:

    1. 上傳錯誤畫面(包含錯誤訊息、URL、時間等)。
    2. 再上傳相關系統拓樸圖或 sequence diagram。
    3. 用這個 prompt 合併分析:
      “`
      這兩張圖分別是:
    4. 錯誤畫面(前端顯示)
    5. 系統架構圖(後端服務與資料流)
      請:
    6. 推測可能的錯誤來源(依機率排序)
    7. 列出需要檢查的 log 與監控指標
    8. 提出一個最小改動的修正方案,並說明影響範圍
      “`

    這種用法適合拿來當排錯思路清單,幫你檢查是否漏掉某些角度(網路、資料庫、第三方服務等)。


    3. 資訊工作者:簡報截圖/掃描 PDF → 重點整理+行動清單

    場景:開完會只有投影片照片;或拿到是掃描版 PDF,沒有文字層。

    操作步驟:

    1. 把照片或 PDF 截圖分批上傳 Sol。
    2. 先叫它「逐頁摘要」,再叫它「整併成完整會議紀錄+行動項目」。
    3. 範例 prompt:
      “`
      這是本次專案會議的簡報截圖,請:
    4. 每張圖先各自寫 3-5 點摘要
    5. 統整成一份會議重點(含背景、決策、未決議題)
    6. 列出所有具體待辦事項,格式:{owner, task, deadline_suggestion}
      “`

    這比純文字總結更精準,因為 Sol 能看到圖表、流程箭頭、註解框這些細節。


    4. 個人學習:課本照片/板書 → 筆記+題庫

    場景:上課拍板書、拍課本,想回家變成系統化筆記。

    操作步驟:

    1. 把同一章節的幾張照片一次上傳。
    2. 請它先整理成「樹狀大綱」,再生成題目。範例:
      “`
      這些照片是同一章節的內容,請:
    3. 整理成分層的大綱(章節 → 小節 → 關鍵概念)
    4. 用自己的話重寫成教學筆記,讓高中生看得懂
    5. 根據內容出 5 題選擇題、5 題簡答題,附標準答案
      “`

    久了你會發現:Sol 可以直接變成你的圖片型知識轉文字型筆記的流水線。


    💡 關鍵: 不論你是 PM、工程師或學生,只要日常有「截圖」或「拍照記錄」,Sol 就能幫你把這些零散視覺資訊變成系統化產出。


    怎麼開始:免費用 Sol +簡單 API 範例

    1. 在 ChatGPT 免費/低階方案使用 Sol

    目前 Sol 已整合在 OpenAI 的 ChatGPT 中,免費或低階方案也能用,重點是:

    💡 關鍵: 即使是免費或低階方案,也能直接使用 Sol 視覺模型,降低導入門檻。

    1. 入口位置:
    2. 登入 chatgpt.com 或官方 App。
    3. 新建對話,確保模型選擇為最新可視覺模型(通常會標示 GPT‑5.6 或支援「圖片上傳」)。

    4. 上傳圖片方式:

    5. 在輸入框旁邊使用「上傳檔案/圖片」按鈕,上傳截圖、照片、掃描件。
    6. 同一則訊息可上傳多張,適合完整章節或多頁簡報。

    7. 提問範例 prompt 模板:
      “`
      這張圖(或這幾張圖)是:[簡短描述,例如:產品原型圖/系統拓樸/簡報/課本內容]。
      請依照以下步驟幫我處理:

    8. 先用自己的話描述這張圖在講什麼
    9. 把重要元素整理成結構化資料(條列或表格)
    10. 依我的角色(產品/工程師/學生),提出 3-5 個你建議我接下來可以做的具體行動
      “`

    你可以把這段當作通用模板,之後再加上更細的輸出格式要求(例如「用 JSON 回答」)。


    2. 給開發者:最小可行 API 範例(圖像+文字 → JSON)

    以下是使用 OpenAI API(Node.js 範例)調用 GPT‑5.6 Sol,把圖片與指令變成 JSON 結構輸出的最小例子:

    注意:實際模型名稱與 endpoint 可能依 OpenAI 更新調整,請以官方文件為準。

    npm install openai
    
    import OpenAI from "openai";
    import fs from "fs";
    
    const client = new OpenAI({ apiKey: process.env.OPENAI_API_KEY });
    
    async function analyzeImageToJSON() {
      const imageBytes = fs.readFileSync("./input.png");
      const base64Image = imageBytes.toString("base64");
    
      const response = await client.chat.completions.create({
        model: "gpt-5.6-sol", // 依官方最新名稱調整
        messages: [
          {
            role: "user",
            content: [
              {
                type: "text",
                text: "請分析這張圖,輸出介面元素與可能的使用流程,格式為 JSON:{elements:[], flows:[]}"
              },
              {
                type: "image_url",
                image_url: {
                  url: `data:image/png;base64,${base64Image}`
                }
              }
            ]
          }
        ],
        response_format: { type: "json_object" }
      });
    
      console.log(response.choices[0].message.content);
    }
    
    analyzeImageToJSON().catch(console.error);
    

    這段程式碼做的事很單純:

    • 把本機圖片轉成 base64
    • 丟給 GPT‑5.6 Sol 模型,搭配文字指令
    • 要求模型直接回傳 JSON 結構(方便你接在後續系統)

    3. 隱私與公司內部畫面注意事項

    視覺模型很容易讓人「隨手截圖就丟」,但有幾點要特別提醒:

    • 避免敏感資訊:
    • 公司內部系統截圖若含客戶資料、金額、地址、帳號,先打碼或模糊關鍵區域。
    • 法規敏感資料(醫療、金融)請遵守公司政策,不要直接上傳雲端模型。

    • 確認使用條款:

    • 不同方案對「是否用你的資料做模型訓練」的政策不同,請在帳號設定與隱私條款中確認。

    • 內網場景處理:

    • 若需要分析高度敏感架構圖,可考慮在公司內部部署方案(例如自架模型),不要直接使用公網 API。

    總結:把 Sol 想成一個「圖片轉結構化資料」的助理——你給它任何圖,它就幫你拆成可編輯、可推理、可執行的資訊。從 PM、工程師,到知識工作者和學生,只要日常有截圖或照片,就值得試著把這些「視覺碎片」,交給 GPT‑5.6 Sol 變成你工作流程的一部分。

    🚀 你現在可以做的事

    • 登入 chatgpt.com,上傳一張你常用系統或簡報截圖,照文中的通用模板試一次
    • 將文中的 Node.js 範例貼到本機專案,改成你自己的圖片與 prompt,測試 JSON 輸出
    • 選一個工作或學習場景(PM、工程師、會議紀錄或課本),設計一個固定的 Sol 使用流程並連續使用一週
  • HashAgent:一鍵分享、在地跑的 AI 代理

    HashAgent:一鍵分享、在地跑的 AI 代理

    📌 本文重點

    • HashAgent 用一條 URL 分享可用狀態代理
    • 所有設定編碼進網址,在瀏覽器本地跑模型
    • 適合團隊共享工具、PoC demo、隱私文本處理
    • 開發者可當無後端前端容器做快速試驗

    用一句話說清楚:HashAgent 是一個「用 URL 分享、在瀏覽器本地跑」的 AI 代理容器,讓你不用架伺服器,就能把一個預先設定好的 AI 小工具分享給同事或客戶。

    工具網址:https://hashagent.pages.dev/


    核心功能:把「會動的代理」裝進一條網址

    1. 用一條 URL 分享一個預先配置好的代理

    HashAgent 的設計很直覺:所有代理設定都被編碼進 URL,像是:

    • 使用哪個模型
    • 預設系統 prompt
    • 任務腳本(例如:「請幫我總結貼上的文件」)

    你只要:

    1. 打開 HashAgent:https://hashagent.pages.dev/
    2. 在設定區填好:
    3. 模型名稱
    4. 系統提示(System prompt)
    5. 任務描述或腳本
    6. 點擊產生/複製 URL,丟給同事

    對方打開連結就直接進入一個「可用狀態」的代理,不用再解釋怎麼切模型、怎麼寫指令。

    💡 關鍵: HashAgent 把完整代理配置嵌入網址,任何人點開就能直接用同一套設定。

    👉 可立即行動:

    • 想像你現在有一個固定的「會議紀錄總結」工作,把提示寫好,生成 URL,貼到團隊 Slack,讓大家以後都用這一個入口。

    2. 在瀏覽器端用 WebGPU 本地推論

    HashAgent 依賴瀏覽器 WebGPU 能力,在使用者的電腦上直接跑模型,好處很明確:

    • 文字內容不會送到外部伺服器
    • 沒有額外 API 費用
    • 測試 PoC 不用再申請雲端資源

    要讓它順利運作,你可以這樣檢查與調整:

    1. 使用支援 WebGPU 的瀏覽器:
    2. 建議:Chrome / Edge / Brave(版本越新越好)
    3. 在 chrome://flags 搜尋「WebGPU」,確認是啟用狀態(若已預設開啟可忽略)。
    4. 打開 HashAgent 頁面時,留意是否有「WebGPU not supported」類似提示,有的話換一個瀏覽器或機器測試。

    💡 關鍵: 使用者的瀏覽器與硬體決定推論是否能在本地完成,這是 HashAgent 的隱私與免伺服器優勢來源。

    👉 可立即行動:

    • 用自己的筆電和桌機各打開同一條 HashAgent URL,感受不同 GPU/CPU 下的速度差異。

    3. 支援自訂 Prompt 與任務腳本

    HashAgent 不是只有一個對話框,而是可以預設「代理該怎麼工作」:

    典型可設定內容包括(實際欄位以官方頁面為準):

    • System prompt:定義代理角色,例如:「你是一個專門做長文摘要的助手,只輸出三段摘要與三個行動建議。」
    • 任務腳本:針對一個固定流程,例如:
    • 接收使用者貼上的原文
    • 先輸出 3 句話摘要
    • 再輸出一個行動清單

    你可以把這些寫死在設定裡,然後一鍵分享:

    • 同事只要打開網址、貼文本,就能得到同樣格式的輸出
    • 測試不同版本的提示時,只要多產幾條 URL 對比

    👉 可立即行動:

    • 做兩條代理 URL:
    • A 版:摘要偏「精簡」
    • B 版:摘要偏「詳細」
    • 實際讓同事在會議前後各用一次,收集哪一版更好用。

    適合誰用:三類典型場景

    1. 團隊共享小工具:一鍵文檔總結代理

    情境:公司裡大家都在用 ChatGPT / Claude 檢查文件,但每個人 prompt 都不一樣,輸出品質參差不齊。

    用 HashAgent 可以:

    • 把「標準版」文檔總結流程寫成 system prompt
    • 固定輸出格式(例如:摘要、風險點、下一步行動)
    • 用一條 URL 分享到團隊 wiki / Notion

    效果:

    • 新人只要打開網址+貼文件,就能用同一套「公司標準」摘要模板。

    2. 內部 PoC:不用伺服器就能 demo 的代理

    情境:你是內部 AI 團隊,要給老闆看一個新的代理 workflow 構想,但還不想花時間架後端。

    做法:

    • 在 HashAgent 裡設定好流程 prompt
    • 選一個本地可跑的模型
    • 把生成的 URL 直接在會議現場打開 demo

    效果:

    • 不用申請雲帳號、API Key
    • Demo 環境就是瀏覽器,任何人都可以當場打開運行

    3. 個人隱私場景:本地處理敏感文本

    情境:

    • 合約書、履歷、公司內部簡報,不想丟出去雲端
    • 但又想用 LLM 做摘要、改寫、潤飾

    HashAgent 的本地推論特性很適合:

    • 打開自己的「合約總結代理」
    • 把 PDF 文本複製貼上
    • 整個過程只在自己機器上運算

    👉 可立即行動:

    • 做一條專門處理「履歷優化」的 HashAgent URL,只在求職階段自己用,且資料不離開裝置。

    實作教學:幾分鐘建立一個簡單 HashAgent

    以下用「一鍵文檔總結代理」當示範,步驟會以官方頁面目前常見結構為例(未來若 UI 調整,以頁面為準)。

    步驟一:打開 HashAgent 並選模型

    1. 進入:https://hashagent.pages.dev/
    2. 找到模型選擇欄(例如「Model」或類似欄位)。
    3. 選擇一個支援 WebGPU 的本地模型(通常會有預設選項)。

    如果頁面提供多個模型:

    • 選較小的模型:載入快、推論快
    • 選較大的模型:推論慢,但輸出品質可能更好

    步驟二:寫任務描述(System Prompt)

    在「System Prompt」或「Agent Prompt」欄位填入類似內容:

    你是一個專門為知識工作者服務的文檔摘要助手。
    使用繁體中文回答。請依照以下格式輸出:
    1. 三句話總結本文重點。
    2. 列出 3-5 個可行的下一步行動建議。
    3. 若本文有任何風險點或注意事項,請額外列出。

    這樣一來,任何人打開這條 URL,再貼入文本,都會得到相同格式的輸出。


    步驟三:生成分享 URL

    在 HashAgent 頁面通常會有某種「Share」或「Copy URL」按鈕,底層邏輯是:

    • 把你的設定序列化寫入 URL hash 或 query string
    • 例如:https://hashagent.pages.dev/#... 或 ?config=...

    操作方式:

    1. 點擊「Generate / Copy URL」
    2. 取得一條很長的連結
    3. 貼到:
    4. Slack / Teams 群組
    5. 公司內部 wiki
    6. 產品 demo 文檔

    👉 可立即行動:

    • 做好第一條代理後,請兩位同事用它來總結同一份文件,觀察輸出是否一致,微調 prompt。

    如何在不同瀏覽器 / 機器上測試效能

    HashAgent 的效能很依賴硬體與瀏覽器,以下是一個簡單測試流程:

    1. 準備一條相同的 HashAgent URL
    2. 在以下環境各測一次:
    3. Windows + Chrome
    4. macOS + Chrome / Safari(視 WebGPU 支援情況)
    5. Linux + Chromium 或支援 WebGPU 的瀏覽器
    6. 測量兩個指標:
    7. 模型載入時間(從進入頁面到可以輸出第一段文字)
    8. 單次完整回應時間(例如處理同一篇 1,000 字文章)

    若遇到太慢或無法運行,可以:

    • 換較小的模型
    • 確認瀏覽器版本已更新
    • 在設定裡調低生成長度或溫度(根據 UI 選項調整)

    💡 關鍵: 透過在不同環境測量載入與回應時間,你可以實際評估 HashAgent 是否符合團隊或產品 demo 的效能需求。


    與其他工具搭配:向量庫、Obsidian、VSCode

    HashAgent 目前偏「單體代理」,但你可以把它當作前端容器,搭配其他工具:

    • 搭配本地向量庫:
    • 在後端用你熟悉的工具(如 LlamaIndex、Local vector DB)先做檢索
    • 把檢索後的上下文貼到 HashAgent 中,由代理負責總結/解釋

    • 搭配 Obsidian:

    • 在 Obsidian 裡選一篇筆記,複製內容
    • 貼到 HashAgent 的「摘要代理」裡
    • 把輸出貼回新筆記,形成標準化摘要

    • 搭配 VSCode:

    • 將部分程式碼或 log 貼入 HashAgent 的「debug 代理」URL
    • 以預先設定好的 prompt 輔助 debug 或重構

    👉 可立即行動:

    • 建兩條代理 URL:一個專門負責「Obsidian 筆記摘要」、一個專門負責「程式碼解說」,分別收藏在瀏覽器書籤列。

    給開發者:把 HashAgent 當成前端容器

    如果你在做 LLM workflow、agent framework,HashAgent 可以扮演:

    • 「無後端 Demo 殼」:
    • 把整個 workflow 壓縮成一組 prompt + 設定
    • 用 HashAgent 的 URL 形式丟給使用者試用

    • 「早期用戶回饋管道」:

    • 你可以快速產出多個版本(不同 prompt、不同模型)
    • 用多條 URL 做 A/B 測試

    • 「內部教學模板」:

    • 把教學代理(例如:教如何寫公司標準文件)包成 URL
    • 給新員工在瀏覽器裡直接操作

    當你準備好要產品化時,再把這些代理邏輯搬到自己的前端 + 後端架構裡即可。


    小結:先從一個「可分享的摘要代理」開始

    如果你不知道從哪裡開始,建議順序:

    1. 打開 https://hashagent.pages.dev/
    2. 選一個預設模型
    3. 寫一個「公司標準的文檔摘要 prompt」
    4. 生成 URL,貼到團隊群組

    當你能用 HashAgent 成功分享第一個「會動」的代理給同事,你就掌握了這個工具的核心價值:用 URL 把 AI 工作流程裝起來,讓任何人打開就能用,且資料留在自己的裝置上。

    🚀 你現在可以做的事

    • 立刻打開 HashAgent,建立一條「公司標準文檔摘要」URL 並分享到團隊 Slack 或 Teams
    • 在兩台不同設備上用同一條代理 URL 測試 WebGPU 效能,確認是否適合正式使用
    • 為個人敏感資料(履歷或合約)設計一條專用 HashAgent 代理 URL,加入瀏覽器書籤以便重複使用
  • 用 Obsidian Skills 把筆記變成可編程知識庫

    用 Obsidian Skills 把筆記變成可編程知識庫

    一句話定位:Obsidian Skills 是一個讓 AI 代理可以透過 CLI 操作整個 Obsidian 資料庫的插件,把「寫筆記、整理目錄、重構內容」全部變成可自動執行的任務。

    📌 本文重點

    • 讓 AI 用 CLI 直接操作整個 Obsidian Vault
    • 把你的筆記工作流程寫成可重複的 Skills
    • 用自動化 Workflow 把筆記變成有結構的知識系統
    • 先在測試 Vault 試跑,再導入真正工作環境

    原始專案在 GitHub 開源:kepano/obsidian-skills


    核心功能:讓 AI 真的「會用」你的筆記庫

    1. 透過 CLI 操作 Obsidian:筆記不再只是文字

    Obsidian Skills 的核心,是讓 AI 能透過命令列介面(CLI)直接操作你的 Obsidian Vault:

    • 讀取、建立、修改 Markdown 檔
    • 操作 JSON Canvas(Obsidian 畫布)等開放格式
    • 在整個 Vault 裡搜尋、過濾、重構內容

    你可以做的行動:

    1. 把你常做的筆記操作寫成「命令」交給 AI,例如:
    2. 列出 /notes/book/ 底下所有檔案,按日期排序
    3. 讀取某篇筆記,加上 TL;DR 摘要段落
    4. 在終端機或 Agent Framework(例如 OpenAI 的 Assistants、LangChain 等)裡,把這些命令繫結到 Obsidian Skills 提供的 CLI 工具,讓 AI 能執行。

    💡 關鍵: 透過 CLI,把「打開 → 搜尋 → 編輯筆記」這些原本只能手動完成的操作,變成 AI 可以批次執行的自動化任務。

    效果:你不再需要手動打開每一篇筆記,而是讓 AI 代理以「工具使用者」身份,批次處理你的整個知識庫。


    2. 自訂 Skills:讓 AI 學會你的筆記工作流程

    Obsidian Skills 最有價值的地方,是可以定義「技能」(Skills),讓 AI 代理知道:

    • 要如何寫新筆記(檔名規則、Frontmatter 格式)
    • 要如何更新既有筆記(加註、改版號、補索引)
    • 要如何整理資料夾、產生目錄、建立索引頁

    你可以這樣做:

    1. 設計 1–2 個固定流程,寫成 Skill 描述:
    2. Skill 範例:
      • 名稱:summarize_folder
      • 說明:讀取指定資料夾所有 Markdown,為每篇建立 3 行摘要,並生成一篇索引筆記,列出檔名 + 摘要 + 連結。
    3. 把這個 Skill 配給 AI 代理,之後只要下指令:
    4. 「對 research/llm/ 跑 summarize_folder」
    5. 代理就會用 CLI + Skills 流程完整跑完。

    💡 關鍵: 把你「自己怎麼整理筆記」這套隱性流程,寫成 Skills 交給 AI,才能讓代理長期維護你的知識庫,而不是一次性的文案改寫。

    效果:你的「整理習慣」被寫進程式,AI 不只是改文字,而是照你的規則長期維護知識庫結構。


    3. 搜尋 + 編輯一條龍:變成第二大腦自動化助手

    Obsidian Skills 把「搜尋」和「編輯」串在一起:

    • 先在 Vault 裡搜尋相關筆記
    • 把結果餵給模型
    • 模型依照 Skill 規則進行產生或重構

    你可以做的行動:

    1. 定義一個 Skill:refactor_notes_to_wiki
    2. 步驟:
      1. 搜尋某資料夾所有 Markdown
      2. 依標題或 Tag 分類群組
      3. 生成一篇「主 Wiki」筆記,整理出目錄與連結
    3. 在 CLI 或 Agent 裡,下指令:
    4. 「把 projects/app-x/notes 裡所有筆記重構成專案 Wiki」

    效果:原本零散的一堆筆記,會自動變成可瀏覽的索引頁、主題頁,像一個有結構的知識網站。


    適合誰用:具體場景

    1. 知識管理:整理讀書筆記與研究資料

    典型情境:你有一個 books/ 或 research/ 資料夾,裡面是每本書、每篇論文的粗略筆記,多年下來完全失控。

    可以這樣實作:

    • Skill:book_notes_overview
    • 功能:
      • 扫描 books/ 底下所有筆記
      • 讀取每篇的重點段落(例如 ## Key Ideas)
      • 生成一篇「閱讀索引」:按主題整理出書名 + 核心概念 + 連結
    • 你要做的,只是定期觸發這個 Skill,讓 AI 幫你維護「閱讀地圖」。

    2. 專案管理:把散亂筆記整理成專案 Wiki

    典型情境:專案期間每天都有會議記錄、待辦、想法草稿,分散在不同筆記裡,收尾時很難回顧全貌。

    可以這樣實作:

    • Skill:project_wiki_builder
    • 把 projects/<name>/daily/ 下的每日筆記:
      • 整理出時間線
      • 抽出決策記錄、關鍵里程碑
      • 生成一個 project-wiki.md,包含:
      • 專案概覽
      • 重要決策列表
      • 里程碑時間軸
      • 連回原始每日筆記

    3. 工程師日誌:自動整理每日開發筆記

    典型情境:你每天在 Obsidian 裡記下 bug、嘗試過的解法和終版解決方案,但事後很難再找回「當初怎麼解」。

    可以這樣實作:

    • Skill:dev-log-index
    • 搜尋含有 #bug 或 #issue 的筆記
    • 解析出:問題描述、相關檔案、最後解法
    • 建立一個「問題索引」筆記,方便未來重用

    💡 關鍵: 把日常「隨手記」轉成可搜尋的問題索引,長期下來會變成你的私有技術知識庫。


    怎麼開始:安裝與基本設定

    下面以「你已經有 Obsidian Vault」為前提,帶你從 0 到可以跑第一個 workflow。

    1. 安裝 Obsidian Skills 插件

    1. 打開 Obsidian → 設定 → 社群外掛(Community plugins)
    2. 啟用「允許安裝第三方外掛」
    3. 在外掛瀏覽中搜尋 Obsidian Skills(如果尚未上架,可從 GitHub 手動安裝):
    4. 前往專案頁面:https://github.com/kepano/obsidian-skills
    5. 依說明下載並放入 .obsidian/plugins/ 資料夾
    6. 在 Obsidian 裡啟用外掛

    行動檢查:確認你可以在設定中看到 Obsidian Skills 的選項,並看到 CLI 路徑或相關設定項。


    2. 設定 API Key 與模型

    Obsidian Skills 本身不內建模型,它通常透過你選擇的 AI 平台(例如 OpenAI、Anthropic、本地模型)來運作。

    最低限度設定:

    1. 在 Obsidian Skills 設定頁輸入 API Key(例如 OpenAI API)
    2. 選擇模型名稱:
    3. 文本重構與長文摘要:gpt-4.1 或其他高階模型
    4. 低成本批次整理:gpt-4o-mini 或相似等級模型
    5. 設定最大上下文長度與回應長度,避免會議記錄太長時被截斷。

    行動建議:先用便宜或免費模型跑小規模測試,確認流程正確,再套用到整個 Vault。


    實戰 Workflow 範例(可直接複製)

    下面示範 2 個你可以實際跑的工作流程。具體語法要依 Obsidian Skills 版本與你的 Agent Framework 做微調,但邏輯是一樣的。

    Workflow 1:自動整理某資料夾所有筆記並產生總結

    目標:對 research/llm/ 底下所有筆記,生成一篇「總結索引」。

    步驟

    1. 定義 Skill(概念描述):
    skill: summarize_folder
    input: folder_path
    actions:
      1. list all markdown files under {folder_path}
      2. for each file, read content and extract key points
      3. generate a new markdown note `_summary-{folder_name}.md`
         with sections:
           - overview of the folder
           - table of files: filename, 3-line summary, link
    
    1. 在你的 AI 代理設定中,加入這個 Skill,並授權它使用 Obsidian CLI 操作。
    2. 在終端機或對話介面裡下指令:
    agent run summarize_folder --folder_path="research/llm"
    
    1. 回到 Obsidian,檢查是否多了一篇 _summary-llm.md,內容包含每篇研究筆記的摘要與連結。

    行動建議:先對一個小資料夾測試,確認摘要品質與結構格式,再擴大到整個知識庫。


    Workflow 2:把一份長會議記錄拆成多篇結構化筆記

    目標:你有一份超長的會議記錄 meeting-2024-08-10.md,希望拆成「決策」「待辦」「討論背景」三種筆記,並串成一個索引。

    步驟

    1. 定義 Skill(概念描述):
    skill: split_meeting_notes
    input: note_path
    actions:
      1. read markdown note at {note_path}
      2. identify sections: decisions, action items, context/discussion
      3. create three new notes:
           - {note_path}-decisions.md
           - {note_path}-actions.md
           - {note_path}-context.md
      4. create an index note `{note_path}-index.md`
         linking to the three notes with brief summaries.
    
    1. 在代理中加入此 Skill。
    2. 執行指令:
    agent run split_meeting_notes --note_path="projects/app-x/meeting-2024-08-10.md"
    
    1. 打開 Obsidian,檢查多出來的 4 篇筆記:
    2. ...-decisions.md:列出所有明確決策
    3. ...-actions.md:待辦事項,適合再丟進任務管理工具
    4. ...-context.md:保留完整對話與背景
    5. ...-index.md:快速入口

    行動建議:把這套 Skill 當成「會議模板」,之後每次只要把原始會議記錄丟給同一個 Skill 即可。


    自訂技能與安全 / 隱私注意事項

    如何自訂技能

    設計 Skill 時,注意三件事:

    1. 明確輸入與輸出:
    2. 輸入:資料夾、檔案路徑、標籤
    3. 輸出:新筆記路徑、命名規則
    4. 具體步驟:把你平常的手動流程拆成 3–5 個具體動作,交給 AI。
    5. 格式約束:要求 AI 回傳標準 Markdown 或 JSON,方便 Obsidian 正確解析。

    建議:先寫成人類看的「操作說明」,再轉成 Skill 定義給代理,避免太抽象。


    安全與隱私注意事項

    1. API 外傳內容範圍:
    2. 所有送給模型的文字,都可能被第三方服務看到。
    3. 先從非敏感資料夾測試;機密專案可考慮只用本地模型。
    4. 權限控管:
    5. 不要讓代理有刪除整個 Vault 的權限。
    6. Skill 盡量設計成「新增 / 更新特定資料夾」,不要全域改寫。
    7. 版本控管與備份:
    8. 建議搭配 Git 或 Obsidian Sync,確保 AI 重構筆記前有備份。

    行動建議:在真正讓代理處理「工作用 Vault」之前,先建立一個「測試 Vault」,練習 Skills 和 Workflow,確保不會誤刪或覆寫重要資料。


    小結:把 Obsidian 當成可自動化的知識系統

    Obsidian Skills 的價值不在於「更聰明的聊天」,而是讓 AI 能:

    • 讀懂你的筆記結構
    • 依照你設計的 Skills 操作整個 Vault
    • 持續幫你整理、重構、索引知識

    從今天開始,你可以先選一個小資料夾,設計一個簡單 Skill,跑完上面的兩個 Workflow。當你習慣這種「把筆記工作流程寫成技能」的思維後,Obsidian 就會從「寫筆記的地方」,變成「可編程的第二大腦」。

    🚀 你現在可以做的事

    • 去 GitHub 下載並安裝 kepano/obsidian-skills,在測試 Vault 啟用外掛
    • 為你最常用的資料夾(例如 research/ 或 projects/)寫出第一個 Skill 描述,交給 AI 代理使用
    • 在終端機或 Agent 裡實際跑一次 summarize_folder 或 split_meeting_notes Workflow,觀察輸出並微調規則
  • RAGFlow 實戰:從 PDF 到多代理助理

    RAGFlow 實戰:從 PDF 到多代理助理

    📌 本文重點

    • RAGFlow 把各種文件變成可查詢的智慧助理
    • 支援 RAG + 多 Agent 工作流,一站式整合
    • 易於部署與接入現有系統,適合團隊內部知識應用
    • 可從簡單問答慢慢擴展到會執行任務的 AI 助理

    RAGFlow 解決的問題很直接:把「一大堆文件、網頁」變成「會自己查資料、自己動手執行的 AI 助理」。

    專案連結:https://github.com/infiniflow/ragflow


    核心功能:RAG + Agent 一站搞定

    1. 資料接入與向量化:丟文件就能問

    RAGFlow 的第一層就是把各種原始資料變成「可被 LLM 搜尋理解」的向量索引。

    你可以實際做的事:

    • 支援來源大致可分:
    • 文件:PDF、Word、Markdown、純文字
    • 網頁:URL 抓取、站內內容同步
    • 結構化內容:CSV、JSON(做報表型問答很實用)
    • 常見流程:
    • 在 RAGFlow 後台建立一個 Knowledge Base
    • 上傳公司工程文檔 / 產品手冊 / SOP PDF
    • 設定切分規則(例如:依段落、標題分 chunk)
    • 選擇 Embedding 模型(內建或外部,像是 Hugging Face 上的中文向量模型)
    • 建立索引(系統會自動向量化並存入向量庫)

    這一步做完,你就等於有了一個「會理解語義」的知識庫,而不是只能關鍵字搜尋的檔案櫃。

    💡 關鍵: 透過向量化與語義搜尋,文件從「只能關鍵字查」升級成「能用自然語言問問題」的智慧知識庫。

    2. 檢索層設計:不只是「找幾段文字」

    RAGFlow 把檢索層做得比較「工程化」,可以細調:

    • 索引與向量庫選擇:
    • 內建向量引擎
    • 或接外部向量庫(如 Milvus、PgVector 等)
    • 檢索策略可調:
    • Top-K(一次取幾段)
    • 相似度門檻(不夠像就不要給模型亂猜)
    • 多輪查詢(先廣泛找,再縮小範圍)

    你可以做的調整動作:

    • 對「工程文檔」類知識庫:
    • chunk 設大一點(保留上下文),例如 800–1000 字
    • Top-K 調高(例如 8–10),避免漏掉關鍵步驟
    • 對「QA 知識庫」類資料:
    • chunk 設小一點(每題一段)
    • Top-K 只取 3–5,讓回答更集中

    這樣調完,LLM 拿到的上下文就更乾淨,回答會明顯少犯「自己亂編」的錯。

    💡 關鍵: 調整 chunk 大小與 Top-K 是降低幻覺、提升回答準確率的核心手段。

    3. 多代理協作:有人查、有人想、有人執行

    RAGFlow 的亮點是多 Agent 工作流。不是只給你一個「聊天機器人」,而是可以把任務拆給不同角色:

    常見的 Agent 角色設計:

    • Retriever Agent:只負責根據問題去知識庫檢索
    • Summarizer Agent:把檢索結果整理成可閱讀摘要
    • Planner Agent:拆解任務步驟(例如:先查產品規格,再產出比較表,最後寫結論)
    • Executor Agent:真的去調 API、寫入工單、更新系統

    你可以在 RAGFlow 裡做的事情:

    1. 建立一個 Workflow,指定多個 Agent 節點
    2. 設計流程圖:
    3. 使用者提問 → 檢索 Agent → 摘要 Agent → 回答 Agent
    4. 對客服場景:回答 Agent 判斷是否需建立工單 → 如果需要,丟給 Executor Agent 調用工單系統 API

    這種拆分的好處是:每個 Agent 的 System Prompt 可以很精準,調整也比較容易觀察哪一段出問題。

    💡 關鍵: 多 Agent 拆分角色,讓「查資料、思考、執行」三件事各自優化,比單一聊天機器人穩定得多。


    適合誰用:三個典型場景

    1. 團隊知識庫問答:工程文檔 / 產品手冊 / SOP

    適合情境:

    • 軟體團隊:想讓新人直接問「部署步驟」「API 使用範例」
    • 硬體 / SaaS 產品:希望售前售後都能秒查產品規格、授權規則

    可實際做的:

    • 建立一個「Internal KB」
    • 匯入:
    • Git repo README、Wiki 轉成 PDF
    • 內部 SOP、操作手冊、Onboarding 文件
    • 建立一個 QA Agent:只允許根據知識庫回答,不會自己瞎編超出範圍的內容

    2. 客服與支援 Bot:先查知識庫,再動手開工單

    適合情境:

    • 官網線上客服、App 內支援中心
    • B2B 工單系統前台

    可以設計的流程示例:

    1. User 問:帳號、付費、故障
    2. RAG Agent:
    3. 先查 FAQ / 幫助中心 / 條款文件
    4. 回覆解法
    5. 評估是否要升級:
    6. 若使用者多次追問或提到「不能用」「錯誤碼」,交給 Executor Agent
    7. Executor Agent 呼叫工單 API,建立 Ticket,回傳工單編號

    這樣你得到的不是一個「只能回 FAQ 的機器人」,而是能接著做事情的支援助理。

    3. 數據 / 報告助理:多來源文件 → 週報 / 簡報框架

    適合情境:

    • PM、營運:每週要整理多份報表、數據截圖、訪談記錄
    • 顧問 / 分析師:客戶給你一堆 PDF 報告,要快速產出簡報大綱

    可操作的工作流範例:

    1. 上傳:
    2. Google Analytics / Amplitude 匯出報表(CSV)
    3. 各部門週報(PDF/Docx)
    4. 客戶訪談逐字稿
    5. Workflow 設計:
    6. 檢索 Agent:依照「本週」「產品 A」「轉換率」等關鍵詞找資料
    7. 摘要 Agent:對各來源做重點整理
    8. 報告 Agent:產出「本週成效總結 + KPI 變化原因 + 下週建議行動」框架

    你可以在此基礎上,讓 Executor Agent 直接生成 Markdown / PPT 大綱,甚至丟到自家文檔系統。


    怎麼開始:從部署到接入自家系統

    1. 用 Docker 一鍵部署 RAGFlow

    先準備一台機器(本機或雲端均可):

    • 建議配置:
    • CPU 4 核以上
    • RAM 8GB 以上
    • 有 GPU 更好(但非必須)

    以 Docker Compose 為例(以官方 README 為準):

    # 取得專案
    git clone https://github.com/infiniflow/ragflow.git
    cd ragflow
    
    # 啟動(實際指令以官方文件為準)
    docker compose up -d
    

    啟動後:

    • 打開瀏覽器訪問類似 http://localhost:port 的管理介面(依官方說明)
    • 建立管理帳號

    官方專案與更新請看:https://github.com/infiniflow/ragflow

    2. 接一個免費 / 便宜 LLM

    RAGFlow 可以接:

    • 本地部署開源模型(透過 Ollama / vLLM 等)
    • 或雲端 API(OpenAI、阿里通義、字節、百度等)

    如果你想先用開源模型:

    • 選擇方向示例:
    • Qwen 系列(中文友好)
    • Gemma / Gemma 2(Google 開源,英文較強)
    • Nemotron / Nemotron Lightning(適合雲端部署,高效推論)

    實作步驟:

    1. 在 RAGFlow 的 LLM 設定頁,新增模型提供者
    2. 如果用雲端 API:填入 API Key、模型名稱(如 qwen-turbo)
    3. 如果接本地:填寫本地推論服務的 URL(例如你用 vLLM 啟的 endpoint)

    測試方式:在介面裡直接試打一段文字,看能否正常回應。

    3. 走一個 End-to-End 範例:PDF → Agent Workflow

    假設你要做一個「公司內部 SOP 助理」。

    1. 建立知識庫
    2. 在後台新增 Knowledge Base:company-sop
    3. 上傳:人資流程 SOP、報銷流程、IT 報修流程(PDF/Word)
    4. 設定:

      • chunk 大小 500–800 字
      • 選一個中文向量模型(如 bge-large-zh 類)
      • 建立索引
    5. 建立簡單 Agent 工作流

    6. 建立一個 Workflow:sop-assistant
    7. 節點配置:
      • 節點 1:User Input
      • 節點 2:Retrieval Agent
      • 指定使用 company-sop 知識庫
      • 節點 3:Answer Agent
      • System Prompt 例:
        > 你是公司內部 SOP 助理,只能根據提供的 SOP 文件回答。若文件中沒有相關內容,請明確說「文件中沒有這部分說明」並建議聯絡負責部門。
    8. 連線:User Input → Retrieval Agent → Answer Agent → 輸出

    9. 測試互動

    10. 在 Workflow 測試頁輸入:
      • 「新人報到第一天要做哪些流程?」
      • 「海外差旅報銷要準備什麼文件?」
    11. 檢查:Answer Agent 回覆中是否有明確指出 SOP 條款、步驟,必要時微調 chunk / Top-K。

    4. 用 REST API 接入自家網站 / 工具

    完成 Workflow 之後,你可以透過 HTTP 對它發問,嵌入到產品裡。

    典型 API 互動(偽例,請依官方文件實際調整路徑):

    POST http://your-ragflow-host/api/workflows/sop-assistant/run
    Content-Type: application/json
    
    {
      "input": {
        "query": "我要怎麼申請筆電維修?"
      }
    }
    

    後端會回一個 JSON,其中包含:

    • 模型回答內容
    • 可能還有使用到的文件片段(方便你在前端顯示「引用來源」)

    實際接入建議:

    • 官網 / 內部系統前端:做一個 Chat UI,後端把使用者輸入轉發到 RAGFlow API
    • 內部 Bot(如 Slack、Teams):寫個小 Bot,把訊息丟給 Workflow API,再把回答貼回頻道

    補充:RAGFlow、向量庫與模型框架的關係

    要把整套系統看清楚,可以把角色分成三層:

    名稱 核心功能 免費方案 適合誰
    RAGFlow (https://github.com/infiniflow/ragflow) RAG + 多 Agent 工作流、資料接入、檢索與 LLM 編排 開源自架 想做完整 RAG 應用、需要工作流與 API 的團隊
    向量資料庫(如 Milvus、Postgres + pgvector) 儲存與檢索向量,支援語義搜尋 多數有開源版 有大量文檔 / 多模態資料,要穩定、高效向量檢索的團隊
    Transformers (https://github.com/huggingface/transformers) 提供各類 LLM / embedding 模型與推論框架 開源 需要自行訓練 / 微調模型、客製化 NLP 任務的工程師

    可以簡單理解為:

    • Transformers 負責「模型」
    • 向量庫負責「記憶」
    • RAGFlow 把兩者接在一起,幫你做「會查資料又會動手的 AI 助理」

    想快速上手 RAGFlow,最實用的路徑就是:一台機器 + Docker、一個便宜或免費的 LLM API、一疊 PDF,先做出一個真的能回答問題的內部助理,再慢慢加上更多 Agent 和外部 API,讓它從「會回答」進化到「會幫你做事」。

    🚀 你現在可以做的事

    • 到 GitHub 下載 RAGFlow 專案並用 docker compose up -d 在測試機器上啟動
    • 準備一疊內部 SOP / 產品手冊 PDF,上傳到新建的 Knowledge Base 做第一版助理
    • 在 RAGFlow 裡配置一個簡單 Workflow,然後用自家網站或 Slack Bot 透過 REST API 接入試跑
  • 用 Unsloth 把筆電變成小型 AI 伺服器

    用 Unsloth 把筆電變成小型 AI 伺服器

    📌 本文重點

    • Unsloth Desktop 把筆電變成本地多模態 AI 伺服器
    • 支援多 GPU / CPU,並提供 OpenAI 兼容 API
    • 適合本地聊天助理、RAG、Agent 與多模態 Side Project
    • 幾乎不改程式即可把既有 OpenAI workflow 搬到本機

    用一句話定位:Unsloth Desktop 就是把你的筆電變成「小型 AI 伺服器 + 實驗室」的開源桌面工具,讓聊天、程式助理、RAG、影像與語音模型都能在本機跑起來。

    工具來源:
    – Reddit 介紹文:https://www.reddit.com/r/LocalLLaMA/comments/1vlj87v/introducing_unsloth_desktop_app/
    – Product Hunt:https://www.producthunt.com/products/unsloth


    核心功能:把「本地模型」變成可用的服務

    下面三個功能,是你真的會用到、立刻能起手的重點。

    1. 支援多種模型格式:MLX / diffusion / 語音 / GGUF

    Unsloth Desktop 的定位不是「只跑 LLM」,而是一個多模態模型的統一入口:

    • 語言模型:支援 GGUF(llama.cpp 系列)、MLX(Apple Silicon 上的高效框架)
    • 影像 / 視覺:支援 diffusion 影像 / 影片模型
    • 語音:支援音訊模型(語音辨識、TTS 等)

    你可以這樣開始行動:

    1. 安裝好 Unsloth 後,打開模型面板
    2. 選擇一個預設 GGUF LLM(例如 MiniMax-H3、Muse Glimmer)
    3. 選一個簡單的 diffusion 模型(如 Stable Diffusion 系列)
    4. 在同一個介面裡,分別測試文字聊天和影像生成

    這種「同一套操作邏輯管理多模態模型」的好處,是你不用在不同 CLI 工具之間切來切去,對 AI 新手非常友善。


    2. 多 GPU & CPU 加速,本地推理真的跑得動

    很多人「幻想」在筆電上跑模型,卡在效能與顯示記憶體。Unsloth Desktop 的重點是盡量把你手上的硬體吃乾抹淨:

    • 支援多種 GPU:NVIDIA、AMD、Intel、Mac(含 Apple Silicon)
    • 支援 CPU 推理:沒有獨顯也可以跑,只是速度會慢一些
    • 對訓練 / 微調:標榜約 2 倍訓練速度、70% VRAM 節省(來源:官方 Reddit 介紹)

    💡 關鍵: 大約 2 倍訓練速度與 70% VRAM 節省,代表同樣硬體上能跑更大模型或更多實驗。

    你可以立刻做的事:

    1. 在設定頁面確認硬體偵測到的 GPU / CPU
    2. 選一個中型模型(例如 7B gguf),先跑一次聊天測試
    3. 觀察系統資源使用(macOS 的活動監視器、Windows 的工作管理員),確認真的有用到 GPU

    如果你是 Mac 使用者,可以搭配像這篇關於 Apple Silicon + llama.cpp 的效能優化思路:https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md,來理解「為什麼在 M 系列晶片上跑本地 LLM 是可行的」。


    3. OpenAI 兼容 API + 自我修復工具呼叫

    Unsloth Desktop 最關鍵的功能,是把本地模型包成一個 OpenAI 兼容的 API:

    • 提供 OpenAI-compatible endpoint(Unsloth Native)
    • 可以同時串本地模型和雲端模型(例如 OpenAI、Anthropic 等),在同一個 API 層切換
    • 內建「自我修復」的工具呼叫與沙盒化代碼執行:模型在呼叫外部工具或執行程式碼出錯時,可以自動重試 / 修正,同時把程式碼限制在安全環境裡

    💡 關鍵: OpenAI 兼容 API 讓你幾乎不改程式碼,就能把原本的雲端 workflow 直接換成本地模型。

    這讓你可以做幾件事:

    1. 把本地 LLM 當成 ChatGPT-compatible 的後端,接在現成客戶端(如 Chatbox、Continue、Open WebUI 等)
    2. 在 VS Code 旁邊跑自己的模型,搭配 Claude Code / Codex 類工具一起用
    3. 建立簡單 Agent:模型收到任務 → 呼叫系統工具或小腳本 → 在沙盒裡執行 → 回傳結果

    適合誰用:三種典型場景

    1. 本地聊天與程式助理:在 VS Code 旁跑自己的模型

    如果你平常習慣用 Claude Code、Cursor 或 GitHub Copilot,想要多一個「完全不出機房」的備用助理,可以這樣玩:

    • 把 Unsloth Desktop 裝在開發機上,啟動一個 GGUF LLM
    • 用 VS Code 外掛或本地聊天客戶端,改成連至 Unsloth 的 OpenAI 兼容 API
    • 寫程式時,用雲端模型做主力、遇到敏感專案(公司內網、客戶程式碼)就切到本地模型

    具體行動建議:

    1. 選一套 ChatGPT-compatible 客戶端(例如 Continue 或 Chatbox)
    2. 在其設定裡,把 api_base 改成 Unsloth 提供的 endpoint(例如 http://localhost:port/v1)
    3. 選定模型名稱,例如 local-llm-7b,直接開始對話與程式補全

    2. 私有資料實驗與原型:本機 RAG / Agent,不經雲端

    很多團隊不敢把內部文件丟上雲端 RAG,Unsloth 提供了一條完全本地的實驗路線:

    • 把公司或個人 PDF / Markdown / internal wiki 先處理成向量資料庫(自行寫腳本或用現成 RAG 套件)
    • 模型端用 Unsloth 提供的本地 LLM API
    • 在本機 web app 或小工具裡,做檢索 + 回答組合

    可以這樣起手:

    1. 在你的後端(Node.js / Python)中,接 Unsloth 的 API 當成 chat/completions 或 responses 來源
    2. 用如 n8n / LangChain / LlamaIndex 這類工具,把「取文件片段 → 呼叫本地 LLM」串起來
    3. 先做一個只服務自己筆電的小型內部 FAQ Bot,再考慮用 Cloudflare Tunnels 把 Unsloth API 安全地開到公司內網(Unsloth 原文有提到 Cloudflare 保護連線)

    3. 多模態 Side Project:影像生成、語音模型、簡單 Agent 工作流

    如果你平常喜歡做 Side Project,Unsloth 可以當成你所有 AI 功能的統一後端:

    • 用 diffusion 模型接一個「本地 Stable Diffusion 影像生成頁面」
    • 用語音模型做「錄音 → 轉文字 → LLM 摘要 → TTS 回覆」的工作流
    • 用 Agent 功能做一個「會自己跑 bash / Python 腳本」的小助手,幫你整理檔案或抓網頁資料

    具體行動:

    1. 在 Unsloth Desktop 裡啟動影像 + 語言 + 語音模型
    2. 在本地 web app(React / Vue / Svelte 任意)裡,統一呼叫同一個 API endpoint
    3. 利用工具呼叫與沙盒功能,設計幾個具體指令,例如「幫我整理 Downloads 資料夾」或「抓這個網站最新 10 篇文章做摘要」

    怎麼開始:從安裝到接上現有 workflow

    1. 安裝:Mac / Windows / Linux 都有

    Unsloth Desktop 是開源工具,支援三大桌面平台:

    • Mac:適合 Apple Silicon,用 MLX 模型可以發揮硬體優勢
    • Windows:多數開發者主力,適合接 NVIDIA / AMD GPU
    • Linux:伺服器與進階用戶首選

    行動步驟:

    1. 前往官網或 GitHub 下載最新版(可從 Product Hunt 連過去:https://www.producthunt.com/products/unsloth)
    2. 安裝並啟動,確認介面可以看到模型列表
    3. 在設定裡檢查硬體偵測與 API 設定(本地端口、是否啟用 OpenAI 兼容模式)

    2. 跑起第一個 GGUF / MLX 模型

    上手建議流程:

    1. 在介面中選擇一個輕量模型(例如 3B–7B GGUF),避免一開始就把 VRAM 撐爆
    2. 點選「啟動 / RUN」讓模型載入;等待載入完成
    3. 使用內建聊天介面,輸入一段問題(例如「幫我寫一個 Python 把 CSV 轉成 JSON 的程式」)
    4. 確認回答品質與速度,調整溫度、max tokens 等基本參數

    若你是 Mac M 系列:

    • 優先選 MLX 模型,在偏好設定裡確認使用 Apple GPU
    • 對照前面的 Apple Silicon + llama.cpp 文章,思考是否要調整 batch size 等設定

    3. 啟用 OpenAI 兼容 API:用 curl 測試

    確認 API 真的跑起來,是往後串接 n8n / Zapier 的基礎。

    假設 Unsloth 在本機開一個 http://localhost:8000/v1 的 API,可以這樣測:

    curl http://localhost:8000/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer YOUR_LOCAL_KEY" \
      -d '{
        "model": "local-llm-7b",
        "messages": [
          {"role": "user", "content": "幫我用 Python 寫一個排序函式"}
        ]
      }'
    

    你應該會拿到一個結構與 OpenAI 非常接近的 JSON 回應。確認:

    • model 名稱是否正確
    • 是否需要 API key(有些版本可設定為無認證,只限本機)

    💡 關鍵: 成功用 curl 打通 http://localhost:8000/v1/chat/completions,就代表之後的任何 OpenAI 客戶端幾乎都能直接改 endpoint 來使用本地模型。


    4. 在 n8n / Zapier / 本地 web app 裡改掉 endpoint

    最後一步,把你原本的 workflow 直接「搬家」到自己筆電上的 Unsloth。

    以 n8n 為例:

    1. 找到原本呼叫 OpenAI 的 HTTP Request 節點
    2. 把 URL 從 https://api.openai.com/v1/chat/completions 改成 http://localhost:8000/v1/chat/completions
    3. 把 Authorization header 改成對應的本地 key(或移除認證視你設定而定)
    4. 保留原本的 messages 結構,只把 model 改成 Unsloth 內的本地模型名稱

    Zapier 類似做法:

    • 若使用 Webhooks by Zapier,改成打本地 URL
    • 若原本用的是 OpenAI 官方 integration,則改為自訂 webhook

    對於自己寫的 web app:

    • 在環境變數裡新增 OPENAI_BASE_URL=http://localhost:8000/v1
    • 程式碼中使用 OPENAI_BASE_URL 來組合 API URL,而不是寫死 api.openai.com

    這樣,你所有原本設計給 OpenAI / Claude 的 workflow,可以在幾乎不改程式的情況下,直接切到自己機器上的 Unsloth。本地 + 雲端混用時,只要切換 base URL 或 model 名稱,就能控制資料是否出機房。


    簡短比較:Unsloth 與常見本地 LLM 工具差異

    若你已經在用 Ollama、llama.cpp,也可以把 Unsloth 當成「更偏向多模態與訓練、又有桌面介面」的補充工具。

    名稱 核心功能 免費方案 適合誰
    Unsloth Desktop 多模態模型管理 + 本地訓練 + OpenAI 兼容 API 開源免費 想在筆電做本地 Agent、多模態實驗的開發者
    Ollama 本地 LLM 管理與推理(重文字) 開源免費 想快速跑文字模型、不需要訓練與多模態的人
    llama.cpp 低階 C++ 推理引擎(GGUF、效能優化) 開源免費 有工程背景、願意自己包 API 的技術使用者

    如果你想要一個「按裝置效能極限推到滿、又不必寫太多底層程式」的本地 AI 實驗室,Unsloth Desktop 是一個很實用的選擇:先讓它跑起一個本地 LLM,接上 OpenAI 兼容 API,然後把你現有的工作流一個一個搬過來,你就真正擁有了屬於自己的多模態 Agent 伺服器。

    🚀 你現在可以做的事

    • 前往 Product Hunt 或 GitHub 下載並安裝 Unsloth Desktop,啟動一個 7B gguf 或 MLX 模型
    • 用 curl 或你常用的 ChatGPT-compatible 客戶端,將 api_base 改成 http://localhost:8000/v1 測試本地 API
    • 挑一個現有用 OpenAI 的 workflow(如 n8n 流程或小型 web app),只改 endpoint 與 model 名稱,把它搬到本機 Unsloth 上跑