分類: AI 工具

  • Haystack 實戰:一天做出公司 AI 助理

    Haystack 實戰:一天做出公司 AI 助理

    📌 本文重點

    • Haystack 把 RAG + Agent 流程統一成框架
    • 少寫檔案處理與檢索 script,快速做公司助理
    • 用範本與工具擴展成可連公司系統的 Agent
    • 一天內跑出第一個可給同事用的 QA 助理

    用 Haystack,你可以少寫一堆 RAG script,把「文件檢索、LLM 調用、Agent 流程管理」統一交給一個開源框架處理。

    官方網站:https://haystack.deepset.ai/


    為什麼不要再自己拼 RAG script?

    多數人做公司內部 AI 助理,走的流程都是:

    1. 自己寫檔案讀取、切 chunk、丟向量庫
    2. 自己串 LLM API,處理 history、retrieval 邏輯
    3. 想加一點工具(查 DB、叫 REST API)又多一支 script

    問題是:
    – 每新增一個資料源或工具,都要重構流程
    – 很難部署成穩定 API 給同事用

    Haystack 的定位很直接:把 RAG + Agent 的骨架先幫你做好,你只需要選模型、選向量庫、加自己工具,就能變成一個可上線的 AI 助理。

    💡 關鍵: 用框架統一 RAG + Agent 流程,可以讓你只專注在選模型、選向量庫與設計工具,少掉大量重複的整合工作。


    核心功能:你可以少寫的三件事

    1. 文件管線:多資料源 + 多向量庫

    Haystack 幫你處理「資料→文件→向量」的整條管線:

    你可以:
    – 選擇資料源:檔案夾、PDF、Markdown、Confluence、Notion 等
    – 選擇向量庫:FAISS、Weaviate、Qdrant、Elasticsearch…
    – 用同一套 API 建 index、更新文件,避免 N 種自訂 script

    實際行動:先在本地建一個簡單文件管線

    pip install haystack-ai
    

    範例(Python):

    from haystack import Pipeline
    from haystack.document_stores import FAISSDocumentStore
    from haystack.nodes import PDFToTextConverter, TextSplitter, EmbeddingRetriever
    
    # 建立向量庫
    doc_store = FAISSDocumentStore(faiss_index_factory_str="Flat")
    
    # 文件處理節點
    converter = PDFToTextConverter()
    splitter = TextSplitter(chunk_size=500, chunk_overlap=50)
    retriever = EmbeddingRetriever(document_store=doc_store, embedding_model="sentence-transformers/all-MiniLM-L6-v2")
    
    indexing = Pipeline()
    indexing.add_node(converter, name="converter", inputs=["File"])
    indexing.add_node(splitter, name="splitter", inputs=["converter"])
    indexing.add_node(retriever, name="retriever", inputs=["splitter"])
    
    indexing.run({"File": {"paths": ["./docs/handbook.pdf"]}})
    

    跑完,你就有一個可檢索的公司文件向量庫。


    2. 問答 / ChatBot 範本:已幫你處理 history + retrieval

    Haystack 內建多種 QA / ChatBot 範本,你不用自己寫:
    – 如何把 user 問題拿去檢索文件
    – 如何把檢索結果塞進 prompt
    – 如何處理多輪對話的 history

    你只要:
    1. 選用哪一個 LLM(雲端或本地)
    2. 綁定上一步建立好的向量庫

    範例:最小 QA API(搭配 Docker 跑一個 stack)

    docker run -p 8000:8000 deepset/haystack:latest
    

    在 Python 中寫一個簡單 QA pipeline:

    from haystack import Pipeline
    from haystack.nodes import PromptNode
    from haystack.document_stores import FAISSDocumentStore
    from haystack.nodes import EmbeddingRetriever
    
    # 連到既有向量庫
    doc_store = FAISSDocumentStore(faiss_index_path="faiss_index")
    retriever = EmbeddingRetriever(document_store=doc_store, embedding_model="sentence-transformers/all-MiniLM-L6-v2")
    
    # LLM(可改成你的雲端 / 本地模型)
    prompt_node = PromptNode("gpt-4o", api_key="YOUR_OPENAI_KEY")
    
    qa = Pipeline()
    qa.add_node(retriever, name="retriever", inputs=["Query"])
    qa.add_node(prompt_node, name="llm", inputs=["retriever"])
    
    result = qa.run({"Query": "我們的休假制度怎麼規定?"})
    print(result["results"][0])
    

    這樣就有一個最小的「公司文件 QA API」,可以包成 FastAPI / Flask 給同事使用。


    3. Agent 範本:多工具呼叫 + 任務分解

    當你想讓助理不只回答文件內容,還能查系統資料或叫內部 API,Haystack 的 Agent 範本就派上用場。

    你可以:
    – 定義多個工具(例如:查工時系統 REST API、查 CRM 客戶資料)
    – 讓 Agent 自己決定何時呼叫哪個工具,並把結果融入回答

    範例:加一個「查內部 REST API」工具

    from haystack.agents import Tool, Agent
    import requests
    
    # 定義工具
    def get_user_vacation(user_id: str) -> str:
        r = requests.get(f"https://internal-api.company.com/vacation/{user_id}")
        return r.json()["summary"]
    
    vacation_tool = Tool(
        name="vacation_lookup",
        func=get_user_vacation,
        description="查詢員工剩餘休假與最近申請紀錄。輸入 user_id。",
    )
    
    agent = Agent(tools=[vacation_tool], model="gpt-4o")
    
    answer = agent.run("幫我查一下員工 1234 的休假狀態,再用中文整理給我。")
    print(answer)
    

    到這一步,你已經從「純 QA 助理」升級成「簡單 Agent」,可以真正接公司系統工作流程。

    💡 關鍵: 一旦把公司內部 REST API 或 DB 封成工具交給 Agent,你的助理就能從「只會看文件」變成「真的能查系統、執行工作」的實用工具。


    適合誰用?兩個具體場景

    1. 公司內部文件助理(Confluence / PDF / Notion)

    目標:讓同事問「新人入職流程」「出差報帳規則」時,直接跟 AI 聊天,不必翻 Confluence / PDF。

    你可以這樣做:
    1. 把公司手冊、流程文件、政策 PDF 匯出到一個資料夾
    2. 用 Haystack 文件管線建立向量庫
    3. 用 QA 範本 + LLM 做一個 /ask-docs API
    4. 用簡單前端(React / internal tool)做一個聊天頁面給同事用


    2. 客戶 FAQ 機器人(網站 / LINE / Web Chat)

    目標:把客服中心常見問題、產品 FAQ 集中到一個聊天介面,讓客戶自助查詢。

    你可以:
    1. 用 Haystack 把 FAQ CSV / 網站內容抓下來做 index
    2. QA pipeline 對接你的 LLM(可以選較便宜模型,參考 AI 成本問題:https://blog.dshr.org/2026/06/ais-affordability-crisis.html)
    3. 透過 Agent 工具連到訂單查詢 API,讓客戶問「我的訂單現在在哪?」時能真的查到資料


    怎麼開始:一天內跑出第一個可用助理

    步驟 1:本地快速上手

    1. 建環境

    bash
    python -m venv venv
    source venv/bin/activate # Windows 用 venv\Scripts\activate
    pip install haystack-ai

    1. 選模型
    2. 想省錢、保留隱私:用本地開源模型(例如 DeepSeek 輕量版,部署教學可參考:https://pub.towardsai.net/how-to-run-deepseek-locally-on-your-own-computer-and-the-catch-most-guides-skip-60517629d00d)
    3. 想先跑順:用雲端 OpenAI / Anthropic 等

    步驟 2:選一個向量庫

    開發階段,可以先用:
    – FAISS:本地測試快速、安裝簡單
    – Qdrant / Weaviate:要多機部署再考慮

    把向量庫實例塞到 Haystack document_store,就能用同一套 pipeline 程式碼。


    步驟 3:照官方範例跑出第一個 QA API

    官方入門範例在:https://haystack.deepset.ai/tutorials

    你可以:
    1. 先照「Quickstart RAG」跑一遍(約 30 分鐘)
    2. 把示範資料換成公司文件
    3. 用 FastAPI 包一層 HTTP API:

    from fastapi import FastAPI
    from pydantic import BaseModel
    
    app = FastAPI()
    
    class Query(BaseModel):
        question: str
    
    @app.post("/qa")
    async def qa_endpoint(q: Query):
        result = qa.run({"Query": q.question})
        return {"answer": result["results"][0]}
    

    部署與實戰小訣竅

    1. 用環境變數切換雲端 / 本地模型

    實務上你會想在:
    – 開發:用本地開源模型省錢
    – 上線:用雲端模型提高穩定性

    可以這樣設計:

    import os
    from haystack.nodes import PromptNode
    
    MODEL_NAME = os.getenv("LLM_MODEL", "gpt-4o")
    MODEL_ENDPOINT = os.getenv("LLM_ENDPOINT")  # 本地時填自己的伺服器 URL
    
    prompt_node = PromptNode(MODEL_NAME, api_key=os.getenv("LLM_API_KEY"), url=MODEL_ENDPOINT)
    

    只要在部署時改環境變數,就能切換不同模型和推理後端。


    2. Prompt logging:先看清楚 Agent 在幹嘛

    Haystack 支援把 pipeline 執行資訊輸出,你可以:
    – 把每次 prompt、檢索結果、工具呼叫記錄到 DB / Log 文件
    – 用這些紀錄回頭調整 prompt、優化 Agent 行為

    簡單做法:
    – 在 FastAPI 層加 middleware,把 qa.run() 的輸入輸出存進 DB
    – 固定每週 review 一次錯誤回答,調整資料和 prompt


    3. 評估:不要只看「感覺」,要看準確率

    Haystack 有基礎評估工具,你可以:
    1. 準備 20-50 題真實問題 + 正確回答
    2. 用這些問題跑 pipeline,計算命中率、是否有 hallucination
    3. 調整 chunk 大小、retriever top-k、模型種類

    💡 關鍵: 用 20–50 題標註資料做簡單評估,比只看「用起來感覺不錯」更能掌握準確率與幻覺問題。


    總結:先用框架,把精力留給「你自己的工具」

    如果你已經寫過一次 RAG pipeline,就知道真正麻煩的不是 LLM,而是:文件流程、檢索、上下文管理、工具呼叫。Haystack 把這些基礎骨架收斂成一套可重複使用的框架,你可以把力氣放在:

    • 接公司內部系統(REST API / DB / CRM)
    • 整理與更新文件資料
    • 設計合乎業務邏輯的 Agent 行為

    照本文步驟,一天內做出第一個「真的可以丟給同事用」的公司 AI 助理,之後再慢慢疊功能,而不是每次都從一堆 RAG script 重寫。


    🚀 你現在可以做的事

    • 到 Haystack 官方教學 跑一遍 Quickstart RAG,並把示範資料換成公司文件
    • 在本地用 FAISS + 一個你熟悉的 LLM(如 gpt-4o 或本地 DeepSeek)建立第一個 QA pipeline
    • 為公司內一個具體場景(例如新人入職或客服 FAQ)做出 /qa HTTP API,丟給 2–3 位同事試用並收集回饋
  • Claude 進 Slack:讓 @Claude 變成常駐隊友

    Claude 進 Slack:讓 @Claude 變成常駐隊友

    📌 本文重點

    • Claude Tag 把 AI 帶進 Slack 工作流
    • 可讀取頻道與文件成為常駐 AI 隊友
    • 產品與工程團隊可用來改 code、寫 spec、整理決策
    • 使用時要重視權限與資料留存設定

    Claude Tag 解決的問題很簡單:把「開瀏覽器問 AI」變成「在 Slack 裡直接叫一個懂你團隊脈絡的 AI 隊友」,接招、改稿、寫 code 都在原本的工作流裡完成。

    官方介紹與申請入口:Anthropic — Introducing Claude Tag


    Claude Tag 是什麼?先用一張心智圖說清楚

    先釐清一個觀念:@Claude 在 Slack 裡不是單獨一個聊天機器人,而是「常駐 AI 隊友」。

    你可以這樣想:

    • Slack 工作區 = 你們的辦公室
    • 各個頻道、DM = 會議室、部門群組
    • @Claude Tag = 一位一直待在辦公室的 AI 同事,可以:
    • 讀你開放給它的頻道歷史
    • 看你丟進 Slack 的文件、PR 連結、會議紀錄
    • 參與日常討論,幫忙把「長聊」轉成「可執行的產出」

    接下來所有操作,都圍繞一件事:在需要的地方標註 @Claude,讓它補位。


    核心功能:3 種你今天就能用起來的玩法

    1. 在任意頻道標註 @Claude 做即席協作

    Claude Tag 的第一個重點:不用開新聊天視窗,直接在任何頻道叫它一起工作。

    可以直接抄下面幾種用法:

    • 改 code / 寫 PR 說明
    • 在 #backend 頻道貼出 PR 連結或片段 code,接著:
    • @Claude 幫我檢查這段改動有沒有潛在效能問題,順便寫一段 PR 說明,給 reviewer 看。
    • 寫 spec / 補文件
    • 把討論串貼給 Claude:
    • @Claude 根據這整串對話,幫我寫一份 API 變更簡要 spec,用條列整理:背景 / 改動 / 風險 / TODO。
    • 整理會議紀要
    • 開完會直接把 Zoom transcript 或重點丟進頻道,然後:
    • @Claude 把這份紀錄整理成:決策摘要 + 待辦事項(標註負責人與期限)。

    這種用法的關鍵:把「輸出格式」講清楚(例如「用條列」、「幫我變成 Jira ticket」),Claude 就會照你們現有習慣產出。


    2. 讓 Claude 漸進學會公司內部知識

    第二個重點,是很多人忽略的:Claude Tag 會累積你們的上下文,但你可以控制它「看到什麼」。

    實際可以做的事:

    1. 設定 Claude 可以進的頻道範圍
    2. 第一次啟用時,由 workspace admin 選擇:哪些 team space、哪些公開頻道可以 @Claude。
    3. 建議做法:先選擇一兩個「資訊集中但不含敏感資料」的頻道當試驗場,例如:

      • #product(功能討論)
      • #eng-help(技術問答)
    4. 有意識地「餵」它公司知識
      每當有重要內部文件,直接在對應頻道讓 Claude 讀:

    5. @Claude 這是我們最新的工程 onboarding docs,幫我整理成 10 個 FAQ,以後新人問類似問題時你可以用。
    6. @Claude 這是 2025 Q4 的產品 roadmap,請記住。之後我問你優先順序時,優先以這份 roadmap 為準。

    7. 隱私與權限注意

    8. 只讓 Claude 加入你願意被 AI 閱讀的頻道。
    9. 對高度機密(薪資、法律糾紛)頻道:不要加入 Claude,也不要貼內容給它看。
    10. 與管理者討論資料留存策略:是否讓 Claude 長期記住對話,還是關鍵討論後再以整理版文件餵給它。

    可行動建議:先選一個「試點 team space」,明確宣告什麼可以給 Claude 看、什麼不行,讓團隊放心試用。


    💡 關鍵: 透過精選頻道與文件餵養,Claude 能逐步成為懂你公司脈絡的專屬知識助理,同時兼顧隱私與安全。

    3. 高價值產品開發場景:開發團隊可以這樣用

    根據 Anthropic 對外說法,內部產品團隊已有約 65% 的程式碼由 Claude 協助生成(來源:The Decoder 報導)。

    💡 關鍵: 有約 65% 內部程式碼由 Claude 參與,代表把 AI 納入日常開發流程已經能帶來實質產能提升。

    這裡整理幾個實際可套用場景:

    1. Code Review 草稿
    2. 在 PR 頻道標註:
    3. @Claude 幫我做這個 PR 的初步 code review,列出:風險點 / 可改善的地方 / 要特別測的情境。
    4. reviewer 只要從 Claude 草稿開始調整,比從零寫 review 快很多。

    5. PR 說明生成

    6. 開 PR 前,把改動片段貼到 Slack:
    7. @Claude 根據這些改動,幫我寫一段清楚的 PR 說明,包含:變更內容 / 為什麼要改 / 影響範圍。

    8. 設計文件摘要與追蹤決策

    9. 設計師在 #product 貼 Figma 連結與說明後:
    10. @Claude 幫我寫一份設計摘要,給工程團隊看,重點放在互動邏輯與 API 需求。
    11. 長期討論串快結束時:
    12. @Claude 把這整串討論變成一份「決策紀錄」,包含:我們決定做什麼、不做什麼、理由是什麼。

    從 0 到能用:5 個步驟完成初始設定

    以下是一個可以直接照做的「從 0 到能用」流程:

    步驟 1:確認資格與安裝入口

    1. 聯絡你們的 Slack workspace admin。
    2. 到 Anthropic 官方頁面申請 Claude Tag:https://www.anthropic.com/news/introducing-claude-tag
    3. 安裝 Slack App(通常由 admin 在 Slack App Directory 點選「Add to Slack」,授權 Claude 進入工作區)。

    步驟 2:建立第一個 team space

    推薦先建立一個「試驗場」:

    • 例:建立一個 #claude-pilot 或選擇現有的 #product 當 Claude 的主要 team space。
    • 在頻道 topic 寫清楚:
    • 這裡允許 @Claude 參與討論
    • 這裡不貼敏感資訊(財務、個資、合約原文)

    步驟 3:設定權限與資料留存

    與 admin 做三件事:

    1. 決定 Claude 可加入的頻道清單(只選跟產品/工程相關的公開頻道開始)。
    2. 確認公司對 AI 工具的資料政策:是否允許對話被用於模型微調或分析;如果不允許,要在管理後台關閉相關選項。
    3. 建立審核機制:例如約定「所有由 Claude 產生的 code,一定要由人類 reviewer 看過再 merge」。

    步驟 4:準備 2~3 個可抄的 Prompt 範本

    直接貼在頻道 pinned messages,讓大家複製使用:

    1. 把對話整理成 Jira ticket

    text
    @Claude 請把上面這整串對話整理成 1 張 Jira ticket:
    - 題目:用一句話描述主要需求
    - 描述:背景 / 使用者故事 / 驗收標準
    - 子任務:列出需要的開發與測試任務
    請用我們平常 Jira 的格式回覆。

    1. 從 PR 線索寫測試案例

    text
    @Claude 根據這個 PR 的改動內容,幫我想出 5 個具體的測試案例:
    - 每個案例要包含:前置條件 / 操作步驟 / 預期結果
    - 優先涵蓋邊界情況與錯誤處理。

    1. 會議後產出決策紀錄

    text
    @Claude 請把這份會議紀錄整理成:
    - 決策摘要(3 行以內)
    - 已決定事項(列點)
    - 尚待釐清的問題(列點,加上提議負責人)


    步驟 5:讓團隊先用一週,再回頭調整

    一週後可以檢視:

    • 哪些 prompt 用得最多?考慮做成 Slack shortcut 或範本文檔。
    • 哪些頻道真的需要 Claude?誰覺得被打擾?再微調頻道清單。
    • 是否需要再開一個「只給 Claude 看整理版文件」的頻道,避免原始對話太雜亂。

    適合誰用?幾個具體場景

    產品與工程團隊

    • 每天在 Slack 上討論需求、看 PR、改 spec 的團隊。
    • 想要減少「會後沒人寫紀錄」、「PR 說明草草帶過」的情況。

    Startup 創辦人與 PM

    • 希望把散落在 Slack 的決策,變成結構化文件或任務。
    • 想要有一個懂公司脈絡的 AI,可以問「我們之前討論過 X 嗎?」並整理出來。

    跨部門協作團隊

    • 法務、行銷、營運共同在 Slack 協作,常有長串討論。
    • 需要有人幫忙把「雜訊」整理成可以丟進 Notion、Confluence 的精簡版本。

    和傳統「開瀏覽器問 ChatGPT」的差異

    最後一個關鍵差異:Claude Tag 會記得你們團隊的上下文。

    與在瀏覽器開 ChatGPT 相比:

    • 你不用每次重新貼背景;Claude 已經在頻道裡看過之前的討論。
    • 它知道你們常用的詞(內部代號、專案名稱),輸出更符合團隊習慣。
    • 它可以把散落在 Slack 的訊息,慢慢累積成組織知識。

    但這也意味著你要更在意資料留存與權限設定:

    • 只讓 Claude 進入你願意被 AI 看見的頻道。
    • 在公司內部文件中說明:哪些類型資料不貼給 Claude。
    • 為 AI 產出的內容訂定審核流程,避免「AI 說的」直接變成正式決策或上線 code。

    如果你已經習慣用 ChatGPT / Claude 網頁版,下一步可以嘗試的是:選一個團隊、選一個 Slack 頻道,把上面 3 個 prompt 貼上去,讓 @Claude 真正變成你們的常駐 AI 隊友。


    🚀 你現在可以做的事

    • 到 Anthropic 官方頁面 申請並安裝 Claude Tag 到你的 Slack workspace
    • 建立一個 #claude-pilot 試驗頻道,貼上文中的 3 個 prompt 範本讓團隊開始使用
    • 與 workspace admin 討論並設定 Claude 可加入的頻道與資料政策,確保權限與留存策略清楚明確
  • 用 HTML 寫腳本做影片:Hyperframes 實戰

    用 HTML 寫腳本做影片:Hyperframes 實戰

    📌 本文重點

    • 用 HTML/TypeScript 把影片當「程式」來維護
    • Hyperframes 將腳本轉成可由 Agent 操控的影片時間軸
    • 適合 PRD/demo、教學文件與 SaaS 行銷影片自動化

    用 TypeScript/HTML 寫「腳本」,讓 Hyperframes 自動渲染成影片時間軸,工程師和產品團隊可以把影片當程式一樣維護、生成、版本控管。

    專案連結:heygen-com/hyperframes on GitHub


    核心功能:把 HTML 當「影片腳本」來寫

    Hyperframes 的一句話定位,就寫在專案首頁:Write HTML. Render video. Built for agents.

    💡 關鍵: 用你已熟悉的 HTML/TypeScript 寫腳本,就能直接生成可維護、可版本控管的影片時間軸。

    1. 用 HTML/TypeScript 描述「場景」

    你不需要學一套新語言,只要會寫基本 HTML + 一點 TypeScript 就能描述影片:

    • 文字:標題、段落、註解
    • 圖片:產品截圖、Logo、示意圖
    • 版面:位置、大小、對齊、動畫時間

    概念有點像「React for video」,只是畫面不是立刻出現在瀏覽器,而是被轉成可渲染的影片時間軸。

    你可以馬上做的事:

    • 想像你平常寫的 landing page,把那套 HTML 思維搬到「影片畫面描述」上
    • 打開一個 PRD 或 Markdown 文件,先用 HTML 把幾個關鍵畫面(標題 + 截圖 + 說明文字)寫成簡單的段落

    2. Hyperframes 轉成時間軸,可被 Agent 動態更新

    Hyperframes 負責兩件事:

    1. 解析你的 HTML/TypeScript 標記
    2. 把它轉成一個「每一秒要顯示什麼」的時間軸,供後端渲染成影片

    因為是程式化的時間軸,AI Agent 可以:

    • 根據使用者輸入,動態生成新的 HTML 段落
    • 修改某段文案 / 圖片,重算時間軸,只重渲染需要改的片段
    • 大量生成「同版面、不同內容」的客製化影片

    你可以馬上做的事:

    • 在腦中把「Premiere 的時間軸」換成「一個可被 AI 修改的 JSON」
    • 思考:你手上的哪類影片,其實只是在不同客戶之間改幾行字、改幾張圖?那些都可以交給 Agent + Hyperframes 自動跑

    3. 為多代理系統設計的「影片引擎」

    Hyperframes 是純 TypeScript 開源專案,設計上就是給 Agent / workflow 用:

    • 可在 Node.js 環境跑,方便接各家 LLM API(包含 Gemini Interactions API、Claude、OpenAI 等)
    • HTML 腳本可存 Git 版本控管,配合 CI/CD 產生最新版本影片資產
    • 適合作為「一個工具節點」,掛在你原有的多代理系統後面

    你可以馬上做的事:

    • 把 Hyperframes 想成「你的 AI pipeline 裡的一個 render-video step」
    • 在系統設計圖上加一個方塊:Agent → 產生 HTML → Hyperframes → 影片檔

    適合誰用:3 個具體場景

    1. 產品 demo 腳本自動化(從 PRD 產生影片)

    場景:你有詳細的 PRD / feature spec,現在要做:

    • 版本更新介紹影片
    • 產品 demo 給內部/客戶

    做法:

    1. 用 LLM 讀 PRD(例如 Gemini Interactions API / Claude),生成一份 HTML 腳本:
    2. 每個 section = 一個場景
    3. 為每個場景標註標題、說明文字、要顯示的截圖檔名
    4. 把這份 HTML 餵給 Hyperframes 轉成影片時間軸
    5. 配合螢幕錄影或靜態截圖,渲染出完整 demo 影片

    可以立刻行動:先選一份最常更新的產品功能說明,試著寫一版最陽春的 HTML 腳本(只有標題 + 一段文字),跑通「文字 → 影片」流程。


    2. 教學 / 文件影片化(Markdown → HTML → 影片)

    場景:你有大量技術文件或教學文章,只停留在文字。

    做法:

    1. 先把 Markdown 轉成 HTML(用現成工具或自己寫 parser 都可以)
    2. 用程式規則把特定標題階層變成影片「章節」
    3. Hyperframes 把每一章節變成一個場景,搭配插圖或 code snippet 截圖

    這樣,你就能:

    • 一鍵更新「教學影片」:只要 Markdown 更新,重新跑 pipeline 即可
    • 給客戶或新同事一份「看得懂」的版本

    可以立刻行動:挑一篇 README 或 API 文件,先用任何 Markdown → HTML 工具轉出 HTML,作為 Hyperframes 的 input 範例。


    3. SaaS 行銷頁 A/B 測試影片 + 客製化影片批量生成

    場景:你有 SaaS 產品,要測試不同文案 / 不同主打功能的影片版本,甚至為不同產業客戶客製化介紹。

    做法:

    • 固定版面:Logo 位置、背景、CTA 位置等寫死在 HTML 模板
    • 動態部分:標題、優點列表、案例截圖由 Agent 依據「產業 / Persona」填入
    • Hyperframes 讀模板 + 動態內容,批量生成 N 支影片

    可以立刻行動:先寫一份「固定版面 + placeholder 文案」的 HTML 模板,想好幾種 Persona,讓 Agent 幫你填字,再交給 Hyperframes 渲染。

    💡 關鍵: 把版面固定、內容變數化,可以穩定批量生成多版本影片,適合 A/B 測試和客製化行銷。


    怎麼開始:從 clone 專案到跑出第一支影片

    以下示範的是一條最小可用 pipeline:手寫 HTML → Hyperframes → 影片檔。

    1. 安裝與跑官方範例

    1. 先 clone 專案:

    bash
    git clone https://github.com/heygen-com/hyperframes.git
    cd hyperframes

    1. 安裝依賴(專案使用 pnpm,可改用 npm/yarn 依 README 說明):

    bash
    pnpm install

    1. 跑官方範例(實際 script 名稱請以 repo README 為準,大致會類似):

    bash
    pnpm demo
    # 或
    pnpm examples:simple

    執行成功後,你應該會在 output/ 或指定目錄下看到一支簡單的 mp4 影片。這一步的目標只有一個:先確認環境能渲染出影片。


    2. 寫一個最小 HTML → 影片 pipeline

    建立一個新檔 scripts/simple.ts,示範概念(示意程式碼,實際 API 以官方文件為準):

    import { render } from "hyperframes";
    import fs from "node:fs";
    
    const html = `
      <scene duration="5">
        <layer>
          <text x="50" y="80" fontSize="42" align="center">
            用 HTML 寫腳本做影片
          </text>
          <text x="50" y="55" fontSize="24" align="center">
            這支影片是 Hyperframes 渲染出來的
          </text>
        </layer>
      </scene>
    `;
    
    async function main() {
      const videoBuffer = await render({
        html,
        width: 1920,
        height: 1080,
        fps: 30,
      });
    
      fs.writeFileSync("output/simple.mp4", videoBuffer);
    }
    
    main();
    

    然後在 package.json 新增指令:

    {
      "scripts": {
        "simple": "ts-node scripts/simple.ts"
      }
    }
    

    執行:

    pnpm simple
    

    目標:確認自己可以從一段自訂 HTML,產生一支 mp4,並理解 HTML 每一行大概對應到畫面什麼東西。


    3. 接上自己的 LLM / Agent

    接下來,把「寫 HTML 腳本」交給 LLM 或 Agent:

    1. 準備一份輸入:PRD、Markdown、網站 HTML 等
    2. 在程式裡呼叫任意 LLM(本地模型或雲端 API 皆可):

    ``ts
    async function generateHtmlFromPrd(prdText: string): Promise<string> {
    const prompt =
    請根據以下 PRD 產生一段 Hyperframes 用的 HTML 腳本,
    拆成多個 ,每個 scene 3-5 秒,場景中包含主標題和一句說明:\n\n${prdText}`;

     const res = await callYourLLM(prompt); // 可接 Gemini Interactions API / Claude / OpenAI
     return res.html; // 規劃好讓模型回傳一整段 HTML
    

    }
    “`

    1. 把 html 換成 LLM 輸出的內容,其他 render 流程不變。

    建議實作順序:

    1. 先用手寫 HTML 確認渲染流程 OK
    2. 再加上 LLM 生 HTML
    3. 最後才整合到完整 Agent / workflow 中

    💡 關鍵: 先跑通「手寫 HTML → 影片」再接 LLM,可以把問題範圍縮小在腳本品質,而不是整條 pipeline。


    實戰 workflow 範例:網站 → 腳本 → 影片

    假設你已經有一個「website cloner」Agent(或直接用 Gemini/Claude 爬一個網址),可以這樣串:

    1. 抓網站內容:
    2. 把目標 landing page HTML 抓回來
    3. 抽出主要標題、副標、幾個關鍵區塊文字
    4. LLM 產生影片腳本 HTML:
    5. prompt:
      > 幫我把下面網站內容濃縮成 60 秒產品介紹影片腳本,輸出 Hyperframes HTML,拆成 4-5 個 scene,依序介紹痛點、解法、功能、CTA。
    6. Hyperframes 渲染影片:
    7. 把上一段產出的 HTML 餵給 Hyperframes
    8. 輸出一支 mp4,直接用在:
      • A/B 測試新版本 landing page
      • 業務寄給潛在客戶的「快速介紹影片」

    這整條線只要串完一次,以後對任何網址都能做到「自動 clone 成一支介紹影片」,只需要調整 prompt 和場景模板。


    小結:把影片當程式來維護

    Hyperframes 的價值在於:讓影片變成一個可以被 HTML / TypeScript、LLM、Agent 操控的「程式」,而不是一次性輸出的二進位檔。

    如果你身在工程或產品團隊,習慣用 Git 管規格、用 CI/CD 部署後端,Hyperframes 讓你用同樣思維管理影片資產,從文字文件一路自動化輸出可用的影片成果。

    🚀 你現在可以做的事

    • clone Hyperframes 專案並跑一次官方範例,確認能成功輸出 mp4
    • 手寫一份最小 HTML 腳本,跑通「HTML → Hyperframes → 影片」流程
    • 挑一份 PRD 或 README,嘗試讓你的 LLM 產生第一版影片腳本 HTML 並渲染出影片
  • 一行指令複製網站?這個開源 AI 超會抄

    一行指令複製網站?這個開源 AI 超會抄

    📌 本文重點

    • 一行指令即可把任意網站拆成 React/Next.js 專案骨架
    • 同步抽離樣式與資源,變成可重用 UI 樣板庫
    • 可自訂 AI 模型與 Agent 流程,嵌入既有開發工作流

    只要一行指令,ai-website-cloner-template 就能幫前端 / 全端工程師,把任意網站抓下來、拆成 React/Next.js 專案骨架,當成你的下一個模板起點。

    專案連結:https://github.com/JCodesMore/ai-website-cloner-template


    核心功能:AI Agent 幫你做的 3 件事

    1. 自動爬 DOM,拆出乾淨的前端骨架

    它做的事可以想成「把你平常手動切版的流程自動化」:

    1. 你輸入目標網址
    2. AI coding agents 會:
    3. 爬取 DOM 結構(HTML 標籤、階層關係)
    4. 抽離文字內容、圖片連結等資源
    5. 判斷哪些區塊可以抽成 React component
    6. 最後輸出一個前端專案:
    7. 支援 React / Next.js 等現代框架骨架
    8. 檔案結構已拆好(components/, pages/, styles/)

    你可以做的事:

    • 把原站當「免費設計稿」,快速得到一個可維護的 React/Next.js 專案,而不是一大包雜亂的 index.html。

    💡 關鍵: 自動切出 components/, pages/, styles/ 結構,讓你一開始就站在「可維護專案」而非雜亂單檔的起跑點。


    2. 抽離樣式與資源,變成可重用的樣板庫

    除了 DOM,它還會幫你拆:

    • CSS / Tailwind class:重構成可讀的樣式檔
    • 圖片 / icon / 字型:整理成資源目錄
    • 結構化內容:方便之後換成你的文案或接 API

    實際效果:

    • 原本你可能要開 DevTools 一個區塊一個區塊 copy style,現在交給 Agent 自動做
    • 把「別人網站」變成「自己的 UI 元件庫」,拿來之後快速組頁

    你可以做的事:

    • 針對常見區塊(Hero、Pricing、Footer)提取成自己團隊的內部 UI Library
    • 搭配設計系統,把色票、字體替換掉,長得像你家產品而不是完全 copy

    3. 與你習慣的 AI 模型 / Agent 框架串在一起

    專案本身是 TypeScript 寫的模板,重點是:

    • AI 模型可替換:支援你自己設定的 API Key(如 OpenAI、Claude 等)
    • Workflow 可客製:你可以改「Agent 該跑哪些步驟」
    • 先爬 sitemap 再挑幾頁複製
    • 只抓特定 path(例如 /pricing、/blog)
    • 複製完自動開 PR 到既有 mono-repo

    你可以做的事:

    • 把它嵌進既有的 AI 代理框架(AutoGen、LangGraph 等),當成「網站拆解模組」
    • 做一個公司內部的「一鍵起站」CLI:輸入競品網址 → 自動產出分析專案 + Demo 站

    💡 關鍵: 可替換模型與自訂 workflow,讓它不只是單一工具,而是能融入你整套 AI 開發流水線的「模組積木」。


    適合誰用?4 個很實際的情境

    1. 競品分析:看懂別人怎麼設計,而不是偷他內容

    「Vibecoding」的概念現在已經被拿來做軟體併購評估,Bain & Company 就會用 AI 把標的產品重現一次,看它到底有沒有護城河。

    你可以用同樣的思路:

    • 把競品的主要頁面 clone 成 Next.js 專案
    • 在程式層級看:
    • 資訊架構怎麼切
    • 互動細節放在哪些 component
    • 如何安排轉換漏斗上的 CTA

    採取行動:

    • 選 1 個競品主頁 → 跑一遍 AI Cloner → 用 VS Code 開專案,直接在 component 結構裡做 UX/IA 分析筆記。

    2. 重構老專案:把舊 jQuery 站拉進現代框架

    很多公司還有:

    • jQuery + 雜 CSS
    • Server-side render 的混雜模板

    你可以:

    1. 在內網或 staging 架一份舊站
    2. 用 AI Cloner 指向這個 URL
    3. 拿到一個 React/Next.js 骨架
    4. 再慢慢把舊的業務邏輯搬過去

    採取行動:

    • 挑公司裡一個「大家都嫌舊但沒時間重寫」的小工具頁面,試著用這個流程生一個新骨架,看看重構成本能不能壓下來。

    3. 設計稿 → 靜態樣板:省去第一輪切版

    設計師常丟來:

    • Figma Prototype 已經掛在公開 URL
    • 或用工具輸出成靜態 demo 站

    以前:你從零切版。現在:

    • 把這個 demo URL 丟給 AI Cloner
    • 得到一個可編輯的前端專案
    • 再按需求調整 class 命名、拆 component

    採取行動:

    • 和設計師約好:先用 No-code / Figma plugin 做出可瀏覽 demo → 丟給 Cloner → 工程師直接在生成專案上改,而不是從白板開始。

    4. POC / 黑客松:一晚搞定 Landing Page + 互動畫面

    黑客松、內部 POC 最常卡在:

    • 「找不到設計」
    • 「前端做不完,最後只剩 API Demo」

    這時可以:

    • 找一個你喜歡的公開 Landing Page
    • 用 AI Cloner 生成前端專案
    • 把文案、Logo、配色改成自己的
    • 接上你做的 API / 後端

    採取行動:

    • 下次 Hackathon 前先準備好一個 starter repo:裡面就是你常用的 clone 模板,換文案 + 功能就能 demo。

    怎麼開始:本機安裝到第一行指令

    以下以本機開發為例,假設你已經有 Node.js 基本經驗。

    1. 環境需求

    • Node.js:建議 18+(node -v 確認)
    • npm 或 pnpm
    • Git
    • 一組可用的 AI API Key(例如 OpenAI)

    採取行動:


    2. 下載專案 & 安裝依賴

    在終端機裡:

    # 1. Clone 專案
    git clone https://github.com/JCodesMore/ai-website-cloner-template.git
    cd ai-website-cloner-template
    
    # 2. 安裝依賴
    npm install   # 或 pnpm install / yarn
    

    3. 設定 AI API Key

    通常專案會使用環境變數(.env)。以 OpenAI 為例:

    1. 在專案根目錄建立 .env 檔
    2. 寫入類似:
    OPENAI_API_KEY=你的_API_Key
    MODEL_NAME=gpt-4.1-mini  # 或你想用的模型
    

    實際變數名稱以 repo 文件為準,請對照 GitHub README。

    採取行動:


    4. 下第一個指令:輸入網址 → 生成專案

    安裝完成後,專案通常會提供一個 CLI script,例如(實際命令以 README 為準):

    # 假設提供 npx 方式
    npx ai-website-cloner clone \
      --url "https://example.com" \
      --framework "next" \
      --out-dir "./cloned-example"
    

    執行流程會大致經過:

    1. 檢查能不能連到目標網站
    2. 由 AI Agents 爬 DOM、解析樣式
    3. 生成 React/Next.js 專案骨架到指定資料夾

    完成後:

    cd cloned-example
    npm install
    npm run dev   # Next.js 開發伺服器
    

    打開 http://localhost:3000,你就會看到一個「長得很像原站」的本地版本。

    採取行動:

    • 先找一個你自己做的公開測試站(或公司內部測試環境),拿來當第一個目標,熟悉流程再碰競品網站。

    5. 客製自己的 workflow:換模型、改 Agent 流程

    因為專案是 TypeScript 寫的,你可以:

    • 在 src/agents(假設路徑)裡修改:
    • 要爬哪些路徑
    • 怎麼決定哪些 DOM 要抽成 component
    • 在設定檔裡替換成你愛用的模型:
    // pseudo example
    const client = new OpenAI({ apiKey: process.env.OPENAI_API_KEY })
    const modelName = process.env.MODEL_NAME ?? "gpt-4.1-mini"
    

    或改成你自己的 Agent Framework,讓它在 Clone 完後:

    • 自動開 issue 給團隊
    • 自動寫一份「前端結構說明」Markdown

    採取行動:

    • 挑一個最常用的模型,先固定下來(例如 gpt-4.1-mini 或 Claude 的中小模型),避免每次切專案都要改設定。

    風險與界線:這工具能做什麼、不能做什麼?

    1. 版權與服務條款:不要直接商用 clone 別人站

    AI Cloner 本質上是在「重現別人網站的設計與結構」,這很容易踩到:

    • 著作權(UI 設計、文案、圖片)
    • 服務條款(很多網站禁止自動抓取內容)

    建議用法:

    • 用在:
    • 內部學習與研究架構
    • 重構自家系統(針對自己擁有的網站)
    • 內部工具、POC、Prototype
    • 避免:
    • 直接把 clone 出來的站上線做商業服務
    • 完整複製競品的 UI、文案、圖片

    採取行動:

    • 在專案 README 或公司內部使用規範裡寫清楚:此工具僅用於「學習 / 內部開發」,禁止直接部署 clone 來對外營利。

    2. 安全性:vibe coding 不是免責牌

    The Verge 曾經寫過一個案例,工程師用 vibe coding 快速做站,結果留下 SQL Injection 洞。AI 幫你省的是「切版、搬磚」,不是「安全檢查」。

    使用這種工具時,記得:

    • 不要盲信生成的程式碼
    • 一律跑:
    • Lint / Type check
    • 基本安全檢查(尤其是你接上自己 API 後)
    • 對任何「用戶輸入 → 資料庫 / API」的路徑,重新檢查:
    • 有沒有做輸入驗證
    • 有沒有用參數化查詢

    採取行動:

    • 把你既有的 ESLint / Prettier / 安全掃描(如 npm audit、SAST 工具)加入這個 clone 專案的 CI流程,要求「生成完也要過一輪檢查」。

    💡 關鍵: 把它當自動切版工具而非完整工程師,安全與品質檢查仍然要照表操課。


    小結:把它當「前端樣板生成器」,而不是抄襲機器

    ai-website-cloner-template 最適合的定位是:

    • 前端 / 全端工程師的 AI 起站工具
    • 幫你:
    • 把「你看到的網站」拆成「你看得懂、改得動的 React/Next.js 專案」
    • 在競品分析、系統重構、黑客松裡省下大段切版時間

    只要守住版權與安全紅線,它會是一個很好用的「AI 助手」,幫你把時間留給真正有價值的程式設計與產品決策。

    🚀 你現在可以做的事

    • 打開 https://github.com/JCodesMore/ai-website-cloner-template,clone 專案並依 README 完成第一次跑 CLI
    • 挑一個自己的舊頁面或 side project,實測從 URL → Next.js 骨架的完整流程
    • 在團隊內部 Git repo 建一個 starter 分支,把客製後的 Cloner flow 當作共用起站模板
  • 一句話搞定 PS+Premiere 重工活

    一句話搞定 PS+Premiere 重工活

    📌 本文重點

    • Adobe 推出可用中文聊天操作的 AI 創意代理
    • Photoshop / Premiere 能一口氣完成多步驟編修流程
    • 可與 ChatGPT / Claude 串接,從腳本到成品一條龍
    • 非專業設計/剪輯者也能快速產出「有水準的粗剪」

    你只要打一句「幫我做一支 30 秒 IG Reels,從這支素材裡挑片段、加中文字幕、用品牌色做開場動畫」,Adobe 新的 AI 代理就會在 Photoshop、Premiere 裡自動跑完一串操作,省掉過去要拆成 N 個步驟的苦工。

    參考消息來源:The Decoder 報導、The Verge 報導


    核心功能:兩塊要先搞懂

    1. 在 Photoshop / Premiere 裡,用中文聊天就能跑一串編輯流程

    現在 Photoshop、Premiere 裡多了一個類似聊天視窗的 AI 助理 / 代理(creative agent)。你打文字指令,它會自己串起多個步驟,而不是只做單一功能。

    能做什麼?(Photoshop 範例)

    在 Photoshop 裡,你可以直接對 AI 助理說:

    • 「把這張產品照背景換成淺灰漸層,幫我多生 3 個構圖版本,適合 IG 正方形貼文。」
    • 「幫我把人物膚色調自然、去雜物、再輸出 1080×1350 解析度。」

    💡 關鍵: 一句指令就能完成「選取主體 → 換背景 → 修圖 → 調尺寸」的整套流程,大幅減少重複操作時間

    AI 代理會依序:

    1. 自動選取主體
    2. 生出新背景(用 Firefly 模型)
    3. 做基本修圖(膚色、瑕疵)
    4. 幫你調整尺寸與構圖

    能做什麼?(Premiere 範例)

    在 Premiere 裡,你可以說:

    • 「從這 5 支原始影片裡挑出最順的一段 30 秒,適合 IG Reels,幫我加中文字幕和簡單 BGM。」
    • 「把這段 3 分鐘訪談剪成 3 支 20 秒的短片,每支要有開場標題和結尾 CTA。」

    AI 代理會:

    1. 自動分析語音與內容節奏
    2. 把重點段落剪出來,放上時間軸
    3. 自動產生逐字稿與中文字幕
    4. 套用你預先設定好的標題樣板、字幕樣式與 BGM

    做得好的地方

    • 重複、機械的工作(切片段、對字幕時間、套版型)可以一口氣交給 AI 跑完
    • 對不熟 Premiere 的人,只要先選好樣板,以後就用一句話叫它套用

    仍然需要人手修的地方

    • 影片節奏:AI 剪出來的片段「不難看」,但你要的是「好看」──節奏、表情卡點最好手動再調
    • 品牌細節:LOGO 尺寸、字體微調、音樂音量比例,AI 會給出「合理值」,但真正的品牌一致性還是要人盯

    行動建議:

    • 下次開 Photoshop / Premiere,直接打開 AI 助理面板,先丟一個「懶人指令」給它,讓它跑完一個 end-to-end 流程,再決定你要在哪裡人工接手。

    2. 串接 ChatGPT / Claude:先聊腳本,再叫 Adobe 幫你「落地製作」

    Adobe 把這個 AI 代理開到第三方平台,像 ChatGPT 和 Claude。簡單講:

    • 在 ChatGPT / Claude 裡,你先用對話方式討論腳本、標題、分鏡
    • 確定後,一句話把結果交給 Adobe 代理去做實體的 PSD / Premiere 專案

    💡 關鍵: 把「構思與溝通」留在 ChatGPT / Claude,把「具體製作」交給 Adobe,能清楚區分腦力與體力工作

    實際工作流示意

    以一支新品介紹短片為例:

    1. 在 ChatGPT 裡:
    2. 輸入:「請幫我寫一支 30 秒 IG Reels 的腳本,產品是 XXX,對象是 YYY,用三段式:問題 → 解決方案 → 行動呼籲。」
    3. 再要求:「把這個腳本拆成分鏡腳本,列出每一鏡需要的畫面說明和字幕。」

    4. 想好腳本後:

    5. 對 ChatGPT 說:「把這個分鏡交給 Adobe Premiere AI 代理,幫我建立一個剪輯專案:用我指定的素材資料夾,按分鏡放上時間軸,預留字幕軌。」

    6. 開啟 Premiere:

    7. 你會看到一個已經排好粗剪、加好字幕框架的專案,只要做細修和套品牌樣式。

    同樣的流程也可以用在圖片:

    • 先在 ChatGPT 想好一週社群貼文主題、文案
    • 再叫 Adobe 代理批量建立多張 PSD:每張自動套用布局、顏色、標題位置

    行動建議:

    • 習慣先在 ChatGPT / Claude 把文字、腳本想清楚,再交給 Adobe 處理「體力活」,你會更清楚 AI 做到哪裡、人要接手哪裡。

    適合誰用?四種典型場景

    1. 短影音剪輯:一人小編做出「有水準的粗剪」

    如果你是:IG / TikTok / YouTube Shorts 小編或個人創作者。

    可以怎麼用:

    • 直接在 Premiere 對 AI 說:「把這支長影片變成 5 支 20 秒直式短影片,每支要有吸睛開場 3 秒。」
    • 讓 AI 先幫你做粗剪與字幕,你只要專心調整前 3 秒和結尾 CTA。

    2. 社群素材批量產出:同一主題多版變化

    如果你是:品牌社群、內容行銷。

    可以怎麼用:

    • 在 Photoshop:「幫我用這個版型,生成 10 張不同文案與背景的社群貼圖,尺寸固定 1080×1080。」
    • 搭配 ChatGPT 生好 10 則貼文文案,再給 Adobe 代理做排版、換色。

    💡 關鍵: 利用固定版型搭配批次文案,可在短時間內產出多份風格一致的社群素材

    3. 行銷企劃做 demo:先有「能看」的草稿再找設計

    如果你是:PM、行銷、業務,要做提案或內部 demo。

    可以怎麼用:

    • 在 Premiere:「幫我做一支 45 秒的提案 demo 影片,用這些截圖和產品錄屏,配上簡單字幕和背景音樂。」
    • 把 AI 做出的初版拿去開會,確認方向後再交給設計師精修,而不是一開始就寫長長需求信。

    4. 工程師做產品 demo 視覺:節省跟設計來回溝通時間

    如果你是:工程師或創業團隊早期開發。

    可以怎麼用:

    • 在 Photoshop:「把這些產品畫面排成一張簡報封面,右邊是截圖拼貼,左邊留大標題區。」
    • 在 Premiere:「用這段操作錄屏,幫我做一支 20 秒『功能亮點』短片,加三個關鍵字做浮水印文字。」

    三步驟開始玩:從更新到貼上第一句指令

    步驟一:更新到支援版本

    1. 打開 Adobe Creative Cloud 桌面程式。
    2. 在「應用程式」頁籤中,找到 Photoshop、Premiere Pro。
    3. 確認已更新到最新版本(通常會標註有 Beta 或顯示 AI 助理更新說明)。
    4. 若看到「加入 Beta 公開測試」也可以優先安裝 Beta 版,較快用到 AI 助理。

    版本與開放情況會隨區域調整,詳細可看 Adobe 官方頁面:https://www.adobe.com/creativecloud.html

    步驟二:在哪裡開啟 AI 代理 / 助理面板

    以目前公開資訊為基準,位置大致如下:

    • Photoshop:
    • 開啟 PS 後,在右側面板或上方工具列,尋找「AI Assistant」或「Assistant」按鈕
    • 點開後會出現聊天視窗,可以直接輸入中文

    • Premiere Pro:

    • 在工作區上方,尋找「AI Assistant」或「Text-based Editing / Assistant」相關入口
    • 或在視窗:Window → Extensions / Assistant 類似選單中啟用

    如果介面語系是中文版,名稱可能翻成「AI 助理」或「創意代理」。

    行動建議:

    • 找到面板後,先不要管功能列表,直接貼一句完整需求給它,看看它能自動做到哪裡。

    步驟三:直接複製貼上的 5 條中文指令

    以下指令你可以直接貼到 Photoshop / Premiere 的 AI 助理裡,視情況替換關鍵詞(品牌名、秒數、平台):

    1. IG Reels 粗剪
      「從這個序列的素材裡挑出最有重點的畫面,做一支 30 秒直式影片,適合 IG Reels,幫我加上自動中文字幕和簡單背景音樂。」

    2. 多支短片拆分
      「把這段 5 分鐘的訪談剪成 4 支 20–30 秒短片,每支要有開場標題、主講人的名字條,結尾加上『關注我們獲得更多內容』字幕。」

    3. 品牌字幕樣式套用
      「用這個序列作為範例,幫我建立一個品牌字幕樣式(字體、顏色、位置),然後把同樣樣式套用到整個專案裡所有字幕。」

    4. 社群圖批量產出(Photoshop)
      「用這張 PSD 作為版型,幫我產生 6 張不同背景顏色的版本,把主標題替換成:A、B、C、D、E、F 六個詞,輸出成 1080×1080 PNG。」

    5. 產品照電商優化(Photoshop)
      「對這一批產品照做背景去雜物,統一換成純白背景,調整光線讓產品更亮但不過曝,並輸出成適合電商的 2000px 正方形圖片。」

    如果你是非專業影片/設計人,建議的第一步是:先用其中一條指令讓 AI 幫你做「初版」,你只需要學會調整少數幾個關鍵參數(秒數、版型、顏色),就能把 Adobe 當成會做苦工的「遠端設計助理」。


    🚀 你現在可以做的事

    • 打開 Premiere 或 Photoshop,找到 AI Assistant 面板,貼上文中的任一測試指令跑一次
    • 在 ChatGPT 或 Claude 裡寫一支 30 秒 IG Reels 腳本,再嘗試用指令把分鏡交給 Adobe 代理建立專案
    • 整理一個常用素材資料夾(產品照或錄屏),專門拿來實驗不同 AI 指令,觀察哪種工作流最順手
  • Kilo:把 AI 工程師變成你的隊友

    Kilo:把 AI 工程師變成你的隊友

    📌 本文重點

    • Kilo 把「AI 寫程式」變成可維護、可自動化的流程
    • 透過 Coding Agent 深度整合 Git、CI/CD 與多模型
    • 適合從 side project 到團隊技術債整理的多種場景

    Kilo 要解決的是:開發者用一堆零散 AI 工具寫程式,卻沒有一個「可維護、可自動化」的整體開發流程。

    Kilo 自稱是「agentic engineering platform」——你可以把它想成:在你的 repo 裡駐點的一個 AI 全端工程師,會幫你

    • 建專案骨架
    • 寫/改功能
    • 跑測試、看錯誤訊息
    • 幫你重構、整理技術債

    而且能直接接上你現有的 Git repo、CI/CD、以及本機或雲端的模型 Provider。


    為什麼需要「agentic 開發平台」?

    你現在可能已經在用:

    • VS Code 外掛(例如 Continue)生成小段程式碼
    • ChatGPT / Claude 看片段檔案、問問題
    • CLI 工具跑一下重構或加註解

    問題是:

    • 多工具拼接難維護:聊天室裡有一堆 prompt 歷史、VS Code 裡有另一堆,過幾天就找不到當初怎麼做到的。
    • Prompt 難複用:每次要做類似任務,都要重新描述一遍需求,無法像 CI script 一樣版本化、共用。
    • 沒有「可測試」的 AI 工作流:AI 幫你改了一堆檔案,但沒有標準化流程(跑測試、檢查 diff、回滾),風險很高。

    💡 關鍵: Kilo 的價值在於把一次性的「聊天魔法」變成可版本化、可測試、可接入 CI/CD 的標準工程流程。

    Kilo 的定位,就是把「AI 幫你寫程式」這件事,變成可配置、可重複、接得進 CI/CD 的工程流程,而不是一次性的聊天魔法。


    核心功能 1:代碼代理接管「從建專案到重構」的流水線

    在 Kilo 裡,你不是跟模型聊聊天,而是跟一個 Coding Agent 合作。這個 agent 可以:

    • 讀你的 repo、測試檔、package.json
    • 根據指令規劃任務(新增功能、修 bug、重構)
    • 自動修改多個檔案、寫測試、跑測試
    • 回報變更內容,讓你決定要不要 merge

    你可以這樣用:

    1. 選一個 side project 資料夾:

    bash
    cd my-project
    # 假設 Kilo 提供 CLI,例如:
    kilo init

    1. 用自然語言下任務(以下為示意):

    bash
    kilo task "在 /api/users 加一個 POST /users endpoint,驗證 email 格式,並補一個 basic 測試"

    1. 查看 Kilo 的輸出:

    2. 會顯示改了哪些檔案

    3. 建議的測試指令
    4. 可能的風險或 TODO

    5. 自己跑一次 git diff,確認沒問題再 commit。

    這個流程很貼近 Reddit 那篇「local coding agents 要一直看護」的心得,只是 Kilo 把「小任務 → 跑測試 → 看 diff → 重複」這套節奏變成標準功能,而不是你自己硬湊。


    核心功能 2:跟現有 Git repo、CI/CD 同步工作

    和一般 IDE 插件不同,Kilo 一開始就假設你有一個「活生生」的 repo 和 pipeline:

    • 直接在現有 repo 裡工作:不需要複製專案到另一個 SaaS;Kilo 讀的就是你本機或公司 Git server 裡的原始碼。
    • 可輸出標準化變更:讓你用 Pull Request / Merge Request 流程來審核 agent 的修改。
    • 能接到 CI/CD:
    • 在 CI 裡觸發 Kilo 工作流,例如:當 label 標記 ai-fix 時,讓 Kilo 先嘗試修 failing test。
    • 或讓 Kilo 自動根據測試結果重新調整 patch,再推一版。

    你可以這樣實作一個「半自動工人」:

    1. 在團隊的 monorepo 裡安裝 Kilo CLI。
    2. 在 CI(例如 GitHub Actions)加一個 job,當 PR 標上 ai-refactor 時:
    3. 讓 Kilo 讀 PR 變更與測試結果
    4. 自動嘗試整理重複程式碼、加註解
    5. 再 push 一個 commit 到同一 PR
    6. Reviewer 的工作就從「手動改所有小問題」變成「看 AI 的 patch,挑重要的修改」。

    這樣 Kilo 不會變成神祕黑箱,而是像一個會寫程式的 bot,嵌在你原本的開發流程裡。


    核心功能 3:在本機模型和雲端模型之間切換

    很多人用本地模型(Local LLM)當 coding agent,遇到的情況跟 Reddit 這篇 很像:

    • 小修小補很順
    • 任務一變大就開始迷路、亂改

    Kilo 的做法是:把「用哪個模型」變成設定,而不是你心情。你可以在 config 裡設定:

    • provider = local:例如接 Ollama、LM Studio,處理日常小變更、內網環境
    • provider = cloud:接 OpenAI、Anthropic 等,用於大 refactor 或跨多模組的大任務

    一個實用策略:

    • 開發階段:
    • 小任務(例如「把這個 service 改成 async/await」)用本地模型
    • 大任務(例如「重構整個 auth 流程」)切到雲端模型
    • CI 裡:
    • 預設用較便宜的雲端模型
    • 特定 label / branch 才用昂貴、上下文大的模型

    💡 關鍵: Kilo 讓你依任務大小與上下文需求,在本地與雲端模型間切換,避免為每個任務都付「最大 context window」的成本。

    這也呼應「context window tax」那篇文章的提醒:不要盲丟整個 codebase 進去,而是用 agent 幫你整理「當下任務真正需要的上下文」,再選適合的模型處理。


    Kilo 和其它 coding agent 的差異

    目前開源世界至少有兩個熱門路線:

    • Continue:偏 IDE 助手,貼近個人開發體驗。
    • Kilo:偏「平台」,替你包一整套 agentic workflow。

    簡單對比:

    名稱 核心功能 免費方案 適合誰
    Kilo Agentic engineering 平台,整合 repo / CI / 多模型 開源 有現成 repo、想把 AI 納入正式流程的個人或團隊
    Continue IDE 內嵌 coding agent,自然語言輔助寫碼 開源 主要在本機編輯器工作、想要即時補碼的工程師

    如果你想要的是「打開編輯器、有個 AI 可以問」,Continue 很好;
    如果你想要的是「把 AI 變成團隊裡固定的一個角色」,Kilo 更接近你要的東西。


    適合誰用:三種典型場景

    1. Side project 快速起步

    狀況:

    • 你有一個想做很久的 side project,但每次卡在「先建框架、選技術棧」。

    可以這樣用 Kilo:

    1. 建一個空資料夾 my-saas-idea。
    2. 啟動 Kilo,給一句需求:

    用 Next.js + Prisma 幫我建一個基本的 SaaS skeleton,要有登入、註冊、簡單的 dashboard。

    1. 讓 Kilo 生成初始專案結構、主要頁面、基本 API。
    2. 你再手動微調風格與商業邏輯。

    目標:把「從 0 到可以 deploy」壓縮到一個晚上。

    💡 關鍵: 把從「空資料夾到可部署原型」壓縮到一個晚上,大幅降低 side project 起步門檻。

    2. 團隊做 internal tool / PoC

    狀況:

    • 老闆要一個 data dashboard、內部工作流程工具,功能明確但預算有限。

    用法:

    1. 由一位工程師負責 repo 結構和核心 domain model。
    2. 讓 Kilo 處理:
    3. 重複的 CRUD API
    4. 表單驗證
    5. 基本的表格 / 篩選 UI
    6. 在 CI 加上:
    7. 每次 PR merge 前由 Kilo 自動生成/更新 API 文件或型別註解。

    這樣人類工程師把時間花在與利害關係人對齊需求,Kilo 負責把「說得清楚的需求」變成程式碼。

    3. 既有專案引入「半自動開發工人」

    狀況:

    • 大型 legacy repo,技術債多,沒人想改。

    你可以:

    1. 挑一小塊模組(例如帳號系統),讓 Kilo 專門負責:
    2. 改 function 命名、補型別
    3. 把重複邏輯抽成共用 helper
    4. 先設定幾個安全守則:
    5. 不改動資料庫 migration
    6. 不刪 public API
    7. 每週固定開一個 ai-refactor branch,讓 Kilo 在上面做整理,再由工程師 review 部分合併。

    你會得到一個「穩定每週幫你還 10% 技術債」的 bot,而不是一次性大爆改。


    15 分鐘上手:從安裝到跑出第一個任務

    以下是一個簡化的「試玩路線」,你可以在今天就跑一遍。

    步驟 1:從 GitHub 安裝 Kilo

    1. 確認你有 Node.js(18+)和 Git。
    2. 全域安裝 Kilo CLI(命令以實際文件為準,下面為示意):

    bash
    npm install -g @kilo-org/cli

    1. 或直接把專案 clone 下來:

    bash
    git clone https://github.com/Kilo-Org/kilocode.git
    cd kilocode
    pnpm install
    pnpm build

    👉 安裝細節請以官方 repo 為準:github.com/Kilo-Org/kilocode

    步驟 2:設定第一個模型 Provider

    1. 在專案根目錄建立 Kilo 設定檔(假設為 kilo.config.json):

    json
    {
    "provider": "openai",
    "model": "gpt-4.1-mini",
    "apiKeyEnv": "OPENAI_API_KEY"
    }

    1. 在 shell 裡設定環境變數:

    bash
    export OPENAI_API_KEY=sk-...your-key...

    1. 如果想用本地模型(例如 Ollama),則把 provider 換成 ollama,並指定對應模型名稱。

    步驟 3:挑一個現有 repo 試跑小任務

    1. 選一個你熟的專案,例如:

    bash
    cd ~/projects/my-api
    kilo init

    1. 跑一個小而明確的任務,例如新增 API endpoint:

    bash
    kilo task "新增 GET /health endpoint,回傳 { status: 'ok' },並補一個簡單的測試"

    1. 等 Kilo 完成後:

    2. 先跑一次測試(例如 npm test)

    3. 看 git diff,確認改動合理
    4. 滿意就 commit:

    bash
    git add .
    git commit -m "Add /health endpoint via Kilo"

    1. 如果想試重構任務,可以改成:

    bash
    kilo task "重構 userService:把重複的 email 驗證邏輯抽成 utils/email.ts,新增測試覆蓋 edge case"

    跑完這一輪,你就會直觀感受到:Kilo 比「一般聊天式 AI」更像是一位會說明自己在做什麼的 junior 工程師,你的工作變成指定需求、設好護欄、檢查成果。


    如果你已經在用各種 AI 助手寫程式,但總覺得東一塊西一塊,不妨試著把 Kilo 當成「AI 工程師駐點平台」,用上面這個 15 分鐘路線跑一圈,看看它能幫你穩定接下哪些工作。

    🚀 你現在可以做的事

    • 打開終端機,依照文中步驟安裝 Kilo CLI,並跑完第一個 kilo task
    • 在一個熟悉的 side project 上,設定 kilo.config.json 並嘗試本地模型與雲端模型切換
    • 在團隊 repo 的 CI(例如 GitHub Actions)中新增一個 ai-refactor label 流程,讓 Kilo 試著幫忙處理技術債
  • 用 OpenMontage 把腳本丟進去就變影片

    用 OpenMontage 把腳本丟進去就變影片

    📌 本文重點

    • OpenMontage 把影片製作變成一條全自動 AI 產線
    • 從腳本、配音到剪輯、字幕都可用多 Agent 自動完成
    • 最適合批量、結構化影片內容,如教學、SOP、短影音
    • 先用預設 pipeline 跑通,再逐步客製成自己的影片工廠

    把一段腳本或大綱丟進去,讓 AI 自動幫你寫文案、配音、找畫面、剪輯、上字幕,最後吐出一支可上架的影片,這就是 OpenMontage 要解決的事。


    核心功能:一條龍的「AI 影片產線」

    OpenMontage 在 GitHub 上被描述成「agentic video production system」,它的重點不是單一功能,而是把 12 條影片管線、52 個工具、500+ 個 Agent 技能串成一條自動化產線。你可以理解成:

    一個會叫 AI 幫你寫腳本、再交給配音、再交給剪輯師、最後交給上字幕小編的自動化導演。

    💡 關鍵: 12 條管線、52 個工具、500+ 技能,代表你可以用同一套系統,標準化處理大量不同類型的影片製作。

    以下用「從腳本到成片」的流程拆解它的多 Agent 分工,你可以比對自己目前的工作流程,看哪一段可以先交給它做。

    1. 腳本 → 完整旁白稿(文案 Agent)

    • 能力:根據你給的一段大綱、要點、甚至只是影片標題,補完成可以直接配音的腳本。
    • 實作方式:
    • 指定使用哪個 LLM(本地 Ollama、雲端 OpenAI、Anthropic 等)。
    • 設定語言風格(教學、推銷、輕鬆對話)和長度。
    • 你可以做的事:
    • 如果你有完整腳本,直接跳過這步,把文字餵進下一階段。
    • 如果你只有重點大綱,可以讓 OpenMontage 幫你展開成可錄音的版本,再人工微調。

    2. 腳本 → 聲音檔(配音 Agent)

    • 能力:把文字轉成 TTS 配音,可用雲端服務或本地 TTS 模型。
    • 支援方式:
    • 接雲端 TTS(如 Azure / Google Cloud / 其他 API)
    • 或接你本機已跑好的 TTS 服務(如 Coqui TTS、gTTS 等)
    • 你可以做的事:
    • 先選一個「你可以負擔得起的」TTS,先不追求完美音色,只求流程跑得通。
    • 測試 30 秒短文案,確認語速、停頓、語氣 OK 再跑長片。

    3. 聲音+腳本 → 鏡頭設計與素材搜尋(鏡頭 / 視覺 Agent)

    • 能力:
    • 讀腳本,切鏡頭節奏(每句或每段對應一個片段)。
    • 幫你決定用什麼畫面:純字幕?B-roll?PPT 風格?示意圖片?
    • 如果有接圖像模型或圖庫 API,會自動生成或抓取畫面素材。
    • 你可以做的事:
    • 決定影片主風格:
      • 教學片:螢幕錄影+重點文字
      • 產品介紹:產品圖+功能重點條列
      • IG / TikTok 短片:大字字幕+快速切換背景
    • 從模板開始,不要一次就想客製每個鏡頭,先讓 AI 出一版草稿,再微調模板。

    4. 音訊+畫面 → 自動剪輯與轉場(剪輯 Agent)

    • 能力:
    • 把配音波形當「時間軸」,對齊每段畫面長度。
    • 自動套用轉場、縮放、背景音樂音量調整。
    • 你可以做的事:
    • 在模板裡設定剪輯節奏:
      • 一般教學:每 4–6 秒切一次畫面
      • 短影音:2–3 秒一鏡頭
    • 定義「品牌預設」:片頭 3 秒 LOGO、片尾 CTA 5 秒,之後所有影片自動套用。

    5. 自動字幕與排版(字幕 Agent)

    • 能力:
    • 根據腳本文字或語音轉文字(ASR)產出字幕檔。
    • 自動排版成符合平台的樣式(YouTube、Reels、抖音)。
    • 你可以做的事:
    • 定義字幕樣式(字體、大小、顏色、陰影、位置),存成模板。
    • 為不同平台輸出不同比例畫面(16:9 / 9:16 / 1:1),讓字幕自動適配。

    適合誰用?這幾種影片直接受益

    OpenMontage 的強項是「批量、結構化」內容,以下場景特別適合:

    1. YouTube 教學片 / 線上課程

    • 用法:
    • 準備課程大綱 → 交給文案 Agent 展開 → 自動配音 → 用簡報風格模板產出畫面。
    • 收益:
    • 一次準備一門課的腳本,批量生成 5–10 支影片,維持統一風格。

    💡 關鍵: 把一門課拆成 5–10 支影片,配合自動化產線,可以在短時間內建立完整教學影片庫。

    2. 產品介紹與 Onboarding 影片

    • 用法:
    • 把產品功能點寫成 bullet list → 讓系統生成說明腳本 → 配音+功能截圖 → 自動剪輯成 1–3 分鐘介紹影片。
    • 收益:
    • PM / 行銷不用每次都重錄講解,更新功能後重跑一版腳本就有新影片。

    3. 社群短影音批量生產

    • 用法:
    • 把一篇長部落格文章丟進去 → 切成 10 個重點 → 每個重點變成 15–30 秒短片。
    • 收益:
    • 維持日更或周更的 Reels / 抖音輸出,而不用每天打開剪輯軟體。

    4. 企業內訓與 SOP 影片

    • 用法:
    • 把現有「文字工作手冊」轉成一批 SOP 解說影片。
    • 針對不同部門(客服、業務、工程)套不同模板與用詞。
    • 收益:
    • 新人訓練標準化,更新規範時只要更新文字內容,影片可快速重生產。

    怎麼開始:從 GitHub 拉下來到跑通第一條產線

    這一段按順序做,你可以在本機完成「丟腳本 → 出影片檔」的最小可用流程。

    1. 基本硬體與環境準備

    最低建議配置(個人工作室可行的等級):

    • CPU:近幾年四核心以上即可
    • RAM:16 GB 起跳(避免多步驟時爆掉)
    • GPU(可選但推薦):
    • 8 GB VRAM 以上,如果你要在本地跑 LLM 或影像模型
    • OS:Linux / macOS / WSL2 的 Windows 都可
    • 安裝 Python 3.10+,以及 git

    行動:

    • 檢查 python --version 和 git --version 是否正常,沒有就先安裝。

    2. 從 GitHub 安裝 OpenMontage

    1. 取得程式碼:

    bash
    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage

    1. 建議使用虛擬環境:

    bash
    python -m venv .venv
    source .venv/bin/activate # Windows 用 .venv\Scripts\activate

    1. 安裝依賴:

    bash
    pip install -r requirements.txt

    安裝過程中如果遇到個別套件失敗,先記下錯誤訊息,優先把核心依賴裝好,之後再處理額外功能(如特定 TTS 或影像模型)。

    3. 接上外部模型:本地 LLM + 雲端 TTS / 圖像

    OpenMontage 的設計是「你自己決定用什麼模型」,所以你需要準備:

    1. LLM 選擇
    2. 想省錢、可接受速度較慢:
      • 在本地跑 Ollama(如 llama3、qwen 等模型),再在 OpenMontage 設定 API endpoint。
    3. 想求穩定與品質:

      • 使用雲端 LLM(OpenAI、Anthropic 等),把 API key 填入 .env 或設定檔。
    4. TTS(配音)

    5. 起步最快:用雲端 TTS 服務,通常有免費額度,適合先測流程。
    6. 在 .env 中設定 TTS_API_KEY 和 endpoint。

    7. 圖像 / 視覺素材

    8. 如果你只做簡單字幕+背景,不一定要接圖像模型。
    9. 如果要自動生成插圖,可接 Stable Diffusion / DALL·E / 其他圖像 API。

    行動:

    • 先只接一個 LLM + 一個 TTS,把「腳本→配音→簡單畫面」流程跑通,再考慮接更多模型。

    4. 使用預設模板跑一次「從 0 到影片」

    OpenMontage 內建多條 pipeline,你可以選擇類似:

    • script_to_video:從腳本開始產生影片
    • outline_to_video:從大綱自動展開腳本再做影片

    步驟示意(實際指令以專案 README 為準):

    python run_pipeline.py \
      --pipeline script_to_video \
      --input_path ./examples/script_zh.txt \
      --output_path ./outputs/demo.mp4
    

    跑完後,確認:

    • 有沒有生成 mp4
    • 配音和畫面有沒有對齊
    • 字幕是否有明顯錯字

    即使結果不完美,你已經有一條可運作的「AI 影片產線」。下一步才是調整模板與工作流。

    5. 自訂模板與工作流:把它變成「你的」影片工廠

    你可以從三個層級去客製:

    1. 文案層級
    2. 修改 prompt:

      • 指定品牌語氣(如:B2B 嚴謹、IG 風格口語)。
      • 控制輸出長度(短於 60 秒、3 分鐘內等)。
    3. 視覺+剪輯層級

    4. 調整:

      • 每一節腳本對應的鏡頭類型(文字卡、產品圖、B-roll)
      • 轉場風格與頻率
      • 字幕樣式與位置
    5. 工作流層級(Pipeline)

    6. 複製現有 pipeline 配置檔,改成你的版本,例如:
      • yt_tutorial_pipeline:長度 8–12 分鐘,16:9,偏教學
      • shorts_batch_pipeline:長度 30 秒內,9:16,字幕大字為主

    行動建議:從一個具體專案開始

    舉個「從 0 設好一條自動影片產線」的實戰範例:

    • 任務:幫你的 SaaS 產品做一系列「功能教學」影片。
    • 流程:
    • 列出 5 個常見功能(例如:註冊、建立專案、匯出報表…)。
    • 每個功能寫一版「要講的重點大綱」,放成 5 個文字檔。
    • 選 outline_to_video pipeline,指定:
      • LLM:雲端 GPT-4 或本地模型
      • TTS:雲端服務
      • 視覺:螢幕截圖配上重點文字模板
    • 跑完 5 支影片,看哪支最接近理想風格,反向調整模板(字幕大小、剪輯節奏)。
    • 固定下來後,後面新功能只要新增大綱文字,就能用同一套 pipeline 產出影片。

    這樣,你等於替「產品教學」這個需求建了一條專用的 AI 影片產線,一人工作室也能穩定輸出影片內容。


    延伸:OpenMontage 和其他 AI 影片工具怎麼搭配?

    雖然本文聚焦在 OpenMontage,但實務上你可能會混用其他工具。以下是可能組合:

    名稱 核心功能 免費方案 適合誰
    OpenMontage 本地部署、多 Agent 影片產線 開源、免費 想高度客製、願意動手設定的創作者
    Pika / Runway 文字 → 影片特效、動畫 有免費試用或額度 需視覺效果強、但不在意管線自動化的人
    Descript 錄音、剪輯、字幕整合 有免費方案 習慣 GUI、重視人工微調的剪輯者
    CapCut 社群短影音剪輯與模板 免費 + 付費功能 TikTok / Reels 創作者

    實務建議:用 OpenMontage 做「80% 自動化版本」,再把成品丟到 Descript / CapCut 做最後 20% 人工潤飾。

    💡 關鍵: 先讓 OpenMontage處理 80% 重複性工作,再用熟悉的剪輯工具做 20% 精修,是目前性價比最高的實戰搭配。


    如果你目前是:手動寫腳本、自己錄音、自己剪、自己上字幕,從今天起可以選一支最常做的影片類型,用 OpenMontage 跑一次全自動版本,看看你能省下多少時間。

    🚀 你現在可以做的事

    • 打開 OpenMontage GitHub,git clone 專案並依照 README 跑通一條 script_to_video pipeline
    • 準備一篇你現有的教學文或產品說明,改成大綱丟進 outline_to_video 測試自動化產線
    • 選定一個影片系列(如產品功能教學),為它建立專用模板與 pipeline,實際量產 3–5 支影片
  • 用文字畫 3D:Adam 實戰指南

    用文字畫 3D:Adam 實戰指南

    📌 本文重點

    • Adam 把自然語言變成可編輯的 OpenSCAD 程式碼與 3D 模型
    • 用「文字 + 滑桿」就能調整尺寸與設計邏輯
    • 雲端試用簡單,也能用 CADAM 自架整合到現有流程

    一句話先講結論:Adam 讓你用一句自然語言描述零件,就能拿到可編輯的 OpenSCAD 程式碼和 3D 模型,用滑桿或文字微調尺寸,直接接到現有 CAD/3D 列印流程。

    官網 / Demo:https://adam.new
    開源專案(CADAM):https://github.com/Adam-CAD/CADAM


    核心功能:從文字到 CAD 程式碼

    Adam 圍繞一條實際工作流程設計:「文字描述零件 → 生成 CAD 程式碼 → 視覺化 3D 模型 → 滑桿 / 文字微調 → 導出到現有流程」。

    💡 關鍵: 這條流程的重點是輸出「可維護的程式碼 + 模型」,而不是單次不可重用的模型檔。


    1. 兩種模式:參數化建模 vs 網格生成

    進入 Adam 介面後,先選模式:

    • 參數化建模(Text → OpenSCAD)
    • 輸入:
      • 例:「一個 20×40 mm 的 L 形支架,厚度 3 mm,兩邊各有 2 個直徑 4 mm 的螺絲孔,孔中心離邊 8 mm。」
    • 輸出:
      • 可編輯的 OpenSCAD 程式碼
      • 內建參數滑桿(長度、厚度、孔徑等)
    • 適合:

      • 要做多尺寸版本、後續要改尺寸的零件
    • 網格生成(Text → Mesh)

    • 輸入:較偏形狀描述,如「帶有圓角的桌角保護套,可套在 20 mm 厚桌板上」。
    • 輸出:
      • 一個可下載的網格(通常是 STL 或類似格式)
    • 適合:
      • 只要快速 3D 列印,不打算日後精細改版的形狀件

    實際操作行動:

    1. 先想清楚這個零件未來會不會「常改尺寸」。
    2. 會改 → 選「參數化建模」;一次性打樣 → 可試「網格生成」。

    2. 滑桿調參 + 文本修改:像寫程式一樣調零件

    Adam 的核心體驗是「文字 + 滑桿」雙軌控制:

    1. 第一次生成:
    2. 在文字框輸入需求,按下生成。
    3. Adam 會:

      • 呼叫 AI 生成 OpenSCAD 程式碼
      • 解析出關鍵尺寸,放成可拖曳的滑桿
    4. 用滑桿調整尺寸:

    5. 介面右側是 3D 模型預覽,左側或下方是參數列表:
      • length、width、thickness、hole_diameter 等。
    6. 你可以直接拖拉滑桿,看模型即時更新。
    7. 適用情境:

      • 客戶說「再厚一點」
      • 3D 列印測試後只想調整孔徑、間距
    8. 用文字改需求:

    9. 覺得形狀邏輯要變,例如:
      • 原本「兩個孔」,改成「三個等距孔」。
    10. 直接在文字框補一句:「改成三個等距螺絲孔,孔徑 5 mm。」
    11. Adam 會重新生成程式碼,並保留參數化結構。

    💡 關鍵: 數值用滑桿、邏輯用文字,能把「一次性建模」變成「可持續迭代的設計流程」。

    實際操作行動:

    • 每次修改先問自己:「這是數值調整,還是設計邏輯變更?」
    • 數值:用滑桿或直接改參數欄位數字。
    • 邏輯:用文字提示重新生成,然後再微調滑桿。

    3. Text → Code:產出可讀的 OpenSCAD

    Adam 的底層策略是「Text → Code → CAD」:

    • 你得到的不是黑盒模型,而是完整 OpenSCAD 程式碼:
    • 具名變數:bracket_length、wall_thickness、hole_offset …
    • 結構清楚的 module() 函式。
    • 你可以:
    • 直接把程式碼複製到本機 OpenSCAD 編輯。
    • 放進 Git 版本控制。
    • 用腳本批次修改某些參數再輸出多版本。

    實際操作行動:

    1. 生成完成後,打開程式碼面板,把 OpenSCAD 內容存成 part.scad。
    2. 用 Git 建版(例如 v1.0、v1.1),把 AI 產生的 CAD 正式納入工程專案。

    適合誰用?三個具體場景


    1. 機構工程師:快速打樣支架 / 夾具

    常見痛點:

    • 為測試治具、感測器支架畫模型,來回改尺寸耗時間。

    用 Adam 的 workflow:

    1. 文字描述:
    2. 「一個可以夾在 20 mm 厚鋁板上的 U 形夾具,內側貼合,外側有一個 5 mm 穿孔用來鎖 M5 螺絲。」
    3. 選「參數化建模」,生成模型和程式碼。
    4. 滑桿調整:板厚、公差、螺絲孔位置。
    5. 導出 STL,送去 3D 列印測試。

    建議做法:把專案常用尺寸(例如板厚、公差)命名成變數,後續專案只改變數就能重用設計。


    2. 3D 列印工作室:一次生成多尺寸版本

    需求:

    • 同一個產品,需要 10、20、30、40 mm 四種尺寸給不同客戶。

    做法:

    1. 在 Adam 生成一個參數化模型,例如「桌角保護套」,把關鍵尺寸寫成變數 edge_size。
    2. 將 OpenSCAD 程式碼複製回本機,寫簡單迴圈:

    scad
    for (s = [10, 20, 30, 40]) {
    edge_size = s;
    // 呼叫 Adam 生成的 module
    corner_protector(edge_size=edge_size);
    }

    1. 在 OpenSCAD 中分別導出不同尺寸 STL。

    替代做法:懶得寫程式時,可在 Adam 的滑桿上手動切四個尺寸,分別匯出四個 STL,適合量少時使用。

    💡 關鍵: 把尺寸參數化後,同一份程式碼就能覆蓋多個規格,大幅減少重畫模型的時間成本。


    3. 軟體工程師:用文字產出可讀 CAD

    痛點:

    • 不熟 3D CAD,但懂程式,希望能為 Side Project 做外殼或支架。

    用 Adam 的方式:

    1. 用你熟悉的軟體語言思維來描述零件:
    2. 「為一塊 100×80 mm 的 PCB 做一個盒子,上方預留 10 mm 高空間,下方有 4 個 M3 鎖孔,孔位與 PCB 四角對齊。」
    3. Adam 會產生具名變數與模組化程式碼:
    4. 很像在讀一個乾淨的程式檔案。
    5. 你可以把 part.scad 放進專案 repo:
    6. hardware/case_v1.scad
    7. 在 CI 裡加註解:「生成 STL 時請用 OpenSCAD 2024.x 以上版本。」

    實際操作行動:團隊中沒有機構工程師時,讓軟體工程師先用 Adam 做「可用但不完美」的機構草稿,再請專業設計師基於 OpenSCAD 程式碼優化。


    怎麼開始:雲端體驗到本機部署


    1. 直接在線上玩 Demo(最快)

    1. 開啟:https://adam.new
    2. 用 Google / GitHub 帳號註冊或以訪客登入(以實際介面為準)。
    3. 選擇模式:
    4. 多尺寸零件 → 「參數化建模」
    5. 只要快速 3D 打樣形狀 → 「網格生成」
    6. 在文字框輸入第一個零件描述,按生成。
    7. 試著:
    8. 拖拉滑桿,觀察模型變化。
    9. 切到程式碼頁籤,複製 OpenSCAD 程式碼。

    目標:第一次使用,用 10 分鐘做出一個「有螺絲孔的簡單支架」並匯出 STL。


    2. 在本機部署開源 CADAM

    如果你想要自架服務(內網使用、接私有模型),可以部署開源專案 CADAM:

    GitHub:https://github.com/Adam-CAD/CADAM

    CADAM 是一個 React + Supabase 的 web app,大致步驟:

    1. 準備環境(本機或伺服器):
    2. Node.js(建議 18+)
    3. pnpm 或 npm
    4. Docker(選用,如果你要用容器)

    5. Clone 專案:

    bash
    git clone https://github.com/Adam-CAD/CADAM.git
    cd CADAM

    1. 安裝依賴:

    bash
    pnpm install
    # 或 npm install

    1. 設定環境變數:
    2. 依照 README 建立 .env 檔:

      • Supabase 金鑰 / URL
      • OpenAI 或相容 LLM 的 API Key(若要自接模型,依說明調整)
    3. 啟動開發伺服器:

    bash
    pnpm dev

    在瀏覽器打開 http://localhost:3000 即可使用。

    行動建議:先在線上版熟悉介面,再決定是否要自架;部署前從 GitHub 的 issue / README 確認當前支援的模型與功能狀態。


    3. 接到 OpenSCAD / CAM / 生產流程

    Adam 的輸出是程式碼 + 模型,你可以這樣接入現有流程:

    3.1 接 OpenSCAD

    1. 從 Adam 介面複製生成的 OpenSCAD 程式碼。
    2. 在本機用 OpenSCAD 打開,進行:
    3. 更進階的布林運算(差集、交集)
    4. 加入你自己的 library / module
    5. 用 OpenSCAD 導出 STL / STEP,交給下游軟體。

    3.2 接 CAM / CNC / 3D 列印

    • 3D 列印:
    • 從 Adam 或 OpenSCAD 匯出 STL。
    • 在 Cura / PrusaSlicer / Bambu Studio 裡切片,設定填充率、支撐等。

    • CNC / CAM:

    • 如果需要 STEP/IGES,可先用其他工具把 STL 轉 B-rep(或改用能輸出 STEP 的 CAD 路線)。
    • 在 Fusion 360 / SolidWorks / FreeCAD 裡做 CAM 規劃,生成刀具路徑。

    實際操作行動:選一個目前專案中的小零件,用 Adam 生成 → 用 OpenSCAD 調整 → 匯出 STL → 3D 列印,完整跑一次小型「文字到實物」流程,確認團隊能接得住輸出格式。


    小結:下一步可以做什麼?

    如果你是:

    • 機構工程師:先把常用的支架 / 夾具模板交給 Adam 生成 OpenSCAD 草稿,日後改尺寸只改變數。
    • 3D 列印工作室:用 Adam 做參數化模型,批次產生多尺寸版本,減少重畫時間。
    • 軟體工程師 / Maker:把 CAD 當程式寫,用 Git 管理 .scad,讓硬體外殼也成為可維護的程式碼資產。

    下一步,開啟 https://adam.new,用一句話描述你今天最想偷懶不想畫的零件,看看 Adam 能幫你省掉多少建模時間。

    🚀 你現在可以做的事

    • 上 https://adam.new,用一句話生出一個含螺絲孔的小支架並匯出 STL
    • 把生成的 OpenSCAD 存成 part.scad,放進 Git repo 當作第一個「程式化 CAD」檔案
    • 到 https://github.com/Adam-CAD/CADAM 看 README,評估是否在團隊內部自架一套 Adam/CADAM 服務
  • 自架 AI 全家桶實戰筆記

    自架 AI 全家桶實戰筆記

    📌 本文重點

    • 用舊 PC 搭建「迷你雲端 + 本地 AI」
    • 利用 Self-Hosting Guide 系統化部署 LLM 與自動化
    • 透過 WireGuard 打通安全的遠端存取通道

    一句話定位:這是一份幫你在家搭一個「迷你雲端 + AI 環境」的說明書,從本地 LLM、家用自動化到安全遠端存取,一套打包。

    主角是 GitHub 上超熱門的自架指南專案 mikeroyal/Self-Hosting-Guide,它像是一本持續更新的「自建 IT 生態系手冊」,你可以照著它,把一台舊 PC 變成自己的 AI 內網與家庭雲。

    下面會聚焦三件跟你最有關的事:

    • 怎麼選、怎麼跑本地 LLM(含硬體需求)
    • 怎麼把模型接進自動化管線(Home Assistant、開發工具、自架 Git)
    • 怎麼用 WireGuard 之類方案,讓整套系統能安全地從外面連回家

    最後會給一條「懶人起手路線」,照做就能在一個週末搭起初版 AI 內網。


    核心功能 1:幫你選與部署本地 LLM

    Self-Hosting Guide 做的事:把本地部署 LLM 的選項、硬體需求、工具鏈整理好,讓你不用從 Reddit、HN 一篇篇啃。

    1.1 怎麼挑模型?

    日常自用、寫程式或辦公,其實不必直接上 70B 巨獸。你可以用這份指南搭配社群經驗,先鎖定幾種典型選項:

    名稱 核心功能 免費方案 適合誰
    Qwen / LLaMA 系列 Q4 量化 通用聊天、程式輔助 開源模型免費 想把 GPT/Claude 部分換成本地的人
    中小型 7B-14B 模型 簡單對話、個人筆記、RAG 多數開源 硬體普通的家用機
    27B–32B 模型(如 Qwen3.6-27B) 強一點的程式與長文理解 模型免費,但吃資源 有 RTX 3090 級 GPU 的進階玩家

    在 Reddit 的 Qwen3.6-27B 優化案例 中,有人用 RTX 3090 + kvflash 把:

    • token 生成速度提升到約 38.6 tok/s
    • KV cache VRAM 從 ~21GB 降到 ~17.5GB

    💡 關鍵: 單張 RTX 3090 透過 kvflash 等優化就能流暢跑 27B 級模型,讓「高階單卡跑大模型」變成實務選項。

    這代表:

    • 高階單卡也能跑 27B 模型
    • 只要配置得當,日常 coding/聊天其實很順

    你可以馬上做的事:

    1. 先確認自己 GPU:
    2. 無 GPU / Intel NUC / 家用舊機 → 目標 7B 量化模型
    3. RTX 3060-3070 → 13B 或 14B 模型
    4. RTX 3090 / 4090 → 可以嘗試 27B 以上(搭配量化 + KV 優化)
    5. 打開 Self-Hosting Guide 的 LLM 章節,挑一套部署方案:
    6. 想圖形化、簡單管理 → 找「Docker + Web UI」路線
    7. 想自己玩細節 → 找 vLLM / text-generation-inference 等關鍵字

    1.2 必備工具:Ollama / LM Studio / vLLM

    本地 LLM 生態裡,以下幾種工具是常見組合(指南裡也有提到相關堆疊):

    名稱 核心功能 免費方案 適合誰
    Ollama 一行指令拉模型、啟動本地 API 完全免費 想快速起一個 ChatGPT 替代的人
    LM Studio 有 UI 的模型下載與啟動器 免費客戶端 不熟 CLI 的使用者
    vLLM 高效推理框架,支援長上下文、KV 優化 開源 想追求高吞吐、寫服務端的工程師

    你可以馬上做的事(以 Ollama 為例):

    1. 在你的 Linux / macOS / Windows 安裝 Docker(或直接安裝 Ollama):
      bash
      curl -fsSL https://ollama.com/install.sh | sh
    2. 拉一個通用聊天模型(例如 qwen:7b):
      bash
      ollama pull qwen:7b
      ollama run qwen:7b
    3. 開啟瀏覽器,接一個簡單 Web UI(比如 Open WebUI 或指南中的前端項目),就有本地 Chat。

    核心功能 2:把模型接進自動化管線

    只在終端機裡跟模型聊天很快會膩,Self-Hosting Guide 的價值是教你:怎麼讓模型變成你家裡與工作流的一部分。

    2.1 家用場景:結合 Home Assistant

    指南中有完整一章介紹 Home Assistant,你可以這樣用:

    • 讓 LLM 幫你:
    • 轉換你說出的自然語言成自動化指令(例如:「我出門了」→ 關燈 + 關冷氣 + 啟動警報)
    • 設計複雜條件自動化(比如天氣 + 家人是否在家 + 時間條件)

    你可以馬上做的事:

    1. 在家裡一台常開機器(NUC/舊 PC)裝好 Docker。
    2. 依照指南,跑起 Home Assistant Docker 容器。
    3. 把本地 LLM 提供的 API(例如 Ollama 預設在 http://localhost:11434)接進 Home Assistant:
    4. 透過 Home Assistant 的 REST / Webhook 自定義整合
    5. 或查指南中列出的 LLM 插件項目,選現成方案

    這樣就能做到:「家裡的自動化規則,全部走本地,不往外傳」。

    💡 關鍵: 把 Home Assistant 與本地 LLM 串起來,就能在完全離線的情況下,用自然語言控制整個智慧家居。

    2.2 工作場景:自架開發工具 + Git 服務

    Hacker News 上有不少人分享,已經用本地模型取代部分 GPT/Claude 的日常 coding(參考:Ask HN: Has anyone replaced Claude/GPT with a local model for daily coding?)。Self-Hosting Guide 把這些需求拆成幾件事:

    • 自架 Git 服務(例如 Gitea)
    • 自架 Code Review / CI 工具
    • 本地 LLM 提供程式輔助、摘要、Code Review

    你可以馬上做的事:

    1. 按指南起一個 Gitea / GitLab Self-Hosted:
    2. 管理自己專案
    3. 把程式碼全部留在家裡伺服器
    4. 啟動一個專門幫你寫程式的本地模型(例如 13B 量化模型):
    5. 用 VS Code / Neovim 插件,把 LLM API 指到你的本地網址
    6. 讓「Copilot 類功能」完全在你自家網路裡運行

    核心功能 3:用 WireGuard 打通「安全外網」

    你在家裡搭了一堆服務(LLM、Home Assistant、Git),下一步就是:如何在外面(公司、咖啡店)也能安全用到?

    Self-Hosting Guide 花了不少篇幅介紹 WireGuard,重點是:

    • 比傳統 VPN 設定簡單
    • 效能好、延遲低
    • 適合「家裡一台主機 + 多台手機/筆電」的拓撲

    你可以馬上做的事:

    1. 按指南在家用伺服器上安裝 WireGuard:
      bash
      sudo apt install wireguard
    2. 建立一個基本設定(指南裡有範本):
    3. 伺服器端設定 IP 範圍(例如 10.0.0.1/24)
    4. 每台裝置一組 key
    5. 在手機、筆電裝 WireGuard App,把設定檔匯入。
    6. 測試從外網連回家裡的 Home Assistant / LLM Web UI:
    7. 確認只透過 VPN 通道能接入
    8. 不把服務直接暴露在公網

    這樣做完,你就可以在外面用自己的「家用 GPT」,而不怕資料跑到第三方。

    💡 關鍵: 用 WireGuard 把家裡變成「只給自己與信任設備開放」的私人雲端,比直接開公網埠安全太多。


    適合誰用?幾個具體情境

    1. 家裡有一台舊電腦,想做點有趣但不想再裝一堆雲服務的人

    • 把它變成:NAS + LLM + Home Assistant 的整合機
    • 儲存相片、影音,順便當你的「家庭 ChatGPT」

    2. 想降低雲端 LLM 成本的開發者 / 早期團隊

    • 常用功能(例如程式補全、文件摘要)搬回本地
    • 只在需要強模型時才連外部 API

    3. 對隱私敏感的自由工作者 / 企業

    • 客戶文件、程式碼不想上雲端
    • 自己管理整個資料與模型環境

    4. 喜歡折騰硬體與自動化的玩家

    • 把 Home Assistant + LLM 玩到極致
    • 用 WireGuard 把家當作自己的「個人雲端」。

    怎麼開始:一週末搞定的懶人路線

    最後總結一條 「起手路線」,照著走就能搭出你的第一版 AI 內網。

    Step 0:準備一台舊機 + Docker

    • CPU:近 5 年內的桌機或筆電
    • RAM:至少 16GB
    • GPU:沒有也行(先跑 7B 小模型),有 RTX 3060 以上更好
    • OS:建議 Ubuntu Server / Debian
    • 安裝 Docker + docker-compose

    Step 1:部署 1 個聊天模型(Ollama)

    1. 安裝 Ollama(或依照 Self-Hosting Guide 中的建議):
      bash
      curl -fsSL https://ollama.com/install.sh | sh
    2. 拉一個通用模型(例如 llama3:8b 或 qwen:7b):
      bash
      ollama pull llama3:8b
    3. 啟動並確認能在瀏覽器/CLI 聊天。

    Step 2:部署 1 個文件 / RAG 服務

    1. 選一個簡單 RAG 專案(例如指南裡推薦的開源 RAG Web UI):
    2. 用 Docker 起一個 Web 服務
    3. 把本地 PDF / Markdown 丟進去建立索引
    4. 把 RAG 的 LLM 後端指向 Ollama 的 API:
    5. 在設定頁填入 http://host.docker.internal:11434 或你的本地 IP
    6. 測試:輸入「幫我整理公司 A 專案會議紀錄」,看回答是否依據你的文件。

    Step 3:逐步擴展成「個人 AI 內網」

    每成功一小步,就再加一個服務:

    1. 接 Home Assistant:
    2. 先只用它做幾條簡單自動化(睡前關燈、出門關冷氣)
    3. 再讓 LLM 參與規則設計與自然語言控制
    4. 接開發工具:
    5. 在 VS Code 裝支援自定義 LSP / LLM 的插件
    6. 把 endpoint 指向你本地 LLM
    7. 最後再加上 WireGuard:
    8. 把整套「迷你雲端」安全地帶出門用

    整個過程不用一次到位,只要跟著 Self-Hosting Guide 的章節,一個一個勾:

    • LLM → Automation → Home Assistant → WireGuard → 其他服務

    做完,你就會有一個完全掌控、可隨時擴充的「自架 AI 全家桶」。


    如果你一直想把 GPT 類工作能力留在自己家裡,這份 Self-Hosting Guide 值得直接 Star 收藏,照著它,一台舊機 + 一個週末,就能搭出你的第一個「個人 AI 內網」。

    🚀 你現在可以做的事

    • 打開 Self-Hosting Guide,先 Star 並閱讀 LLM 相關章節
    • 在一台舊電腦上安裝 Docker + Ollama,實際跑起一個 7B 模型試用
    • 依照指南部署 Home Assistant 與 WireGuard,把本地 LLM 串進家庭自動化與遠端存取
  • 用 Claude Corps 組一支虛擬專案團隊

    用 Claude Corps 組一支虛擬專案團隊

    📌 本文重點

    • Claude Corps 把單一 Claude 變成多角色協作團隊
    • 透過 rubric 審稿 Agent,大幅提升輸出品質
    • 先從「主 Agent + 審稿 Agent」的小流程開始實驗

    一句話定位:Claude Corps 就是「多代理版 Claude 工作流引擎」——讓多個 AI 角色分工協作、互相審查,幫你跑完整個專案流程,而不只是回一個答案。

    👉 官方介紹文:https://www.anthropic.com/news/claude-corps
    👉 rubric grading 實驗文:https://pub.towardsai.net/i-added-one-agent-to-my-claude-setup-and-output-quality-jumped-10-overnight-6e5947a62141


    核心功能:把「一個 Claude」變成「一個團隊」

    1. 多角色分工:策略 / 執行 / 審查

    Claude Corps 的核心概念是:你先設計好幾個固定角色,然後讓他們一起跑流程,而不是一個大 prompt 想包山包海。

    常見三種角色:

    • 策略 Agent(Strategist):負責想方向、列計畫、拆步驟。
    • 執行 Agent(Executor):根據計畫產出具體內容(文案、規格、程式碼)。
    • 審查 Agent(Reviewer):按照事先定好的 rubric(評分標準)檢查、打分、要求重寫。

    你可以從自己現有流程開始,照這三個角色拆:

    行動建議:拿你最近一個要反覆修改的任務(例如長文案撰寫、PRD 撰寫),先在筆記裡寫下:
    – 「策略」要產出什麼?
    – 「執行」要交付什麼?
    – 「審查」要檢查什麼?

    後面我們會把這三塊直接翻成多代理設定。


    2. 長流程協作:從需求到結果的「接力棒」

    Claude Corps 的運作方式,可以理解為:

    1. 每個 Agent 有自己的「角色設定 + 任務說明」。
    2. 任務在 Agent 之間有順序地傳遞(像專案流程),每一步可以讀取前面 Agent 的輸出。
    3. 某些 Agent 還可以「退回修改」——例如 Reviewer 要求 Executor 重寫。

    這讓長流程任務可以被拆成清楚的階段:

    • 不再是「一個超長 prompt」,而是一組可重複、可維護的流程。
    • 你可以只換掉「執行 Agent」,就測試不同寫作風格或程式風格。

    行動建議:選一個你每週都會做的流程(例如「寫週報」或「做競品整理」),用 3–5 個步驟寫成清單,想像每一步由一位 Agent 負責,準備在工具裡實作成 workflow。


    3. 內建 rubric grading 迴圈:讓 AI 自己打分再重寫

    在 Towards AI 那篇案例中,作者只做了一件事:

    在原本的 Claude 產生流程後面,多加一個「評分 Agent」,用 rubric grading 機制打分,如果分數太低就要求重寫。

    💡 關鍵: 只多加一個評分 Agent,就能在既有流程上建立「自評+重寫」迴圈,顯著提升輸出品質。

    關鍵是「分離」:

    • 產出內容的是 主 Agent。
    • 負責打分與給修改建議的是 評分 Agent。

    這樣可以:

    • 降低主 Agent 自己「自賣自誇」的偏差。
    • 讓評分標準可以獨立調整、版本管理。

    行動建議:想一個你最在意品質的輸出(例如「產品頁文案」或「技術文件」),列出 5 條評分標準(如結構、清晰度、錯字、符合品牌語氣等),後面我們會把它翻成 rubric grading Agent。


    實際案例:三種你可以馬上想像的流程

    案例 1:行銷活動全流程

    用 Claude Corps,你可以把一個行銷活動拆成:

    1. 策略 Agent:
    2. 根據產品、目標客群、預算,產出「活動目標 + 訊息主軸 + 渠道組合」。
    3. 內容 Agent:
    4. 依策略生成:EDM 內容、社群貼文、廣告標題、LP 架構。
    5. 審查 Agent:
    6. 根據品牌語氣、禁用詞清單、法規注意事項打分。
    7. 如果某項低於 7/10,要求內容 Agent 重寫該段。

    💡 關鍵: 先用簡單門檻(如 7/10)判斷是否重寫,可以在不大改流程下快速導入品質控管。

    下一步你可以做:先把你現有的一個活動企劃書丟給 Claude,請它幫你拆成「策略 / 內容 / 審查」三階段,當作之後設定多代理流程的草稿。


    案例 2:自動化研究彙整

    研究型工作(PM、顧問、投資研究)非常適合用多代理拆分:

    1. 搜尋 Agent:
    2. 根據關鍵字,抓資料來源(論文標題、新聞、公司年報等摘要)。
    3. 整理 Agent:
    4. 把零散資料整理成結構化表格(時間、來源、關鍵發現)。
    5. 分析 Agent:
    6. 做趨勢整理、異常點分析、風險與機會列表。
    7. 審查 Agent:
    8. 檢查引用是否明確、有無過度延伸推論。

    下一步你可以做:拿近期一份你自己做的研究報告,請 Claude 列出「如果讓三個 AI 分工,你會分給誰做什麼」,你就有一個可以搬進 Corps 的流程骨架。


    案例 3:產品規格 → 需求分解 → 工單產生

    對產品 / 工程團隊來說,最實用的一個模式是:

    1. PRD Agent:
    2. 輸入你草寫的產品想法,產出結構化 PRD(目標、用例、成功指標)。
    3. 需求分解 Agent:
    4. 把 PRD 拆成功能需求、技術任務、依賴關係。
    5. 工單 Agent:
    6. 依照 Jira / Linear 格式,產生工單標題、描述、驗收標準。
    7. 審查 Agent:
    8. 檢查:需求是否有模糊詞、是否有驗收方式、是否與目標對齊。

    下一步你可以做:從你現有的一張 Jira 票開始,請 Claude 幫你「反推」:如果這張票是 AI 產的,上游的 PRD 會長怎樣?然後再用多代理方式讓 AI 自行從 PRD 走到工單。


    如何在現有 Claude 專案中,加一個「審稿/評分 Agent」

    這裡給你一個 最小可行實驗(MVP):不需要整套 Claude Corps,只要你現在有在程式裡呼叫 Claude API,就可以加上「rubric grading 迴圈」。

    假設你目前有一個簡單的 Python 流程:

    from anthropic import Anthropic
    
    client = Anthropic(api_key="YOUR_API_KEY")
    
    user_task = "請寫一篇 500 字的產品介紹文案,產品是…"
    
    # 原本:直接讓 Claude 產出
    resp = client.messages.create(
        model="claude-3-5-sonnet-20240620",
        max_tokens=1200,
        messages=[{"role": "user", "content": user_task}],
    )
    original_output = resp.content[0].text
    print(original_output)
    

    第一步:定義你的 rubric(評分標準)

    先用文字列出你在意的點,例如:

    RUBRIC = """
    你是嚴格的審稿員,負責評估一段文案品質。
    
    請依照以下四個面向,每項 1–10 分評分,並給出具體修改建議:
    1. 結構清晰度(是否有明確開頭、重點段落、結尾)
    2. 語言流暢度(是否口語自然、無明顯錯字)
    3. 說服力(是否清楚說明產品價值,舉例是否具體)
    4. 品牌一致性(是否符合「專業、友善、不浮誇」的語氣)
    
    輸出格式:
    - scores: JSON 格式,包含四項分數與總分 total
    - suggestions: 對每一項給出具體修改建議
    """
    

    第二步:新增一個評分 Agent 呼叫

    def grade_output(text: str):
        resp = client.messages.create(
            model="claude-3-5-sonnet-20240620",
            max_tokens=800,
            messages=[
                {"role": "system", "content": RUBRIC},
                {
                    "role": "user",
                    "content": f"請評分以下文案:\n\n{text}",
                },
            ],
        )
        return resp.content[0].text
    

    你可以先直接 print(grade_output(original_output)) 看看評分長怎樣,再決定要怎麼解析。


    第三步:加上「低分就重寫」的迴圈

    以下是一個簡化版迴圈(概念接近 Towards AI 文中那個 80 行示範):

    import json
    
    MIN_SCORE = 32  # 四項各 8 分的總分門檻
    MAX_TRIES = 3
    
    current_output = original_output
    
    for i in range(MAX_TRIES):
        grading_raw = grade_output(current_output)
        print("=== Grading round", i+1, "===")
        print(grading_raw)
    
        # 嘗試從回覆中抓 JSON scores
        try:
            start = grading_raw.index("{")
            end = grading_raw.rindex("}") + 1
            scores = json.loads(grading_raw[start:end])
        except Exception:
            break
    
        if scores.get("total", 0) >= MIN_SCORE:
            break
    
        # 分數不夠,帶著建議重寫
        rewrite_prompt = f"""
    你剛剛寫了一段文案,得到以下評分與建議:
    
    {grading_raw}
    
    請在保留核心資訊的前提下,依照建議,完整重寫文案。
    """
        resp = client.messages.create(
            model="claude-3-5-sonnet-20240620",
            max_tokens=1200,
            messages=[
                {"role": "system", "content": "你是專業文案撰寫人員。"},
                {"role": "user", "content": rewrite_prompt},
            ],
        )
        current_output = resp.content[0].text
    
    print("=== 最終文案 ===")
    print(current_output)
    

    做到這裡,你就已經擁有:

    • 一個主 Agent(寫文案)
    • 一個評分 Agent(打分 + 給建議)
    • 一個簡單的「多輪改善」迴圈

    💡 關鍵: 設定 MIN_SCORE 與 MAX_TRIES,能在成本可控的情況下,讓文案經過多輪自動優化。

    下一步你可以做:
    – 把 RUBRIC 換成「技術文件」或「教學文章」版本。
    – 把同樣的架構套到「程式碼審查」:改成檢查可讀性、錯誤風險、測試覆蓋建議。


    適合誰用:先把自己當「專案經理」,再讓 AI 來當團隊

    以下幾種工作型態,特別適合導入 Claude Corps 或至少導入「審稿 Agent」:

    • 行銷 / 內容團隊:需要大量產出文案,但又要維持品牌一致、避免錯漏。
    • 產品 / UX 團隊:PRD、用戶故事、需求拆解到工單,流程清楚但繁瑣。
    • 顧問 / 研究 / 投資分析:資料搜集、整理、分析、報告撰寫有明確步驟。
    • 單人創業者 / 自媒體:你一個人要扮演整個團隊,用多代理來「外包」給 AI。

    建議起手式:
    – 不要一開始就設計 10 個 Agent。
    – 先從「主 Agent + 審稿 Agent」開始,把最痛的一個環節自動化。


    怎麼開始:從一個 rubric Agent 起步

    目前 Claude Corps 的完整能力會陸續擴展,不過你可以立刻從現有 Claude API 或 Claude 網頁版開始實驗:

    1. 如果你會寫一點程式:
    2. 申請 Anthropic API Key。
    3. 建一個最小專案(就像上面的 Python 範例),先讓「主 Agent + 評分 Agent」跑起來。
    4. 把 rubric 存成版本可控的檔案,當作你團隊的「寫作 SOP」。

    5. 如果你只用 Claude 網頁版(或其他聊天介面):

    6. 在同一個對話裡,先請 Claude 當「執行者」產出草稿。
    7. 接著開新一則訊息,明確指定:

      你現在是嚴格的審稿員,請依照以下四個面向評分並給修改建議……

    8. 再下一則訊息,把整段評分貼回去,請它依建議完整重寫。

    9. 如果你準備導入多代理架構(如 Claude Corps 或其他 Agent 框架):

    10. 把目前流程畫成 3–5 個步驟(策略 / 執行 / 審查)。
    11. 每一步寫清楚:輸入是什麼?輸出是什麼?由誰接手?
    12. 在框架裡把每一步實作成單獨的 Agent,再用 workflow 串起來。

    只要你成功把「審稿 Agent」加進現有流程,通常輸出品質就會有肉眼可見的提升,接下來要不要擴充成完整多代理團隊,你會更有感覺。


    小結

    • 把 Claude 當成一個人,很容易塞爆它的 prompt;把它拆成多個 Agent,流程會變得好維護、好重複。
    • 最值得先做的第一步,就是加上一個「rubric 審稿 Agent」,讓 AI 自己打分自己改。
    • 從一個最小流程開始(例如單一文案產出),等你看見品質真的上來,再考慮把整個專案流程搬進 Claude Corps 或其他多代理框架。

    🚀 你現在可以做的事

    • 選一個你常做的任務,照「策略 / 執行 / 審查」拆成 3 段,寫成流程草稿
    • 依文中的 Python 範例,在現有 Claude API 流程中加入一個 RUBRIC 評分 Agent
    • 在 Claude 網頁版實際跑一次「先產出、再評分、再依建議重寫」的完整迴圈