分類: AI 工具

  • Needle 2 教學:手機也能跑本地 Agent

    Needle 2 教學:手機也能跑本地 Agent

    📌 本文重點

    • Needle 2:14MB、本地可跑的 Agent LLM
    • 在手機、Pi、穿戴裝置上做工具呼叫與自動化
    • 完全本地推理,低延遲且隱私友善
    • 適合智慧家居、語音助理、穿戴與教育機器人

    用一句話講清楚:Needle 2 是一個只有 14MB、能在 200 美元以內設備上流暢跑的本地 Agent LLM,讓你在手機、樹莓派上直接做工具呼叫與智慧自動化,不用雲端大模型。

    官網與原始介紹:
    – 官方網站:https://cactuscompute.com/needle
    – Hacker News 貼文:https://news.ycombinator.com/item?id=XXXX
    – LocalLLaMA 討論:https://www.reddit.com/r/LocalLLaMA/comments/1vkqy66/needle_2_14mb_agentic_llm_for_phones_wearables/


    核心功能:小,但有 Agent 能力

    1. 超迷你體積:14MB 模型、28MB RAM 就能跑

    Needle 2 是一個 約 45M 參數、2bit 量化壓縮的語言模型,整個模型打包成一個 14MB binary,推理時只吃約 28MB 記憶體。

    💡 關鍵: Needle 2 只要約 28MB RAM 就能推理,讓「在 Pi 和手機上跑 Agent LLM」變成現實。

    它基於 Cactus 提出的 Simple Attention Networks(簡化版注意力架構),犧牲部分模型規模,換來極低的計算量和能耗。實際效能:

    • Raspberry Pi 5:約 500 tokens/sec
    • VR 裝置(Meta Quest 3S / Apple Vision Pro):400–1500 tokens/sec
    • 約 200 美元等級手機(Samsung A 系列):300–700 tokens/sec

    能做什麼行動?
    – 先檢查你的設備是否有 至少 64MB RAM 可用(實務上 Pi 5 / Android 都足夠)。
    – 決定要放在哪台機器當「本地腦袋」:家裡的 Raspberry Pi、舊 Android 手機、或一台廉價 mini PC。


    2. Agent 能力:能理解指令、做工具呼叫

    Needle 2 不是只會聊天,而是設計成 agentic LLM:

    • 能根據系統提示決定是否呼叫工具(API / 裝置控制)
    • 支援 結構化輸出(JSON 等),方便接到你的程式邏輯
    • 專門對「手機操作、智慧家居控制、機器人指令」這類任務做了優化

    在工具呼叫和「手機裝置操作」基準測試上,Needle 2 的表現與 LFM2.5(230M 參數)和 Apple Foundation Model 等,接近甚至部分場景持平,但模型體積卻小了 5–70 倍。

    💡 關鍵: Needle 2 在工具呼叫表現接近百兆參數等級模型,卻能以小 5–70 倍的體積在邊緣設備上運行。

    能做什麼行動?
    – 先想好 你要讓它控制什麼:燈光、家電、機器人、APP、自訂 API。
    – 為每個動作做一個 簡單工具介面(HTTP endpoint、MQTT topic 或 Python function),預留給 Needle 2 來呼叫。


    3. 完全本地:低延遲 + 隱私友善

    Needle 2 最大的賣點不是「厲害」,而是夠小,才能真正放在邊緣設備:

    • 所有推理都在你自己的 Pi / 手機上跑
    • 不需要把語音、對話內容傳出去
    • 本地 TTS / ASR 加上 Needle 2,就能做 完全離線的語音助理

    💡 關鍵: 結合本地 ASR/TTS 與 Needle 2,可以打造完全離線、資料不出機器的語音助理系統。

    能做什麼行動?
    – 對隱私敏感的場景(家裡、兒童教育、醫療輔助)優先考慮放 Needle 2,而不是雲端 API。
    – 若你已用 Home Assistant 或其他 IoT 中樞,把 Needle 2 放在同一台機器上,就能做到「指令 → 本地推理 → 本地控制」。


    適合誰用:4 個具體場景

    1. 離線語音 / 文字助理

    需求情境:露營、船上、地下室、或任何網路不穩的地方,你仍然想有 AI 助理幫忙查資料、整理備忘、操作裝置。

    基本架構:
    1. 麥克風 → ASR(語音轉文字)模型
    2. 文字 → Needle 2 推理(決定要回話或呼叫工具)
    3. 回覆文字 → TTS(文字轉語音)模型

    TTS 可以參考 NVIDIA 在 Hugging Face 上開源的 Magpie TTS 系列:
    – 介紹:https://huggingface.co/blog/nvidia/magpie-tts-multilingual-voice-agents
    – 多語言、延遲低,適合作為本地語音回覆模組

    能做什麼行動?
    – 選一個輕量 ASR(可用 Whisper 小模型或其它 Tiny ASR),加上 Magpie TTS + Needle 2,在 Pi 5 上做一個「離線語音盒子」。
    – 第一步先只做 文字模式:在 Pi 上跑 Needle 2 和簡單 web chat,再再加語音。


    2. 智慧家居自動化中樞(搭配 Home Assistant)

    需求情境:你希望可以自然說「我要看電影模式」,系統自己:關燈、開投影、拉窗簾,而不是自己寫一堆硬規則。

    基本 workflow:
    1. Home Assistant 收到語音或文字指令
    2. 將指令丟給 Needle 2,並提供「目前設備狀態」的上下文
    3. Needle 2 輸出一個 JSON:要執行哪些自動化(開燈、調亮度、設溫度)
    4. Home Assistant 解析 JSON,執行對應動作

    能做什麼行動?
    – 在 Home Assistant 所在的機器(常見就是 Pi)上安裝 Needle 2,做一個 簡單 HTTP 服務,接收文字、回傳 JSON。
    – 設計一個固定格式的 prompt,例如:「你只能輸出 JSON,包含 actions: [],每個 action 有 device_id 和 command」;這樣 Home Assistant 比較好接。


    3. 穿戴式小助理(手錶、VR 裝置)

    需求情境:在 VR / AR 裝置裡,要一個能即時協助你操作菜單、記錄備忘、提示下一步的輕量 AI。

    Needle 2 在 Meta Quest 3S、Apple Vision Pro 上有 400–1500 tokens/sec 的速度,足夠做即時互動:

    基本 workflow:
    1. 系統在背景持續送「使用者現在在看什麼畫面、有哪些按鈕」給 Needle 2
    2. 使用者說「幫我開上次的檔案」,Needle 2 根據 UI 狀態決定操作步驟
    3. Needle 2 輸出一系列「點擊/選擇」指令,交給裝置 API 執行

    能做什麼行動?
    – 若你在做 VR 應用,先嘗試在裝置上跑 Needle 2 的 on-device 推理(官方有 binary 版本)。
    – 先用「純文字模擬」:把 UI 狀態描述成文字給 Needle 2,看它能否產出正確的操作序列。


    4. 教育 / DIY 機器人

    需求情境:學生或 Maker 想做一台會說話、能理解「去拿紅色積木」這種指令的簡易機器人,但硬體預算有限。

    基本設計:
    1. 使用者下指令(語音或文字)
    2. Needle 2 把自然語言轉成「機器人行為計畫」:走幾步、轉幾度、夾取哪個物體
    3. 下游控制程式把計畫翻成馬達指令

    能做什麼行動?
    – 把 Needle 2 放在機器人主控板(Pi / Jetson / 廉價 SBC),透過 UART / I2C 控制下層微控制器。
    – 先做「模擬模式」:給 Needle 2 一個簡化的世界(只有桌面、幾個物品),驗證它能否產出合理計畫,再接上真實硬體。


    怎麼開始:從下載到跑出第一個回應


    1. 下載模型:GitHub / Hugging Face

    Needle 2 主入口:
    – 官方頁面:https://cactuscompute.com/needle

    通常會提供:
    – 單一 binary 檔(約 14MB):內含模型權重與推理引擎
    – 示例程式碼(Python / C / Android)

    能做什麼行動?
    – 在你的開發機(桌機或筆電)先下載並跑一次,確認能輸出文字,再移到 Raspberry Pi / Android。


    2. 在 Raspberry Pi 上安裝與推理範例

    以 Raspberry Pi 5 + Raspberry Pi OS 為例:

    # 更新系統
    sudo apt update && sudo apt upgrade -y
    
    # 安裝基本工具
    sudo apt install -y git python3 python3-pip
    
    # 下載 Needle 2 binary(以官方提供連結為準)
    wget https://cactuscompute.com/needle/needle2_pi5.bin -O needle2
    chmod +x needle2
    

    最簡單文字對話範例(假設 binary 支援 CLI 模式):

    # 啟動互動模式
    ./needle2 --prompt "你是一個住在家裡的本地助理,回答使用者問題。"
    

    若有 Python 綁定,可以像這樣:

    from needle2 import Needle
    
    agent = Needle(model_path="./needle2")
    
    response = agent.generate(
        "幫我規劃一個今天晚上的家務待辦清單,用 JSON 格式輸出。"
    )
    print(response)
    

    能做什麼行動?
    – 先在 Pi 上跑出第一個文字回覆,再加入 HTTP server(Flask / FastAPI),讓其他設備可以丟請求給 Needle 2。


    3. 在 Android 上運行 Needle 2

    官方通常會提供 Android demo app 或 AAR 庫:

    大致步驟:
    1. 在 Android Studio 建立新專案
    2. 引入 Needle 2 的 AAR 或 JNI 庫
    3. 在 MainActivity 裡初始化模型

    示意程式碼(概念):

    class MainActivity : AppCompatActivity() {
        lateinit var needle: NeedleAgent
    
        override fun onCreate(savedInstanceState: Bundle?) {
            super.onCreate(savedInstanceState)
            setContentView(R.layout.activity_main)
    
            needle = NeedleAgent(this, modelPath = "needle2_android.bin")
    
            findViewById<Button>(R.id.sendBtn).setOnClickListener {
                val input = findViewById<EditText>(R.id.inputText).text.toString()
                val output = needle.generate(input)
                findViewById<TextView>(R.id.outputText).text = output
            }
        }
    }
    

    能做什麼行動?
    – 先做一個「純文字聊天 app」,確認速度在你的 Android 上是能接受的,再加麥克風、TTS。對高階機種,可以往即時語音助理發展;對低價機種,先鎖定文字用途即可。


    4. 與 IoT / Home Assistant / TTS / ASR 的整合路線

    把 Needle 2 變成真正的「中樞」,你可以用以下路線:

    1. Needle 2 HTTP 服務(在 Pi / mini PC 上)
    2. 提供 /chat(純文字)
    3. 提供 /plan(輸出 JSON,給自動化用)

    4. Home Assistant / IoT 平台

    5. 建立自訂整合,將使用者指令送到 /plan
    6. 解析 JSON,執行對應燈光、插座、場景

    7. 語音層

    8. ASR:Whisper 小模型或其他輕量 ASR
    9. TTS:NVIDIA Magpie TTS(多語言、低延遲),或其他本地 TTS

    能做什麼行動?
    – 先完成「文字 → Needle 2 → JSON → Home Assistant」的閉環,自動化一個簡單場景(開燈 / 關燈)。
    – 確認穩定後,再加語音層,最後再優化 prompt、加入安全限制(例如不允許某些危險指令)。


    Needle 2 vs 其他輕量模型:怎麼選?

    若你在考慮其它本地 LLM,下面表格可以幫你快速定位(僅示意,聚焦用途):

    名稱 核心功能 免費方案 適合誰
    Needle 2 14MB agent LLM,工具呼叫、IoT 開源權重 手機、Pi、穿戴、機器人
    Ling-3.0-tiny 8B MoE,高效推理、多任務 開源權重 有 GPU / M 系列筆電的開發者
    雲端 ChatGPT / Claude 大模型、通用對話與程式輔助 API / 訂閱 不在意隱私、重視效果的使用者

    Ling-3.0-tiny 參考:https://www.reddit.com/r/LocalLLaMA/comments/1vkqwso/inclusionailing30tiny_8b_a13b_moe_hugging_face/

    簡單判斷:
    – 只有 Pi / 低價手機 → 用 Needle 2 當主力
    – 有不錯 GPU / MacBook M 系列 → 可以用 Ling-3.0-tiny 做桌面助理,Needle 2 留給 IoT


    收尾:下一步行動清單

    如果你想現在就動手,建議照這個順序來:

    1. 去 https://cactuscompute.com/needle 下載 Needle 2,在桌機跑一次簡單對話
    2. 在 Raspberry Pi 5 上部署 Needle 2,做出一個最簡單的 HTTP /chat API
    3. 把家裡一個設備(例如客廳燈)接到 Home Assistant,用 Needle 2 產生 JSON 操作指令
    4. 若你有時間,再加上 ASR + Magpie TTS,讓整套系統能用語音控制

    做到第 3 步,你就已經擁有一個「完全集中在家裡跑、本地決策的智慧家居 Agent」。之後要擴充,只是慢慢多接幾個工具而已。


    🚀 你現在可以做的事

    • 立刻前往 Needle 官方頁面 下載 binary,先在桌機跑一個簡單對話測試
    • 在 Raspberry Pi 上部署 Needle 2,包一層簡單 HTTP /chat 或 /plan API 讓家中設備可呼叫
    • 選一個場景(客廳燈或一台機器人),實作「文字指令 → Needle 2 → JSON 計畫 → 實際動作」的完整閉環
  • Claude Code 自動模式:開發者必玩實測

    Claude Code 自動模式:開發者必玩實測

    📌 本文重點

    • Auto 模式會自動判斷你在寫新功能、改舊程式或除錯
    • 能整合看錯誤、改程式、再執行的完整 workflow
    • 適合用來快速理解專案結構並分階段重構
    • Claude Code 是雲端 AI pair programmer,可搭配既有 IDE / Git

    Claude Code 的 Auto 模式,就是一個會自己判斷你現在在寫新功能、改舊程式還是除錯,主動選工具幫你的 AI 助手,讓你少切視窗、多寫程式。


    一句話先懂:Auto 模式在解決什麼事?

    一般用 AI 寫程式,你要自己決定「現在是要叫它生程式碼、還是幫我跑測試、還是查錯?」;Claude Code 的 Auto 模式直接幫你讀懂上下文與指令,自己決定要:

    • 生成程式碼(Code generation)
    • 讀檔案、理解專案結構
    • 執行程式或測試來 debug
    • 對現有程式碼做重構與優化

    你只要「像對同事講話」描述需求,它會自己選對功能、跑對步驟。

    Auto 模式介紹原文(英):https://claude.com/blog/auto-mode-default-in-claude-code


    核心功能:你可以拿它來做什麼?

    1. 程式碼生成:從需求到檔案結構,一次到位

    Auto 模式不只會產生一個函式,而是會:

    1. 根據你的描述設計檔案與目錄結構
    2. 建立/修改多個檔案
    3. 必要時幫你寫簡單測試或使用說明

    實際用法:

    在 Claude Code 裡直接丟一句:

    幫我用 Node.js + Express 寫一個簡單的 REST API,有 /users CRUD,資料先用記憶體暫存就好,請建立基本專案結構,包含入口 index.js 和路由檔。

    Auto 模式會:

    • 自動建立 index.js、routes/users.js 等檔案草稿
    • 解釋怎麼啟動 server
    • 提出可以加測試或 logging 的建議(你可以選要不要做)

    你可以立刻把這些檔案複製到本機專案,或之後改用 API / IDE 插件串接。

    💡 關鍵: Auto 模式會從需求一路幫你拉到完整檔案結構與啟動方式,減少你查 boilerplate 的時間


    2. 錯誤修正:看 log、改程式、再跑一次

    Auto 模式最大的差別是:它能整合「看錯誤 +改程式+再執行」的流程,而不是只回你「原因可能是什麼」。

    基本 workflow:

    1. 貼上錯誤訊息或測試失敗 log
    2. 說你想要的結果
    3. 讓 Auto 模式決定哪個檔案要改、改什麼

    範例 prompt:

    這是 pytest 的錯誤輸出,test_calculate_price 一直 fail。請幫我找出原因並修改對的檔案,然後給我修正後的程式碼片段就好。

    Auto 模式會:

    • 根據 stack trace 推斷是哪個函式有問題
    • 在對應檔案裡標出問題區塊,提出修改
    • 說明為什麼這樣改可以解決測試失敗

    如果你在 Claude Code 裡有上傳整個 repo,它還能 cross-file 看「其他地方怎麼用這個函式」,避免修一個地方壞一片。


    3. 重構與優化:不只是「換個寫法」

    Auto 模式的重構能力,不只做到「把程式碼變漂亮」,而是會考慮:

    • 函式命名與責任分界
    • 檔案拆分與模組化
    • 重複邏輯抽取
    • 加上必要的 docstring 或註解

    實際用法:

    我這個檔案功能太多了,請你先幫我讀完整檔,整理現在的功能清單,再給一個重構計畫,最後一步一步修改程式碼(可以分成幾個 commit 的建議)。

    你可以照它的「重構計畫」拆成多次對話,逐步套用變更,避免一次大改爆掉。


    4. 多檔案理解:真正懂你的專案結構

    Claude Code 可以讓你上傳整個專案(zip 或接 repo),Auto 模式就能:

    • 建立專案索引(檔案、目錄、framework)
    • 在回答時引用相關檔案片段
    • 針對特定模組做修改而不干擾其他部分

    建議使用方式:

    • Side project:直接把整個專案 zip 上去
    • 公司專案:選擇跟要改的功能相關的子資料夾(避免洩漏敏感資訊)

    之後問問題時,多加一句:

    以上是整個 backend/ 資料夾,請先幫我看懂架構,再建議要改哪個檔案比較安全。


    適合誰用?4 個常見場景 workflow

    1. Side project:快速起專案 + 小步調整

    目標: 少查 boilerplate,多花時間在核心功能。

    建議 workflow:

    1. 在 Claude Code 開一個新 Project,upload 空白或半成品 repo
    2. 用 Auto 模式下指令:
    3. 「幫我補上 basic auth middleware」
    4. 「加一個簡單的設定檔,讓環境變數可以統一管理」
    5. 每次改完都讓它幫你檢查:
    6. 「請確認這個改動不會影響現有路由」

    2. LeetCode / 刷題:不只拿答案,而是練思路

    目標: 用 Claude 當「教練」,不是答案機器。

    建議用法:

    1. 先自己寫出初版解法,貼上程式碼
    2. 對 Auto 模式說:

    這題是 LeetCode [題號],我現在這個解法是 O(n^2),你先不要直接給最優解,請先用中文講解我這個解法的缺點,再給我 1~2 個提示,讓我自己改成更好的做法。

    1. 如果真的卡住再說:

    好,我卡住了,請給我最優解程式碼,並註解標註關鍵步驟。

    💡 關鍵: 明講「先不要給最優解」,能把 Auto 模式變成教練角色,幫你訓練思路而不是只抄答案


    3. 公司專案 debug:看 log + 看多檔案一次搞定

    目標: 把時間留在理解業務邏輯,而不是瞎猜錯在哪。

    安全建議:不要上傳含敏感資料的設定檔(例如 .env、金鑰)。

    實際流程:

    1. 上傳與出錯功能相關的資料夾(例如 services/ + routes/)
    2. 貼上 production log(可匿名化部分內容)
    3. 指令範例:

    這個錯誤只會在特定客戶出現,請幫我看 log 和程式碼,推論最可能的 2–3 個原因,並給我修正建議,請避免大改架構,先以最小修補為主。

    Auto 模式會:

    • 依 log 指到對應函式
    • 確認相關呼叫鏈(跨檔案)
    • 提出幾種修法(你可以挑最保守的)

    4. 重構舊程式碼:從「先讀懂」到「分階段改」

    目標: 讓 AI 先幫你梳理舊專案,再陪你一起拆成小改動。

    建議 prompt 流程:

    1. 先丟整個舊模組:

    這是 5 年前寫的舊模組,請幫我用中文整理:主要功能、依賴關係、明顯的技術債。

    1. 再要求重構計畫:

    請幫我規劃三個階段的重構:第一階段只做安全重構(不改 public API),第二階段開始調整資料結構,第三階段再考慮換框架。

    1. 每個階段再開新對話,讓 Auto 模式只針對相關檔案提出修改建議。

    怎麼開始用 Claude Code Auto 模式?

    1. 入口在哪?怎麼開啟 Auto 模式

    1. 進入 Claude 網站:https://claude.com
    2. 登入帳號(目前有免費層級)
    3. 左側選單點 Claude Code
    4. 建立一個新的 Code project
    5. Auto 模式現在是預設啟用,你在對話框直接輸入需求即可

    在 Auto 模式下,你會看到它自動在右側「檔案區」建立或修改檔案,並標示變更。

    💡 關鍵: Auto 模式預設啟用,加上有免費層級,讓你幾乎沒有門檻就能開始實驗這套 workflow


    2. 上傳專案與基本設定

    上傳方式:

    • 直接拖曳 zip 檔到 Claude Code 頁面
    • 或選擇多個檔案 / 資料夾上傳

    實際設定建議:

    上傳完第一件事,先講明規則:

    這個專案是 Next.js + Prisma,請你之後所有建議都遵守現有架構與命名規則,不要改動資料庫 schema,除非我有明講可以改。

    這可以避免 Auto 模式「好心重構」結果打壞你既有設計。


    3. Prompt 寫法:幾個好用範例

    你可以用這幾個模板直接改關鍵字使用:

    1. 加新功能

    現在的程式已經有 [功能 A],我想加一個 [功能 B]。請先說明你打算改哪些檔案,然後一步一步給我要新增的程式碼片段,避免一次大改。

    1. 找 bug

    這裡是錯誤 log + 相關程式碼。請幫我推論可能原因,優先從最小修補開始,並標出你建議修改的行數與內容。

    1. 重構

    請先用中文說明這個檔案目前在專案裡的角色,再幫我做「不改行為」的重構:只優化可讀性與結構,不要改動任何輸入輸出格式。


    4. 和現有 IDE / Repo 搭配的方式

    目前 Claude Code 本身是「雲端工作區」,典型搭配方式:

    1. Repo 主控權在 Git
    2. 在本機 / 公司標準 Git flow 照常開分支
    3. 把要改的檔案複製到 Claude Code(或壓成 zip 上傳)
    4. 讓 Auto 模式生成 /修改程式碼
    5. 再把修改貼回本機,自己下 commit

    6. 與 IDE 搭配的建議

    7. 在 IDE 裡跑程式與測試(確保環境一致)
    8. Claude Code 負責「看多檔案、出建議」
    9. 你在 IDE 裡套用變更並做最後檢查

    這樣你不用完全換工作環境,只是多一個「雲端 AI pair programmer」,專門處理跨檔案的理解與改動建議。


    延伸比較:Claude Code 跟其他工具怎麼選?

    如果你也在看 Muse Code 或 Codex CLI,可以參考 Towards AI 的架構比較文:
    https://pub.towardsai.net/muse-code-vs-claude-code-vs-codex-cli-7-architecture-differences-worth-evaluating-428c935997f2

    以下是簡化後的使用情境比較:

    名稱 核心功能 免費方案 適合誰
    Claude Code 雲端對話式 Auto 模式、讀多檔案 有免費層級 想用瀏覽器做 code review、重構
    Muse Code 偏 IDE 插件、即時補全 依產品方案而定 喜歡在原本 IDE 即時輔助
    Codex CLI 命令列整合、腳本自動化 視使用方案而定 愛用 terminal、寫自動化腳本

    如果你常在瀏覽器看 PR、或需要快速理解陌生 repo,Claude Code + Auto 模式會特別合用;要深度整合 IDE 再考慮搭配其他工具。


    小結:先讓 Auto 模式幫你「看懂專案」,再叫它出手

    建議第一次使用 Claude Code Auto 模式時,不要直接叫它改一大堆,而是:

    1. 先上傳你要改的部分專案
    2. 叫它用中文整理架構與風格
    3. 再從小需求開始讓它出手(修一個 bug、重構一個檔案)

    習慣這種「先理解、再修改」的工作流後,你會發現 Auto 模式最適合拿來處理那些「自己看得懂但看很久」的問題,把時間留給真正需要你決策的設計與產品細節。


    🚀 你現在可以做的事

    • 到 https://claude.com 開一個新的 Claude Code 專案,試著用 Auto 模式生成一個小型 REST API
    • 把你現在一個正在 debug 的 side project 壓成 zip 上傳,請 Auto 模式依 log 幫你找出 2–3 個可能原因
    • 挑一個舊專案模組,上傳後讓 Auto 模式先用中文整理架構,照文中「三階段重構」流程實驗一次
  • Kitesurf:讓 AI 真的會自己上網的瀏覽器

    Kitesurf:讓 AI 真的會自己上網的瀏覽器

    📌 本文重點

    • Kitesurf 是專給 AI 用的雲端 headless 瀏覽器
    • 可與 Cloudflare Workers 深度整合做自動化腳本
    • 很適合把重複的網頁操作交給 Agent 執行

    一句話先說清楚:Kitesurf 是一個給 AI 用的雲端 headless 瀏覽器,讓你可以把「打開網頁、點按鈕、抓資料」這種重複操作,交給 Agent 自己跑。

    官方介紹與新聞:
    – Kitesurf 技術新聞報導(TechCrunch):https://techcrunch.com/2026/08/07/cloudflare-launches-kitesurf-a-browser-built-for-ai-agents/
    – Cloudflare 產品首頁(可留意 Kitesurf 區塊):https://www.cloudflare.com/


    核心功能:給 Agent 用的瀏覽器長什麼樣

    1. 雲端托管,資源比傳統瀏覽器省

    一般你要讓 AI 幫你「用瀏覽器」,有兩種常見做法:

    • 在本機或伺服器跑一個 Chrome + Puppeteer / Playwright
    • 用第三方爬蟲平台代抓資料

    問題在於:瀏覽器超吃資源,一開幾十個 tab,CPU、RAM 都會爆;而且部署、維護都很麻煩。

    Kitesurf 的做法:

    • 在 Cloudflare 雲端托管瀏覽器實例,不用自己維護機器
    • 專門為「自動化任務」優化,比 Chromium 跑同樣任務用更少資源(來源:TechCrunch 報導)

    💡 關鍵: 把瀏覽器搬上 Cloudflare,能在不爆 CPU/RAM 的前提下,大量並行跑 Agent 任務。

    你可以直接採取的行動:

    1. 先盤點手上「需要瀏覽器、但完全不需要人眼看」的任務,例如每天打開 10 個網站抓價格、每週登入後台匯出報表。
    2. 把這些任務列成清單,準備遷移到 Kitesurf(後面教你怎麼寫最小範例)。

    2. 為 AI agent 打好的控制介面:DOM、截圖、表單填寫

    Kitesurf 的定位不是「給人看的瀏覽器」,而是給程式和 LLM 控制的瀏覽器實例。

    實際可用的能力大致包含:

    • 打開網址、導頁(類似 page.goto(url))
    • DOM 操作與查詢(抓特定元素文字、點按鈕、選擇下拉選單)
    • 截圖與元素截圖(讓 LLM 用圖像理解頁面)
    • 表單填寫與送出(登入、填問卷、提交後台表單)

    這對你有什麼實作上的意義?

    • 可以把「在某個 SaaS 後台點 10 次才能拿到報表」寫成腳本,交給 Agent 每天自動跑
    • 可以讓 LLM 不是只「看 API」,而是真的去打開你指定網站、看 DOM、再整理成結論

    💡 關鍵: Kitesurf 把「點按鈕、填表單、抓文字」這種人類動作,變成 LLM 可以直接呼叫的程式接口。

    你可以直接採取的行動:

    1. 準備一個你最常手動重複操作的網站,例如:電商後台、競品官網、資料庫查詢頁。
    2. 把你平常「人類操作步驟」拆成:打開哪個網址、點哪個按鈕、複製哪段文字,待會用 DOM 操作重現。

    3. 和 Cloudflare Workers / KV / Queues 的組合

    Kitesurf 最大的優勢之一,是長在 Cloudflare 生態系裡,可以直接跟既有服務串起來:

    • Cloudflare Workers:用 JavaScript / TypeScript 寫邏輯,呼叫 Kitesurf 打開頁面、抓資料、回傳給前端或 API 使用者
    • KV / D1 / 專用儲存:把抓到的結果存起來,做快取或歷史紀錄(例如價格走勢)
    • Queues / Cron Triggers:排程定期跑瀏覽任務,例如每天 9 點跑一次、每 5 分鐘抓一次競品價格

    你可以直接採取的行動:

    1. 如果你還沒有 Cloudflare 帳號,先到 https://dash.cloudflare.com/ 註冊免費帳號。
    2. 打開 Workers 介面,建立一個新的 Worker 專案,準備寫 Kitesurf 腳本。

    適合誰用?三種具體場景

    1. 競品與價格監控(行銷、電商營運)

    需求長這樣:

    • 每天要看 5–10 個競品頁面,記錄價格、折扣、是否有新品
    • 有 API 的就調 API,沒有 API 的就只好人工看

    用 Kitesurf + Workers,你可以:

    • 寫一個 Worker,定期叫 Kitesurf 打開競品頁面
    • 用 DOM 抓出「商品名稱、價格、標籤(如:限時優惠)」
    • 存到 Cloudflare KV / D1 或打回自己的後端

    可立即行動:

    • 選 3 個最關鍵的競品頁面,先做一版「只抓價格、標題」的最小腳本,之後再慢慢擴充。

    2. 批次表單填寫、報表下載(營運、後勤)

    典型情境:

    • 每週要登入 3 個系統,下載 CSV 報表
    • 或每天要在某個後台幫客戶批次建立任務 / 建案

    用 Kitesurf 可以:

    • 自動登入(在安全前提下,密碼用 Workers 的 secret 管理)
    • 用表單填寫 API 一次送出多筆資料
    • 把下載的檔案直接丟到你自己的儲存或觸發後續流程

    可立即行動:

    • 選一個「最痛」的後台操作流程,先嘗試只自動完成前 2 步(登入 +進入報表頁),驗證 Kitesurf 能正常操作,再慢慢接續。

    3. 讓客製 chatbot / agent「會自己上網」

    你可能已經有這些東西:

    • 一個幫你回答內部 FAQ 的 chatbot
    • 一個幫你寫 Email 的小 agent

    但它們通常只:

    • 用向量資料庫 + 你給的文件
    • 無法自己上網查新的資訊或打開內部 web 工具

    用 Kitesurf 時,你可以:

    • 在 agent 的工具集中,多加一個「瀏覽器工具」
    • 當使用者問的是需要去網站查的問題,LLM 會先呼叫 Kitesurf 打開指定網站
    • 讀取 DOM / 截圖後再整理成回答

    可立即行動:

    • 先選一個固定網站,例如公司的內部儀表板或公開文檔站,做一個「專門會查這個站」的小 agent,實驗效果。

    Kitesurf vs 其他「瀏覽器 Agent」怎麼選?

    市面上也有其他主打「瀏覽器自動化 Agent」的工具,例如 Hark、Rindler。這裡簡單用表格幫你比:

    名稱 核心功能 免費方案 適合誰
    Kitesurf 雲端 headless 瀏覽器,深度整合 Cloudflare Workers / KV / Queues 依 Cloudflare 定價,通常有免費級別 開發者、想在既有 Cloudflare 架構中加入 Agent 的團隊
    Hark 成品型瀏覽器 Agent,幫你在瀏覽器內完成任務 依產品方案,偏 SaaS 想直接用「會自己操作瀏覽器的助手」的終端使用者
    Rindler 團隊 web 工作流程自動化,偏向表單填寫、資料整理等場景 有試用方案(參考 Product Hunt:https://www.producthunt.com/products/rindler) 行銷、業務、資料分析團隊,想快速自動化重複網頁操作

    延伸閱讀:
    – Hark 報導:https://techcrunch.com/2026/08/05/hark-previews-its-browser-use-agent-for-completing-tasks/
    – Rindler Product Hunt:https://www.producthunt.com/products/rindler

    選擇原則:

    • 如果你 會寫 JS/TS,而且已經或打算用 Cloudflare Workers,選 Kitesurf
    • 如果你只是想要一個「幫你用瀏覽器的成品助手」,不想寫程式,優先看 Hark、Rindler 這類 SaaS

    💡 關鍵: 能寫程式就選 Kitesurf 自建流程,不想碰程式碼就用 Hark / Rindler 這種成品 SaaS。


    怎麼開始:用 Workers 寫一個最小 Kitesurf 範例

    以下示範一個「最小可行」的流程:

    • 在 Cloudflare Workers 用 TypeScript 呼叫 Kitesurf
    • 打開某個網站(比如一個公開新聞頁)
    • 抓特定 DOM 資料(例如標題)並回傳 JSON

    注意:目前 Kitesurf 仍偏新產品,實際 API 介面可能會調整,下方程式碼屬概念示意,重點在於「整體串接思路」。

    1. 建立 Worker 專案

    在終端機:

    npm install -g wrangler
    wrangler init kitesurf-demo
    cd kitesurf-demo
    

    在 wrangler.toml 中設定好帳號等基本資訊。

    2. 在 Worker 中呼叫 Kitesurf

    假設 Cloudflare 為 Kitesurf 提供一個 REST API,可以透過 fetch 呼叫,示意程式碼如下:

    export default {
      async fetch(request: Request, env: any, ctx: ExecutionContext): Promise<Response> {
        const url = new URL(request.url)
        const target = url.searchParams.get('target') ?? 'https://example.com'
    
        // 呼叫 Kitesurf 建立瀏覽器工作,打開頁面、抓指定 selector
        const kitesurfResp = await fetch('https://api.cloudflare.com/kitesurf/sessions', {
          method: 'POST',
          headers: {
            'Content-Type': 'application/json',
            'Authorization': `Bearer ${env.KITESURF_API_TOKEN}`,
          },
          body: JSON.stringify({
            url: target,
            actions: [
              // 這裡描述要做的事:打開頁面後抓某個元素文字
              {
                type: 'extract',
                selector: 'h1',
                name: 'title',
              },
            ],
          }),
        })
    
        const data = await kitesurfResp.json()
    
        // 回傳整理過的結果給使用者
        return new Response(JSON.stringify({
          target,
          title: data.results?.title ?? null,
        }), {
          headers: { 'Content-Type': 'application/json' },
        })
      },
    }
    

    使用方式:部署 Worker 後,打:

    curl "https://你的-worker-url/?target=https://news.yoursite.com/article"
    

    就會得到類似:

    {
      "target": "https://news.yoursite.com/article",
      "title": "某某新聞標題"
    }
    

    你可以直接採取的行動:

    • 把上面的範例改成抓你自己常看的網站標題或價格欄位,驗證 DOM 抽取是否正常。

    延伸:接上 OpenAI / Claude / DeepSeek,做一個「會查網站」的小 Agent

    有了 Kitesurf,就可以把「查網站」變成 LLM 的一個工具。流程示意:

    1. 使用者對你的 API / 前端聊天介面提問
    2. 你的後端(或 Worker)判斷:這題需要上網查,則
    3. 先呼叫 Kitesurf,打開指定網站、抓到 DOM / 截圖
    4. 把抓到的資料丟給 LLM(OpenAI / Claude / DeepSeek 等),請它整理成易讀回答

    範例流程簡化(概念)

    // 1. 先用 Kitesurf 抓資料
    const siteData = await callKitesurf({ url: 'https://example.com/pricing' })
    
    // 2. 把資料丟給 LLM
    const llmResp = await fetch('https://api.openai.com/v1/chat/completions', {
      method: 'POST',
      headers: {
        'Content-Type': 'application/json',
        'Authorization': `Bearer ${env.OPENAI_API_KEY}`,
      },
      body: JSON.stringify({
        model: 'gpt-4o-mini',
        messages: [
          {
            role: 'system',
            content: '你是幫使用者讀網頁並整理重點的助理。',
          },
          {
            role: 'user',
            content: `以下是某網站的價格資訊 DOM 內容,請幫我整理成 3 點重點:\n${siteData.text}`,
          },
        ],
      }),
    })
    
    const answer = await llmResp.json()
    

    你可以直接採取的行動:

    • 選擇你慣用的 LLM(例如 OpenAI、Claude、DeepSeek),先在 Worker 中寫好「接收資料、整理成簡單 summary」的基礎流程,再把 Kitesurf 的結果接進去。

    安全提醒:不要把敏感憑證丟進 Agent 上下文

    讓 AI Agent 可以自己上網,很容易踩到安全雷,這裡列幾個實務注意事項:

    1. 憑證管理用 Workers secrets,不要硬寫在程式碼或 prompt 裡
    2. 例如 KITESURF_API_TOKEN、網站登入密碼,都用 wrangler secret put 管理
    3. 限制 Agent 能操作的網域與行為
    4. 只允許它打你指定的幾個網域,避免亂逛整個網路
    5. 嚴格控管「可以送出表單的頁面」,避免 Agent 誤發郵件或誤改設定
    6. 對輸入做驗證
    7. 使用者輸入的 URL 要做白名單檢查,不要讓任何人用你的 Agent 當跳板亂爬網站

    你可以直接採取的行動:

    • 在寫第一版 Kitesurf + LLM agent 時,就先實作「允許的網域列表」與 secrets 管理,避免之後擴充時重構成本過高。

    總結:先從一個小任務開始,讓 Kitesurf 幫你接手瀏覽器

    Kitesurf 的本質就是:把瀏覽器變成一個可程式化的雲端元件,讓你的 Agent 能確實「會自己上網做事」。

    建議上手順序:

    1. 在 Cloudflare 建立 Worker,寫一個最小範例:打開網址、抓一段文字
    2. 接上你慣用的 LLM,做一個「會讀特定網站並整理重點」的小 Agent
    3. 再把你每天或每週的重複瀏覽器操作,一個個搬到 Kitesurf 上

    從一個最小任務開始,你會很快感受到差別:原本要人盯著螢幕點 20 次的流程,變成一支 Worker + 一個 Agent 就能搞定。

    🚀 你現在可以做的事

    • 到 Cloudflare 註冊帳號並建立一個 kitesurf-demo Worker 專案
    • 挑一個每天重複造訪的網站,照文中範例寫 DOM 抽取腳本
    • 選一個 LLM(如 gpt-4o-mini),把 Kitesurf 抓到的資料接進去做摘要 Agent
  • ChatGPT 免費版無限聊這樣用才划算

    ChatGPT 免費版無限聊這樣用才划算

    📌 本文重點

    • 免費版現在可「無限文字聊天」,能長期聊完一個專題
    • 新增 Think 推理按鈕,讓模型在重要問題上「多想一會」
    • GPT‑5.6 Luna 免費打底,Sol 適合高標準的長期專案
    • 把同一主題集中在長會話,搭配筆記工具形成個人知識庫

    一句話定位:現在的 ChatGPT 免費版,不再只是玩玩看,而是可以陪你長期寫稿、備考、寫小程式的「常駐 AI 助理」。

    官方說明參考(OpenAI Blog)、The Verge 報導、TechCrunch 報導。


    核心功能:免費版變成「可長期工作」的三個關鍵

    1. 無限文字聊天:真正可以把一個專題聊到完

    它是什麼?

    OpenAI 宣布:免費與 Go 用戶的「文字對話」不再有明確次數上限,可以長時間、多輪對話,過去常見的「你今天用量已達上限」在純文字情境下會大幅減少。

    💡 關鍵: 免費用戶的純文字聊天幾乎不再受次數限制,長期討論同一專題變得可行。

    但還是有幾個實際限制:

    • 只有純文字是無限:
    • ✅ 純文字提問、純文字回答:不限次數。
    • ❌ 上傳檔案(PDF、PPT、程式碼壓縮檔)、圖片、影片:仍有流量與頻率限制。
    • 模型記憶仍有限:
    • 同一個對話裡,模型能「記得」的內容有容量上限,太長時前面細節會被壓縮或遺忘。

    你可以怎麼用?

    • 把一個專題集中在一個長對話:
    • 求職:從履歷 → 自傳 → 模擬面試,全都在同一串對話裡進行。
    • 專題報告:先整理題目,再請它拆章節、逐段寫草稿、反覆潤稿。
    • 避免把同一主題打散在不同聊天室:讓模型前後文更完整。

    實作提示句範例:

    「我們接下來都在同一個對話裡工作,你幫我完成一份關於 XXX 的專題。先幫我釐清目標與大綱,之後我會一直在這串對話補充資料與修改。」


    2. 新的 Think / 推理按鈕:讓模型「多想一會」

    它是什麼?

    OpenAI 為免費與 Go 用戶新增了 「Think」按鈕(或界面上的「多想一下」「深度推理」之類字樣),

    • 平常提問 → 直接給答案(速度快,但推理較淺)。
    • 對複雜問題 → 按 Think,模型會用更長時間思考、進行多步推理,再輸出答案。

    The Verge 報導 與 The Decoder 都提到,這個按鈕本質上是「延長模型推理時間」。

    💡 關鍵: Think 按鈕不是換模型,而是讓同一模型在同一題目上花更多算力做多步推理,以提升正確性。

    什麼時候要按 Think?

    把它當成「需要正確性與邏輯性」時才按:

    • 需要多步驟推理:
    • 例如:「請幫我設計一週的讀書計畫,要考慮我每天能讀多久、各科目權重、歷屆考古題。」
    • 需要結構清楚的方案:
    • 專案拆解、流程設計、學習路線圖、商業邏輯分析。
    • 簡單聊天、查單一句翻譯,不需要按。

    實作方式:

    1. 先正常問問題,輸入時加上:

      「這個問題需要嚴謹推理,請使用 Think 功能,多想一會再回答。」

    2. 送出後,在介面上按下 Think(或系統提示你要不要讓它多想一會)。
    3. 收到答案後,繼續往下追問細節,而不是重新開新對話。

    3. Luna / Sol 分工:免費 vs 付費怎麼選?

    OpenAI 現在主要用兩個模型來分工:

    • GPT‑5.6 Luna:較小、較輕量,免費用戶的主力模型。
    • GPT‑5.6 Sol:較強版本,精度與一致性更好,主要給付費層級。

    根據 OpenAI 官方部落格 與多家媒體報導:

    • 免費用戶:
    • 預設使用 Luna,享有 無限文字聊天。
    • 一樣可以用 Think 按鈕,讓 Luna「想久一點」。
    • 付費(例如 ChatGPT Plus / Team):
    • 可選用 Sol,並可能有更多高階功能(更強推理、更好的程式能力)。

    可以把它想成:

    模型 核心功能 免費方案 適合誰
    GPT‑5.6 Luna 日常對話、寫作、翻譯、簡單程式碼,支援無限文字聊與 Think ✅ 免費可用,文字聊天不限次數 學生、一般上班族、剛開始用 AI 的人
    GPT‑5.6 Sol 更精準的回答、更穩定推理,適合複雜專案與開發 ❌ 多在付費方案 工程師、重度內容創作者、需要穩定品質的工作者

    💡 關鍵: 先用免費 Luna 完成 80% 工作,再依需求決定是否為剩下 20% 的高精度需求付費升級到 Sol。

    你可以怎麼做?

    • 先用免費 Luna 打底:
    • 把它當「草稿機」「想法整理工具」。
    • 有長期專案、程式需求再考慮升級:
    • 想要長期維護一個專案或文件庫,而且品質要求高,再切到 Sol / 付費層級。

    適合誰用:三大實戰場景

    1. 日常寫作與翻譯:長篇稿、履歷、Email

    適合誰:寫報告的學生、寫提案的 PM、需要中英互翻的上班族。

    具體可以怎麼用:

    1. 長篇稿件(文章、簡報講稿):
    2. 開一個對話命名:「公司內訓簡報稿」。
    3. 提示:
      > 「接下來這個對話只做一件事:幫我寫一份關於 XXX 的簡報稿。先幫我列大綱,用條列說明每頁要講什麼。」
    4. 之後所有修改、補充全在這個對話裡做。

    5. 履歷與 Cover Letter:

    6. 把原有履歷貼上,請它:
      • 重寫成不同版本(技術版/管理版)。
      • 翻成英文、調整語氣。
    7. 重要修改時按 Think,讓它更認真檢查結構與邏輯。

    8. Email 與翻譯:

    9. 日常回信直接貼中文:
      > 「幫我寫一封給客戶的英文 Email,語氣專業但不要太生硬,內容如下……」
    10. 要求:
      • 給兩個版本:較正式 / 較口語。

    2. 知識學習與考試準備:反覆問答不怕額度

    OpenAI 的使用數據(OpenAI Signals)顯示,很多人已經把 ChatGPT 當成「學習教練」。無限文字聊天剛好補上過去的痛點:

    實戰方式:

    1. 建立「科目專用」對話:
    2. 例如:「專門用來準備多益」「專門用來學 Python 基礎」。
    3. 第一句就說清楚:
      > 「從現在開始,這個對話專門用來準備 XXX 考試,你擔任家教,我是學生。先幫我診斷程度,再幫我排一個四週讀書計畫。」

    4. 長期 Q&A,不怕問太多:

    5. 每天把不懂的題目丟進同一對話:
      • 請它先解題,再用「高中生聽得懂」的方式重講一次。
    6. 遇到觀念題,按 Think 要求它:
      > 「請逐步解釋,每一步都說明為什麼。」

    7. 考前總整理:

    8. 在同一對話裡:
      • 要求它整理「這一週你教我的重點摘要」。
      • 請它出 10 題模擬題,照你的錯題再調整難度。

    3. 工程與資料工作:用 Think 處理複雜需求,專注在「小腳本」

    給工程師與資料工作者的實話:免費 Luna 寫得出程式,但穩定度與大型專案能力不如 Sol。最划算的用法是:

    • 把它當成「小腳本產生器」與「除錯助手」,不要期待它一次產出整個系統。

    可行用法:

    1. 小工具腳本:
    2. 例如:
      • 讀取 CSV、清洗欄位、輸出新的檔案。
      • 簡單網頁爬蟲(合法範圍內)。
    3. 提示:
      > 「請用 Python 寫一個腳本:讀取這個 CSV,移除缺失值,並把日期欄位轉成 YYYY-MM-DD,最後輸出成 new.csv。」
    4. 收到程式碼後自己在本機跑,遇到錯誤再貼錯誤訊息,請它協助除錯。

    5. SQL / 資料查詢:

    6. 把資料表結構貼給它,請它:
      • 幫你寫查詢語句。
      • 解釋每一段的意思。
    7. 複雜查詢時按 Think,讓它仔細拆邏輯。

    8. 演算法與概念講解:

    9. 不要直接叫它「幫我寫一個完整後端服務」,而是:
      • 請它解釋演算法原理。
      • 幫你寫單一函式或單元測試。

    怎麼開始:從帳號到日常工作流程

    1. 帳號與版本選擇

    1. 前往 chatgpt.com 或官方 App。
    2. 註冊 / 登入帳號。
    3. 保持在免費層級即可先用:
    4. 確認介面顯示的是 GPT‑5.6 Luna(通常預設)。
    5. 如果未來要升級,再考慮 Plus / Team 以使用 GPT‑5.6 Sol。

    2. 把同一主題集中在一個長會話裡

    操作習慣調整:

    • 每個重要主題開一個對話並命名:
    • 例如:「多益備考」「Q4 行銷提案」「資料分析腳本」。
    • 對話開頭先設定規則:
    • 你的角色(學生 / PM / 工程師)。
    • 它的角色(家教 / 編輯 / 程式教練)。
    • 工作目標與時間範圍。

    好處:

    • 模型能累積上下文,越聊越懂你的風格與需求。
    • 未來回顧時,有完整脈絡可查。

    3. 什麼時候要按 Think?

    可用這個簡單判斷:

    • ✅ 按 Think:
    • 需要邏輯正確、步驟清楚(讀書計畫、專案拆解、程式設計流程)。
    • 需要模型幫你「設計方案」、不是只給片段答案。
    • ❌ 不用按:
    • 單句翻譯、簡單重寫、日常聊天。

    你也可以在提示裡明講:

    「這題很重要,請用深度推理模式回答,如果不確定請標註不確定之處。」

    4. 和自己的知識庫 / Notion 串成工作流程

    免費版還是沒有「內建你的私有資料庫」,但可以用以下方式接起來:

    1. 在 Notion / Obsidian 中建立主題頁:
    2. 例如:「多益學習紀錄」「專案 X 知識庫」。
    3. 每次在 ChatGPT 中得到有用內容:
    4. 把最終版本貼回 Notion:
      • 大綱、重點整理、程式碼片段、讀書計畫等。
    5. 下次對話時:
    6. 先從 Notion 把相關內容複製一段給它,讓它「回想」上下文。
    7. 再繼續往下工作。

    你可以設定一個每日例行:

    • 早上:開啟「今天工作計畫」對話,請 ChatGPT 幫你排程。
    • 工作中:隨時在相應對話裡提問、寫稿、寫腳本。
    • 晚上:把重要成果整理回 Notion,形成自己真正擁有的知識庫。

    總結一句: 把 ChatGPT 免費版當成「長期可用、但偶爾需要你自己收尾」的助手——善用無限文字對話與 Think 按鈕,再配合自己的筆記工具,你可以在不付費的情況下,先把 80% 的日常工作和學習搬到 AI 上。

    🚀 你現在可以做的事

    • 立刻到 chatgpt.com 開一個新帳號,建立 2~3 個「專題專用」對話(例如:多益、履歷、資料分析)
    • 在其中一個對話裡貼上你正在寫的文章或報告,照文中示範提示請它重組大綱與草稿
    • 選一個主題在 Notion 建立頁面,今天就把一段 ChatGPT 對話結果整理貼回去,開始累積你的 AI 協作知識庫
  • 用 loopx+Cloudflare computer 組一支 AI 遠端團隊

    用 loopx+Cloudflare computer 組一支 AI 遠端團隊

    📌 本文重點

    • 用 loopx 管理長期、多 Agent 任務
    • 用 Cloudflare computer 給 Agent 一個可操作桌面
    • 示範「研究助理小隊」自動化 workflow
    • 提供可直接複製的安裝與最小範例程式碼

    讓多個 AI 工具像遠端同事一樣,長期幫你操作電腦工作,而不是每天重來一次,這就是 loopx 搭配 Cloudflare computer 想解決的問題。

    這篇會帶你:
    – 用 loopx 管長期任務與多 Agent 協作
    – 用 Cloudflare computer 給 Agent 一個真的「電腦桌面」可操作
    – 示範一個「研究助理小隊」workflow
    – 最後給你一套可直接複製的安裝+最小範例程式碼


    兩個工具在多 Agent 工作桌中的分工

    先用一張表快速對比:

    名稱 核心功能 免費方案 適合誰
    loopx 長任務 state kernel、目標管理、自動喚醒、多 Agent 交接 開源免費 要讓多個 Agent 長期合作、需要配額控管的人 / 團隊
    cloudflare/computer 給 Agent 一個可操作的桌面與瀏覽器環境 開源免費 想讓 Agent 實際「點、打、開網頁」做自動化的人

    一句話理解:
    – loopx = 專案經理+任務系統
    – Cloudflare computer = 共享遠端桌面

    💡 關鍵: loopx 管的是「長期任務與協作」,Cloudflare computer 管的是「實際電腦操作」,兩者分工清楚才有穩定、多 Agent 的自動化工作桌。


    loopx 核心功能:讓任務可以「長跑」而不是一次性對話

    1. State kernel:任務狀態集中管理

    loopx 自稱是「state kernel」,重點是:
    – 每個長期目標(project)都有自己的 持久狀態:目前做到哪、還有哪些 Todo、哪些已完成
    – 支援多 Agent:你可以把不同工具(例如寫程式 Agent、搜尋 Agent)接到同一個目標底下

    你可以採取的行動:
    – 為每個長期任務(例:產品研究、側專案)在 loopx 建立一個 goal
    – 把「任務進度」從 Notion / Google Sheet 移到 loopx 的 state 裡,讓 Agent 直接讀寫

    2. 長期目標管理+可執行待辦(Todos)

    loopx 允許你把大目標拆成細任務,並且讓 Agent 自己執行:
    – 設定 goal:例如「整理 10 家競品的功能表」
    – 拆成 todos:如「收集官網資料」「彙整成表格」
    – 每個 todo 都是可以被 Agent 調用的可執行項目,完成後會記錄在 evidence log

    你可以採取的行動:
    – 把人類原本寫在代辦軟體的任務,改成由 loopx 管理的 todos
    – 讓 LLM(例如 Claude 或 GPT)根據現有 evidence,自動產生下一個 todo

    3. 自動喚醒與配額感知

    loopx 的特色是「懂得停與再啟動」:
    – 配額感知:你可以設定 API 使用額度,讓 Agent 在接近上限時減少動作或暫停
    – 自動喚醒:當條件達成(例如有新資料、時間到了),loopx 會再喚醒 Agent 繼續跑

    你可以採取的行動:
    – 設定每天最多 token 或 API 次數,避免帳單爆掉
    – 設時間型任務:例如每天早上 9 點喚醒研究 Agent 更新資料

    💡 關鍵: 有配額感知與自動喚醒,才能讓多 Agent 長期運作而不怕超支或中斷,再用條件喚醒續跑。

    4. 可驗證交接(verifiable handoffs)

    多 Agent 最大的麻煩是「交接混亂」。loopx 幫你:
    – 每個 Agent 的輸出都記在 evidence log
    – 下一個 Agent 拿到的不只是文字,而是「帶證據的任務狀態」

    你可以採取的行動:
    – 定義每個 Agent 的輸出 schema(例如必須輸出 JSON 帶 evidence link)
    – 用 loopx 的 handoff 機制,把「搜尋結果」交給「整理 Agent」


    Cloudflare computer:給 Agent 一台可操作的電腦

    Cloudflare computer 的概念很直接:

    把一台「遠端桌面」包成程式介面,讓 Agent 控制滑鼠、鍵盤、瀏覽器。

    1. 桌面與瀏覽器控制

    功能你可以想成:
    – Agent 能開啟瀏覽器、輸入網址、點擊、捲動
    – 可以截圖或讀取目前畫面內容,回傳給 LLM 分析

    你可以採取的行動:
    – 把原本你每天重複點網頁、下載報表的流程,寫成一個 computer 任務
    – 讓 Agent 用瀏覽器登入某些工具,抓資料後再交給 loopx 管理

    2. TypeScript 開源,易整合現有工具鏈

    Cloudflare computer 用 TypeScript 寫成:
    – 可以直接在 Node.js / Bun 環境跑
    – 易跟現有的前後端專案整合

    你可以採取的行動:
    – 在現有 Node 專案中新增一個 agent-runner.ts,專門讓 LLM 控制 computer
    – 把 computer 的操作記錄(log)丟回 loopx 作為 evidence


    範例 workflow:「研究助理小隊」

    目標:

    每週自動更新一次「某個產業的最新資料整理」,包含連結、摘要與重點整理。

    角色分工

    • Agent A:資料搜尋員
    • 使用 Cloudflare computer 操作瀏覽器
    • 任務:搜尋關鍵字、打開前幾個結果、抓取主要內容與連結

    • Agent B:整理與筆記員

    • 接收 Agent A 的 evidence(網址、內容)
    • 用 LLM 整理成表格與文字摘要

    • loopx:專案管理員

    • 建立 goal「產業周報」
    • 安排每週排程,自動喚醒 Agent A
    • 管理 todos 與 handoff:
      • todo:search_industry_updates
      • handoff:把 evidence 傳給 B
      • todo:summarize_and_export

    實際跑起來會長怎樣?

    1. 每週一上午,loopx 喚醒 Agent A,執行 search_industry_updates。
    2. Agent A 用 Cloudflare computer 開 Google / Twitter,找到本週新資料,保存成 evidence(JSON + 原始內容)。
    3. loopx 把 evidence 當作 handoff,指定給 Agent B。
    4. Agent B 讀取 evidence,用 LLM 整理成:
    5. 一張 Markdown 表格
    6. 一份 1-2 頁的摘要
    7. loopx 把結果寫回某個儲存位置(例如 Git repo、Notion API、或本地檔案)。

    你可以採取的行動:
    – 先從「每週一個產業」開始,實驗多 Agent 交接流程
    – 再把產業數量增加、或增加第三個 Agent 負責「翻譯」「產出簡報」

    💡 關鍵: 把搜尋、整理、輸出拆給不同 Agent,並用 loopx 管理 handoff,就能讓「產業周報」自動每週生成。


    怎麼開始:安裝與最小範例

    1. 安裝 loopx(Python)

    前提:你需要 Python 3.10+、一個虛擬環境,與至少一個 LLM API(例:Qwen、Claude、GPT)。

    # 建議開虛擬環境
    python -m venv venv
    source venv/bin/activate  # Windows 改用 venv\Scripts\activate
    
    pip install loopx  # 以實際 repo 為準,若尚未上傳到 PyPI,則:
    # pip install git+https://github.com/huangruiteng/loopx.git
    

    最小 Python 範例(示意):

    from loopx import StateKernel, Goal
    from loopx.llm import OpenAIClient  # 或你自包的 Qwen / Claude client
    
    llm = OpenAIClient(api_key="YOUR_KEY", model="gpt-4o")
    kernel = StateKernel(llm=llm)
    
    # 建立一個長期目標
    goal = Goal(
        name="industry_weekly_report",
        description="產業最新資訊每週整理一次",
    )
    
    kernel.register_goal(goal)
    
    # 定義一個簡單 todo:產生本週提綱
    @kernel.todo("draft_outline")
    def draft_outline(state):
        """用 LLM 為本週產業周報產出提綱"""
        prompt = f"根據目前 evidence,為本週產業周報列出 5 個小節標題。" 
        outline = kernel.llm.complete(prompt)
        state["outline"] = outline
        return outline
    
    if __name__ == "__main__":
        # 執行一次 todo(之後可用排程呼叫)
        result = kernel.run_todo("industry_weekly_report", "draft_outline")
        print(result)
    

    若你要接 Qwen / Claude / GPT,做法很像:
    – 包一層 LLMClient 類別,統一 complete(prompt) 介面
    – 把 API key 放在環境變數,避免硬編碼


    2. 安裝 Cloudflare computer(TypeScript)

    前提:Node.js 18+。

    mkdir ai-computer && cd ai-computer
    npm init -y
    npm install @cloudflare/computer
    

    最小 TypeScript 範例(簡化示意):

    import { Computer } from "@cloudflare/computer";
    
    async function main() {
      const computer = new Computer();
      const session = await computer.start();
    
      // 開啟一個網址
      await session.open("https://www.google.com");
    
      // 在搜尋框輸入關鍵字並送出(實際 API 以官方為準)
      await session.type("生成式 AI 產業新聞");
      await session.enter();
    
      // 取得畫面截圖或文字
      const screenshot = await session.screenshot();
      // 把 screenshot 路徑或 base64 傳回 Python 的 loopx 作 evidence
    
      await session.close();
    }
    
    main().catch(console.error);
    

    你可以採取的行動:
    – 先把 Cloudflare computer 當成「可腳本化的瀏覽器」,先寫死流程
    – 確認操作穩定後,再把指令改由 LLM 產生(例如:llm.plan_steps() → session.*)


    3. 把兩者接在一起:權限與工具調用

    建議做法:
    – 以 loopx 為中心:所有外部工具(Cloudflare computer、資料庫、檔案系統)都當成「工具函式」
    – 每個 Agent 有一份「工具白名單」,例如:
    – 搜尋 Agent:只允許呼叫 computer.search_web()
    – 整理 Agent:只允許存取檔案與 loopx state

    簡單示意(Python pseudo-code):

    from tools import call_computer  # 這裡透過 HTTP/IPC 呼叫 TS 程式
    
    @kernel.tool("search_web")
    def search_web(query: str):
        # 把 query 傳給 Node/TS 的 Cloudflare computer
        result = call_computer(query)
        return result  # 回傳給 LLM 作 evidence
    

    你可以採取的行動:
    – 先定義一小組安全工具(例如:只讀網頁、不能亂下載檔案)
    – 在 LLM prompt 中明確寫上「只可呼叫這些工具」
    – 逐步放寬權限,視實際需求增加更多操作


    適合誰用?

    幾個具體場景:

    • 個人創作者:
    • 每週產業周報、內容題材研究、自動整理靈感庫
    • 小型團隊 / 新創:
    • 客戶調研、競品追蹤、Release Note 整理
    • 讓 Agent 先跑一輪收集與整理,人類最後審閱
    • 開發者 / 資訊人員:
    • 想實驗多 Agent 架構、測試不同 LLM(Qwen、Claude、GPT)
    • 把既有爬蟲、報表腳本逐步改成由 Agent 控制

    如果你已經在用 LLM 做單次問答,下一步可以是:
    – 用 loopx 把「一次問答」變成「持續進行的專案」
    – 用 Cloudflare computer 讓 Agent 真正動手「操作電腦」


    總結:先從一個「長任務」開始

    不要一次想太大,可以這樣開始:

    1. 選一個你每週都要重複做的知識工作(例:產業新聞整理)。
    2. 用 loopx 建立 goal+一兩個 todo,接上你現有的 LLM(Qwen / Claude / GPT)。
    3. 用 Cloudflare computer 把搜尋步驟自動化,先寫死流程,再交給 Agent 控制。
    4. 把 evidence 與結果記錄下來,逐步擴充更多 Agent。

    一旦這個「研究助理小隊」跑起來,你就等於多了一支可以長期運作的遠端 AI 團隊。


    🚀 你現在可以做的事

    • 到 GitHub 查看並 git clone loopx 專案,在本機跑起最小範例
    • 依照文中的 Node.js 步驟安裝 @cloudflare/computer,寫一個可自動打開網站的腳本
    • 選一個你每週重複的知識工作,照文中 workflow 建立第一個「研究助理小隊」並實際跑一週
  • 用手機跑 128K AI 小助手:LFM2.5 實戰

    用手機跑 128K AI 小助手:LFM2.5 實戰

    📌 本文重點

    • LFM2.5-2.6B 支援 128K 長上下文,可一次處理整本文件
    • 內建多步驟 Agent 與 tool calling,可拆解任務自動執行
    • 量化後記憶體 < 2.5GB,手機 CPU 也能跑到 17–30 tok/s
    • 適合本地文件助理、批量任務與離線手機 AI 助理

    一台手機就能跑的長上下文 AI 小助手,幫你在本地處理文件、批量任務和簡易自動化,不靠雲端也能用得上 AI。

    參考來源:Reddit LocalLLaMA 討論、LFM2.5-2.6B 發布帖、OnePlus 13 實測,以及 Hugging Face 專題文:Deploy local agents everywhere with LFM2.5-2.6B。


    核心功能:為什麼是「一台手機就能跑的 Agent」?

    1. 128K 長上下文:整本報告一次丟進去

    • 它是什麼:LFM2.5-2.6B 支援約 128K tokens 上下文,大約可以一次吃下數十萬字的內容。
    • 具體能做什麼:
    • 整本 PDF 報告、技術文件、會議紀錄一次丟進去,讓模型幫你摘要、對比、找重點。
    • 長期對話不會「忘記前文」,可以當持續的工作助理。
    • 你可以馬上做的事:
    • 準備 1–2 本常用的 PDF(如年度報告、專案文件),作為之後測試的資料集。

    💡 關鍵: 支援約 128K tokens 的長上下文,讓單次對話就能覆蓋整本報告或多份文件,減少來回上傳與分段處理的麻煩。

    2. 多步驟 Agent + 工具呼叫:不只是聊天,是能「自己拆步驟」的小幫手

    • 它是什麼:模型後訓練時就針對多步驟代理流程(multi-step agent workflows),並支援 tool calling 格式,能主動:
    • 判斷需要使用工具(如讀檔、發 API)。
    • 先規劃步驟,再分批完成任務。
    • 適合的工具類型:
    • 檔案讀寫工具:讀取本地 txt、md、pdf(先轉文字)。
    • Web API:查天氣、查匯率、打公司內部 API。
    • 你可以馬上做的事:
    • 想一個「需要拆步驟」的工作流程,例如:整理一週郵件 → 分類 → 摘要 → 拉出待辦清單,留著稍後做 Agent 範例。

    3. 本地推理友善:記憶體 < 2.5GB,在手機 CPU 跑到 17–30 tok/s

    • 它是什麼:LFM2.5-2.6B 約 2.69B 參數,官方提供 Q4_K_M GGUF 量化版本,在手機上記憶體占用低於 2.5GB。
    • 實測數據:
    • Reddit 用戶在 OnePlus 13 手機上純 CPU 跑,約 17 tok/s。
    • Liquid AI 官方報告在某些推理與工具調用基準上,和 Qwen 3.5 9B 類模型接近,但資源需求低很多。
    • 你可以馬上做的事:
    • 確認自己的設備:RAM 至少 4GB(桌機 / 筆電更好),手機 Android 版本支援安裝第三方推理 App 或自訂引擎。

    💡 關鍵: 在純 CPU 手機上僅需不到 2.5GB 記憶體就能跑到約 17 tok/s,代表即使沒有高階 GPU,也能實際部署長上下文本地 AI。


    適合誰用:三個實戰場景

    1. 本地文件助理:長文閱讀、知識庫整理

    場景:你有大量 PDF 報告、技術文件,平常用雲端模型怕機密外流,或上傳很慢。

    可以怎麼用 LFM2.5:

    1. 在桌機用 llama.cpp 跑 LFM2.5,讀取本地資料夾中的文件(轉成文字)。
    2. 把多份文件丟進同一個上下文,請它:
    3. 「幫我整理這三份報告的差異,列出一頁摘要+決策建議。」
    4. 「從這堆文件找出所有提到 2025 年預算的段落。」

    你可以立刻做的事:

    • 整理一個 docs/ 資料夾,把 3–5 份常用文件轉成純文字(txt),準備接入 LFM2.5。

    2. 批量任務 Agent:整理郵件、報告、待辦清單

    場景:你每天有一堆重複的小事,例如「每週整理專案更新」、「把會議紀錄轉成待辦」。

    可以怎麼用 LFM2.5:

    1. 寫一個簡單腳本從郵件或系統導出文字(如 weekly_emails.txt)。
    2. 讓 Agent 執行一套固定流程:
    3. 讀入所有文本 → 按專案或標籤分類。
    4. 每類輸出摘要與關鍵日期。
    5. 最後產生「本週待辦清單」。

    你可以立刻做的事:

    • 決定一個你每週都在做的重複整理任務,想好輸入格式(例如一個大 txt),稍後在工具呼叫範例裡實作。

    3. 手機上的離線問答與簡易自動化

    場景:出差在外、網路不穩,也想有一個在手機上的「私人 AI 小助理」。

    可以怎麼用 LFM2.5:

    1. 在手機安裝支援 GGUF 的本地推理 App(如某些社群版 llama.cpp App,或自行編譯)。
    2. 把常用資料(旅遊行程、公司 FAQ、個人筆記)放進手機,讓模型作為離線問答庫。
    3. 再加上幾個簡單工具:
    4. 查本地檔案(行程、備忘錄)。
    5. 呼叫 Web API(天氣、匯率)— 有網路時也能用。

    你可以立刻做的事:

    • 在手機上預留至少 3–4GB 空間和足夠 RAM,並確認能安裝第三方推理 App 或有 adb 環境可連接自製引擎。

    怎麼開始:從桌機到手機,一步步實作

    步驟一:在 Hugging Face 下載模型與量化權重

    1. 打開 Hugging Face 模型頁:
    2. 搜尋 LFM2.5-2.6B 或直接從官方 Blog 連結進入:https://huggingface.co/LiquidAI。
    3. 選擇 GGUF 格式(例如官方提到的 Q4_K_M 量化版本)。
    4. 使用 git lfs 或直接瀏覽器下載:

    bash
    git lfs install
    git clone https://huggingface.co/LiquidAI/lfm2-5-2-6b-gguf

    你可以立刻做的事:

    • 安裝 git lfs,測試是否能順利 clone 大檔案。

    步驟二:用 llama.cpp 在桌機跑起來

    1. 安裝 llama.cpp:

    bash
    git clone https://github.com/ggerganov/llama.cpp
    cd llama.cpp
    make

    1. 把剛下載的 GGUF 模型放到 ./models/lfm2-5-2-6b-q4_k_m.gguf。
    2. 用基本推理指令測試:

    bash
    ./main \
    -m models/lfm2-5-2-6b-q4_k_m.gguf \
    -c 128000 \
    -n 256 \
    -p "你是一個中文助理,請用繁體中文回覆。幫我總結這段文字:..."

    你可以立刻做的事:

    • 先把 -c 設小一點(例如 8192),確認能跑,再逐步拉高到 128K 測試極限。

    💡 關鍵: 先以較小上下文長度測試穩定性,再逐步拉高到 128K,可以避免一開始就因資源不足導致崩潰。

    步驟三:在手機或低端設備配置推理引擎

    你有兩條路可以選:

    方案 核心功能 免費方案 適合誰
    原生 llama.cpp 編譯 直接在 Android / Linux 編譯 llama.cpp,跑 GGUF 模型 開源免費 喜歡動手編譯、可用 adb 的技術玩家
    第三方推理 App 安裝社群開發的本地 LLM App,匯入 GGUF 模型 多數免費或開源 想快速在手機體驗本地 AI 的一般使用者

    大致步驟示意(原生編譯路線):

    1. 在桌機用 adb 連上 Android 手機,確認有 shell:

    bash
    adb shell

    1. 把編譯好的二進位與模型檔推上手機:

    bash
    adb push ./main /data/local/tmp/
    adb push ./models/lfm2-5-2-6b-q4_k_m.gguf /data/local/tmp/

    1. 在手機上跑:

    bash
    cd /data/local/tmp
    chmod +x main
    ./main -m lfm2-5-2-6b-q4_k_m.gguf -c 32768 -n 128 -p "請用繁體中文介紹你自己。"

    你可以立刻做的事:

    • 測試一次 adb shell 是否正常;如果你偏好 GUI,搜尋一款支援 GGUF 的 LLM App,確認可以匯入模型檔。

    步驟四:串接簡單工具(檔案讀取 + Web API)

    LFM2.5 支援 tool calling 格式,你可以在自己的程式裡定義工具,讓模型決定何時呼叫。

    以下以 Python + llama.cpp HTTP 伺服器為例(概念示意):

    1. 先啟動 llama.cpp 的伺服器模式:

    bash
    ./server \
    -m models/lfm2-5-2-6b-q4_k_m.gguf \
    -c 128000 \
    --host 127.0.0.1 --port 8080

    1. 在 Python 定義兩個工具:讀檔與查匯率:

    python
    tools = [
    {
    "name": "read_file",
    "description": "讀取本地文字檔內容",
    "parameters": {
    "type": "object",
    "properties": {
    "path": {"type": "string"}
    },
    "required": ["path"]
    }
    },
    {
    "name": "get_fx_rate",
    "description": "查詢美元對新台幣即時匯率",
    "parameters": {
    "type": "object",
    "properties": {}
    },
    }
    ]

    1. 當模型輸出 tool call 時,由你的程式實際執行:

    python
    def call_tool(name, args):
    if name == "read_file":
    with open(args["path"], "r", encoding="utf-8") as f:
    return f.read()
    if name == "get_fx_rate":
    # 這裡打某個匯率 API
    return "目前 USD/TWD 約為 32.1"

    你可以立刻做的事:

    • 先做最簡單版本:只寫一個 read_file 工具,讓模型幫你讀取某個 txt,並摘要內容。

    收尾:下一步可以做什麼?

    如果你已經在桌機跑起 LFM2.5,有幾個很實際的下一步:

    • 把你的「每週重複工作」整理成一個 Agent 流程,固定用同一組工具+提示詞執行。
    • 把常用的公司文件、技術文檔轉成文字,作為 128K 上下文的知識庫。
    • 在手機上先跑小上下文(8K/16K),確認效能,再逐步增加到 32K,觀察速度和可用性。

    LFM2.5-2.6B 的重點不在「有多大」,而在「足夠聰明又能在你手邊的設備上跑」,只要你願意花一個週末,把下載、llama.cpp、簡單工具串接三件事做完,就能擁有一個真正屬於自己的本地 AI 小助手。

    🚀 你現在可以做的事

    • 到 Hugging Face 下載 LFM2.5-2.6B 的 Q4_K_M GGUF 模型,並在桌機用 llama.cpp 跑通基本推理
    • 準備一個 docs/ 資料夾與一個「每週重複任務」,作為之後 Agent 與長上下文測試用資料
    • 在手機上安裝支援 GGUF 的本地 LLM App 或配置 adb 環境,預留 3–4GB 空間準備導入模型
  • 用 livekit/agents 做一個即時語音 AI 助手

    用 livekit/agents 做一個即時語音 AI 助手

    📌 本文重點

    • livekit/agents 幫你包好即時語音串流與房間管理
    • 透過插件快速串接各家 LLM/STT/TTS
    • 適合打造客服、家教、會議助理、遊戲 NPC 等語音場景

    一句話先講清楚:livekit/agents 是一個「開箱即用」的實時語音/視頻 AI agent 開源框架,幫你處理好語音串流、通話房間、跟各家 LLM 串接,讓你專心寫「助理要做什麼」。

    專案連結:https://github.com/livekit/agents


    核心功能:它幫你省掉哪些麻煩

    1. 即時語音串流處理(含多方通話)

    用傳統方式做語音助手,你得自己處理:WebRTC 連線、音訊編碼、封包、延遲調優。livekit/agents 把這些變成幾行 Python:

    💡 關鍵: 框架直接處理 WebRTC 與音訊串流細節,讓你用少量程式碼就能做出低延遲語音助手。

    • 自動接收使用者麥克風語音、轉成模型可用的 audio stream
    • 支援多人房間:每個人一條 audio track,可針對某人回應或廣播
    • 跟 LiveKit RTC 原生整合,等於直接接上一整套「類 Discord / Zoom 的底層基礎建設」

    實際操作可以從他們的 demo server 開始:

    # 1. 安裝套件
    pip install livekit-agents livekit-plugins-openai
    
    # 2. 跑官方 demo(語音助理)
    python -m livekit.agents.examples.voice_assistant
    

    跑起來後,你就有一個能接 LiveKit 房間、聽語音、回語音的 AI 助手,可以先拿來當「互動介面沙盒」。


    2. 一層抽象包掉 LLM、STT、TTS

    你不需要自己手動串「語音轉文字(STT)→ LLM → 文字轉語音(TTS)」,agents 已經有 plugin 模組:

    💡 關鍵: 透過 plugin,你可以像換積木一樣替換不同家的 LLM/STT/TTS,而不必重寫整套語音流程。

    • 官方提供 OpenAI、Anthropic 等插件(livekit-plugins-openai 等)
    • 你可以像換積木一樣,改用別家雲端 LLM 或自建模型
    • 支援多模態(文字 + 語音,未來可加上影像)

    範例:用 OpenAI 做一個最小語音助手(簡化示意)

    from livekit.agents import AutoAgent
    from livekit.plugins import openai
    
    llm = openai.ChatCompletion(model="gpt-4o-mini")
    
    async def handle_event(event, ctx):
        if event.type == "speech":  # 使用者講話片段
            text = event.transcript
            resp = await llm.complete(text)
            await ctx.speak(resp.text)  # 語音回覆
    
    agent = AutoAgent(on_event=handle_event)
    agent.run()
    

    你只需要關心 handle_event 裡「收到什麼 → 要回什麼」,其餘串流、排程、回應時機都交給框架。


    3. 房間管理與多角色 Agent

    如果你想做「會議小秘書 + 客服機器人 + 語音監考官」這類多角色場景,livekit/agents 也有:

    • 房間(room)管理:每個房間有多名參與者與多個 agent
    • 可以設定 agent 只聽某個角色、只回某些人
    • 結合 LiveKit 原本的錄製、串流功能,做後續轉錄、紀錄

    典型用法:開一個房間,裡面放

    • 一個「會議紀錄 agent」專心記錄與摘要
    • 一個「Q&A agent」回覆指定問題
    • 再視需要增加自訂邏輯(例如檢查是否有敏感字)

    適合誰用?幾個具體場景

    1. 線上客服機器人(語音版)

    想像電話客服或網站語音客服:

    • 使用者進房間 → 說出問題
    • agent 即時聽、查 FAQ 或後端 API → 用自然語音回覆
    • 若遇到無法回答的問題,可把通話轉接真人(LiveKit 本來就支援真人進房)

    可以做的行動:

    • 先用官方 voice assistant demo 跑起來
    • 把 LLM prompt 改成「客服知識庫助理」,接上你的 FAQ 文檔

    2. 語音家教、語言學習助手

    • 學生講英文/中文 → agent 即時糾錯、給例句
    • 用多房間管理不同學生,讓每個人有自己的語音助教

    可以做的行動:

    • 把 LLM 的系統提示改成「語言老師」
    • 把 agent 的回應邏輯改成:先評分、再給建議回覆

    3. 會議即時小秘書

    • 開一個房間,把所有會議成員加入
    • agent 只做三件事:即時紀錄要點、提醒超時、會後產出摘要

    可以做的行動:

    • 使用 LiveKit SDK 做會議房間
    • 在 agents 內部實作:每 5 分鐘自動整理一次目前紀錄、會後產出總結

    4. 遊戲語音 NPC

    • 玩家用麥克風跟 NPC 說話
    • agent 根據遊戲狀態(你可以從遊戲伺服器丟資料給 agent)決定 NPC 回應

    可以做的行動:

    • 在遊戲伺服器中接 WebRTC / HTTP 與 LiveKit
    • 把玩家座標、任務進度寫進 LLM 的 context

    怎麼開始:最小可行示例

    下面是一條「從零到能跟 AI 說話」的最短路徑,假設你會基本 Python。

    步驟 1:準備環境

    1. 安裝 Python 3.10+(建議用虛擬環境)
    2. 安裝套件:

    bash
    pip install "livekit-agents[full]" livekit-plugins-openai

    1. 申請:

    2. LiveKit Cloud 帳號(或自己架 LiveKit Server)→ 拿到 LIVEKIT_API_KEY、LIVEKIT_API_SECRET、LIVEKIT_URL

    3. OpenAI API Key(或你要用的其他雲端 LLM)

    步驟 2:跑官方 voice assistant demo

    在專案 repo 裡會有類似示例,可以照以下思路:

    export LIVEKIT_API_KEY=xxx
    export LIVEKIT_API_SECRET=yyy
    export LIVEKIT_URL=wss://your-livekit-domain
    export OPENAI_API_KEY=sk-...
    
    python -m livekit.agents.examples.voice_assistant
    

    啟動後:

    1. 到 LiveKit 提供的範例前端(通常 repo 或 docs 會有連結)
    2. 填上相同的房間名稱
    3. 打開麥克風,你就能跟 AI 說話

    串接主流雲端 LLM:以 OpenAI 為例

    使用 livekit-plugins-openai 可以快速改成使用你想要的 OpenAI 模型,例如 gpt-4o、gpt-4o-mini。

    💡 關鍵: 只要改動模型與插件設定,就能快速切換不同雲端 LLM,而保留同一套語音互動邏輯。

    示意程式:

    from livekit.agents import AutoAgent
    from livekit.plugins import openai
    
    system_prompt = """你是一個友善的即時語音助手,回答要簡短、口語化。"""
    
    llm = openai.ChatCompletion(
        model="gpt-4o-mini",
        system_prompt=system_prompt,
    )
    
    async def on_event(event, ctx):
        if event.type == "speech" and event.is_final:  # 完整一句話
            text = event.transcript
            resp = await llm.complete(text)
            await ctx.speak(resp.text)  # 由 agents 幫你轉語音播放
    
    agent = AutoAgent(on_event=on_event)
    agent.run()
    

    如果你要換成其他 LLM(Anthropic、DeepSeek 等),通常只要:

    • 換插件(例如 livekit-plugins-anthropic)
    • 換初始化那一行,其他事件處理邏輯可以保持不變

    改造成「中文語音助手」

    要讓它好好講中文,關鍵有三個:

    1. STT 支援中文:選擇支援中文語音辨識的模型(例如 OpenAI 的多語 speech model)。

    2. LLM 語言偏好:在 system prompt 裡明講:

    text
    你是一個中文語音助手,只用繁體中文回覆。
    回覆要口語、句子不要太長,方便即時朗讀。

    1. TTS 選中文聲音:

    2. 若使用 OpenAI TTS,在初始化時指定中文 voice

    3. 或用本地 TTS(如 Coqui TTS)輸出中文音頻,再由 agents 播放

    實作上,只要調整:

    • plugin 設定中的模型名稱、語言
    • prompt 描述

    其他語音串流邏輯不變。


    部署到雲端或自家伺服器

    livekit/agents 本身就是 Python 程式,你可以當作一般後端服務來部署。

    部署選項概覽

    方案 核心做法 適合誰
    LiveKit Cloud + 雲端 VM LiveKit 用官方雲服務,agents 跑在 AWS / GCP 想先跑起產品、不想維護 RTC 的團隊
    全自架(LiveKit Server + agents) 自己架 LiveKit Server + 部署 agents 對延遲、成本、數據有嚴格控管需求
    Docker / K8s 把 agents 打包成容器,水平擴展 使用 k8s 的公司 / 團隊

    基本部署步驟:

    1. 把你的 agent 程式包成一個 Python app(例如 main.py)
    2. 用 uvicorn 或類似方式啟動(若你還要提供 HTTP API)
    3. 在雲端 VM 或 K8s 上跑起來,設定環境變數(LIVEKIT_URL、API key、LLM key)
    4. 前端(Web / Mobile / 遊戲客戶端)只要接 LiveKit 的 SDK 就能加入房間

    和官方 GPT-Live 概念的關係

    OpenAI 在文章 Continuous voice interaction with GPT-Live 裡提到:

    GPT-Live 使用無回合(turnless)語音模型與低延遲架構,讓語音對話可以連續、不中斷。

    livekit/agents 跟它的角色有點像「自幹一個 GPT-Live 式的應用框架」:

    • GPT-Live:OpenAI 自家的完整產品體驗
    • livekit/agents:你可以拿來做自己的「GPT-Live 版本」,接你選的 LLM、你自家的後端、你想要的 UI

    如果你希望的是:

    • 「我要一個可完全客製、可掛在自家雲上的即時語音 AI 助手」

    那 livekit/agents 正是為這種需求設計的工具。


    下一步可以做什麼?

    給你一條實作 checklist:

    1. 用 pip 安裝 livekit-agents 與你要的 LLM plugin
    2. 在 LiveKit Cloud 建一個 project,拿到 API key / URL
    3. 跑官方 voice assistant 示例,確認可以講話互動
    4. 把 LLM prompt 改成你的場景(客服 / 家教 / 會議小秘書 / NPC)
    5. 加入最簡單的業務邏輯(查 FAQ、打你自家 API)
    6. 打包成服務部署到雲端,前端用 LiveKit SDK 接進來

    做到第 4 步,你就已經有第一個能上線試用的即時語音 AI app 了。之後再慢慢加功能,而不是一開始就被 WebRTC 和語音串流細節卡住。

    🚀 你現在可以做的事

    • 先在本機安裝 livekit-agents,跑起官方 voice_assistant 示例
    • 申請 LiveKit Cloud 和 OpenAI 等 LLM 帳號,設定好 API key 與環境變數
    • 把示例程式中的 system_prompt 改成你的實際場景(客服、家教或會議),開始調整互動邏輯
  • 在手機上跑本地滲透測試 AI:Nightcrawler 實戰

    在手機上跑本地滲透測試 AI:Nightcrawler 實戰

    📌 本文重點

    • Nightcrawler 讓手機成為行動滲透測試助手
    • 所有掃描與報告盡量在本地完成以保護隱私
    • 適合個人、小型內網與紅隊前期偵察使用
    • 只需簡單設定即可建立可重複安全檢查流程

    只用一支手機,在本地跑一個 AI pentesting agent,幫你自動掃描手機與周邊網路、找出潛在弱點並給出修補建議,這就是 Nightcrawler 要解決的問題。

    專案連結:https://github.com/garagehq/nightcrawler/


    核心功能:手機上的「行動滲透測試助手」

    1. 本地運行的 AI 滲透測試代理

    Nightcrawler 的定位很單純:在你的手機上扮演一個會自動行動的「滲透測試助手」,所有分析與推理盡量在本地完成。

    你可以直接讓它:

    • 在目前網路環境中自動偵測可掃描的目標(路由器、NAS、開發機等)
    • 針對指定 IP、子網做基本安全檢查
    • 把掃描結果整理成報告,並列出優先處理的問題

    可行動: 安裝完成後,從最簡單的指令開始:

    nightcrawler scan --target 192.168.0.0/24
    

    這會讓它在你家或辦公室內網跑一輪基本偵察,之後再看報告調整範圍。


    2. 自動掃描手機與周邊網路

    Nightcrawler 的重點不是只看「單一主機」,而是以你的手機作為入口,對周邊環境做偵察與掃描。

    實際能做到的事情包括:

    • 讀取手機目前連線的 Wi-Fi 網段,列出可到達的主機
    • 對這些主機做基本的 port scan / service 掃描
    • 將服務指紋交給 AI module,判斷可能存在的弱點類型(例如:舊版 HTTP 伺服器、未設密碼的管理介面)

    💡 關鍵: 透過手機作為入口,可以在不額外佈署設備的情況下掌握整個局部網路的暴露面。

    可行動: 在安全範圍內測試家中設備:

    nightcrawler scan --auto
    

    這會依照手機當前的網路環境自動偵測可掃描主機,適合初次使用快速看「家用設備有哪些服務暴露在網路上」。

    提醒:只在你有權限的網路與設備上使用,遵守當地法律與公司安全政策。


    3. 弱點說明 + 修補建議,一次給你

    掃描只是第一步,Nightcrawler 的價值在於「解讀」:它會用 AI 把技術細節翻譯成你可以直接採取行動的建議。

    一份典型報告會包含:

    • 找到的主機列表、服務與 port
    • 可能的風險標籤(例如:medium-risk: outdated SSH)
    • 每條問題的:
    • 為什麼是風險
    • 可能被怎麼利用
    • 具體修補步驟(更新版本、關閉不必要服務、改密碼策略等)

    💡 關鍵: 把「資安專業術語」轉成具體修補步驟,是讓非專業使用者也能實際提升安全的關鍵差異。

    可行動: 每次跑完掃描後,把報告依「風險等級」分三類:

    • 先處理 High:例如公開管理介面、預設帳密
    • 再排 Medium:例如舊版服務、弱加密
    • Low 視情況保留或記錄

    4. 本地運行的隱私與延遲優勢

    與雲端安全掃描工具相比,Nightcrawler 強調「盡可能在本地推理」,好處是:

    • 不需把內網結構、設備 IP、服務資訊丟到第三方伺服器
    • 在弱網路或無網路環境仍可使用基本功能
    • 掃描結果只存放在你手機本地,方便做內網紅隊演練前期偵察

    💡 關鍵: 把掃描與分析留在本地,可以同時兼顧安全檢查與敏感環境下的隱私需求。

    可行動: 在報告設定中,將輸出目錄指定為手機加密儲存區或你信任的私有備份方案(如加密同步到自建 NAS),避免報告外流:

    nightcrawler scan --target 192.168.0.0/24 --output /secure/reports/
    

    適合誰用:三個具體場景

    1. 個人手機安全檢查

    如果你平常只靠 Android/iOS 內建的安全提示,其實只看到「App 權限」的一小部分。Nightcrawler 可以幫你補上:

    • 手機連線的 Wi-Fi 是否有可疑設備
    • 是否有開啟但你根本沒在用的服務(如某些測試用 web server)
    • 從外部角度看你的開發機、測試機有多「裸露」

    可行動: 每次連上公共 Wi-Fi(咖啡店、旅館)時,跑一次快速掃描:

    nightcrawler scan --auto --profile public_wifi
    

    把這當作「連上陌生網路前的健康檢查」。


    2. 小型內網的簡易滲透測試

    對中小企業、小型團隊來說,請專業資安顧問做完整滲透測試成本不低,但你可以先用 Nightcrawler 做一輪「預檢」。

    適合用在:

    • 新部署內網服務前,快速看是否有明顯暴露
    • 老舊系統尚未汰換前,先抓幾個最容易被打的點
    • 內部開發環境(CI server、test server)是否有開到外部網段

    可行動: 選擇一個子網作為範圍,定期(例如每月)跑一輪掃描,建立安全 baseline:

    nightcrawler scan --target 10.0.0.0/24 --output /secure/monthly/
    

    之後比對差異,看是否有新增高風險服務或設備。


    3. 紅隊演練的前期偵察

    對紅隊或安全研究者來說,Nightcrawler 可以當作「隨身偵察工具」。在合法授權範圍內:

    • 用手機在現場快速掃描演練環境
    • 取得初步服務列表後,再用更專業工具(如 nmap、Burp)深挖
    • 用 AI 生成攻擊路徑假設,幫助制定演練腳本

    可行動: 把 Nightcrawler 報告當作演練前的「資產盤點」,再把標記為 High 的項目納入紅隊攻擊路徑設計。


    怎麼開始:從安裝到第一次掃描

    1. 下載與安裝

    目前 Nightcrawler 以開源專案形式提供,主入口在 GitHub:

    https://github.com/garagehq/nightcrawler/

    一般上手路線:

    1. 確認支援平台:以 Android(搭配 Termux)或 Linux 手機環境為主,iOS 需額外繞路(如越獄或遠端代理)。
    2. 安裝必要環境:在手機安裝 Termux 或類似終端環境;確保有 Python / Node.js(依專案需求)與必要套件。
    3. Clone 專案:
      bash
      git clone https://github.com/garagehq/nightcrawler.git
      cd nightcrawler
    4. 依 README 安裝依賴:通常是 pip install -r requirements.txt 或專案提供的安裝腳本。

    可行動: 完成上述步驟後,在終端輸入:

    nightcrawler --help
    

    確認指令有正確註冊,確定環境準備完畢。


    2. 基本配置:先限制好掃描範圍

    為了避免不小心掃到不該掃的網段,建議一開始就設定清楚:

    • 指定允許掃描的子網(例如:家用路由器分配的網段)
    • 限制最大併發連線數,避免造成設備負擔
    • 啟用報告匿名化(隱藏部分 IP、主機名,方便分享給同事但不暴露太多細節)

    範例配置檔(假設為 config.yaml):

    network:
      allowed_ranges:
        - 192.168.0.0/24
      max_concurrent_scans: 32
    report:
      anonymize: true
      output_dir: /secure/reports/
    

    可行動: 按上述範例建立自己的 config.yaml,之後所有掃描都帶上:

    nightcrawler scan --config config.yaml --auto
    

    3. 第一次執行建議腳本與報告解讀方式

    第一次跑,建議用「保守但全面」的腳本:

    nightcrawler scan \
      --config config.yaml \
      --target 192.168.0.0/24 \
      --profile default \
      --output /secure/reports/first_scan.json
    

    跑完後,報告通常為 JSON 或簡易 HTML。解讀時可以照這個順序:

    1. 先看 Summary:總共有多少主機、幾個 High / Medium / Low issue。
    2. 鎖定 High:逐一查看是哪些設備(路由器?NAS?開發機?),問題是什麼類型(弱密碼、未授權存取、舊版服務)。
    3. 執行修補:根據建議更新 firmware、關掉不必要服務、改強密碼政策。
    4. 再跑一次掃描:確認問題是否消失或降級。

    可行動: 把第一份報告視為「現狀快照」,搭配你現有的備份/加固流程,一次整理。


    簡單 workflow 示範:Nightcrawler + 備份 / 加固工具

    為了讓你讀完就能馬上用,這裡給一個最簡單可落地的 workflow:

    1. 偵察與報告(Nightcrawler)
    2. 每月或每次環境變更後,跑一次:
      bash
      nightcrawler scan --config config.yaml --auto --output /secure/reports/scan_$(date +%F).json

    3. 備份重要設定與資料(例如:rsync / restic / 自建 NAS 工具)

    4. 對報告中標記為「關鍵設備」的主機,將設定檔與重要資料做加密備份。
    5. 可用簡單指令,例如:
      bash
      rsync -avz /etc /backup/router_config/

    6. 加固與追蹤

    7. 根據 Nightcrawler 報告中的修補建議,逐項調整設定。
    8. 建立一個簡單的變更紀錄(哪一天改了哪台設備、做了什麼修補)。
    9. 下次掃描時,比對報告、確認風險有下降。

    這樣,你就用一支手機,建立起一個「可重複、可追蹤」的個人或小型團隊安全檢查流程。


    小結

    Nightcrawler 把「手機上跑本地滲透測試 AI」這件事變成日常可以操作的工作:連上網路、跑掃描、看報告、依建議加固。只要你願意花一點時間設定範圍與流程,就能在不依賴雲端的大前提下,對自己的手機和內網做更有系統的安全檢查。

    🚀 你現在可以做的事

    • 到 GitHub 下載並安裝 Nightcrawler,完成環境與依賴設定
    • 建立自己的 config.yaml,限定掃描網段並設定輸出目錄後跑一次初始掃描
    • 依第一份報告中的 High / Medium 風險執行修補,並建立每月定期掃描與變更紀錄流程
  • 把 Windows 變成會做事的 AI 助理

    把 Windows 變成會做事的 AI 助理

    📌 本文重點

    • PPC 讓 AI 直接操作你電腦上的檔案與工作流程
    • 可整合 Microsoft 365,幫你寫報告、改表格、做簡報
    • 適合上班族、學生、自僱者用來處理重複性電腦任務

    只用一句話來說:Perplexity Personal Computer(下文簡稱 PPC)就是把你的 Windows 變成一個會幫你翻資料夾、寫報告、整理表格的 AI 助理,而不是只會在瀏覽器裡回答問題的聊天機器人。

    官方介紹(英文):Perplexity Personal Computer
    Windows 版本延伸報導:The Verge 報導連結


    核心功能:讓 AI 直接幫你用電腦做事

    1. 存取本機檔案:把「找資料+整理」全交給它

    PPC 最大的差別,是它不是只看你貼進來的文字,而是可以存取你授權的本機資料夾。

    可實際做到的事:

    • 幫你掃整個專案資料夾:
    • 指令例子:
      > 幫我讀這個「專案A」資料夾裡的所有 Word、PDF 和 PowerPoint,整理成一份 500 字的中文摘要,列出三個主要風險。

    💡 關鍵: 讓 PPC 直接讀整個專案資料夾,比你手動開檔整理摘要省下大量時間與心力。

    • 整理雜亂檔名:
    • 讓它先理解檔案內容,再幫你產生重新命名建議(例如「會議記錄_2024-07-產品策略」),你再手動套用。
    • 找到你忘記放哪的檔案:
    • 指令例子:
      > 幫我在已授權的資料夾裡找「合約」相關檔案,列出檔名、日期、一句話說明內容。

    你可以立刻做的事:

    1. 選一個「工作專案資料夾」。
    2. 授權 PPC 存取這個資料夾(下文有步驟)。
    3. 給它第一個任務:「幫我整理這個資料夾的重點,產出一頁簡報提綱」。

    2. 整合 Microsoft 365 / Teams:直接寫 Word、改 Excel、準備簡報

    根據 The Verge 報導,Perplexity 已經在 5 月加入 Microsoft 365 和 Teams 整合,Windows 版 PPC 也延續這個能力:

    • Word 報告:
    • 指令例子:
      > 根據這個資料夾中的「銷售數據.xlsx」和「客戶訪談記錄.docx」,幫我在 Word 裡產出一份 1500 字的季度銷售分析草稿,語氣正式、適合給部門主管看。
    • Excel 整理:
    • 幫你從多個表合併成一張,再加上簡單公式、樞紐分析建議。
    • 指令例子:
      > 幫我把這三個 Excel 的銷售數據合併成一張表,用欄位「月份」「產品線」「營收」整理,並附上三個你建議的樞紐分析切法。
    • PowerPoint 簡報提綱:
    • PPC 可以先幫你產出「每頁標題+ bullet 要點」,你再進 PowerPoint 微調。
    • 指令例子:
      > 幫我根據這份「季度報告.docx」寫一份 10 頁簡報的大綱,每頁列出標題和 3 個重點。

    💡 關鍵: 直接在 Word、Excel、PowerPoint 裡讓 PPC 動手寫草稿,相當於多了一位熟悉你文件架構的虛擬助理。

    你可以立刻做的事:

    • 選一份現有的 Word 報告或 Excel 表,請 PPC「幫我重寫/重排版」一次,看它能幫你省掉多少時間。

    3. 在 Windows 上當「常駐數位員工」

    The Verge 把 PPC 形容成「general-purpose digital worker」——簡單說,就是一個可以長期駐守在你電腦上的「虛擬同事」。

    具體可以怎麼用:

    • 每週例行工作,變成一份指令:
    • 例如:每週五下午,叫它從固定資料夾拉資料,生週報草稿。
    • 特定任務模板:
    • 「整理會議記錄→產出行動清單」、
    • 「統整多份 PDF→寫成讀書筆記」。

    這類用法呼應了 OpenAI 研究中提到的趨勢:AI 不只是幫你查資料,而是讓你可以把「整個任務」交出去,自己專注在判斷與決策上。

    你可以立刻做的事:

    • 列出 3 件你每週重複做、又覺得麻煩的電腦任務,嘗試用一句話描述後丟給 PPC 看看它能接手多少。

    適合誰用:上班族、學生、自僱者的典型一天

    1. 上班族:週報、會議、找資料一次搞定

    情境 A:週報整理

    • 把一週的會議記錄、輸出報表都丟進同一資料夾。
    • 指令例子:

      幫我讀這個資料夾所有檔案,整理成一份 800 字的週報草稿,分成「本週進度」「問題與風險」「下週計畫」三段。

    情境 B:會議記錄彙總

    • 用 Teams 開會+錄影+自動轉錄,存到指定資料夾。
    • PPC 任務:
    • 幫你整理出會議摘要、待辦事項、問題列表。

    情境 C:資料夾搜尋+總結

    • 當你知道「有這份文件但忘記放哪」,就讓 PPC 在授權資料夾裡找,並順便寫摘要。

    2. 學生:整理課堂 PDF、做讀書筆記

    情境 A:課堂 PDF 整理

    • 把指定課程的講義 PDF、老師投影片、自己的筆記放在同一資料夾。
    • 指令例子:

      幫我把這個資料夾的所有檔案整理成一份考前重點,列出 10 個一定要會的名詞解釋,附上簡短說明。

    情境 B:讀書筆記生成

    • 把電子書或掃描 PDF 放進資料夾。
    • 請 PPC 依「章節+重點+例題」格式幫你整理。

    💡 關鍵: 將課堂 PDF 與筆記交給 PPC 先做初步整理,可以把原本要花數小時的複習濃縮成短時間的重點閱讀。


    3. 自由工作者:報價單、合約草稿、專案文件

    情境 A:報價單

    • 把過去的報價單放進資料夾,讓 PPC 學你的風格。
    • 指令例子:

      根據這些既有報價單格式,幫我為這個新案子產出一份報價草稿,保留我原本的項目命名方式。

    情境 B:合約草稿

    • 把你常用的標準合約放入資料夾。
    • 請 PPC 根據新案內容生成一份草稿,你再逐條檢查。

    怎麼開始:從下載到下第一個指令

    提醒:介面可能會隨版本更新略有差異,以下是概念上的步驟,你可以搭配官方頁面操作。

    步驟 1:下載並安裝 Windows 版 PPC

    1. 前往 Perplexity 官網。
    2. 找到 Personal Computer 或 Windows App 的下載連結。
    3. 下載安裝檔,照著安裝精靈一路下一步即可。

    步驟 2:登入 Perplexity 帳號

    1. 安裝完成後啟動 PPC。
    2. 使用你的 Perplexity 帳號登入(沒有帳號可先註冊免費帳號)。
    3. 若有方案選擇頁,先用免費/一般方案試用即可,之後再考慮升級。

    步驟 3:授權存取特定資料夾

    1. 首次啟動時,PPC 通常會要求你選擇可以存取的資料夾。
    2. 建議做法:
    3. 先建立一個「AI 專用工作資料夾」,例如 D:\AI_Workspace。
    4. 把你要它處理的檔案複製進來。
    5. 在 PPC 設定裡,只授權這個資料夾,避免一次全開 C 槽。

    步驟 4:下第一個實戰指令

    把這句直接貼進去,然後看它怎麼做:

    幫我整理這個資料夾裡所有報告,產出一份 1 頁的 PowerPoint 簡報提綱,包含:專案背景、目前進度、主要問題、下一步建議。請列出每一頁的標題和 bullet point。

    接著:

    • 請它把提綱輸出成你想要的語氣(報告用、同事用、老闆用)。
    • 再叫它幫你寫成 Word 草稿,或提供可以貼進 PowerPoint 的內容。

    安全與習慣:只開你要它看的資料

    1. 權限設定:只開工作資料夾

    使用原則很簡單:

    • 原則 1:不要讓它看到你不會給同事看的東西。
    • 原則 2:授權時只給「專用資料夾」,不要一次開整顆硬碟。

    建議做法:

    • 工作用:建立 Work_AI 資料夾,把專案相關檔案複製進去,再授權 PPC。
    • 私人用:另開 Personal_AI 資料夾,用來放個人學習或讀書資料。

    2. 何時關閉存取

    • 處理完某個專案,就可以在設定裡取消該資料夾權限,或把檔案移出。
    • 若在公司電腦上使用,請先確認公司 IT 或資安政策。

    3. 和雲端工具搭配成工作流

    PPC 只負責「在你電腦上」的事情,你可以這樣搭配:

    • OneDrive / SharePoint:
    • 因為檔案會同步到本機,PPC 就能讀到公司文件庫裡的檔案。
    • Notion / Obsidian:
    • 把 PPC 生成的週報、筆記貼回 Notion,當作知識庫;
    • 下次可以再讓 PPC 讀 Notion 匯出的 Markdown 或 PDF,做進階整理。

    三個今天就可以交給它的任務

    讀到這裡,如果你只想先試三件事,直接照抄這三個任務就好:

    1. 一週工作回顧

      幫我讀這個資料夾裡的所有會議記錄和報表,整理成一份 800 字的中文週報草稿,分成「本週完成」「遇到問題」「下週計畫」,文字語氣正式一點。

    2. 整理課堂或研討會筆記

      這個資料夾裡是同一門課的 PDF 和我的筆記,請幫我整理成一份考前重點,列出每一章的標題、3–5 個關鍵概念和你自製的小例子。

    3. 專案簡報提綱

      根據這個資料夾的文件內容,幫我寫一份 10 頁內的專案簡報大綱,包含頁數標題和 bullet point,目標讀者是主管,語氣專業但容易理解。

    把這三件事交給 PPC,你大概就能感受到:你的 Windows 不再只是「可以開 Office 的電腦」,而是一個可以幫你做整理、寫草稿、準備簡報的 AI 助理。

    🚀 你現在可以做的事

    • 前往 Perplexity 官網 下載 Windows 版 PPC,建立一個專用工作資料夾並授權給它
    • 挑選一個現有專案資料夾,直接下文中的任一指令,觀察 PPC 能幫你完成多少整理工作
    • 為自己列出 3 個重複性電腦任務,逐一丟給 PPC 試跑,評估是否納入日常工作流程
  • GPT‑5.6 實戰指南:這樣用才有感

    GPT‑5.6 實戰指南:這樣用才有感

    📌 本文重點

    • GPT‑5.6:長文、流程、程式更穩更省
    • 長文件與多會議可一次整理成可執行清單
    • 多步驟 Agent 讓固定週報、審稿自動化
    • 程式碼 Debug 與專案結構理解顯著提升

    GPT‑5.6 關鍵差異:更聰明也更省

    先看它跟舊版模型(以 GPT‑4.5 為例)的實際差異,幫你判斷「什麼時候值得切到 5.6」。

    官方說明與技術細節可參考 OpenAI Blog:https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency

    項目 GPT‑4.5 GPT‑5.6 對知識工作者的影響
    長文上下文長度 中等(長報告易截斷) 明顯加長,摘要更穩定 合約、企劃、會議紀錄可以一次丟、一次總結
    多步驟 Agent 工作流 有,但較易「跑偏」 強化規劃與執行一致性 可以放心交給它一串重複任務週週自動跑
    程式碼理解與 Debug 能看,但脈絡感較弱 對專案結構、CLI/IDE 整合更友善 開發者用來查錯、重構、產生腳本更可靠
    價格效能比 同級模型偏貴 單次推論更省、吞吐量更高 同樣預算下可處理更多工作內容
    Agent 風險控制 自主性有限 更強,但仍需人類監督 適合半自動流程,不適合放任它跑公司財務

    💡 關鍵: GPT‑5.6 在長文處理、多步驟工作流與推論成本上,同時比 GPT‑4.5 有感升級,是「工作效能差異」而不是單純版本號更新。

    如果你每天要處理長文件、固定行政流程、或寫程式,GPT‑5.6 的升級會是可感知的差異,而不是「版本號升級而已」。


    核心功能一:長文閱讀與總結,真的可以一口氣丟完

    GPT‑5.6 在長文處理上做了兩件事:

    1. 上下文更長:可以穩定處理多萬字級文件,不容易「忘記前面講什麼」。
    2. 跨文件對齊能力變好:可以同時比較多份合約、多場會議紀錄,抓出差異與關鍵決策。

    實際場景 1:合約審閱流程

    你可以這樣做:

    1. 打開官方 Web 端(ChatGPT / OpenAI 平台),模型切到 GPT‑5.6。
    2. 上傳最近要簽的合約 PDF(或貼純文字)。
    3. 用這個「可重複使用的系統提示」當開頭,存成一個固定對話:
    你是有 10 年科技業商務合約經驗的法務助手,只做三件事:
    1)用一般人能懂的話,列出合約對我方的義務、風險、與不合理條款;
    2)把所有「需我方行動」的條款整理成待辦清單(含期限、負責角色);
    3)給出可直接貼給對方的修改建議(條文版本)。
    
    回答時請使用:
    - 條列式
    - 分成「風險重點」「待辦清單」「建議修正條文」三段
    - 保持在 2,000 字以內。
    
    1. 之後每次有新合約,只要把檔案丟進同一個對話,它就會套用同一套審閱邏輯,不用重寫指令。

    實際場景 2:會議紀錄變成行動計畫

    很多團隊會有一堆會議紀錄,但沒有可追蹤的行動項目。

    操作步驟:

    1. 把一週內的所有會議紀錄整理成一個檔案(Notion / Docs 匯出成 PDF 或 TXT)。
    2. 丟給 GPT‑5.6,搭配這段提示:
    請你把這一週的所有會議紀錄,整理成:
    1)專案列表(每個專案一段);
    2)每個專案的「已決定事項」與「待決定事項」;
    3)待辦事項清單(含負責人、截止日期建議)。
    
    輸出格式:
    - Markdown
    - 清單可以直接貼進 Notion 或 Jira 使用。
    
    1. 把輸出的 Markdown 貼回 Notion,當作專案 Wiki 的「本週更新」。下一週只要丟新的紀錄到同一對話即可。

    核心功能二:多步驟 Agent 工作流,讓重複任務自動跑

    OpenAI 在 GPT‑5.6 上強化了 Agentic workflows,也就是「讓模型自己規劃、拆解、執行一串任務」。

    官方說法可見:https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency

    目前不建議讓它完全自主跑商業(例如自動下廣告、投資),相關風險可以參考 Bottleneck Labs 的實測:https://www.bottlenecklabs.com/blog/autonomously-run-businesses。但用在半自動、可控的例行工作非常合適。

    實際場景 3:週報自動生成 Agent

    假設你每週會寫一份「專案週報」給主管,內容包括:進度、風險、下週計畫。

    設計流程:

    1. 建一個固定對話,模型選 GPT‑5.6。
    2. 用下面這段作為系統提示(System Prompt):
    你是我的專案週報助理,每週的流程固定如下:
    
    步驟 1:整理輸入資料
    - 接收我貼給你的:會議紀錄、專案更新、Issue 列表
    - 去除重複資訊
    
    步驟 2:歸納重點
    - 依專案分類整理「本週完成」「進行中」「阻礙與風險」
    
    步驟 3:產出週報
    - 以「給主管看的」口吻
    - 每個專案 3-5 點
    - 最後一段是「下週計畫」,用條列式
    
    每次我只要貼原始資料,你就自動跑完以上三步驟,再把結果給我。
    
    1. 每週只要把實際內容貼進同一對話,GPT‑5.6 會先自己整理輸入,再輸出週報,不用你每次重新下指令。
    2. 你最後只要人工檢查、微調語氣即可發送。

    實際場景 4:內容審稿流程 Agent

    用於內容團隊:文章初稿 → GPT‑5.6 審稿 → 人類總編。

    設定方式:

    1. 在對話中描述固定流程:
    2. 檢查結構(標題、段落、CTA)。
    3. 檢查事實錯誤(標示可能有問題的地方,請不要編造資料)。
    4. 改寫成指定品牌語氣。
    5. 要求它每次先列出「修改建議清單」再給「修改後版本」,你就能清楚知道它做了什麼,降低風險。

    核心功能三:程式碼輔助與 Debug,結合 CLI / IDE 更好用

    GPT‑5.6 在程式碼方面的提升,主要有三個實感:

    1. 看得懂專案結構:不是只看單一檔案,而是能理解多檔案之間的呼叫關係。
    2. 錯誤定位更準:針對 stack trace、log,可以比較精確地指出可能出問題的區塊。
    3. 更適合搭配 IDE / CLI:例如在 VS Code、Cursor 等編輯器中,把 GPT‑5.6 設為後端模型。

    價格效益方面,社群討論可參考:https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/

    💡 關鍵: 把 GPT‑5.6 接到 IDE 或 CLI 後,它能同時看 log、測試與多檔程式碼,成為實際可用的「對專案有全貌的 Debug 助手」。

    實際場景 5:CLI + GPT‑5.6 Debug 流程

    假設你在本機開發一個 Python 專案,常常遇到測試失敗。

    一個簡單可落地的流程:

    1. 在 IDE 裝好 ChatGPT / OpenAI 或第三方外掛,模型選 GPT‑5.6。
    2. 當測試失敗時,把以下內容丟給模型:
    3. 失敗的測試輸出(含堆疊訊息)。
    4. 相關檔案程式碼(不要只貼片段)。
    5. 用這個提示模板:
    這是某個 Python 專案的測試失敗輸出與相關程式碼。
    
    請你:
    1)先用自己的話描述這次錯誤可能的成因(不超過 10 行);
    2)列出 3 個最可能的錯誤位置(檔案 + 行數範圍);
    3)給出一個最小修改方案(diff 風格),並說明為何這樣改。
    
    請不要引入新第三方套件,只在既有架構內修正。
    
    1. 把它回傳的 diff 貼回程式碼,跑測試驗證;有問題再跟它來回微調。

    成本對比:如果你在意雲端費用

    市面上已經有模型在成本上追近 GPT‑5.6 的中階版本,例如 Deepseek Flash V4:

    報導連結:https://the-decoder.com/new-deepseek-flash-model-matches-openais-gpt-5-6-luna-at-roughly-60-percent-lower-cost/

    名稱 核心功能 免費方案 適合誰
    GPT‑5.6 Luna 高階智慧 + 高上下文 + 強 Agent 流程 視平台方案而定 需要穩定長文處理與多步驟工作流的團隊
    Deepseek V4 Flash 接近 Luna 智慧,但推論成本約低 60% 有基本免費額度 預算有限、需要大量請求的開發者或中小企業

    簡單策略:

    • 需要高可靠長文處理、關鍵決策協助:優先用 GPT‑5.6 Luna。
    • 需要大量批處理程式碼或小任務:可以混搭較便宜的模型,把 GPT‑5.6 留給「關鍵任務」。

    💡 關鍵: 在推論成本約低 60% 的前提下,Deepseek Flash V4 適合作為批量任務模型,而 GPT‑5.6 Luna 留給高價值、高風險的工作。


    適合誰用?四種典型角色

    1. 產品經理 / PM:
    2. 每週要寫進度報告、整理會議紀錄、比對需求文件。
    3. 可以把 GPT‑5.6 當成「會整理但不會拍板」的文件助理。

    4. 行銷 / 內容編輯:

    5. 需要固定產出週報、月報、企劃書、內容審稿流程。
    6. 用多步驟 Agent 做成「輯稿流水線」,自己只做最後審核。

    7. 軟體工程師 / 資料科學家:

    8. 常常需要讀別人程式碼、改舊專案、Debug 難以重現的錯誤。
    9. 把 GPT‑5.6 接到 IDE,讓它陪你一起看 log、改測試。

    10. 創業者 / 小團隊負責人:

    11. 要自己處理合約、企劃、簡報、內外部溝通。
    12. 用 GPT‑5.6 先把「資訊與文件整理好」,再用人脈做最後判斷。

    怎麼開始?10 分鐘試用清單

    以下是一個你可以在 10 分鐘內完成的 GPT‑5.6 實測路徑。

    1. 在官方 Web 端切模型

    1. 登入 ChatGPT 或 OpenAI 平台。
    2. 新增一個對話,模型選 GPT‑5.6 或 GPT‑5.6 Luna(依方案而定)。
    3. 建立一個「合約/週報助手」系統提示,照前文範例貼上。

    2. 在常見工具中切換模型

    • Notion AI:
    • 進入設定檢查是否支援選擇 OpenAI 模型版本。
    • 有支援的話,將資料庫的「自動摘要」「會議紀錄整理」類功能的模型切到 GPT‑5.6。
    • IDE / 插件(VS Code / Cursor 等):
    • 打開擴充設定,確認有 OpenAI key 並可指定模型。
    • 將預設模型改為 gpt-5.6(實際名稱依官方更新為準)。

    3. 10 分鐘實測任務清單

    1. 丟一份最近的會議紀錄,要求 GPT‑5.6 把它整理成待辦清單。
    2. 丟一份合約或企劃書,用前面的合約助手提示跑一次,感受長文表現。
    3. 在你的程式碼專案中,丟一個測試錯誤給它,要求列出三個可能原因與一個修正方案。
    4. 設一個每週固定任務(週報 / 新聞整理),在對話中寫清楚流程,讓它連續跑兩週,看輸出是否穩定。

    做完這 4 件事,你大概就能知道:

    • 你目前的工作流程裡,哪一塊最適合交給 GPT‑5.6。
    • 需要搭配哪些工具(Notion、IDE、CLI)才能真的省時間,而不是多一個聊天視窗。

    小結:先把 GPT‑5.6 當成「超強文書+流程助手」

    GPT‑5.6 的真正價值,不在於它會不會自己開公司賺錢,而在於:

    • 面對大量文件時,你不必自己讀完再整理;
    • 面對固定流程時,你可以只設計一次指令,之後讓它週週自動跑;
    • 面對難 Debug 的程式碼時,你多了一個能看專案全貌的助手。

    先從這三件事開始,你會比較清楚:在你的工作裡,GPT‑5.6 到底能幫你省下多少時間。然後,再決定要不要投入更複雜的 Agent 流程和整合。

    🚀 你現在可以做的事

    • 在 ChatGPT / OpenAI 中建立一個固定的 GPT‑5.6「合約/週報助手」對話並貼上文中的系統提示
    • 選一週的會議紀錄與一份合約,實際丟給 GPT‑5.6 跑完整理與待辦清單流程
    • 在你的 IDE(如 VS Code / Cursor)中切換預設模型為 gpt-5.6,用一次 Debug 提示測試程式輔助能力