📌 本文重點
- LFM2.5-2.6B 支援 128K 長上下文,可一次處理整本文件
- 內建多步驟 Agent 與 tool calling,可拆解任務自動執行
- 量化後記憶體 < 2.5GB,手機 CPU 也能跑到 17–30 tok/s
- 適合本地文件助理、批量任務與離線手機 AI 助理
一台手機就能跑的長上下文 AI 小助手,幫你在本地處理文件、批量任務和簡易自動化,不靠雲端也能用得上 AI。
參考來源:Reddit LocalLLaMA 討論、LFM2.5-2.6B 發布帖、OnePlus 13 實測,以及 Hugging Face 專題文:Deploy local agents everywhere with LFM2.5-2.6B。
核心功能:為什麼是「一台手機就能跑的 Agent」?
1. 128K 長上下文:整本報告一次丟進去
- 它是什麼:LFM2.5-2.6B 支援約 128K tokens 上下文,大約可以一次吃下數十萬字的內容。
- 具體能做什麼:
- 整本 PDF 報告、技術文件、會議紀錄一次丟進去,讓模型幫你摘要、對比、找重點。
- 長期對話不會「忘記前文」,可以當持續的工作助理。
- 你可以馬上做的事:
- 準備 1–2 本常用的 PDF(如年度報告、專案文件),作為之後測試的資料集。
💡 關鍵: 支援約
128K tokens的長上下文,讓單次對話就能覆蓋整本報告或多份文件,減少來回上傳與分段處理的麻煩。
2. 多步驟 Agent + 工具呼叫:不只是聊天,是能「自己拆步驟」的小幫手
- 它是什麼:模型後訓練時就針對多步驟代理流程(multi-step agent workflows),並支援 tool calling 格式,能主動:
- 判斷需要使用工具(如讀檔、發 API)。
- 先規劃步驟,再分批完成任務。
- 適合的工具類型:
- 檔案讀寫工具:讀取本地
txt、md、pdf(先轉文字)。 - Web API:查天氣、查匯率、打公司內部 API。
- 你可以馬上做的事:
- 想一個「需要拆步驟」的工作流程,例如:整理一週郵件 → 分類 → 摘要 → 拉出待辦清單,留著稍後做 Agent 範例。
3. 本地推理友善:記憶體 < 2.5GB,在手機 CPU 跑到 17–30 tok/s
- 它是什麼:LFM2.5-2.6B 約
2.69B參數,官方提供Q4_K_MGGUF 量化版本,在手機上記憶體占用低於2.5GB。 - 實測數據:
- Reddit 用戶在 OnePlus 13 手機上純 CPU 跑,約
17 tok/s。 - Liquid AI 官方報告在某些推理與工具調用基準上,和 Qwen 3.5
9B類模型接近,但資源需求低很多。 - 你可以馬上做的事:
- 確認自己的設備:RAM 至少
4GB(桌機 / 筆電更好),手機 Android 版本支援安裝第三方推理 App 或自訂引擎。
💡 關鍵: 在純 CPU 手機上僅需不到
2.5GB記憶體就能跑到約17 tok/s,代表即使沒有高階 GPU,也能實際部署長上下文本地 AI。
適合誰用:三個實戰場景
1. 本地文件助理:長文閱讀、知識庫整理
場景:你有大量 PDF 報告、技術文件,平常用雲端模型怕機密外流,或上傳很慢。
可以怎麼用 LFM2.5:
- 在桌機用
llama.cpp跑 LFM2.5,讀取本地資料夾中的文件(轉成文字)。 - 把多份文件丟進同一個上下文,請它:
- 「幫我整理這三份報告的差異,列出一頁摘要+決策建議。」
- 「從這堆文件找出所有提到 2025 年預算的段落。」
你可以立刻做的事:
- 整理一個
docs/資料夾,把 3–5 份常用文件轉成純文字(txt),準備接入 LFM2.5。
2. 批量任務 Agent:整理郵件、報告、待辦清單
場景:你每天有一堆重複的小事,例如「每週整理專案更新」、「把會議紀錄轉成待辦」。
可以怎麼用 LFM2.5:
- 寫一個簡單腳本從郵件或系統導出文字(如
weekly_emails.txt)。 - 讓 Agent 執行一套固定流程:
- 讀入所有文本 → 按專案或標籤分類。
- 每類輸出摘要與關鍵日期。
- 最後產生「本週待辦清單」。
你可以立刻做的事:
- 決定一個你每週都在做的重複整理任務,想好輸入格式(例如一個大
txt),稍後在工具呼叫範例裡實作。
3. 手機上的離線問答與簡易自動化
場景:出差在外、網路不穩,也想有一個在手機上的「私人 AI 小助理」。
可以怎麼用 LFM2.5:
- 在手機安裝支援 GGUF 的本地推理 App(如某些社群版
llama.cppApp,或自行編譯)。 - 把常用資料(旅遊行程、公司 FAQ、個人筆記)放進手機,讓模型作為離線問答庫。
- 再加上幾個簡單工具:
- 查本地檔案(行程、備忘錄)。
- 呼叫 Web API(天氣、匯率)— 有網路時也能用。
你可以立刻做的事:
- 在手機上預留至少
3–4GB空間和足夠 RAM,並確認能安裝第三方推理 App 或有adb環境可連接自製引擎。
怎麼開始:從桌機到手機,一步步實作
步驟一:在 Hugging Face 下載模型與量化權重
- 打開 Hugging Face 模型頁:
- 搜尋
LFM2.5-2.6B或直接從官方 Blog 連結進入:https://huggingface.co/LiquidAI。 - 選擇 GGUF 格式(例如官方提到的
Q4_K_M量化版本)。 - 使用
git lfs或直接瀏覽器下載:
bash
git lfs install
git clone https://huggingface.co/LiquidAI/lfm2-5-2-6b-gguf
你可以立刻做的事:
- 安裝
git lfs,測試是否能順利 clone 大檔案。
步驟二:用 llama.cpp 在桌機跑起來
- 安裝
llama.cpp:
bash
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make
- 把剛下載的 GGUF 模型放到
./models/lfm2-5-2-6b-q4_k_m.gguf。 - 用基本推理指令測試:
bash
./main \
-m models/lfm2-5-2-6b-q4_k_m.gguf \
-c 128000 \
-n 256 \
-p "你是一個中文助理,請用繁體中文回覆。幫我總結這段文字:..."
你可以立刻做的事:
- 先把
-c設小一點(例如8192),確認能跑,再逐步拉高到128K測試極限。
💡 關鍵: 先以較小上下文長度測試穩定性,再逐步拉高到
128K,可以避免一開始就因資源不足導致崩潰。
步驟三:在手機或低端設備配置推理引擎
你有兩條路可以選:
| 方案 | 核心功能 | 免費方案 | 適合誰 |
|---|---|---|---|
原生 llama.cpp 編譯 |
直接在 Android / Linux 編譯 llama.cpp,跑 GGUF 模型 |
開源免費 | 喜歡動手編譯、可用 adb 的技術玩家 |
| 第三方推理 App | 安裝社群開發的本地 LLM App,匯入 GGUF 模型 | 多數免費或開源 | 想快速在手機體驗本地 AI 的一般使用者 |
大致步驟示意(原生編譯路線):
- 在桌機用
adb連上 Android 手機,確認有 shell:
bash
adb shell
- 把編譯好的二進位與模型檔推上手機:
bash
adb push ./main /data/local/tmp/
adb push ./models/lfm2-5-2-6b-q4_k_m.gguf /data/local/tmp/
- 在手機上跑:
bash
cd /data/local/tmp
chmod +x main
./main -m lfm2-5-2-6b-q4_k_m.gguf -c 32768 -n 128 -p "請用繁體中文介紹你自己。"
你可以立刻做的事:
- 測試一次
adb shell是否正常;如果你偏好 GUI,搜尋一款支援 GGUF 的 LLM App,確認可以匯入模型檔。
步驟四:串接簡單工具(檔案讀取 + Web API)
LFM2.5 支援 tool calling 格式,你可以在自己的程式裡定義工具,讓模型決定何時呼叫。
以下以 Python + llama.cpp HTTP 伺服器為例(概念示意):
- 先啟動
llama.cpp的伺服器模式:
bash
./server \
-m models/lfm2-5-2-6b-q4_k_m.gguf \
-c 128000 \
--host 127.0.0.1 --port 8080
- 在 Python 定義兩個工具:讀檔與查匯率:
python
tools = [
{
"name": "read_file",
"description": "讀取本地文字檔內容",
"parameters": {
"type": "object",
"properties": {
"path": {"type": "string"}
},
"required": ["path"]
}
},
{
"name": "get_fx_rate",
"description": "查詢美元對新台幣即時匯率",
"parameters": {
"type": "object",
"properties": {}
},
}
]
- 當模型輸出 tool call 時,由你的程式實際執行:
python
def call_tool(name, args):
if name == "read_file":
with open(args["path"], "r", encoding="utf-8") as f:
return f.read()
if name == "get_fx_rate":
# 這裡打某個匯率 API
return "目前 USD/TWD 約為 32.1"
你可以立刻做的事:
- 先做最簡單版本:只寫一個
read_file工具,讓模型幫你讀取某個txt,並摘要內容。
收尾:下一步可以做什麼?
如果你已經在桌機跑起 LFM2.5,有幾個很實際的下一步:
- 把你的「每週重複工作」整理成一個 Agent 流程,固定用同一組工具+提示詞執行。
- 把常用的公司文件、技術文檔轉成文字,作為
128K上下文的知識庫。 - 在手機上先跑小上下文(
8K/16K),確認效能,再逐步增加到32K,觀察速度和可用性。
LFM2.5-2.6B 的重點不在「有多大」,而在「足夠聰明又能在你手邊的設備上跑」,只要你願意花一個週末,把下載、llama.cpp、簡單工具串接三件事做完,就能擁有一個真正屬於自己的本地 AI 小助手。
🚀 你現在可以做的事
- 到 Hugging Face 下載
LFM2.5-2.6B的Q4_K_MGGUF 模型,並在桌機用llama.cpp跑通基本推理- 準備一個
docs/資料夾與一個「每週重複任務」,作為之後 Agent 與長上下文測試用資料- 在手機上安裝支援 GGUF 的本地 LLM App 或配置
adb環境,預留 3–4GB 空間準備導入模型








