📌 本文重點
- North Mini Code 是針對程式碼與 Agent 優化的 30B 開源模型
- 可在本地或內網部署,避免程式碼外流與雲端綁定
- 透過 vLLM / FastAPI 等,可接到 IDE 當自家 Copilot
- 可擴展成自動重構、產 PR 的完整 Code Agent workflow
雲端 Copilot 很好用,但貴、會上傳程式碼、也被綁在特定平台;North Mini Code 讓你用一顆開源小模型,在自己機器上做出專屬的 AI 程式碼 Agent。
模型連結:Hugging Face – CohereLabs/North-Mini-Code-1.0
https://huggingface.co/CohereLabs/North-Mini-Code-1.0
核心功能:這顆模型能幹嘛?
1. 專門為「程式碼 + Agent」調過的 30 億參數模型
- 參數規模:30B(約
3B active),重點是 效能 / 顯示記憶體比很友善。 - 授權:Apache 2.0,可商用、可改、可包進你的產品,不用談授權費。
- 能力:在人工程式碼分析指標(Artificial Analysis Coding Index)拿到 33.4 分,與同級模型競爭力接近。
- 官方定位:Cohere 把它稱為 開源 Agentic Coding Model,也就是特別優化「一步一步推理、呼叫工具、改檔案」這種工作流程。
💡 關鍵: 這顆 30B 模型以約 3B active 參數達到 33.4 分表現,代表在顯存友善的前提下仍具同級競爭力。
可以做的事:
- 寫與理解多語言程式碼(Python、TypeScript、Go…)。
- 幫你拆解需求 → 拆任務 → 生出具體修改建議與 patch。
- 當成 Agent 的「大腦」,搭配工具去讀檔案、改檔案、送 Pull Request。
行動建議:先到 Hugging Face 頁面按下 Duplicate in Space 或在 Web UI 裡試幾個自己的 code snippet,確認風格合不合胃口。
適合誰用?幾個具體場景
- 公司不方便把原始碼丟上雲端:金融、醫療、政府專案,用雲端 Copilot 有合規壓力,North Mini Code 可以放在內網 GPU 或伺服器裡使用。
- Side project 想省錢又想有 Copilot 感覺:自己架一顆模型,用 Cursor、Claude Code 或自製 VSCode 插件連上去,平常寫 side project 就靠它輔助。
- 想做自家產品的「內嵌 Coding Agent」:SaaS、DevOps 工具、内部平台,想加「一鍵重構」「一鍵產生自動化 script」,可以直接把這顆模型包進去,不用每月燒雲端 API。
- 研究 / 教學單位:開課教 AI for Programming,可以讓學生直接在本地玩 Agent,而不是只調用雲端 API。
怎麼開始(一):最快速的入門方式
這一層目標:先看到模型實際寫程式碼的樣子,不用寫太多 infra。
1. 直接在 Hugging Face 線上試
- 開啟模型頁:https://huggingface.co/CohereLabs/North-Mini-Code-1.0
- 找到
Inference或Spaces Demo區塊。 - 貼上一段自己的函式,輸入提示:
text
你是一位資深後端工程師,請重構以下 Python 函式,要求:
1. 拆成小函式
2. 加上型別註記
3. 解釋主要修改點
- 看輸出是否符合你平常期待的 coding style。
行動目標:至少用你現在在做的專案語言(例如 TypeScript + NestJS / Python + FastAPI),試 3 個 prompt,確認模型對你主力技術棧的理解能力。
2. 用現成推理伺服器跑起來(TGI / vLLM)
如果你手上有一台有 GPU 的機器,可以用現成的推理伺服器:
text-generation-inference (TGI):Hugging Face 官方推,部署簡單。vLLM:效能好、支援 OpenAI-style API。
以 vLLM + Docker 為例(概念示意):
docker run --gpus all -p 8000:8000 \
vllm/vllm-openai:latest \
--model CohereLabs/North-Mini-Code-1.0 \
--download-dir /models
跑起來後,你就有一個 OpenAI 相容的 /v1/chat/completions API 可以 call。
行動目標:用你最熟悉的推理方案(TGI 或 vLLM 選一個)先在伺服器上跑起來,用 curl 或 Postman 成功打到一次 API。
怎麼開始(二):包成 OpenAI-style API,接到 IDE 裡
這一層目標:讓 North Mini Code 像 OpenAI 一樣被 Cursor、Claude Code 或自製 VSCode 插件當作後端使用。
假設你已經用 vLLM 把模型跑在 localhost:8000,現在可以再包一層簡單的 Python 代理 API,對外維持 OpenAI 介面(方便未來切換模型)。
1. 用 Python FastAPI 做一個薄封裝
# app.py
from fastapi import FastAPI
from pydantic import BaseModel
import requests
OPENAI_COMPAT_URL = "http://localhost:8000/v1/chat/completions" # vLLM
app = FastAPI()
class Message(BaseModel):
role: str
content: str
class ChatRequest(BaseModel):
model: str
messages: list[Message]
temperature: float | None = 0.2
@app.post("/v1/chat/completions")
async def chat(req: ChatRequest):
payload = {
"model": "CohereLabs/North-Mini-Code-1.0",
"messages": [m.model_dump() for m in req.messages],
"temperature": req.temperature,
}
r = requests.post(OPENAI_COMPAT_URL, json=payload)
return r.json()
啟動:
uvicorn app:app --host 0.0.0.0 --port 3000
現在,http://localhost:3000/v1/chat/completions 就是一個「自家版 OpenAI API」。
2. 接到 Cursor / VSCode / 自製工具
以 Cursor 為例:
- 打開 Cursor 設定 →
Models→ 自訂 API。 - 填寫:
- Base URL:
http://localhost:3000/v1 - API Key:隨便填一個(例如
local-north-mini),因為你自己的服務可以忽略驗證。 - 選擇此自訂模型作為預設 Coding 模型。
之後你在 Cursor 內:
Tab補全、聊天寫 code、改檔案的請求,全部都會走到你這顆本地的 North Mini Code。
行動目標:把 IDE(Cursor 或 VSCode 插件)接到你剛剛包好的 API,嘗試用它完成一個小功能(例如寫一個簡單的 REST API route)。
怎麼開始(三):變成真正的 Code Agent Workflow
這一層目標:不是只有「聊天寫 code」,而是讓模型能 看專案、給重構建議、自己產生 PR 草稿。
💡 關鍵: 當模型被嵌入自動讀檔、產 diff、送 PR 的流程時,才真正從「聊天輔助」升級為完整 Code Agent。
範例 Workflow:從 Git repo → 重構建議 → PR 草稿
流程拆解:
- 從 Git repo 讀取指定資料夾的檔案內容。
- 用 North Mini Code 產生重構建議與 patch(例如 unified diff)。
- 建立分支、套用 patch、產生 commit 和 PR 草稿(或 MR)。
簡化版 Python 範例(偏偽碼):
from git import Repo
import openai # 指向你自己的 /v1
openai.api_base = "http://localhost:3000/v1"
openai.api_key = "local-north-mini"
repo = Repo("./your-project")
files = ["app/service/user_service.py", "app/api/user_routes.py"]
code_snippets = []
for path in files:
content = (repo.working_tree_dir + "/" + path)
with open(content, "r", encoding="utf-8") as f:
code_snippets.append(f"# FILE: {path}\n" + f.read())
prompt = """
你是一位資深後端工程師與程式碼重構專家。
請針對下列檔案:
1. 給出具體重構建議
2. 產生 unified diff 格式的 patch(只包含必要修改)
3. 每個修改前加上簡短註解(英文)
注意:
- 保持對外介面不變
- 如果不需要改,請明確說明原因
""" + "\n\n".join(code_snippets)
resp = openai.ChatCompletion.create(
model="north-mini-code",
messages=[{"role": "user", "content": prompt}],
)
patch = resp["choices"][0]["message"]["content"]
# 接下來可以用 `git apply` 或 python-git 應用 patch,然後用 GitHub / GitLab API 建 PR
這裡的關鍵不是 Git 操作細節,而是:
- 把「讀檔案」「套 patch」「建分支與 PR」都寫在程式裡。
- North Mini Code 只負責做它擅長的事:理解現有 code → 給出修改 diff。
搭 SkillSpector + agentsview:安全與使用監控
你一旦開始寫 Agent,下一步就是 安全與觀察。這裡可以搭兩個開源專案:
| 名稱 | 核心功能 | 免費方案 | 適合誰 |
|---|---|---|---|
| SkillSpector | 掃描 Agent 的「技能」或工具,找出可能的安全漏洞與惡意模式 | 開源 | 有多個自動化工具、會對 Repo/GCP/AWS 操作的團隊 |
| agentsview | 本地優先的 Coding Agent 會話分析與使用監控,支援 Claude Code、Codex 等 | 開源 | 想看「Agent 整天在幹嘛」、算 Token 用量與失敗率的團隊 |
實際做法:
- 用
SkillSpector扫描你寫給 Agent 用的工具(例如「自動 apply patch」「執行 migration」),避免權限過大或不安全操作。 - 用
agentsview紀錄 coding agent 的 session:prompt / 回應 / 結果,方便 debug 與觀察模型在專案上的實際表現。
行動目標:挑一個小專案,寫一個「自動產生重構 PR 草稿」的 Agent,然後用 SkillSpector 檢查工具安全,並用 agentsview 觀察它的使用行為。
實務建議:硬體需求與小顯卡怎麼玩
最低硬體需求(實務向)
North Mini Code 是 30B 級別模型,原生 FP16 會非常吃顯存,一般建議:
- 順暢推理:
- 1 張 24GB GPU(如
RTX 4090/A5000)+ 量化(例如 4-bit) - 或 2 張 16GB 以上多卡,使用 tensor parallel(如
vLLM、TGI支援)。 - CPU-only:可以,但速度會很慢,只適合測試 API,不適合作 coding 時的即時補全。
💡 關鍵: 若有 24GB 級 GPU 搭配 4-bit 量化,就能在單機上實現接近雲端 Copilot 的流暢體驗。
只有一張小顯卡怎麼量化部署?
如果你只有 12GB / 16GB 等級的顯卡,可以這樣做:
- 使用量化權重:在 Hugging Face 上搜尋是否有 North Mini Code 的
GPTQ、GGUF或AWQ版本。 - 用
Ollama/llama.cpp類工具載入 GGUF: - 例如:
bash
ollama create north-mini-code -f Modelfile
# Modelfile 內容需指向 CohereLabs 的 GGUF 權重 - 再用
ollama serve+ollama run north-mini-code來提供本地服務。 - 降低 context 長度與 batch size:在
vLLM/TGI設定裡調低max_tokens/max_seq_len與 batch,換取顯存空間。
如果你的顯卡只有 8GB:
- 建議作為 離線工具 使用(例如一次性重構 / 安全掃描),不要期待「即時 Copilot 感受」。
- 或改把模型部署在公司內部一台較大的伺服器上,自己本機透過 VPN 或內網連線使用。
行動目標:確認自己機器的 GPU 型號與顯存,選一套適合的部署方式:
- ≥24GB:直接
vLLM+ 4-bit 量化,當日常 Copilot。 - 12–16GB:找量化權重 + 降 context,當「按需叫用」的 Agent。
- 只有 CPU:拿來跑批次任務或試驗,工作時還是接遠端伺服器。
總結
如果你:
- 不想再冒險把私有程式碼丟到雲端,
- 不想被單一 Copilot / API 鎖死,
- 又想要一顆可以放進自己 workflow 裡的程式碼 Agent 大腦,
那麼 Cohere North Mini Code 提供了:開源授權、針對程式碼與 Agent 工作流優化、可在本地或私有雲部署的折衷選項。從 Hugging Face 線上試用,到接進 IDE,再到自動產生 PR 的完整 Agent,你可以一步步把它變成你團隊自己的「內建 Copilot」。
🚀 你現在可以做的事
- 到 Hugging Face 下載或在線試用
CohereLabs/North-Mini-Code-1.0,用你的主力語言丟 3 段程式碼測試- 用
vLLM或TGI在一台有 GPU 的機器上跑起來,並用FastAPI包成 OpenAI-style API 接到 Cursor / VSCode- 選一個小專案,實作「自動重構並產生 PR 草稿」的 Agent,搭配
SkillSpector與agentsview做安全與使用監控


發佈留言