用 North Mini Code 打造自己的 Coding Agent

用 North Mini Code 打造自己的 Coding Agent

📌 本文重點

  • North Mini Code 是針對程式碼與 Agent 優化的 30B 開源模型
  • 可在本地或內網部署,避免程式碼外流與雲端綁定
  • 透過 vLLM / FastAPI 等,可接到 IDE 當自家 Copilot
  • 可擴展成自動重構、產 PR 的完整 Code Agent workflow

雲端 Copilot 很好用,但貴、會上傳程式碼、也被綁在特定平台;North Mini Code 讓你用一顆開源小模型,在自己機器上做出專屬的 AI 程式碼 Agent。

模型連結:Hugging Face – CohereLabs/North-Mini-Code-1.0
https://huggingface.co/CohereLabs/North-Mini-Code-1.0


核心功能:這顆模型能幹嘛?

1. 專門為「程式碼 + Agent」調過的 30 億參數模型

  • 參數規模:30B(約 3B active),重點是 效能 / 顯示記憶體比很友善
  • 授權:Apache 2.0,可商用、可改、可包進你的產品,不用談授權費。
  • 能力:在人工程式碼分析指標(Artificial Analysis Coding Index)拿到 33.4 分,與同級模型競爭力接近。
  • 官方定位:Cohere 把它稱為 開源 Agentic Coding Model,也就是特別優化「一步一步推理、呼叫工具、改檔案」這種工作流程。

💡 關鍵: 這顆 30B 模型以約 3B active 參數達到 33.4 分表現,代表在顯存友善的前提下仍具同級競爭力。

可以做的事:

  • 寫與理解多語言程式碼(Python、TypeScript、Go…)。
  • 幫你拆解需求 → 拆任務 → 生出具體修改建議與 patch。
  • 當成 Agent 的「大腦」,搭配工具去讀檔案、改檔案、送 Pull Request。

行動建議:先到 Hugging Face 頁面按下 Duplicate in Space 或在 Web UI 裡試幾個自己的 code snippet,確認風格合不合胃口。


適合誰用?幾個具體場景

  • 公司不方便把原始碼丟上雲端:金融、醫療、政府專案,用雲端 Copilot 有合規壓力,North Mini Code 可以放在內網 GPU 或伺服器裡使用。
  • Side project 想省錢又想有 Copilot 感覺:自己架一顆模型,用 Cursor、Claude Code 或自製 VSCode 插件連上去,平常寫 side project 就靠它輔助。
  • 想做自家產品的「內嵌 Coding Agent」:SaaS、DevOps 工具、内部平台,想加「一鍵重構」「一鍵產生自動化 script」,可以直接把這顆模型包進去,不用每月燒雲端 API。
  • 研究 / 教學單位:開課教 AI for Programming,可以讓學生直接在本地玩 Agent,而不是只調用雲端 API。

怎麼開始(一):最快速的入門方式

這一層目標:先看到模型實際寫程式碼的樣子,不用寫太多 infra。

1. 直接在 Hugging Face 線上試

  1. 開啟模型頁:https://huggingface.co/CohereLabs/North-Mini-Code-1.0
  2. 找到 InferenceSpaces Demo 區塊。
  3. 貼上一段自己的函式,輸入提示:

text
你是一位資深後端工程師,請重構以下 Python 函式,要求:
1. 拆成小函式
2. 加上型別註記
3. 解釋主要修改點

  1. 看輸出是否符合你平常期待的 coding style。

行動目標:至少用你現在在做的專案語言(例如 TypeScript + NestJS / Python + FastAPI),試 3 個 prompt,確認模型對你主力技術棧的理解能力。

2. 用現成推理伺服器跑起來(TGI / vLLM

如果你手上有一台有 GPU 的機器,可以用現成的推理伺服器:

  • text-generation-inference (TGI):Hugging Face 官方推,部署簡單。
  • vLLM:效能好、支援 OpenAI-style API。

vLLM + Docker 為例(概念示意):

docker run --gpus all -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model CohereLabs/North-Mini-Code-1.0 \
  --download-dir /models

跑起來後,你就有一個 OpenAI 相容的 /v1/chat/completions API 可以 call。

行動目標:用你最熟悉的推理方案(TGIvLLM 選一個)先在伺服器上跑起來,用 curl 或 Postman 成功打到一次 API。


怎麼開始(二):包成 OpenAI-style API,接到 IDE 裡

這一層目標:讓 North Mini Code 像 OpenAI 一樣被 Cursor、Claude Code 或自製 VSCode 插件當作後端使用。

假設你已經用 vLLM 把模型跑在 localhost:8000,現在可以再包一層簡單的 Python 代理 API,對外維持 OpenAI 介面(方便未來切換模型)。

1. 用 Python FastAPI 做一個薄封裝

# app.py
from fastapi import FastAPI
from pydantic import BaseModel
import requests

OPENAI_COMPAT_URL = "http://localhost:8000/v1/chat/completions"  # vLLM

app = FastAPI()

class Message(BaseModel):
    role: str
    content: str

class ChatRequest(BaseModel):
    model: str
    messages: list[Message]
    temperature: float | None = 0.2

@app.post("/v1/chat/completions")
async def chat(req: ChatRequest):
    payload = {
        "model": "CohereLabs/North-Mini-Code-1.0",
        "messages": [m.model_dump() for m in req.messages],
        "temperature": req.temperature,
    }
    r = requests.post(OPENAI_COMPAT_URL, json=payload)
    return r.json()

啟動:

uvicorn app:app --host 0.0.0.0 --port 3000

現在,http://localhost:3000/v1/chat/completions 就是一個「自家版 OpenAI API」。

2. 接到 Cursor / VSCode / 自製工具

以 Cursor 為例:

  1. 打開 Cursor 設定 → Models → 自訂 API。
  2. 填寫:
  3. Base URL: http://localhost:3000/v1
  4. API Key:隨便填一個(例如 local-north-mini),因為你自己的服務可以忽略驗證。
  5. 選擇此自訂模型作為預設 Coding 模型。

之後你在 Cursor 內:

  • Tab 補全、聊天寫 code、改檔案的請求,全部都會走到你這顆本地的 North Mini Code。

行動目標:把 IDE(Cursor 或 VSCode 插件)接到你剛剛包好的 API,嘗試用它完成一個小功能(例如寫一個簡單的 REST API route)。


怎麼開始(三):變成真正的 Code Agent Workflow

這一層目標:不是只有「聊天寫 code」,而是讓模型能 看專案、給重構建議、自己產生 PR 草稿

💡 關鍵: 當模型被嵌入自動讀檔、產 diff、送 PR 的流程時,才真正從「聊天輔助」升級為完整 Code Agent。

範例 Workflow:從 Git repo → 重構建議 → PR 草稿

流程拆解:

  1. 從 Git repo 讀取指定資料夾的檔案內容。
  2. 用 North Mini Code 產生重構建議與 patch(例如 unified diff)。
  3. 建立分支、套用 patch、產生 commit 和 PR 草稿(或 MR)。

簡化版 Python 範例(偏偽碼):

from git import Repo
import openai  # 指向你自己的 /v1

openai.api_base = "http://localhost:3000/v1"
openai.api_key = "local-north-mini"

repo = Repo("./your-project")
files = ["app/service/user_service.py", "app/api/user_routes.py"]

code_snippets = []
for path in files:
    content = (repo.working_tree_dir + "/" + path)
    with open(content, "r", encoding="utf-8") as f:
        code_snippets.append(f"# FILE: {path}\n" + f.read())

prompt = """
你是一位資深後端工程師與程式碼重構專家。
請針對下列檔案:
1. 給出具體重構建議
2. 產生 unified diff 格式的 patch(只包含必要修改)
3. 每個修改前加上簡短註解(英文)

注意:
- 保持對外介面不變
- 如果不需要改,請明確說明原因
""" + "\n\n".join(code_snippets)

resp = openai.ChatCompletion.create(
    model="north-mini-code",
    messages=[{"role": "user", "content": prompt}],
)
patch = resp["choices"][0]["message"]["content"]

# 接下來可以用 `git apply` 或 python-git 應用 patch,然後用 GitHub / GitLab API 建 PR

這裡的關鍵不是 Git 操作細節,而是:

  • 把「讀檔案」「套 patch」「建分支與 PR」都寫在程式裡。
  • North Mini Code 只負責做它擅長的事:理解現有 code → 給出修改 diff。

SkillSpector + agentsview:安全與使用監控

你一旦開始寫 Agent,下一步就是 安全與觀察。這裡可以搭兩個開源專案:

名稱 核心功能 免費方案 適合誰
SkillSpector 掃描 Agent 的「技能」或工具,找出可能的安全漏洞與惡意模式 開源 有多個自動化工具、會對 Repo/GCP/AWS 操作的團隊
agentsview 本地優先的 Coding Agent 會話分析與使用監控,支援 Claude Code、Codex 等 開源 想看「Agent 整天在幹嘛」、算 Token 用量與失敗率的團隊

實際做法:

  • SkillSpector 扫描你寫給 Agent 用的工具(例如「自動 apply patch」「執行 migration」),避免權限過大或不安全操作。
  • agentsview 紀錄 coding agent 的 session:prompt / 回應 / 結果,方便 debug 與觀察模型在專案上的實際表現。

行動目標:挑一個小專案,寫一個「自動產生重構 PR 草稿」的 Agent,然後用 SkillSpector 檢查工具安全,並用 agentsview 觀察它的使用行為。


實務建議:硬體需求與小顯卡怎麼玩

最低硬體需求(實務向)

North Mini Code 是 30B 級別模型,原生 FP16 會非常吃顯存,一般建議:

  • 順暢推理
  • 1 張 24GB GPU(如 RTX 4090 / A5000)+ 量化(例如 4-bit)
  • 或 2 張 16GB 以上多卡,使用 tensor parallel(如 vLLMTGI 支援)。
  • CPU-only:可以,但速度會很慢,只適合測試 API,不適合作 coding 時的即時補全。

💡 關鍵: 若有 24GB 級 GPU 搭配 4-bit 量化,就能在單機上實現接近雲端 Copilot 的流暢體驗。

只有一張小顯卡怎麼量化部署?

如果你只有 12GB / 16GB 等級的顯卡,可以這樣做:

  1. 使用量化權重:在 Hugging Face 上搜尋是否有 North Mini Code 的 GPTQGGUFAWQ 版本。
  2. Ollama / llama.cpp 類工具載入 GGUF
  3. 例如:
    bash
    ollama create north-mini-code -f Modelfile
    # Modelfile 內容需指向 CohereLabs 的 GGUF 權重
  4. 再用 ollama serve + ollama run north-mini-code 來提供本地服務。
  5. 降低 context 長度與 batch size:在 vLLM / TGI 設定裡調低 max_tokens / max_seq_len 與 batch,換取顯存空間。

如果你的顯卡只有 8GB:

  • 建議作為 離線工具 使用(例如一次性重構 / 安全掃描),不要期待「即時 Copilot 感受」。
  • 或改把模型部署在公司內部一台較大的伺服器上,自己本機透過 VPN 或內網連線使用。

行動目標:確認自己機器的 GPU 型號與顯存,選一套適合的部署方式:

  • ≥24GB:直接 vLLM + 4-bit 量化,當日常 Copilot。
  • 12–16GB:找量化權重 + 降 context,當「按需叫用」的 Agent。
  • 只有 CPU:拿來跑批次任務或試驗,工作時還是接遠端伺服器。

總結

如果你:

  • 不想再冒險把私有程式碼丟到雲端,
  • 不想被單一 Copilot / API 鎖死,
  • 又想要一顆可以放進自己 workflow 裡的程式碼 Agent 大腦,

那麼 Cohere North Mini Code 提供了:開源授權、針對程式碼與 Agent 工作流優化、可在本地或私有雲部署的折衷選項。從 Hugging Face 線上試用,到接進 IDE,再到自動產生 PR 的完整 Agent,你可以一步步把它變成你團隊自己的「內建 Copilot」。

🚀 你現在可以做的事

  • 到 Hugging Face 下載或在線試用 CohereLabs/North-Mini-Code-1.0,用你的主力語言丟 3 段程式碼測試
  • vLLMTGI 在一台有 GPU 的機器上跑起來,並用 FastAPI 包成 OpenAI-style API 接到 Cursor / VSCode
  • 選一個小專案,實作「自動重構並產生 PR 草稿」的 Agent,搭配 SkillSpectoragentsview 做安全與使用監控

留言

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *