📌 本文重點
- 小模型搭配高品質描述也能畫得好
- Lens 完整開源,可在本機或雲端部署
- 用 GPT 先整理資料,可微調出專屬圖像模型
- 先用 Demo 試 prompt,再決定是否自建 API
用一台普通筆電就能跑的開源圖像模型 Lens,把「小模型也能畫得好」這件事變成現實,適合想在本機或雲端快速搭一個可用圖像生成系統的人。
原始研究與開源專案可見 Microsoft Research 公告與程式碼倉庫(可從 The Decoder 報導 追蹤連結)。
核心功能:小模型,靠好資料撐起來
1. 3.8B 參數也能畫出細節圖
Lens 的參數量只有約 38 億,比主流閉源大模型小很多,但在多個圖像生成基準測試中,成績可以追上甚至超過體型更大的模型。關鍵不是「堆參數」,而是訓練資料:
- 使用約 8 億筆、由
GPT‑4.1產生的高品質圖像描述 - 描述內容細到「光源方向、鏡頭焦段、材質、構圖」,不是只寫「一隻貓坐在桌子上」
- 小模型可以在這些精準標註上更有效學習
💡 關鍵: 約 38 億參數配上 8 億筆精準描述,證明小模型只要資料夠好,也能接近甚至超過大模型表現。
你可以怎麼用這個優勢?
在實際 prompt 時,多寫一點細節,Lens 特別吃「具體描述」:
一個極簡風格的手機 App 圖標,白色背景,中間是扁平化的藍色雲朵,
線條乾淨,無陰影,適合放在 iOS 主畫面。
比起只寫「雲朵圖標」,具體描述會更接近 Lens 當初訓練時看到的高質量 caption,使輸出品質更穩定。
2. 完整開源:程式碼 + 權重 + 資料流程
Lens 的程式碼與模型權重開源,你可以:
- 在本機部署,不經過第三方雲端
- 在自己的伺服器上做內網圖像生成
API - 自行微調,適配特定風格(例如公司品牌視覺)
可行動的做法:
- 把 Lens 當作「公司內部版 Midjourney」,搭配簡單前端頁面給同事用
- 在產品原型工具(如 Figma 插件、內部
dashboard)後端接上 LensAPI
3. 訓練思路可複用:用 GPT 先把資料變好
Lens 的另一個重點,是用 GPT‑4.1 先幫原始圖像資料寫出高品質描述,再拿來訓練。對個人或團隊來說,這給了很實際的路線:
- 收集自家產品圖(例如鞋子、包包、介面截圖)
- 用
GPT‑4.x幫每張圖生成細緻描述 - 用這批資料微調 Lens,得到一個「專門懂你家產品」的圖像模型
你可以馬上做的實驗:
- 拿 50 張自家產品圖
- 用
ChatGPT/Azure OpenAI幫每張圖寫 3–4 句的超詳細描述 - 把這批圖 + 描述存成
JSON/CSV - 未來如需微調 Lens,就已經有一批乾淨資料可以用
💡 關鍵: 先用大型語言模型替資料加上高品質描述,可以顯著降低後續訓練或微調的成本,讓小模型也具備專領域能力。
適合誰用:三個典型場景
1. App 圖標與 UI 草圖
需求:快速生出幾十款圖標概念,不想每次都手動畫。
Lens 可以:
- 輸出風格統一的 App 圖標草稿
- 為不同功能模組快速生成
icon系列
範例 prompt:
為一款習慣追蹤 App 生成 4 個圖標提案:
扁平化風格,柔和配色,每個圖標有明確象徵:
打卡用打勾符號、番茄鐘用簡化的時鐘、
統計用長條圖、個人設定用簡化人物輪廓。
背景簡潔,適合 iOS 風格。
2. 行銷素材:社群貼文、Banner 草圖
需求:行銷團隊需要快速產出視覺草案,交給設計師再精修。
Lens 可以:
- 生成不同構圖的社群貼文底圖
- 幫你先找到「方向」,再請設計師改
實際使用方式:
- 將產品賣點寫成 2–3 句描述
- 指定風格(例如「韓系清新」、「科技感藍紫配」)
- 產出 5–10 張圖,挑 1–2 張給設計師重製
3. 產品原型圖:硬體外觀、介面草稿
需求:先有一組「看得懂」的圖,再進行工業設計或 UI 設計。
Lens 可以:
- 幫你畫出不同外型的裝置草案(例如智慧音箱、耳機)
- 幫 App 原型搭配大致配色與版型
範例 prompt:
一款家用智慧音箱的產品概念圖,
圓柱形機身,霧面白色塑膠材質,上半部有細密圓孔,
底部有一圈柔和的 LED 光環,放在木質桌面上,
整體風格偏向北歐極簡風。
怎麼開始:最低摩擦上手路線
路線 1:完全不寫程式,先用 Hugging Face Demo Space
如果你只是想試看畫得如何,最簡單是使用 Hugging Face 上的 Demo(搜尋「Lens text-to-image」即可,或從 The Decoder 報導頁面 追過去)。
步驟:
- 開啟 Demo Space 頁面
- 在文字框輸入中文或英文
prompt - 選擇解析度與步數(預設即可)
- 點擊
Generate
適合:
- 行銷或產品同事想先測試效果
- 還沒有決定要不要自己部署
小技巧:
- 先用 Demo 找到你喜歡的
prompt模板 - 再複製這些
prompt到你自己的部署裡使用
路線 2:會寫程式,用 Transformers 建自己的圖像生成 API
如果你熟悉 Python,建議直接用 Hugging Face Transformers 在本機或雲端跑 Lens,幾行程式碼就能得到一個可呼叫的 API。
以下假設你已安裝 Python 3.10+。
1. 安裝必要套件
pip install torch torchvision --index-url https://download.pytorch.org/whl/cpu
pip install transformers accelerate safetensors
如果你有 NVIDIA GPU,可改用官方 CUDA 版 PyTorch 安裝指令。
2. 下載並載入 Lens 模型
以 Transformers 為例(假設模型名稱為 microsoft/lens-3.8b,實際名稱請依 Hugging Face Hub 為準):
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
model_id = "microsoft/lens-3.8b"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.float16,
device_map="auto"
)
prompt = "a minimal blue and white app icon of a cloud on a white background, flat design, no shadows"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
with torch.no_grad():
outputs = model.generate(**inputs, max_new_tokens=256)
# 假設模型會輸出圖像 latent,再解碼成圖片
# 這部分請依官方範例加入解碼步驟
因為 Lens 是影像模型,實際程式碼會包含「文字 -> 影像 latent -> 圖檔」三階段;建議直接參考官方 repo 的 inference.py 或示範 notebook,把其中的 inference 函數包一層 API。
3. 快速包一個本機 API(Flask 範例)
from flask import Flask, request, send_file
from io import BytesIO
app = Flask(__name__)
@app.post("/generate")
def generate():
data = request.get_json()
prompt = data.get("prompt", "")
# 呼叫 Lens 推理函數,回傳 PIL Image
image = run_lens(prompt)
buf = BytesIO()
image.save(buf, format="PNG")
buf.seek(0)
return send_file(buf, mimetype="image/png")
if __name__ == "__main__":
app.run(host="0.0.0.0", port=8000)
有了這個 API,你就可以:
- 在前端或
no-code工具(如 Bubble、Retool)裡直接呼叫 - 在
CI pipeline裡自動生成demo圖像
💡 關鍵: 先用 Hugging Face Demo 測試,再用短短數十行程式碼包成
API,可以在普通硬體上快速搭起團隊可用的圖像生成服務。
最低摩擦指南:你現在可以做什麼
- 先用 Hugging Face Demo 試出一組好用
prompt: - 各準備一組 App 圖標、行銷素材、產品原型的
prompt模板 - 決定部署路線:
- 只需要偶爾用 → 繼續用 Demo
- 團隊要每天用 → 自己在雲端或本機起一個 Lens
API - 把
prompt模板寫進文件: - 給團隊共用,確保風格一致
Lens 的真正價值,不只是「輕量」這一點,而是用高品質 GPT‑4.1 描述資料換來的「小而準」行為。只要你願意在描述上多花一點心思,就能在普通硬體上,得到足夠好用的圖像生成系統。
🚀 你現在可以做的事
- 打開 Hugging Face 搜尋「Lens text-to-image」,實際輸入 3 組
prompt測試效果- 在一台開發機上依照文中步驟安裝
Transformers,跑通一個簡單的 LensAPI- 收集 20–50 張自家產品圖,配合
GPT‑4.x產生描述,準備未來微調用的資料集


發佈留言