Mistral 發布 Shieldstral 1.0-3B:安全政策用白話問句寫,改規則不必重訓模型
Mistral AI 於 2026 年 8 月 4 日發布 3B 開放權重多模態安全分類器 Shieldstral 1.0-3B,Apache 2.0 授權、單張 16GB GPU 可跑。最大突破是政策改用自然語言問句在推論當下給定,免重新訓練;官方同時誠實列出多語表現不均的侷限。
Mistral AI 於 2026 年 8 月 4 日在官方 news 頁發布 Shieldstral 1.0-3B,一個 30 億參數的開放權重多模態安全分類器,採 Apache 2.0 授權,權重放在 Hugging Face(mistralai/Shieldstral-1.0-3B),單張 16GB NVIDIA GPU 即可執行。它的工作是判斷一段文字或一張圖片是否違反規範,並回傳一個校準過的安全分數。
最大突破:政策用自然語言問句寫
傳統 guardrail 模型是把固定的危害分類在訓練時就寫死在模型裡,要新增或修改一條規則,往往得重新訓練一次。Shieldstral 改成讓開發者在推論當下用自然語言問句寫政策,模型依照當下給定的問句作答,完全不需重訓。
架構是二元問答三段式:
- instruction:說明這次評估的情境
- query:一句是非問句,也就是政策本身
- document:待判斷的內容
單次前向傳播由 yes/no 的 logits 產生分數,判決可壓縮成單一 token,因此結果毫不含糊;文字與圖片共用同一個介面。
規格與數據:3B 對上七倍體積
底座為 Ministral-3-3B-Base-2512,搭配 Pixtral 視覺編碼器,訓練上下文 32k,訓練資料為 5410 萬組對比配對(用來區分內容相似、但一個合規一個違規的案例),涵蓋 12 種語言。官方以十個開放 guard 基線(含 GPT-OSS-Safeguard-20B、OmniGuard-7B)做對比:文字安全平均 F1 84.9%、多模態安全平均 F1 83.8%、政策適應性 F1 91.3%,官方稱可匹敵體積達其七倍的模型。由於是開放權重、企業自行部署,官方未公布定價。
官方自陳的侷限
Mistral 少見地把弱點寫在自家公告裡:語言涵蓋不均,阿拉伯文、印尼文表現落後部分基線;未來工作方向是多語涵蓋、長文件穩健性與更廣的多模態安全。換句話說,benchmark 的平均分數並不等於每個語言都一樣好。
對管理者的意義
政策免重訓這條路並非 Shieldstral 首創,GPT-OSS-Safeguard 等開放權重 guard 模型已有前例;Shieldstral 的意義在於把「什麼算違規」寫成自己的白話規則、在自家 16GB GPU 上跑的門檻,壓到前所未有的低。在自行部署下,待判內容完全不出公司網路,內容審查與資料治理的主導權便從外部 API 供應商回到企業手上;法規或公司規範一變,當天改一句問句就生效,不必等供應商更新模型。但要誠實提醒:3B 的小模型仍會誤判,官方自己承認非英語表現不均,泰國企業若要用在泰文貼文、客服對話或直播留言上,務必先用自家真實資料抽樣實測,不能照單全收 benchmark 數字。