Jev 是什麼:為什麼 TypeSafe 要做一個不生成文字、只回帶型別答案的 AI 模型

目錄
共 13 個章節
Jev 是什麼:一個不生成文字、只回帶型別答案的模型
TypeSafe AI 在 2026 年 9 月 15 日發表的 Jev 走反方向:收下一段狀態(文字或 JSON),回傳事先定義好的選項、每個選項的機率與信心分數(confidence,模型對自己答案的把握程度),整個過程不產生任何一句話。它只下判斷,不寫報告。

為什麼官方把它叫 System One:快思與慢想分家:名字借自康納曼《快思慢想》:一套快、憑直覺,一套慢、要推理。官方說企業流程多數決定屬於前者,例如分類、路由、要不要轉人工,大家卻長期租用擅長慢想的大型語言模型來做,等於拿跑車去送便當。
choice、score、noul:三種問題型別
官方 API 只有一個端點,問題分三種型別。看 Cloudflare Workers AI 官方文件的真實回應最直接。狀態是一句客服訊息「我的出款已經三天失敗」,同時問三個問題:
is_urgent屬 noul 型別,回傳 0.95,代表有 95% 機率該當急件。department屬 choice 型別,從事先列好的選項挑中 billing,信心分數 0.8,其中 billing 機率 0.87、technical 0.13、sales 0。frustration屬 score 型別,分數 1.04,信心分數 0.94,對應等級 1 的機率是 0.96。
程式端只要讀這幾個欄位就能分流,不必解析任何句子。三種型別分工如下:
| 型別 | 一句話說明 | 適合的工作 | 回傳內容 |
|---|---|---|---|
choice |
從事先列好的選項挑一個 | 分類、分流、路由 | 選中的選項,加上每個選項的機率 |
score |
給一個有序等級的分數 | 風險排序、品質評分 | 分數、信心分數、各等級的機率 |
noul |
是非題的機率(白努利分布) | 要不要升級人工、流程判斷節點 | 0 到 1 的機率與信心分數 |
noul 最容易讓人一頭霧水,它其實是統計上的白努利分布,也就是是非題的機率。官方執行長在 Hacker News 上承認這個名字取得不好。記住它回傳一個 0 到 1 的數字,超過門檻就動作,低於門檻交給別人處理。
官方發布稿用了「不會幻覺」的說法,正確理解是型別安全不等於答案正確,它仍可能挑到一個合法卻不正確的選項。真正實用的是它同時給出的信心分數,讓程式決定哪些題目自己處理、哪些升級上去。
它跟生成式模型差在哪:計費方式、速度,與「不會幻覺」的真相
如果你用過生成式模型的 API,帳單邏輯大概是:送進去的字要錢,吐回來的字也要錢,回得越長越貴。Jev 剛好反過來。它的牌價是每百萬輸入 token 0.042 美元,輸出免費、快取輸入免費(官方定價頁,2026-09-27)。帳單的主體是「你送進去的狀態」,問題本身幾乎不計費。同一個狀態底下問 3 題還是 13 題,帳單差異不大。

這改變了省錢的方法。生成式模型要你把輸入和回答都寫短,Jev 要你一次把相關的問題全部問完。官方 cookbook 用一份 13 題的法規簡報跑長篇維基文章,批次問比逐題問便宜 12.2 倍、快 10.0 倍,答案完全相同。省下來的成本只有在同一個狀態要重複問很多次的時候才成立。
速度更要看量測條件。官方發布稿(2026-09-15)宣稱端到端 70 到 500 毫秒、比前沿模型快 40 到 200 倍。八天後的獨立盤點,也就是 dev.to〈Jev After Eight Days of Independent Tests〉(2026-09-23),掃過 14 篇 arXiv 預印本與 104 個 GitHub 評測,量到的區間是「比跑在迷你電腦上的本地 Gemma 4 26B 還慢 0.5 倍」到「快 12.1 倍」。兩邊不衝突,差別在跟誰比、在哪裡計時。常被引用的「70 毫秒對 329 秒」,是一邊只輸出結構化答案、另一邊跑完整思考鏈,任務本來就不對等。
「不會幻覺」到底是什麼意思
這四個字是行銷語言,官方文件本身沒有這樣寫。可以想成一張選擇題考卷:Jev 不可能寫出選項 (A) 到 (D) 以外的答案,因為輸出型別在送出前就被 schema 鎖死;但它完全可以挑中一個合法卻錯誤的選項。型別安全保證的是答案落在你給的選項表裡,不是答案一定正確。
官方自己的 jaggedness 頁(查閱日 2026-09-27)就把限制列得很白:它照字面讀、不是計算機、日期對它來說只是文字、狀態塞進越多無關內容越不準。能補救這件事的,是它同時回傳的信心分數。ayautomate 在 2026-09-19 公布的 791 筆決策實測(程式與原始結果公開)發現,只讓 Jev 處理信心 0.80 以上的題目、其餘轉給 GPT-5.6 Terra,準確度等於全程用 Terra,成本只要 26 到 28%,平均延遲約一半。高信心自己做、低信心往上送,這個分流架構才是它跟生成式模型最關鍵的差別。
真實案例:729 個作品裡,大家拿 Jev 來做什麼
一個新模型值不值得碰,看官方影片不準,看別人真的拿它做了什麼、花了多少錢比較準。社群自己維護的目錄站 Made with Jev 在 Jev 發布後八天做了一次盤點:729 個公開作品、667 位作者,其中 624 位(約 93.6%)只做了一個作品。這組數字要老實讀,量很大,但絕大多數是發表當週的試作,真正有量測、能規模化的還是少數。331 個作品公布了任何數字,中位數專案只有 11 顆星,前五大專案就吃掉 67.1% 的星數。目錄站自己也註明,這些數字全部由作者自報、未經審計。

同一份統計裡,15 個有公布用量與總額的執行,中位每筆決策成本是 0.000068 美元,換算下來一美元大約 14,727 筆決策。延遲中位數 300 毫秒,19 個回報裡有 18 個低於 1 秒。
九種工作,共同點是不用寫字:目錄站把作品歸成九類:分類大批資料、把工作分派到不同佇列、挑選 AI 代理的下一步、在即時影格內做決策、出貨前先評分、擋下高風險步驟、壓縮模型要讀的內容、在資料庫裡逐列判斷、決定畫面要顯示什麼。共同點是都不產出文字,只需要一個判斷。台灣的對應場景很直白:客服信要進哪個部門、留言該不該先送審、這張訂單要不要轉真人,都是同一種工作。
三個有完整數字的案例
- 1,018 篇論文分類,花 0.08 美元(作者自報,作品公開)。同一條管線裡,用 DeepSeek V4 Flash 寫摘要花 3.99 美元,把標題、摘要加 24 個候選主題交給 Jev 分類只花 0.08 美元,中位端到端 256 毫秒。開發者 Hassan El Mghari 的結論是不同工作該用不同模型,而且他上線前先跑過評估才替換原本的分類,這點比多數展示誠實。
- Every 編輯部的 1,709 個判斷(第三方獨立,媒體公司自己做的)。主編 Dan Shipper 用 37 篇自家文章乘上 21 道問題,成本不到 1 美分,中位每段 0.35 秒,對照的 Fable 5.1 是 8.83 秒,7 個刻意植入的缺陷抓到 6 個。這是目前最乾淨的一份第三方小樣本,優先引用。
- 客服分流的預先註冊實驗(第三方獨立,程式與結果公開)。作者 Suraj Phanindra 用銀行業 30 類加一類「不在此範圍」,比的是每 1,000 個「又快又對」的決策要多少錢:Jev 在每秒 40 張票時是 0.048 美元,Claude Haiku 4.5 是 1.70 美元。要留意 Jev 並不是最準的(92.1%,Haiku 為 93.6%),它的優勢出現在高負載、時間預算緊的時候。
三條放在一起看,來源性質差很多:729 個作品與 1kpapers 屬於作者自報,Every 與客服實驗則是第三方獨立、程式公開可查。要引用數字時,這兩類得分清楚,才不會把展示文宣當成量測結果。
替代方案有限公司觀點:開源替代已經追上來,該賣的是分流架構
客戶最常問「Jev 要不要跟」;可以試,但別把預算押在單一模型上。它做的事叫讀出決策(decision readout):提示停在答案該開始處,只取候選標籤那幾個 token 的機率分數,再轉成正規化機率分布(softmax)。這是老技術,開源幾天內就有對打版本,該投資的是「哪段用便宜模型、哪段升級給貴模型」的分流設計。

讀出決策是老技術,開源版就貼在旁邊
任何開源模型都做得到:vLLM 用 logprob_token_ids、SGLang 用 /v1/score;Featherless 的 SimpleJev 包成 Jev 相容伺服器,文件自己註明「這些機率不是校準過的正確率」。
社群追得快。Kev 7,279 顆星,自報 0.852 對 Jev 0.857;Nimble-9B 1,851 顆星,13 個公開資料集平均 75.9% 對 77.3%;Luce 只有 7 顆星,500 筆 kubernetes issue 上 86.9%,贏 Jev 84.7%(星數 2026-09-27 以 GitHub API 複核)。考卷不同不能直接排名。
反證更該注意:有標籤時小模型常輾過去。310M 日文編碼器只用 200 筆訓練,新聞主題分類贏 Jev 12 分(88.8% 對 76.8%);釣魚偵測兩行正規表達式 91.6%,Jev 62.6%。有幾百筆標好的資料時,微調或寫規則往往更划算。
我們對台灣市場的落地建議
最常見的浪費是用最貴的方式處理最簡單的問題。做法是把決策與生成拆開再分流:高信心交給便宜的決策模型,不足的升級給前沿模型,再不行轉真人。第三方實測(ayautomate,2026-09-19)的結論就是這個做法:準確度不變,成本只要 26 到 28%。
落地順序:
- 先用客戶 200 到 500 筆歷史資料量測正確率與信心分布。
- 門檻寫在程式裡,才能調整與 A/B 測試。
- 中文沒有獨立實測,導入前要用真實資料小規模驗證。
- 狀態含使用者可控文字,要當成敵意輸入。
自架不一定省:本地 Gemma 4 26B 在單張 L4 上滿載,每百萬次決策最多 5.43 美元,Jev 同條件 5.54 美元,差距很小,自架還有機器攤提與維運。不建議用的場合:一次性、量少、題目選項不固定或需要產出文字,用便宜的前沿模型或寫規則就夠。
我們賣的是分流架構與量測方法,不是單一模型。
台灣團隊怎麼開始:五種決策場景與導入前的檢查清單
Jev 只回帶型別的答案加機率,不回文字。所以只問一句:這工作需要寫出一段話嗎?要寫客服信、文案、摘要,它幫不上忙;只要從固定幾類挑一類、打分數、回 0 到 1 的機率,就是它的守備範圍。

五種不需要產出文字的工作
| 工作場景 | 對應型別 | 白話說明 |
|---|---|---|
| 客服來信分流 | choice | 從訂單、退換貨、帳務、其他挑一類 |
| 表單與名單分類 | choice | 產業別、需求類別、案件大小 |
| 留言與內容審核 | score | 依風險等級排序,先處理最危險的 |
| 要不要轉真人 | noul | 回一個機率,超過門檻才升級 |
| 自動化流程的判斷節點 | noul | 取代流程圖裡由人判斷的那個方形 |
官方示範的真實回應:狀態「我的出款已經三天失敗」同時問三題,回傳 urgent 0.95、部門挑中帳務(信心 0.8)、不滿分數 1.04,程式端讀欄位就能分流。
導入前的檢查清單
- 先有量測辦法,再談自動化。把信心門檻與升級規則寫進程式,才有東西可以調、可以驗證。
- 中文要用客戶自己的資料做小規模實測。獨立測試全是英文任務,中文與台灣場景無公開資料(截止 2026-09-27),不能拿英文成績推論。
- 客戶已有幾百筆標籤,要誠實講。官方 benchmark 顯示 200 到 1,000 筆真實標籤時,微調小模型或寫規則往往勝過它。釣魚偵測對照:1,000 筆訓練的模型 97.4%、兩行正規表達式 91.6%、Jev 62.6%(2026 整理,題目不完全相同,僅看方向)。
- 狀態裡有使用者可控欄位,就當成敵意輸入。官方公布的限制說明頁承認刻意爭取分類的文字可以推動答案,要先用程式過濾。
- 別對客戶說「不會幻覺」。型別安全只保證不吐出選項表以外的值,不保證挑對。
台灣的難處不是模型不夠聰明,而是常用最貴的方式處理最簡單的問題。要留在客戶端的是分流架構:高信心自動處理、低信心升級。三種問題型別會改版、價格會變動,這套分法才帶得走。
常見問題 FAQ
Q:想試 Jev,需要自己架伺服器嗎?
不用。它掛在 Cloudflare Workers AI 上,開好帳號就能直接呼叫;想自己架,開源模型一樣做得到同樣的判斷。
Q:可以直接拿它來寫客服回信或做摘要嗎?
不行。它只回選項、分數與機率,不產出句子。要寫文字交給生成式模型,Jev 負責的是「這封信該進哪個部門」「這張單要不要轉真人」這一類判斷。
Q:中文場景可以直接上線嗎?
目前公開的實測幾乎都是英文任務。上線前先拿自家 200 到 500 筆歷史資料小規模驗證,確認正確率與信心分布再決定。
📩 有任何問題或需要協助,歡迎聯絡我們:[email protected]
Related





