open-jev 在 Banking77 十類分組答對 77.1%。Laya 是 55.6%;Kev 兩個尺寸都被 other 選項拖累。
看分組診斷分類能力,
得拆成三道題看。
open-jev 與 open-jev-laya 固定樣本實測。這份紀錄把分類命中、分數排序、標籤定義與執行時間拆開,避免一個準確率掩蓋真正的差異。
同一批模型,
不同任務有不同答案。
Laya 的 SMS spam AUC 是 0.894,但 0.5 門檻的 accuracy 只有 56.5%。分數會排序,不代表門檻已可用。
看 spam 分數kev-4b 在平衡子集答對 87.0%,但單題 p50 約 8.5 秒。Laya 的 77 選項會被截短,不能直接當成公平對照。
看 77-way 限制!執行環境:下方所有延遲都來自 Node.js WebGPU,不是瀏覽器實測。評測使用固定資料、固定問題,每列只推論一次。
先比較同一個任務。
切換任務查看 macro-F1 和原始指標。SMS 的 accuracy 會受到正常訊息占多數影響,請同時看 AUC、precision 和 recall。
Macro-F1
Brier / ECE 越低通常代表機率與正確率較一致。SMS ECE 對照 spam 正類機率;多選題以最高選項機率對預測正確性計算。樣本分箱會影響估值,請一併看樣本數與原始分數分布。
會排序,
也可能選錯門檻。
資料有 27 則 spam、173 則正常訊息。只答「正常」也有 86.5% accuracy,是這組最重要的基準線。
accuracy · 低於全部答正常
AUC 高,表示 spam 常排在正常訊息前面;但預設門檻下,許多正常訊息也得到接近 1 的分數。要先用獨立驗證集選門檻並檢查校準。
不要直接用 confidence 做人工複核門檻。 Laya ECE 0.415;在本批資料挑出的最佳 F1 門檻 0.99999256 也是樣本內結果,F1 0.679,尚未獨立驗證。
381 次選 other,
真實標籤只有 6 題。
主圖把模型選出的 other 數量和資料裡真正的 other 放在同一條 462 題刻度上。Kev 的偏差遠大於標籤本身的比例。
輸出分布對照真實標籤
細線標出真實 other 的位置;Kev 的 381 次預測裡,僅約 6 題是真實 other。把 other 從 Kev 候選排除後,離線 argmax accuracy 為 76.6%(kev-0.6b)與 78.4%(kev-4b)。
降低 other 分數
這些係數在同一批 462 題上試算,不能當成已驗證修正。
越有把握,反而越常錯
Kev 的高信心多半是很有把握地選了 other,現在不適合用信心分數自動分流。
分組定義也在影響分數。
真實 other 只包含 contactless_not_working(6 題),語意上較像 card。費用類也散落在 transfers、atm_cash、exchange_fx 與 disputes_refunds;fees_charges 原始只有 card_payment_fee_charged。
這是對固定預測做的離線重標 diagnostic,不是重新推論,也不代表新 taxonomy 已獲確認。
多選項測試,
先看得進去多少。
每個 intent 固定抽一題。模型間的速度與分類能力取捨很明顯,但 Laya 與 open-jev 各有不同的輸入限制。
多寫 fallback 規則,
沒有解決 other 偏差。
v2 跑完整 462 題;v3、v4 是每類一題的 77 題 pilot。三種改寫都沒有勝過原始 baseline。
| 模型 / 問法 | n | Accuracy | Macro-F1 | 選 other | p50 |
|---|---|---|---|---|---|
| kev-0.6b · baseline | 462 | 16.0% | 0.200 | 381 | 264 ms |
| kev-0.6b · fallback v2 | 462 | 10.8% | 0.140 | 410 | 500 ms |
| open-jev · baseline | 462 | 77.1% | 0.736 | 4 | 231 ms |
| open-jev · fallback v2 | 462 | 20.3% | 0.273 | 327 | 445 ms |
Kev: baseline 15.6% → v3 14.3% → v4 13.0% open-jev: 75.3% → 14.3% → 22.1%
v2 雖抓到全部 6 個真實 other,卻同時製造 Kev 404、open-jev 321 個 false other。這些提示詞是在同一評測集上設計,不是獨立驗證。
速度數字,
要連執行環境一起讀。
每題延遲包含 tokenization、sequence construction、forward pass 和 decode;不含頁面載入時間。
| 任務 | kev-0.6b | kev-4b | open-jev | Laya |
|---|---|---|---|---|
| SMS spam · n=200 | 108 / 189 | 534 / 1,016 | 101 / 159 | 89 / 140 |
| Banking77 group · n=462 | 264 / 312 | 1,394 / 1,684 | 231 / 291 | 116 / 166 |
| Banking77 intent · n=77 | 1,826 / 2,004 | 8,542 / 9,102 | 未執行 | 226 / 294 |
每格為 p50 / p99,單位毫秒。三種任務的樣本量不同。
Node.js WebGPU
Node v24.18.0 · macOS arm64 · Transformers.js 4.3.0。Laya 使用 fp16;Kev 與 open-jev 使用 Q4。
Laya 權重約 647 MB
快取後載入 1.77 秒;第一次下載與初始化約 71.96 秒。Kev-0.6b 1.61 秒、Kev-4b 6.39 秒、open-jev 2.75 秒。
Kev 系列一致性 1.000
三個 open-jev 內建模型在 50 則平衡 SMS 子集各重跑三次,預測一致;這不是整體準確率估計。Laya 未做重複測試。
資料來源、版本與限制
- 固定問題與資料:tryjev/eval revision 52770fc
- Laya sequence/client:open-jev-laya commit f25eec4
- Laya 權重:固定 Hub revision
- 來源資料集:Banking77、SMS Spam Collection
每題只跑一次,只有 50 則 SMS 做三次重複一致性檢查。open-jev 77-way 因 context limit 未執行;Laya 77-way 受到截短。重標 taxonomy、分數懲罰、最佳門檻都是同批資料上的離線診斷。Node WebGPU 延遲不代表瀏覽器量測。